Loading...
Loading...
Tingkat Veo 3.1 yang lebih cepat dan murah, mencakup teks ke video, gambar ke video, referensi ke video, dan transisi frame awal-akhir.
Masuk untuk menjalankan model
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Estimasi biaya per pembuatan berdasarkan durasi dan resolusi. Anda hanya membayar untuk yang Anda jalankan.
Inilah endpoint yang Anda pakai ketika wajah yang sama, jaket yang sama, atau muka toko yang sama harus bertahan di sekumpulan klip. Kami menjalankan Veo 3.1 Fast milik Google sebagai google/veo-3.1-fast/reference-to-video, ia menerima array image_urls berisi hingga tiga gambar referensi, dan kami menagih per detik: $0.01 per detik, ×1.5 dengan audio aktif. Setiap klip di sini berdurasi 8 detik, jadi harganya $0.12 per klip pada 720p dengan suara.
Satu gambar sudah cukup, dan klip yang lebih pendek akan membantu? Pakai Veo 3.1 Fast image-to-video — ia menganimasikan satu frame awal dan akan memberi Anda 4 atau 6 detik. Sama sekali tidak ada yang perlu diunggah? Veo 3.1 Fast text-to-video berjalan hanya dengan sebuah prompt.
Pengukuran per detik bersifat universal untuk model ini — Google, fal.ai, dan Replicate semuanya melakukannya, dan begitu pula kami. Karena reference-to-video terkunci di 8 detik, tabel di bawah adalah satu-satunya konfigurasi yang penting. Angka diperiksa pada 26 Agustus 2026, pada 720p dengan audio:
| Provider API | Penagihan | Tarif (720p, audio aktif) | Klip 8 detik | vs. kami |
|---|---|---|---|---|
| E2X (saat ini) | per detik | $0.01/d ×1.5 audio | $0.12 | — |
| Google Gemini API | per detik | $0.10/d | $0.80 | 6,7× harga kami |
| fal.ai | per detik | $0.15/d | $1.20 | 10× harga kami |
| Replicate | per detik | $0.15/d | $1.20 | 10× harga kami |
| Harga daftar E2X (sebelum diskon) | per detik | $0.10/d ×1.5 | $1.20 | tarif kami tanpa diskon |
Baca baris terakhir itu berhadapan dengan dua marketplace tersebut. Harga daftar kami adalah $1.20 untuk klip 8 detik — persis yang ditagihkan fal.ai dan Replicate. Anda membayar sepersepuluhnya hari ini, dan itu masih mendarat 6,7× di bawah API Google sendiri. Jarak itu adalah diskon yang sedang berjalan atas model yang identik, bukan tier yang dipreteli.
Hitung harga 1080p dengan sengaja: fal.ai dan Replicate menyertakan lompatan 720p → 1080p tanpa biaya tambahan, sementara Google menagih tarif per detik yang lebih tinggi. Resolusi juga merupakan pengali di sisi kami — angka terkininya ada di llms.txt model ini.
Harga dan ketentuan produk dapat berubah sewaktu-waktu. Periksa harga terkini masing-masing provider sebelum mengambil keputusan pembelian. Harga Google Batch atau Flex tidak setara langsung dengan request API on-demand standar karena kondisi penjadwalan, ketersediaan, dan pemrosesannya berbeda; karena itu harga tersebut tidak disertakan dalam perbandingan ini. Ini adalah perbandingan dengan cakupan terbatas, bukan klaim bahwa E2X adalah opsi termurah di dunia dalam setiap konfigurasi.
Batas Google eksplisit: "Gunakan hingga tiga gambar referensi untuk memandu kontennya", yang dijelaskan dalam schema mereka sebagai "Hingga tiga gambar untuk dipakai sebagai referensi gaya dan konten." Tiga. Yang keempat berada di luar apa yang diterima model.
Anggaran itu memaksa sebuah keputusan, dan itulah bagian menarik dari endpoint ini. Anda membelanjakan tiga slot untuk apa pun yang tidak boleh melenceng. Sebuah pemotretan kampanye biasanya berjalan begini: satu potret bersih sang presenter, satu foto seluruh badan yang memperlihatkan busananya, satu foto lokasinya. Setiap klip dalam set itu lalu kembali dengan orang yang sama, pakaian yang sama, tempat yang sama — Anda hanya mengubah prompt-nya.
Pekerjaan produk terbagi berbeda: dua sudut objeknya, satu frame perlakuan warna mereknya. Prinsip yang sama. Referensi membawa identitas, prompt membawa aksi.
Ini bukan tugas image-to-video. Di sana, gambar Anda adalah frame satu. Di sini referensinya adalah panduan dan frame pembukanya dihasilkan darinya. Butuh klip yang bermula pada gambar diam persis yang sudah disetujui? Itu endpoint yang satunya.
Aturan Google berbunyi: durasi "Harus '8' saat memakai extension, gambar referensi, atau dengan resolusi 1080p dan 4k." Gambar referensi ada di daftar itu, jadi opsi 4 dan 6 detik yang ditawarkan dua endpoint lainnya tidak ada di sini. Schema kami tetap menampilkan enum duration; untuk capability ini satu-satunya nilai yang sah adalah "8".
Susun anggaran sesuai itu. Rangkaian enam klip berarti 48 detik output — $0.72 di kami, $7.20 di fal.ai atau Replicate.
Field wajib: prompt dan image_urls.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/reference-to-video",
"input": {
"prompt": "Perempuan dari gambar 1, mengenakan mantel dari gambar 2, melangkah masuk ke lobi dari gambar 3 dan mengibaskan air hujan. Ia mendongak dan berkata: \"Kamu menunggu.\" Cahaya tungsten hangat, gema marmer.",
"image_urls": [
"https://example.com/talent-portrait.jpg",
"https://example.com/wardrobe-coat.jpg",
"https://example.com/lobby-set.jpg"
],
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
Submit mengembalikan sebuah job ID; lakukan polling atau daftarkan sebuah webhook:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/reference-to-video",
input: {
prompt:
"Maskot dari gambar 1 melompat ke meja dari gambar 2, menjatuhkan sebuah cangkir, lalu terpaku. Langkah kaki berdecit, denting keramik, kemudian sunyi.",
image_urls: [
"https://example.com/mascot-turnaround.png",
"https://example.com/kitchen-set.jpg",
],
aspect_ratio: "9:16",
resolution: "720p",
duration: "8",
has_sound: "true",
seed: 60411,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Status berjalan pending → processing → completed, atau berakhir di failed / cancelled. Rencanakan sekitar empat menit per job — jendela resmi Google adalah lantai 11 detik dan 6 menit pada jam sibuk. Pakai ulang satu seed di seluruh set kalau Anda ingin hasil generasinya saling berima.
Bobot identik, harga per detik identik. Bentuk input Anda yang memilih endpoint-nya:
| Endpoint | Opsi durasi | Klip 8d, 720p + audio | Pilih saat |
|---|---|---|---|
| Veo 3.1 Fast reference-to-video | hanya 8d | $0.12 | Hingga 3 gambar harus mengunci wajah, busana, atau tempat lintas klip |
| Veo 3.1 Fast image-to-video | 4 / 6 / 8d | $0.12 | Satu gambar diam harus menjadi frame pertama secara harfiah |
| Veo 3.1 Fast text-to-video | 4 / 6 / 8d | $0.12 | Hanya prompt, tidak ada yang perlu diunggah |
| Omni Flash reference-to-video | — | $0.80 (konfigurasi default) | Keluarga yang berbeda, ketika tampilan Veo bukan yang Anda mau |
Kami lebih ingin Anda membelanjakan lebih sedikit. Kalau satu gambar sudah menyelesaikan pekerjaannya, image-to-video berharga sama sekaligus membuka klip 4 dan 6 detik — versi 4 detik berbiaya $0.06, separuh dari 8 detik tetap yang Anda bayar di sini. Datanglah ke endpoint ini ketika konsistensi lintas beberapa klip memang kebutuhan sesungguhnya, karena itulah satu hal yang tidak bisa dilakukan yang lain. Sisa kategorinya ada di bawah reference-to-video; semua yang lain ada di katalog model.
Model menerima sebuah array tanpa label. Tidak ada apa pun di payload yang mengatakan slot dua adalah busana dan bukan karakter kedua — jadi sebutkanlah di dalam prompt.
Pengindeksan berhasil: "perempuan dari gambar 1", "mantel dari gambar 2", "lobi dari gambar 3". Beberapa kata saja, dan sebagian besar ambiguitas yang menghasilkan output tercampur aduk pun lenyap.
Tiga kebiasaan lagi:
Beri setiap referensi satu tugas. Foto ramai yang memuat seseorang, sebuah produk, dan sebuah ruangan meminta model menebak apa yang Anda pedulikan. Crop rapat.
Ulangi identitasnya dalam kata-kata. "Rambut perak pendek yang sama, kacamata bulat yang sama" memperkuat apa yang ditunjukkan referensinya. Asuransi murah.
Tuliskan dialognya. Google menghasilkan audio secara native tanpa sakelar mati di API mereka, jadi suara tetap terjadi apa pun yang terjadi — ucapan, efek, ambiens. Kutip barisnya dan ia mendarat di frame yang tepat.
Google mendukung bahasa Inggris sepenuhnya dan belum mengevaluasi bahasa lain untuk model ini, jadi pertahankan teks instruksinya dalam bahasa Inggris — dialog yang dikutip boleh dalam bahasa apa pun yang dibutuhkan adegannya.
Dua hari untuk mengunduh. Retensi Google atas video yang dihasilkan adalah dua hari — "Anda harus mengunduh video Anda dalam 2 hari sejak dibuat." Untuk kampanye berisi dua puluh klip yang dibangun selama seminggu, itu keputusan arsitektur, bukan catatan kaki. Salin outputs[0].url ke penyimpanan Anda sendiri begitu sebuah job selesai.
SynthID pada setiap output. Watermark tak kasatmata milik Google diterapkan pada semua video Veo dan bisa diverifikasi lewat platform mereka. Tidak ada provider yang bisa menonaktifkannya.
Generasi manusia dibatasi wilayah. Di UE, Inggris, Swiss, dan MENA, personGeneration dibatasi ke allow_adult.
Beri versi pada set referensi Anda. Konsistensi bergantung pada pengiriman referensi yang identik byte demi byte setiap kali. Potret hasil ekspor ulang yang diselipkan di tengah sebuah batch akan terlihat.
Kami menagih $0.01 per detik output, ×1.5 dengan audio aktif. Endpoint ini terkunci di 8 detik, jadi klip 720p dengan suara adalah $0.12. Resolusi lebih tinggi membawa pengalinya sendiri — periksa halaman model versi live sebelum merencanakan batch 1080p.
Paling banyak tiga. Dokumentasi Google menyebut Anda boleh memakai hingga tiga gambar referensi untuk memandu kontennya, dan schema mereka menggambarkannya sebagai referensi gaya dan konten. Lebih sedikit tidak masalah; dua adalah hal yang lumrah.
Google mensyaratkan 8 detik kapan pun gambar referensi terlibat — aturan yang sama yang mencakup 1080p dan 4k. Butuh 4 atau 6 detik? Pakai endpoint image-to-video atau text-to-video: model yang sama, harga per detik yang sama.
Image-to-video menjadikan satu gambar sebagai frame pembuka secara harfiah. Reference-to-video menerima hingga tiga gambar sebagai panduan identitas, busana, gaya, atau lokasi, lalu menghasilkan frame pembuka yang konsisten dengannya. Pakai referensi ketika konsistensi lintas beberapa klip lebih penting daripada frame pertama yang spesifik.
Ya. Google menghasilkan dialog, efek suara, dan ambiens secara native, tanpa cara untuk menonaktifkannya di API mereka sendiri. Kami memaparkan has_sound dengan default true, dan setelan itu menerapkan pengali harga ×1.5.
Semua output Veo membawa SynthID, penanda tak kasatmata milik Google untuk konten yang dihasilkan AI, yang bisa diverifikasi di platform mereka. Tidak ada provider — termasuk kami — yang bisa mematikannya.
Kami menganggarkan kira-kira empat menit. Google mempublikasikan minimum 11 detik dan maksimum 6 menit pada jam sibuk, jadi untuk satu set klip lengkap pakailah webhookUrl alih-alih menahan loop polling tetap terbuka.