Loading...
Loading...
Tingkat Veo 3.1 yang lebih cepat dan murah, mencakup teks ke video, gambar ke video, referensi ke video, dan transisi frame awal-akhir.
Masuk untuk menjalankan model
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/image-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Estimasi biaya per pembuatan berdasarkan durasi dan resolusi. Anda hanya membayar untuk yang Anda jalankan.
Serahkan satu gambar diam ke endpoint ini dan ia menjadi frame pertama sebuah shot yang bergerak dan bermusik. Kami menjalankan Veo 3.1 Fast milik Google sebagai google/veo-3.1-fast/image-to-video, dan kami menagih per detik output: $0.01 per detik, ×1.5 dengan trek audio aktif. Jadi klip 720p berdurasi 8 detik dengan suara adalah $0.12 — satu gambar plus satu prompt, tanpa repot mengurus referensi.
Tidak punya gambar awal untuk diolah? Kalau begitu Veo 3.1 Fast text-to-video adalah endpoint Anda — model yang sama, harga yang sama, hanya prompt, dan ia mengizinkan Anda turun ke 4 atau 6 detik. Kalau justru Anda punya beberapa gambar dan intinya menjaga satu karakter tetap konsisten lintas shot, pergilah ke Veo 3.1 Fast reference-to-video.
Tidak ada yang menjual model ini per video. Google, fal.ai, Replicate, dan kami semua mengukur output detik demi detik, jadi perbandingan yang adil harus mengunci konfigurasinya. Ini dia 8 detik, 720p, audio aktif, saat kami terakhir memeriksanya pada 26 Agustus 2026:
| Provider API | Penagihan | Tarif (720p, audio aktif) | Klip 8 detik | vs. kami |
|---|---|---|---|---|
| E2X (saat ini) | per detik | $0.01/d ×1.5 audio | $0.12 | — |
| Google Gemini API | per detik | $0.10/d | $0.80 | 6,7× harga kami |
| fal.ai | per detik | $0.15/d | $1.20 | 10× harga kami |
| Replicate | per detik | $0.15/d | $1.20 | 10× harga kami |
| Harga daftar E2X (sebelum diskon) | per detik | $0.10/d ×1.5 | $1.20 | tarif kami tanpa diskon |
Renungkan baris paling bawah itu. Harga daftar kami tanpa diskon adalah $1.20 untuk klip 8 detik — angka yang identik dengan yang ditagihkan fal.ai dan Replicate. $0.12 yang Anda bayar sekarang adalah sepersepuluhnya, dan masih 6,7× di bawah API Google sendiri.
Resolusi memukul tagihan secara berbeda tergantung di mana Anda membeli. Naik dari 720p ke 1080p tidak menelan biaya tambahan di fal.ai atau Replicate; Google menagih tarif per detik yang lebih tinggi. Kami juga memperlakukan resolusi sebagai pengali, jadi bacalah angka terkini dari llms.txt model ini sebelum merencanakan proses 1080p.
Harga dan ketentuan produk dapat berubah sewaktu-waktu. Periksa harga terkini masing-masing provider sebelum mengambil keputusan pembelian. Harga Google Batch atau Flex tidak setara langsung dengan request API on-demand standar karena kondisi penjadwalan, ketersediaan, dan pemrosesannya berbeda; karena itu harga tersebut tidak disertakan dalam perbandingan ini. Ini adalah perbandingan dengan cakupan terbatas, bukan klaim bahwa E2X adalah opsi termurah di dunia dalam setiap konfigurasi.
Gambar Anda menjangkarkan frame satu. Semua setelahnya dihasilkan — pegang model mental itu, karena ia menjelaskan sekaligus kekuatannya dan cara gagalnya.
Kekuatannya: komposisi, palet, busana, dan set sudah selesai ditetapkan. Anda tidak sedang berjudi lewat prosa untuk mereproduksi foto produk yang sudah disetujui klien. Masukkan gambar diamnya, deskripsikan geraknya, dapatkan klip yang bermula persis di tempat gambar diam itu bermula.
Cara gagalnya: makin jauh klip itu berjalan dari frame tersebut, makin banyak ia berimprovisasi. Minta orbit 180° dalam delapan detik dan sisi jauh subjeknya adalah karangan. Minta push-in lambat plus satu putaran kepala, dan ia bertahan.
Audionya ikut menumpang. Google menghasilkannya secara native dan API mereka tidak punya sakelar untuk menonaktifkannya — dialog tersinkron, langkah kaki di tempat kaki menjejak, room tone di bawahnya. Sebuah foto diam masuk; sesuatu bersoundtrack keluar.
Batasan Google atas gambar sumber, terus terang:
image_url saat job berjalan, bukan saat Anda mengirimkannya.Yang terakhir itu menyebabkan lebih banyak kegagalan daripada sisanya digabungkan: tautan bertanda tangan yang berumur pendek kedaluwarsa di tengah antrean.
Dua field wajib di sini: prompt dan image_url.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/image-to-video",
"input": {
"prompt": "Barista menggeser cangkirnya ke depan dan uap mengepul naik. Push-in lambat ke arah crema. Desis mesin espresso, obrolan kafe lirih di belakang.",
"image_url": "https://example.com/counter-shot.jpg",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
Anda menerima job ID sebagai balasan. Lakukan polling, atau serahkan webhook kepada kami:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/image-to-video",
input: {
prompt:
"Ia menurunkan kacamata hitamnya dan melirik ke luar bingkai sebelah kiri. Ujung roknya terangkat tertiup angin. Kamera terkunci, camar dan debur ombak di bawahnya.",
image_url: "https://example.com/lookbook-03.jpg",
aspect_ratio: "9:16",
resolution: "720p",
duration: "8",
has_sound: "true",
seed: 88117,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Animation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Job bergerak pending → processing → completed, atau berhenti di failed / cancelled. Kirim webhookUrl kalau Anda lebih suka tidak melakukan polling. Kami merencanakan kira-kira empat menit; rentang yang dipublikasikan Google adalah 11 detik pada kondisi terbaik, 6 menit pada jam sibuk.
Perhatikan tipenya: duration, resolution, dan has_sound adalah string. "true", bukan true.
Tiga pintu menuju bobot yang identik, dengan harga per detik yang identik. Input Anda yang menentukan yang mana:
| Endpoint | Klip 8d, 720p + audio | Pilih saat |
|---|---|---|
| Veo 3.1 Fast image-to-video | $0.12 | Satu gambar diam yang sudah disetujui harus menjadi frame satu |
| Veo 3.1 Fast text-to-video | $0.12 | Belum ada apa pun — dan Anda mau opsi 4d atau 6d |
| Veo 3.1 Fast reference-to-video | $0.12 | Hingga tiga gambar harus mendefinisikan wajah, produk, atau tempat yang berulang |
Pembagian jujurnya: pakai endpoint ini ketika gambar diam itu adalah frame pembukanya. Pakai reference-to-video ketika gambar Anda berperan sebagai panduan — aktor yang sama di lima adegan — dan terimalah bahwa ia mengunci Anda ke 8 detik. Sekadar menjajaki? Jangan unggah apa pun: text-to-video pada 4 detik berbiaya $0.06 dan melahap storyboard dengan cepat. Telusuri sisanya di kategori image-to-video atau di seluruh katalog model.
Kesalahan umumnya adalah mendeskripsikan ulang gambar yang baru saja Anda unggah. Model bisa melihatnya. Setiap kata yang dihabiskan untuk "seorang perempuan bermantel merah di dermaga" adalah kata yang tidak dihabiskan untuk apa yang terjadi berikutnya — dan itu mengundang penafsiran ulang atas frame yang sudah Anda kunci.
Tulislah perubahannya. Tiga kebiasaan memikul sebagian besar kualitasnya:
Berikan satu gerak utama. Satu putaran kepala, satu dorongan kamera, satu pintu terbuka. Tumpuk empat aksi ke dalam delapan detik dan tidak satu pun terbaca.
Sebutkan di mana kamera berada dan apakah ia bergerak. "Terkunci", "dolly in lambat", "handheld melayang ke kanan". Diam soal ini menghasilkan layangan tanpa arah.
Beri musiknya dengan lantang. Sebutkan ambiensnya dan setiap baris dialog dalam tanda kutip. Audionya dihasilkan entah Anda merencanakannya atau tidak, jadi rencanakanlah.
Prompt dalam bahasa Inggris didukung sepenuhnya. Google belum mengevaluasi bahasa lain untuk model ini, jadi pertahankan instruksinya dalam bahasa Inggris bahkan ketika baris ucapannya dalam bahasa lain.
Dua hari. Itu jendela unduhan Anda. Google menyimpan video yang dihasilkan selama dua hari — kalimat mereka: Anda harus mengunduh video Anda dalam 2 hari sejak dibuat. Tarik outputs[0].url ke penyimpanan Anda sendiri di jalur kode yang sama yang membacanya. Tautan yang dikembalikan bersifat sementara.
SynthID ada di setiap frame. Google memberi watermark pada semua output Veo dengan penanda provenance tak kasatmatanya, yang bisa diverifikasi lewat platform mereka. Tidak ada provider yang bisa menonaktifkannya, termasuk kami.
Manusia di wilayah yang diatur. Di seluruh UE, Inggris, Swiss, dan MENA, personGeneration dibatasi pada allow_adult.
Samakan aspect ratio dengan sumber Anda. Gambar diam 16:9 dengan permintaan 9:16 memaksa model mengarang bagian tepinya.
Kami mengenakan biaya $0.01 per detik video yang dihasilkan, dikalikan 1,5 ketika audio aktif. Itu membuat klip 720p 8 detik dengan suara menjadi $0.12. Resolusi lebih tinggi menerapkan pengalinya sendiri, jadi periksa halaman model versi live sebelum menganggarkan batch 1080p atau 4k.
Di bawah 8 MB, minimal 720p, dan salah satu dari 16:9 atau 9:16. Kami mengambilnya dari image_url yang Anda berikan, jadi tautannya harus masih bisa diakses saat job berjalan — URL bertanda tangan yang kedaluwarsa adalah kegagalan paling umum di sini.
Tidak di endpoint ini — ia menerima tepat satu image_url. Kalau beberapa gambar perlu memandu sebuah generasi, pakai reference-to-video, yang menerima array berisi hingga tiga.
Ya, dan itu alasan utama meraih model ini. Google memproduksi dialog, efek, dan ambiens yang tersinkron secara native, tanpa sakelar mati di API mereka sendiri. Schema kami memaparkan has_sound, dengan default true, yang membawa pengali ×1.5.
Hingga 8 detik. Endpoint ini menerima 4, 6, atau 8, tetapi output 1080p dan 4k mensyaratkan 8 detik penuh. Tidak ada satu pun di keluarga Veo 3.1 Fast yang melampaui 8 detik dalam satu call.
Setiap video Veo membawa SynthID, watermark provenance AI tak kasatmata milik Google, dan ia bisa diperiksa di platform verifikasi mereka. Tidak ada yang menawarkan cara mematikannya.
Rencanakan sekitar empat menit per job. Angka resmi Google menempatkan lantainya di 11 detik dan langit-langit jam sibuknya di 6 menit, jadi webhook mengalahkan loop polling begitu Anda menjalankan volume yang sungguhan.