Loading...
Loading...
Keluarga model video Google yang membuat klip dari prompt teks atau gambar referensi, dioptimalkan untuk hasil cepat.
0/7 item
Masuk untuk menjalankan model
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Estimasi biaya per pembuatan berdasarkan durasi dan resolusi. Anda hanya membayar untuk yang Anda jalankan.
Omni Flash adalah gemini-omni-flash-preview milik Google — model video keluarga Gemini, bukan Veo — dan promosi DeepMind sendiri untuknya cuma satu kalimat: "Bayangkan Gemini Omni seperti Nano Banana, tetapi untuk video." Kami menjalankan kemampuan reference-to-video-nya sebagai google/omni-flash/reference-to-video, dan kami menagih $0.10 untuk setiap detik video 720p yang jadi. Klip default 8 detik karena itu berbiaya $0.80, audio termasuk.
Perhatikan satuannya. Tidak ada yang menjual satu klip di sini dengan tarif datar, jadi angka apa pun yang Anda bandingkan harus dikalikan dengan panjang yang hendak Anda render.
Punya naskah tetapi tidak punya gambar untuk dibawa ke dalam shot? Kalau begitu Veo 3.1 Fast text-to-video adalah endpoint yang Anda cari — ia bermula hanya dari prompt, dan di platform kami biayanya jauh lebih rendah. Kami kembali ke sana di bawah, dengan jujur.
Posisi kami terhadap tempat-tempat lain yang bisa memanggil model ini, diperiksa pada 26 Agustus 2026:
| Provider API | Per detik (720p) | Klip 8 detik | vs. E2X |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | kami 23% lebih murah |
| Atlas Cloud | $0.135 | $1.08 | kami 26% lebih murah |
| Runware | $0.10 | $0.80 | setara |
| Google Gemini API | $0.10 | $0.80 | setara |
Harga dan ketentuan produk dapat berubah sewaktu-waktu. Periksa harga terkini masing-masing provider sebelum mengambil keputusan pembelian. Harga Google Batch atau Flex tidak setara langsung dengan request API on-demand standar karena kondisi penjadwalan, ketersediaan, dan pemrosesannya berbeda; karena itu harga tersebut tidak disertakan dalam perbandingan ini. Ini adalah perbandingan dengan cakupan terbatas, bukan klaim bahwa E2X adalah opsi termurah di dunia dalam setiap konfigurasi.
Kami tidak akan memoles kenyataan itu: pada model ini kami menyamai tarif Google alih-alih memangkasnya, dan penghematannya nyata hanya terhadap fal.ai dan Atlas. Gambar referensi nyaris tidak terasa — Google menghitung satu gambar sebagai 2.040 token, jadi tiga gambar berbiaya sekitar satu sen. duration adalah field yang menggerakkan tagihan Anda.
Inti endpoint ini adalah kesinambungan. Serahkan sebuah subjek kepada model — seseorang, sebuah produk, sebuah set, sebuah tampilan — deskripsikan adegan yang tidak pernah memotretnya, dan subjeknya selamat sampai tujuan.
Anda bisa melampirkan beberapa referensi, bukan satu. Contoh yang dipublikasikan Google sampai enam; tidak ada maksimum resmi yang didokumentasikan, dan angka dari pihak ketiga saling bertentangan, jadi kami tidak akan mencetak satu angka pun. Bangunlah untuk segelintir, uji langit-langit Anda sendiri.
Audio dihasilkan bersama gambarnya, bukan ditempelkan. Ia tersinkron dengan aksinya, dan Anda mengarahkannya dari prompt yang sama — minta hujan di atap seng dan room tone yang rendah, dan itulah yang kembali. Tidak ada trek audio terpisah untuk diedit belakangan.
Sepuluh detik adalah atapnya. Enum duration kami memaparkan 4, 6, 8, dan 10; model Google berjalan 3 sampai 10 detik, dan 10 itu batas keras. Tidak ada endpoint perpanjangan, tidak ada interpolasi. Apa pun yang lebih panjang adalah pekerjaan menjahit di editor Anda sendiri — dan kesinambungan antarpotongan menjadi masalah Anda.
720p, 24 fps, dan itu saja daftarnya. Field resolution kami membawa nilai 1080p dan 4k dan Google mencantumkan resolusi lebih tinggi sebagai segera hadir, tetapi hari ini model mengembalikan 720p. Biarkan pada default. Halaman provider yang mengiklankan 1080p di sini mendahului dokumentasi Google sendiri.
Harapkan sekitar 45 detik pemrosesan untuk klip standar — p50 hasil pengukuran dari eachlabs, bukan angka resmi, jadi pakailah untuk merencanakan, bukan untuk menjanjikan.
Dua field wajib: image_urls dan prompt. Buat sebuah key dari dashboard Anda, simpan di server yang Anda kendalikan, lalu kirim job-nya.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "Sepatu kets dari gambar 1 tergeletak di aspal basah saat sebuah bus menjauh di belakangnya. Push-in lambat. Lalu lintas ambien dan hujan ringan, tanpa musik.",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
Responsnya membawa sebuah job ID. Video butuh beberapa menit, jadi lakukan polling perlahan — atau lewati polling dan sertakan webhookUrl di body submit:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"Perempuan pada referensi berjalan melintasi pasar malam, papan neon memantul di jaketnya. Handheld. Gumaman kerumunan dan suara gorengan di kejauhan.",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
Status bergerak pending → processing → completed, atau berhenti di failed atau cancelled. Schema dan harga versi live ada di spesifikasi machine-readable kalau Anda lebih suka membacanya secara terprogram.
Perbandingan yang penting, dan ia tidak menyanjung halaman ini:
| Model | Harga kami (8d, 720p, audio) | Pilih saat |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | Beberapa referensi harus tetap konsisten, atau Anda butuh klip 10 detik |
| Veo 3.1 Fast reference-to-video | $0.12 | Hingga tiga referensi, 8 detik, dan Anda mau tagihan lebih murah |
| Veo 3.1 Fast image-to-video | $0.12 | Satu frame diam yang ingin Anda animasikan |
| Veo 3.1 Fast text-to-video | $0.12 | Sama sekali tidak ada materi sumber |
Veo 3.1 Fast berbiaya sepersekian Omni Flash di platform kami, dan ia mencapai 1080p dan 4K, yang saat ini tidak bisa dilakukan Omni Flash. Pada harga daftar Google sendiri keduanya berada di $0.10 per detik yang sama untuk 720p — pemberian diskon kamilah yang membuka jaraknya. Jadi mulailah dari Veo Fast. Kembalilah ke sini ketika batas tiga referensinya yang menghambat Anda, ketika Anda butuh dua detik ekstra itu, atau ketika Anda menginginkan perilaku video-editing di balik pembingkaian "Nano Banana untuk video". Opsi lain ada di kategori reference-to-video, dan seluruh katalog model muat dalam satu halaman.
Public Preview berarti sudut-sudut kasarnya didokumentasikan alih-alih disembunyikan. Baca ini sebelum Anda membangun:
Tulis shot-nya, bukan ceritanya. Satu subjek, satu gerak kamera, satu kondisi pencahayaan — lalu sebutkan bunyinya seperti apa, karena audio keluar dari prompt yang sama dan kesunyian adalah pilihan yang Anda ucapkan lantang.
Beri label pada lampiran Anda ketika lebih dari satu yang masuk: "gambar 1 adalah botolnya, gambar 2 adalah close-up labelnya." Tidak ada hal lain yang memberi tahu model referensi mana yang jadi pemeran utama. Jaga bahasa kamera tetap sederhana — "push-in lambat", "terkunci", "handheld mengikuti" mengalahkan satu paragraf sinematografi.
Setiap klip membawa watermark SynthID — tak terlihat oleh penonton, terdeteksi secara terprogram — dan content credentials C2PA dilekatkan secara default. Tidak ada provider yang menjalankan model ini bisa mematikannya, termasuk kami. Kalau kontrak klien melarang aset AI berlabel, bereskan itu sebelum Anda berintegrasi.
Simpan ulang output Anda di penyimpanan Anda sendiri di dalam handler penyelesaian. URL hasil bukan alamat permanen, dan video yang tidak bisa Anda ambil kembali adalah video yang Anda bayar dua kali.
Ia adalah gemini-omni-flash-preview milik Google, model pembuatan dan pengeditan video dari keluarga Gemini alih-alih keluarga Veo. DeepMind menggambarkannya sebagai "Nano Banana, tetapi untuk video" — penekanannya jatuh pada membawa referensi secara konsisten dan mengedit rekaman yang sudah ada, sementara Veo menyasar generasi sinematik dari nol. Ia berstatus Public Preview.
$0.80. Kami mengenakan biaya $0.10 per detik output 720p, jadi panjanglah yang menggerakkan tagihan — klip 4 detik $0.40, maksimum 10 detik $1.00. Itu tarif kami pada pemeriksaan 26 Agustus 2026.
Lebih dari satu, dan contoh yang didokumentasikan Google sampai enam — tetapi tidak ada maksimum resmi yang dipublikasikan. Sumber di luar Google mengutip langit-langit yang berbeda-beda dan saling bertentangan, jadi kami tidak akan mengulang angka yang tidak bisa kami verifikasi. Uji payload Anda sendiri sebelum merancang di sekitar jumlah tertentu.
Tidak hari ini. Ia menghasilkan 720p pada 24 fps, dan Google mencantumkan resolusi lebih tinggi sebagai segera hadir. Kalau Anda butuh 1080p atau 4K sekarang, Veo 3.1 Fast mencapai keduanya.
Veo 3.1 Fast, untuk sebagian besar pekerjaan. Ia berbiaya $0.12 untuk klip 8 detik dengan audio di platform kami melawan $0.80 di sini, dan ia naik sampai 4K. Pilih Omni Flash ketika Anda butuh lebih dari tiga gambar referensi, durasi 10 detik, atau perilaku video-editing-nya.
Ya, secara native dan tersinkron dengan aksi di layar. Anda mengarahkannya dari prompt yang sama — sebutkan ambiensnya, efeknya, atau mintalah musik. Audio tidak bisa diedit belakangan lewat API, jadi sebuah perubahan berarti render ulang.
Ya. Setiap output membawa watermark SynthID yang tak bisa dilihat penonton tetapi bisa dibaca perkakas deteksi, plus content credentials C2PA yang aktif secara default. Tidak ada provider yang memaparkan parameter untuk menonaktifkan keduanya.
Hanya di luar EEA, Swiss, dan Inggris — Google membatasi pengeditan video yang diunggah di wilayah-wilayah tersebut. Generasi reference-to-video itu sendiri tidak terpengaruh. Catat juga bahwa referensi video diterima oleh schema tetapi tidak diproses dengan benar, jadi kirimlah gambar.