Loading...
Loading...
Generate video from up to seven reference images with Gemini Omni 1.1 Flash. The reference images carry character and style consistency into the result.
0/7 item
Masuk untuk menjalankan model
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Estimasi biaya per pembuatan berdasarkan durasi dan resolusi. Anda hanya membayar untuk yang Anda jalankan.
Sebuah kampanye tidak pernah cuma satu klip. Ia sebuah shot list — sebelas baris, tas kurir yang sama di setiap baris, dan tak ada anggaran untuk satu sore ketika tas itu berubah kelabu di sekitar baris keenam. Reference-to-video menjaga tas itu tetap tas yang sama. Kami menjalankannya sebagai google/omni-1.1-flash/reference-to-video dan menagih $0.09 per detik output 720p, jadi klip delapan detik default berbiaya $0.72, audio termasuk.
Field yang mengerjakan tugas itu adalah image_urls — sebuah array, dengan minItems: 1 dan maxItems: 7 di schema kami. Batas atas itulah alasan halaman ini ada. Tujuh slot menunjukkan sebuah subjek dari cukup banyak sudut sehingga model berhenti mengarang sudut-sudut yang Anda sembunyikan.
Materi lain, pintu lain: satu gambar diam tunggal ke Omni 1.1 Flash image-to-video, kedua ujung sebuah shot dengan jarak di antaranya ke start-end-frame-to-video, dan sebuah brief tanpa aset apa pun ke Omni 1.1 Flash text-to-video, yang membawa seluruh kisi harganya.
Tarif kami, dibaca dari katalog live pada 28 Agustus 2026:
| Panjang klip | Harga pada 720p |
|---|---|
| 4 detik | $0.36 |
| 6 detik | $0.54 |
| 8 detik (default) | $0.72 |
| 10 detik | $0.90 |
Harga daftarnya $0.15 per detik; diskon tetap 40% menurunkannya ke $0.09. Resolusi menskalakannya dari sana — $0.0297 pada 360p, $0.18 pada 4K, jadi render 4K sepuluh detik adalah $1.80. Lalu angka yang menentukan cara Anda membangun: lampirkan satu referensi atau tujuh, tak ada satu pun di atas yang bergerak. duration dan resolution adalah seluruh rumusnya. Referensi adalah bobot gratis.
Harga dan ketentuan produk dapat berubah sewaktu-waktu. Periksa harga terkini masing-masing provider sebelum mengambil keputusan pembelian. Harga Google Batch atau Flex tidak setara langsung dengan request API on-demand standar karena kondisi penjadwalan, ketersediaan, dan pemrosesannya berbeda; karena itu harga tersebut tidak disertakan dalam perbandingan ini. Ini adalah perbandingan dengan cakupan terbatas, bukan klaim bahwa E2X adalah opsi termurah di dunia dalam setiap konfigurasi.
API mengambil setiap URL di dalam array, jadi semuanya harus berada di tempat yang bisa dijangkau worker kami lewat HTTPS biasa — sebuah bucket publik, tautan bertanda tangan yang belum kedaluwarsa, tidak ada yang di balik login.
Tujuh adalah maksimum tervalidasi, bukan sebaris kalimat di halaman dokumentasi. Kirim yang kedelapan dan request-nya ditolak sebelum satu GPU pun tersentuh. Itu terdengar seperti batasan; perlakukan sebagai anggaran. Satu set yang pantas memakai ketujuh slotnya berisi tampak tiga perempat, profil, punggung, satu detail pembawa merek, satu pada jarak yang akan dibingkai klipnya, dan satu di bawah cahaya netral. Sudut hero yang diduplikasi cuma memboroskan slot. Sudut yang Anda sembunyikan akan ditebak.
Itulah pergeseran dari generasi sebelumnya. Endpoint reference-to-video Gemini Omni Flash kami menjalankan gagasan yang sama pada $0.075 per detik tanpa batas atas terdokumentasi sama sekali — Google tak pernah mempublikasikan satu pun, jadi kami menolak mencetak angka yang tak bisa kami pertanggungjawabkan. Itu endpoint yang lebih murah, dua puluh persen, dan alasannya kelihatan: tidak ada batas maksimum tujuh slot yang tervalidasi, dan tidak ada tingkat 360p untuk melatih satu set referensi sebelum Anda mengeluarkan uang. Google mempensiunkan model itu pada 30 September 2026. Kalau sebuah pipeline masih menunjuk ke sana, migrasinya cuma tukar slug, biayanya seperlima lebih mahal per detik, dan mendarat di sini.
Bangun array-nya sekali. Simpan ketujuh URL itu di samping shot list Anda dan kirim array yang identik itu bersama setiap job. Set-nya adalah suku tetap; prompt-nya yang jadi variabel.
Pembalikan itulah alur kerjanya. Karena referensilah yang membawa subjeknya, tiap prompt berhenti mendeskripsikan seperti apa rupa benda itu dan mulai mendeskripsikan apa yang terjadi padanya — kamera, apa yang bergerak, cahayanya, suaranya. Prompt jadi lebih pendek dan klip jadi lebih konsisten, yang bukan trade-off seperti dugaan orang. Kunci sebuah seed saat membandingkan dua pilihan kata untuk satu shot, supaya Anda bisa tahu apakah penulisan ulangnya yang menolong atau sekadar undian.
Anggarkan 240 detik per job dan sebarkan shot list-nya secara paralel. Lalu tetap terkalibrasi oleh apa yang diakui model card Google:
"Menjaga konsistensi penuh sepanjang proses pengeditan, menghasilkan adegan dengan gerakan kompleks, atau merender teks yang benar-benar akurat masih menjadi tantangan."
Tujuh referensi mempersempit penyimpangannya. Mereka tidak menghapusnya.
Dua field wajib: prompt dan image_urls. Simpan key Anda di sisi server lalu kirim job-nya.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/reference-to-video",
"input": {
"prompt": "Gambar 1 adalah sepeda lipatnya, gambar 2 engselnya, gambar 3 pengendaranya. Halaman berbatu saat matahari terbit. Pengendara membuka lipatannya dan mengunci rangkanya. Wide terkunci. Kicau burung, trem di kejauhan.",
"image_urls": [
"https://example.com/bike-folded.jpg",
"https://example.com/bike-hinge.jpg",
"https://example.com/rider.jpg"
],
"duration": "8",
"aspect_ratio": "16:9"
}
}'
Yang kembali adalah data.jobId. Render butuh beberapa menit, jadi lakukan polling perlahan — atau kirimkan webhookUrl dan lewati polling.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
// Satu array, dipakai ulang oleh setiap prompt.
const image_urls = [
"https://example.com/fox-puppet-front.jpg",
"https://example.com/fox-puppet-muzzle.jpg",
"https://example.com/fox-puppet-profile.jpg",
];
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/reference-to-video",
input: {
prompt:
"Gambar 1 adalah boneka rubahnya. Ia mencondongkan badan dari kiri frame dan memiringkan kepalanya. Dolly masuk perlahan. Gemerisik kertas, room tone yang lembut.",
image_urls,
duration: "10",
aspect_ratio: "9:16",
resolution: "1080p",
seed: 70413,
},
}),
}).then((r) => r.json());
const { jobId } = submitted.data;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") { console.log(job.data.outputs[0].url); break; }
if (job.data.status === "failed") throw new Error(job.data.error?.message);
await new Promise((r) => setTimeout(r, 5000));
}
Status berjalan pending → processing → completed, atau berhenti di failed / cancelled. Satu jebakan: duration dan resolution adalah string. "10", jangan pernah 10. Schema dan harganya ada di spesifikasi machine-readable.
Veo 3.1 Fast reference-to-video berbiaya $0.01 per detik di platform yang sama ini. Sembilan kali lebih murah. Delapan detik di sana $0.08 melawan $0.72 di sini, dan kami tidak akan menguburnya di bawah sebuah tabel.
Jadi jawaban defaultnya adalah Veo. Kalau sebuah shot list butuh tiga referensi, delapan detik, dan 720p, memanggil apa pun selain itu berarti membuang uang untuk apa-apa.
Empat hal membalikkannya. Anda butuh lebih banyak referensi daripada yang diterima Veo, yang berhenti di tiga melawan tujuh milik kami — bedanya seperti meliput sebuah subjek versus sekadar mencuplikinya. Anda butuh sepuluh detik, yang tak akan diberikan Veo. Anda butuh 4K. Atau Anda mau tingkat 360p, tempat dua puluh draft berbiaya lebih murah daripada satu klip jadi dan pemenangnya dirender ulang dari array dan seed yang sama. Di luar keempat hal itu, ambil yang murah. Selebihnya ada di kategori reference-to-video, dan sisanya di katalog model.
Referensi Anda adalah unggahan benda nyata, dan kadang orang nyata. Google memblokir unggahan gambar yang menampilkan anak di bawah umur, atau sebagian individu yang dikenali, bagi pengguna di Inggris, Swiss, dan Wilayah Ekonomi Eropa. Di sini itu sebuah batasan casting, bukan catatan kaki. Taruh di dalam brief, bukan di dalam job yang gagal pukul dua pagi.
Setiap frame membawa SynthID. Watermark tak terlihat milik Google ada di semua output dan tak ada provider yang bisa mematikannya, termasuk kami. Bereskan kontrak apa pun yang melarang aset AI berlabel sebelum Anda berintegrasi.
Suara lahir dari kata-kata. Audio dihasilkan bersama gambarnya dan diarahkan dari prompt yang sama — tidak ada sakelar has_sound, tidak ada unggahan referensi audio.
URL hasil kedaluwarsa. Salin tiap output ke penyimpanan Anda sendiri di dalam handler yang membaca outputs[0].url. Kampanye yang Anda render ulang adalah kampanye yang Anda bayar dua kali.
Bahasa Inggris satu-satunya bahasa prompt yang didukung penuh, dan model ini terdaftar di Gemini Enterprise Agent Platform, penerus yang Google tempatkan menggantikan Vertex AI pada April 2026. Latar belakangnya ada di ulasan rilis kami.
Melampirkan tujuh gambar memberi tahu model apa saja yang ada. Ia tidak mengatakan mana yang jadi pemeran utama. Itu Anda lakukan lewat prosa: gambar 1 adalah tekonya, gambar 2 adalah tutup enamelnya, gambar 3 adalah dapurnya. Bernomor, di baris pertama, sebelum arahan apa pun.
Lalu berhenti mendeskripsikan subjeknya. Prompt yang menspesifikasikan ulang warna dan bentuk sesuatu yang sudah Anda lampirkan sedang berdebat dengan referensi Anda sendiri, dan model akan membelah selisihnya. Habiskan kata-kata untuk apa yang tak bisa dibawa array: kamera, satu gerakan, cahayanya, ambiensnya. Jaga tiap prompt tetap satu shot berkelanjutan — minta narasi tiga adegan dan yang Anda dapat adalah keburaman. Panduan prompting Gemini Omni kami menggali lebih dalam soal kosakata shot.
Tujuh, dan batasnya dipublikasikan alih-alih ditebak-tebak: image_urls divalidasi dengan minItems: 1 dan maxItems: 7, jadi entri kedelapan gagal saat submit. Pendahulunya tidak punya batas atas terdokumentasi. Itulah perbedaan praktis terbesarnya.
Tidak. Kami menagih per detik video jadi, diskalakan oleh resolusi; jumlah referensi tidak ada di dalam perhitungan itu. Satu referensi atau tujuh, klip 720p delapan detik tetap $0.72. Panjang dan resolusi satu-satunya tuas.
Nomori mereka di dalam prompt — gambar mana yang memuat produknya, mana detailnya, mana lingkungannya — lalu deskripsikan aksinya. image_urls cuma daftar telanjang sampai prosa Anda membagikan perannya.
Justru itu bentuk yang dimaksudkan. Simpan array-nya sekali dan kirim tanpa diubah bersama setiap prompt, hanya arahannya yang bervariasi. Sebuah seed yang dikunci menjaga pencahayaan cukup stabil agar klip-klipnya bisa disambung.
Hampir selalu, pada $0.01 per detik — Veo 3.1 Fast sembilan kali lebih murah untuk request yang setara. Pindahlah ke sini ketika tiga referensi tidak cukup meliput, ketika editan butuh sepuluh detik, ketika deliverable-nya 4K, atau untuk loop draft 360p.
360p, 720p, 1080p atau 4K, pada 16:9 atau 9:16, dalam 4, 6, 8 atau 10 detik, selalu pada 24 fps. Dua resolusi teratas adalah hasil upscale alih-alih render native, jadi nilailah ketajamannya pada footage Anda sendiri.
Google mendeprekasi gemini-omni-flash-preview pada tanggal itu, dan setiap provider yang menjalankan bobot tersebut berhenti di hari yang sama. Arahkan job Anda ke sini: bentuk request yang sama, batas atas referensi yang terdokumentasi. Halaman reference-to-video yang lama tetap tayang sebagai rujukan migrasi.