Adegan 40 Detik Gemini Omni 1.1 Flash Adalah Empat Tagihan Terpisah
Angka di setiap judul pekan ini adalah empat puluh. Adegan empat puluh detik dari model video baru Google — yang terdengar seperti Anda mengetik sebuah prompt lalu mendapat empat puluh detik kembali.
Tidak begitu. Satu panggilan ke gemini-omni-1.1-flash mengembalikan tiga sampai sepuluh detik. Empat puluh adalah yang Anda capai dengan memperpanjang klip itu tiga kali lagi — empat pekerjaan seluruhnya, masing-masing ditagih terpisah. Tidak ada yang berbohong — pengumuman Google sendiri menjelaskan kelanjutan itu dengan gamblang — tetapi angkanya menempuh jarak jauh dari kalimat tersebut, dan sampai ke banyak orang sebagai angka per generasi.
Inilah ringkasan yang kami sendiri ingin punya sebelum menyodorkan kartu: berapa biaya empat puluh detik, untuk apa tier 360p itu, dan batasan-batasan yang terkubur di dokumentasi — salah satunya menutup fitur utama itu sepenuhnya bagi pengembang Eropa.

Empat puluh detik adalah empat pekerjaan, dan empat faktur
Model video menagih per detik output, dan perpanjangan tidak membawa diskon — satu kelanjutan berbiaya sama dengan satu generasi baru, jadi empat puluh detik dihitung seperti empat klip sepuluh detik. Di setiap tier:
| Resolusi | Di E2X | Langsung dari Google |
|---|---|---|
| 360p | $1.19 | $1.35 |
| 720p | $3.60 | $4.06 |
| 1080p | $5.40 | $6.08 |
| 4K | $7.20 | $12.16 |
Empat kali sepuluh detik pada tiap tarif per detik. Angka kami berasal dari katalog langsung; halaman model memuat angka terkini kalau tulisan ini menua.
Kolom Google itu layak dikomentari, karena tarifnya ternyata sulit sekali ditemukan. Dua halaman resmi memuat tangga lengkapnya dan pencarian teks tidak menangkap satu pun. Di pengumuman peluncuran harganya duduk di dalam sebuah gambar — terbaca oleh manusia, tak terlihat oleh Ctrl-F. Di halaman Cloud pricing mereka muncul sebagai token per detik terhadap meteran $17.50-per-satu-juta, jadi mereka tidak tampak seperti harga sampai Anda mengalikannya. Halaman yang akan Anda buka lebih dulu, dokumentasi harga API, memberi satu dari empat anak tangga: "an effective price of approximately $0.10 per second" di 720p.
Keduanya sepakat, dengan satu kerutan pembulatan — pengumumannya menunjukkan $0.03 / $0.10 / $0.15 / $0.30 yang rapi, sementara hitungan token mendarat sedikit di atas masing-masing. Penagihan mengikuti token, jadi kolom di atas juga; tulisan peluncuran memuat perhitungan tier demi tier.
Lima dolar empat puluh untuk empat puluh detik 1080p, enam sekian dari Google. Itu harga tempel sebelum satu pun take alternatif — dan Anda akan mengambilnya, karena perpanjangan terakhirlah tempat penyimpangan muncul. Anggarkan potongan yang Anda simpan ditambah dua yang Anda buang, dan satu sekuens empat puluh detik yang jadi berharga enam belas dolar, bukan lima.
Baris 360p dulu adalah baris yang kami kalah, dan kami mencetaknya begitu di sini sampai belum lama ini. Ia berubah: tier draf kami sekarang $0.0297 per detik melawan $0.0338 milik Google, dua belas persen di bawah. Jangan membaca terlalu banyak dari itu. fal ada di $0.03 — jarak satu persen, derau statistik yang didandani seperti kemenangan, dan hal semacam itu bisa berbalik begitu seseorang menyunting sebuah pengali. Alur kerja draf di bawah ini berlaku dari siapa pun Anda membelinya; ia tidak pernah bergantung pada harganya milik kami.
Peningkatan 1.1 yang sesungguhnya adalah ingatan, bukan durasi
Durasi kurang lebih sudah terjangkau sebelumnya. Yang membuatnya berguna adalah apa yang dilihat model ketika ia melanjutkan.
Preview bulan Juni membaca satu detik terakhir klip yang sedang diperpanjangnya. Satu detik memberi tahu apa yang ada di dalam layar dan nyaris tidak ada tentang apa yang sedang terjadi, jadi perpanjangannya menyimpang. Shot yang mengikuti berhenti mengikuti. Sebuah jaket bergeser satu nada warna. Cahaya membangun dirinya ulang di setiap sambungan.
Gemini Omni 1.1 Flash membaca sampai sepuluh detik rekaman sebelumnya. Sepuluh detik cukup panjang untuk tahu bahwa dolly-nya masih berjalan, dari sisi mana key light datang, dan kira-kira apa warna mantelnya — itulah sebabnya sekuens empat bagian kini bisa menyatu sama sekali. Kalau ada yang bilang fitur utama 1.1 adalah durasi, ia salah arah. Durasi itu aritmetika. Ingatan itu modelnya.
1080p dan 4K adalah upscale, bukan render
Satu tanda kurung di dokumentasi Google mengubah apa yang seharusnya Anda bayar. Dari referensi model, apa adanya: "1080p output (upscaled)" dan "4K output (upscaled)". Model me-render di bawah resolusi itu lalu menaikkan skalanya. Puncak tangga bukan detail yang lebih banyak — ia file yang lebih besar membawa informasi yang sama.
Yang mewarnai ulang baris 4K di atas. Dua belas dolar sekian, dari Google, untuk empat puluh detik output hasil upscale. Kalau spesifikasi klien menuntut dimensi 4K, bayarlah. Kalau Anda memilih 4K dengan anggapan ia terlihat lebih baik, Anda membayar tepat tiga kali tarif 720p Google untuk sebuah pengubahan ukuran yang bisa Anda jalankan sendiri di ffmpeg.
Buat draf di 360p, selesaikan di 720p
Inilah bagian yang menghemat uang, dan tidak ada yang menaruhnya di judul.
360p berbiaya $0.0297 per detik di sini — draf empat detik adalah dua belas sen, melawan $0.36 di 720p dan $0.54 di 1080p. Google juga mengklaim 360p berjalan sampai 60% lebih cepat, angka vendor alih-alih yang kami ukur sendiri, meski arahnya jelas benar.
Sekarang aritmetikanya. Katakanlah satu shot butuh sepuluh percobaan sebelum gerakannya pas — realistis untuk apa pun dengan gerakan kamera yang spesifik.
- Sepuluh kali jalan langsung di 1080p → $5.40
- Sepuluh kali jalan di 360p → $1.19, lalu satu pemenang di-render ulang di 1080p → $1.73
Enam puluh delapan persen lebih murah, dengan biaya satu generasi tambahan di ujung. Jujurlah tentang apa yang bisa diberitahukan satu kali jalan di 360p: komposisi, gerakan kamera, apakah model menyisipkan potongan yang tidak pernah Anda minta. Tekstur halus tidak bisa ia nilai — resolusinya tidak cukup untuk membawanya.
Berikut prompt yang sama pada kedua tier, seed yang sama, empat detik masing-masing. Draf lebih dulu:
Lalu render 720p dari prompt dan seed yang identik:
Keduanya menampilkan stopwatch kuningan di atas batu tulis gelap, kamera melakukan dolly masuk dari kiri, key light hangat menyapu logamnya. Prompt untuk keduanya, apa adanya:
Editorial slow-motion macro shot of a brass mechanical stopwatch resting on a dark slate table, its second hand sweeping forward in a single continuous shot with no scene cuts. Camera performs a slow dolly in from the left, shallow depth of field, one warm amber key light raking across the metal, cool blue rim light behind. Fine dust drifts through the beam. Clean dark background, no text, no logos, no people. Sound design: a soft mechanical tick and low room tone, nothing else.
(Prompt sengaja dibiarkan dalam bahasa Inggris: model ini hanya dievaluasi untuk bahasa Inggris.)
Dua belas sen melawan tiga puluh enam. Draf itu memberi tahu kami bahwa dolly-nya terbaca dan model menahan satu shot — semua yang kami perlukan sebelum berkomitmen. Jalankan loop Anda di bawah sana.
Perpanjangan hanya bergerak maju
Perpanjangan adegan menambahkan di belakang, dan bentuk batasan itu menentukan cara Anda merencanakan sebuah sekuens. Anda tidak bisa menyisipkan ke tengah sebuah klip. Anda tidak bisa memperpanjang mundur untuk membangun pembuka. Tidak ada "simpan akhirannya, bangun ulang empat detik pertama" — kemampuannya berjalan satu arah saja. Kalau shot ketiga salah, semua yang di hilirnya masuk tong sampah bersamanya.
Jadi tumpukan usaha di depan. Generasi pertama menetapkan bahasa kamera, palet dan pencahayaan untuk semua yang di hilirnya, dan ia satu-satunya segmen yang bisa Anda revisi dengan murah. Pada perpanjangan ketiga Anda sudah sedalam empat pekerjaan tanpa cara untuk menjangkau ke belakang.
Perpanjangan tidak akan melakukan satu hal lagi. Berikan ia video seseorang yang sedang berbicara, minta dialog baru, dan ia menolak — Google membatasi modifikasi ucapan. Pemberitaan saat peluncuran membacanya sebagai penahanan rilis yang bertanggung jawab dan disengaja alih-alih fitur yang hilang; pembingkaian itu milik si pewarta, tetapi pembatasannya ada di dokumentasi. Jangan membangun produk sulih suara di atas model ini.
Pengembang Eropa, baca baris ini dua kali
Terkubur di dokumentasi sebagai satu kalimat: di EEA, Swiss dan Britania Raya, menyunting dan memperpanjang video yang diunggah tidak tersedia.
Itu bukan pembatasan yang lunak. Fitur utamanya — ambil rekaman, lanjutkan — tidak bekerja di sebagian besar Eropa. Text-to-video dan image-to-video tetap jalan. Tapi kalau rencananya adalah sebuah alat yang memperpanjang klip yang diunggah pengguna Anda, dan pengguna itu duduk di Berlin atau Manchester, rencana itu mati — dan pengumumannya tidak pernah menyebutnya.
Periksa ini terhadap region deployment Anda sebelum menulis satu baris pun kode integrasi. Ini item termahal di sini kalau baru ditemukan terlambat.
Tombol-tombol yang tidak ada
Datang dari model teks, Anda akan meraih parameter yang tidak ada di sini. Dokumentasi Google menandai seluruh permukaan sampling sebagai tidak didukung: tidak ada temperature, tidak ada top_p, tidak ada instruksi sistem, tidak ada stop sequence, tidak ada negative prompt. Tidak satu pun.
Satu-satunya permukaan kendali Anda adalah prompt itu sendiri, dan dokumentasi pihak ketiga menaruh plafonnya di 40,000 karakter — tali yang panjang, meski angka itu bukan yang kami temukan di referensi Google sendiri. Semua yang biasanya Anda lakukan dengan sebuah parameter sampling harus ditulis ke dalam bahasa Inggris sebagai gantinya. Kalau Anda ingin tahu cara menulis bahasa Inggris itu dengan baik, kami membahas sintaks prompt-nya di tulisan tersendiri, termasuk struktur tag dan masalah potongan adegan, dan tidak ada gunanya mengulangnya di sini.
Satu peringatan. Dokumentasi schema pihak ketiga untuk model ini mencantumkan temperature dan top_p sebagai field yang diterima, sementara referensi Google bilang keduanya tidak didukung. Kami tidak akan memberi tahu Anda mana yang benar — kami memberi tahu bahwa keduanya bertentangan. Jangan merancang di sekitar parameter itu hanya berbekal satu daftar schema; uji dulu apakah mereka mengubah sesuatu.
Suara yang tak bisa dimatikan, bahasa Inggris yang tak bisa ditinggalkan
Audio dihasilkan secara natif bersama setiap klip dan tidak ada sakelar untuk mematikannya. Tidak ada parameter, tidak ada flag, tidak ada mode senyap. Anda bisa mengarahkannya — satu kalimat Sound design: benar-benar bekerja — tapi Anda tidak bisa menolaknya. Untuk sematan di blog itu berarti membisukan di pemutarnya, yang dilakukan kedua klip di atas.
Anda juga tidak bisa memasok audio sebagai referensi, menyunting audio yang dihasilkan setelahnya, atau mempertahankan audio dari video yang Anda unggah untuk diperpanjang. Ketiganya harapan yang masuk akal. Tidak satu pun didukung.
Dukungan bahasanya lebih sempit daripada yang disiratkan pemasaran: bahasa Inggris adalah satu-satunya bahasa yang didukung penuh. Bahasa Jepang dan lainnya didokumentasikan sebagai belum dievaluasi — cara hati-hati untuk mengatakan hasilnya tidak bisa diprediksi. Kalau prompt atau dialog Anda bukan bahasa Inggris, anggarkan kejutan.
Ketahui batas referensinya sebelum merancang pipeline input. Referensi video: sampai tiga klip, tiga detik masing-masing, dan Google memperingatkan bahwa memasok beberapa sekaligus bisa memperburuk hasil — perlakukan tiga sebagai plafon, bukan target. Rasio aspeknya 16:9 atau 9:16, ini juga dari Google. Dua angka yang dikutip berdampingan dengan itu bukan: frame rate 24 fps dan rentang satu-sampai-tujuh untuk gambar reference-to-video, keduanya datang dari dokumentasi schema pihak ketiga. Setiap frame membawa watermark SynthID, dan kami belum menemukan penyedia yang membuka sakelar untuknya.
Sebelum mengeluarkan uang, lakukan ini
Empat pemeriksaan, berurutan. Yang pertama membunuh lebih banyak integrasi daripada sisanya digabungkan.
- Pastikan region Anda. Kalau Anda di EEA, Swiss atau Britania Raya dan produk Anda memperpanjang video yang diunggah, berhenti di sini. Model ini tidak bisa mengerjakan itu untuk Anda.
- Hitung harga sekuensnya, bukan klipnya. Kalikan dengan perpanjangannya, lalu dengan take yang benar-benar akan Anda jalankan. Empat puluh detik 1080p adalah $5.40 di sini pada kondisi terbaik, realistisnya tiga kali itu begitu Anda menghitung pengulangan.
- Tanyakan apakah Anda butuh Omni sama sekali. Satu detik Veo 3.1 Fast berbiaya satu sen di sini, melawan sembilan pada Omni di 720p. Satu shot, tanpa kelanjutan, tanpa interpolasi frame, tanpa siapa pun yang harus tampak sama dua klip kemudian — maka kelipatan itu adalah uang yang dibakar.
- Bangun loop Anda di tier draf. Iterasi di 360p, naikkan pemenangnya. Enam puluh delapan persen bukan kesalahan pembulatan.
Omni memang layak kelipatannya tepat di tempat fitur-fitur 1.1 menunjuk: melanjutkan sebuah shot, menginterpolasi antara frame pertama dan terakhir, menghidupkan gambar diam, atau membawa satu subjek melintasi potongan. Di luar itu, ia cara mahal untuk membeli satu klip.
Sudut pandang lainnya ada di sebelah: apa yang sebenarnya hadir di hari peluncuran, apa yang dikatakan dan tidak dikatakan papan peringkat — peringkat arena yang beredar pekan ini milik model sebelumnya — dan rincian harga platform demi platform. Schema dan harga langsung ada di katalog.
Harga dan ketentuan produk berubah. Periksa harga terkini tiap penyedia sebelum mengambil keputusan pembelian.
Pertanyaan yang sering diajukan
Apakah Gemini Omni 1.1 Flash benar-benar bisa membuat video 40 detik?
Bisa, tapi tidak dalam satu panggilan. Satu generasi mengembalikan 3 sampai 10 detik. Empat puluh detik adalah total kumulatif yang Anda capai dengan memperpanjang klip yang ada tiga kali lagi — empat pekerjaan — dan tiap perpanjangan ditagih terpisah pada tarif per detik yang sama dengan generasi baru. Di E2X satu sekuens 40 detik pada 1080p berbiaya $5.40, melawan $6.08 kalau memanggil Google langsung.
Berapa biaya satu sekuens Gemini Omni 40 detik?
Kalikan 40 detik dengan tarif per detik untuk resolusi Anda; perpanjangan tidak membawa diskon. Di E2X itu $1.19 di 360p, $3.60 di 720p, $5.40 di 1080p dan $7.20 di 4K. Langsung dari Google, dihitung dari tarif token-per-detik yang diterbitkannya, durasi yang sama berbiaya $1.35, $4.06, $6.08 dan $12.16. Tambahkan take yang dibuang dan perkirakan dua sampai tiga kali angka utamanya.
Apakah output 4K Gemini Omni 1.1 Flash benar-benar 4K?
Bukan. Dokumentasi Google melabeli tier 1080p maupun 4K sebagai "upscaled" — model me-render lebih rendah lalu menaikkan skala hasilnya. File-nya berdimensi 4K; gambarnya tidak membawa detail 4K. Kecuali spesifikasi pengiriman menuntut dimensi itu, tarif tier teratas membeli pengubahan ukuran, bukan informasi tambahan.
Bisakah saya memakai Gemini Omni 1.1 Flash di Uni Eropa?
Sebagian. Text-to-video dan image-to-video bekerja, tetapi menyunting atau memperpanjang video yang diunggah tidak tersedia di EEA, Swiss dan Britania Raya. Karena perpanjangan adalah kemampuan utamanya, ini memblokir produk Eropa mana pun yang dibangun di sekitar melanjutkan rekaman dari pengguna. Verifikasi terhadap region deployment Anda sebelum berintegrasi.
Apakah Gemini Omni 1.1 Flash mendukung temperature atau negative prompt?
Referensi Google menandai permukaan sampling sebagai tidak didukung — tidak ada temperature, top_p, instruksi sistem, stop sequence atau negative prompt. Teks prompt adalah satu-satunya kendali Anda, dengan dokumentasi schema pihak ketiga menaruh plafonnya di 40,000 karakter. Dokumentasi pihak ketiga yang sama mencantumkan temperature dan top_p sebagai field yang diterima, bertentangan dengan Google, jadi ujilah sebelum bergantung padanya.
Bisakah saya mematikan audio di output Gemini Omni?
Tidak. Model membangun trek suara ke dalam setiap klip secara bawaan, dan tidak ada parameter yang mematikannya. Instruksi sound design di dalam prompt mengarahkan apa yang Anda dapat, tapi Anda tidak bisa menolaknya, memasok referensi audio, menyunting hasilnya, atau mempertahankan audio dari video yang Anda unggah untuk diperpanjang. Untuk pemutaran senyap, bisukan di pemutarnya.
Bisakah Gemini Omni memperpanjang video mundur atau menyunting bagian tengah adegan?
Tidak. Perpanjangan hanya menambahkan di ujung sebuah klip — tidak ada perpanjangan mundur untuk membangun pembuka, tidak ada penyisipan ke tengah sekuens. Rencanakan sesuai itu: generasi pertama menetapkan bahasa kamera dan pencahayaan untuk segala sesuatu sesudahnya, dan satu kesalahan di awal membatalkan setiap perpanjangan yang dibangun di atasnya.
Apakah Gemini Omni 1.1 Flash sepadan dibanding Veo 3.1 Fast?
Hanya kalau Anda butuh apa yang ditambahkan Omni. Veo 3.1 Fast berjalan $0.01 per detik di E2X melawan $0.09 milik Omni di 720p. Untuk satu klip tanpa perpanjangan, tanpa kontrol frame awal-akhir dan tanpa kesinambungan lintas-shot, Veo menang telak. Omni baru layak preminya pada sekuens banyak shot dan pekerjaan kesinambungan berbasis referensi.