Kembali ke Blog

Kontinuitas Shot di Gemini Omni 1.1 Flash: Endpoint Mana Memperbaiki Pergeseran Mana

E2X Team··16 menit membaca
gemini-omniprompt-engineeringvideo-generationcontinuitygoogle

Google menerbitkan dua kalimat tentang model ini pada peluncuran yang sama, dan keduanya menunjuk arah berlawanan.

Yang pertama ada di pengumumannya: ketika Omni melanjutkan sebuah klip, kini ia membaca "up to 10 seconds of prior context — a leap from previous models that only referenced the final second." Sepuluh kali lipat memori. Yang kedua ada di model card DeepMind, di bawah batasan: "maintaining complete consistency throughout edits, generating scenes with complex motion, or rendering perfectly accurate text remains a challenge."

Keduanya benar, dan bersama-sama mereka menggambarkan pekerjaannya. Kontinuitas di sini bukan sakelar yang Anda nyalakan melainkan sekumpulan pilihan yang dibuat di sisi input — endpoint mana yang Anda panggil, apa yang Anda kunci dengan sebuah gambar, kalimat mana yang Anda ulang kata demi kata. Biaya sekuens empat bagian adalah argumen terpisah yang tidak akan kami ulang.

Papan gabus seorang supervisor kontinuitas dipenuhi foto instan aktor yang sama dalam jaket kerja hijau yang sama, diambil dari sudut yang sedikit berbeda

Empat endpoint, empat hal berbeda yang ditahan

Di E2X, gemini-omni-1.1-flash hadir sebagai empat kapabilitas pada satu harga — $0.18 per detik pada 4K, yang mana pun yang Anda panggil. Itu mengubah cara memikirkannya: memilih di antara mereka tidak pernah menjadi keputusan anggaran, hanya keputusan kerajinan.

Apa yang dikunci masing-masing:

KapabilitasYang ia tahanYang tidak akan ia tahan
text-to-videoTidak ada selain kata-kata AndaApa pun yang tidak Anda tuliskan
image-to-videoFrame pembuka, persisSemua setelah kira-kira detik pertama
start-end-frame-to-videoKedua ujung shot-nyaJalur di antara keduanya
reference-to-videoIdentitas dan penampilan subjekFraming, pemanggungan, posisi kamera

Bacalah itu sebagai diagnostik alih-alih daftar fitur: sebutkan pergeseran yang Anda lihat, lalu pilih endpoint yang menanganinya.

Shot-nya mulai salah. Sudut kedua Anda membuka di ruangan yang berbeda, atau karakternya masuk sudah di tengah gestur. Beri ia sebuah frame: image-to-video mengambil sebuah still dan memulai di sana, jadi shot kedua bisa membuka pada tangkapan dari frame terakhir shot pertama, atau pada render still yang sudah Anda setujui sebelumnya. Ini perbaikan kontinuitas termurah yang ditawarkan modelnya.

Shot-nya berakhir salah. Gerakannya benar dan pendaratannya tidak — tangannya meraih pintu dan pintunya ada di tempat lain. Itu start-end-frame-to-video. Anda memasok start_frame_url dan end_frame_url, modelnya mengisi intervalnya, dan frame yang harus dicocokkan potongan berikutnya adalah frame yang Anda pilih alih-alih yang diberikan kepada Anda.

Orangnya berubah. Bukan framing, bukan pemanggungan — wajah, rambut, jaketnya. Itu reference-to-video, satu-satunya dari keempatnya yang tujuannya adalah identitas. Array image_urls kami menerima minimum satu dan maksimum tujuh; Runware mendokumentasikan plafon yang sama — "up to 7 images" — sementara referensi Google tidak menyebut angka, meski contoh yang ia kerjakan menjalankan enam tag. Perlakukan tujuh sebagai konsensus pihak ketiga, bukan jaminan yang diterbitkan.

Referensi video dibatasi lebih ketat dan Google memang menerbitkan angkanya: "Video references support a maximum of 3 clips, up to 3 seconds each", bersama "Referencing or reasoning across multiple videos is not supported" — tiga adalah plafon yang Anda dekati, bukan target yang Anda penuhi. Soal apa yang layak ada dalam sebuah gambar referensi, dokumentasi Runware lebih spesifik daripada milik Google, merekomendasikan potret mid-shot yang bersih — framing dari pinggang ke atas, latar netral, detail pengenal terlihat — karena "Full-body shots, busy backgrounds, or extreme angles dilute the model's read on the character."

Apa yang dikunci seed, dan apa yang tidak

Tidak ada sampler pada endpoint ini. Dokumentasi Google datar soal itu: "System instructions, temperature, top_p, stop sequences, and negative prompts are not supported." Tanpa permukaan sampling berarti satu kendali keterulangan, dan itu adalah seed — integer opsional yang diterima keempat skema kapabilitas kami.

Layak diketahui dari mana field itu berasal, karena ia sama sekali tidak ada dalam referensi Google. Dokumentasi 1.1 milik Runware membawa sebuah seed dan menjelaskan mengembalikan "the randomly generated seed" bila Anda tidak memasoknya; kami membuka field-nya pada setiap kapabilitas; Google, di halaman yang pertama Anda periksa, tidak mengatakan apa-apa. Pakailah, tetapi jangan memperlakukannya sebagai kontrak.

Bagian yang menjebak orang: seed mengunci sampelnya, bukan subjeknya. Seed yang sama dan prompt yang identik bita demi bita adalah pengulangan. Seed yang sama dan satu kata yang disunting adalah undian baru — sampling ulang, bukan sentuhan halus. Itu kebalikan dari kenop temperature, dan artinya kebiasaan model gambar untuk menahan seed sambil menyetel prompt tidak berpindah ke sini.

Yang menyisakan seed berguna untuk tepat dua hal dalam pekerjaan multi-shot, dan tidak berguna untuk yang ketiga:

  • Merender ulang take simpanan pada tier lebih tinggi. Buat draf, temukan take-nya, lalu jalankan prompt dan seed yang sama pada resolusi pengiriman Anda. Tidak ada yang berubah, jadi tidak ada yang di-resample.
  • Mengisolasi satu variabel. Ubah kalimat pencahayaannya, tahan seed-nya, dan apa pun yang bergerak bisa diatributkan pada kalimat itu. Bukan eksperimen terkendali, tetapi lebih cepat daripada sampling ulang secara buta.
  • Membawa sebuah wajah antara dua shot berbeda. Ia tidak akan bisa. Dua prompt adalah dua prompt; seed tidak mengingat karakter Anda. Identitas lintas shot datang dari gambar referensi, bukan dari sebuah integer.

Tuliskan seed di samping prompt pada saat sebuah take berhasil. Tidak ada riwayat untuk memulihkannya nanti.

Blok kunci: paragraf yang sama, diulang kata demi kata

Karena sebuah panggilan text-to-video tidak punya memori panggilan Anda sebelumnya, instruksi kontinuitas paling umum di lapangan justru tidak ditujukan kepada siapa pun: "Jaga semuanya konsisten dengan shot sebelumnya" menunjuk sebuah shot yang belum pernah dilihat modelnya.

Perbaikannya tidak glamor. Tulis satu blok fakta penampilan dan set lalu tempelkan ke setiap prompt dalam sekuensnya, tanpa diubah — tidak diparafrase, tidak diringkas, tidak diurutkan ulang. Deskripsi baru adalah undian baru.

Berikut dua versi shot kedua yang sama dalam sekuens dua shot. Pertama yang bergeser:

Continuing the same scene, a tighter shot of the same man at his
workbench in the garage. Cinematic lighting, moody atmosphere,
highly detailed, professional colour grading. He lifts the machined
part into the light and turns it slowly while his colleague watches
from the right. Keep the characters and the location consistent
with the previous shot. Single continuous shot, no scene cuts.
Sound design: workshop room tone and quiet handling noise.

Hitung apa yang dibiarkan prompt itu tak terkunci dan Anda punya daftar hal-hal yang bebas berubah: warna hijau persis jaketnya, apakah manset itu berjumbai, apakah ada bandana sama sekali, apa yang tergantung di pegboard, dari mana cahayanya datang. Tidak ada yang dituliskan, jadi tidak ada yang terutang kepada Anda — sebuah shot cakap dari sore yang berbeda adalah jawaban benar atas yang ditanyakan.

Tulis ulangnya mempertahankan aksinya dan membelanjakan kata-katanya pada fakta alih-alih kata sifat:

In a single continuous shot, no scene cuts. Medium two-shot in a
cluttered garage workshop, 40mm lens at f/4, both subjects sharp.

[Lock - repeat verbatim in every shot of this sequence]
Man: mid-forties, close-cropped grey hair parted on his left, faded
green canvas work jacket, frayed left cuff, oil stain on the right
pocket, steel watch on his left wrist. Woman: thirties, dark hair
tied back, grey knit sweater, red bandana at her neck, clipboard in
her right hand. Set: steel workbench, pegboard behind with three
wrenches hanging left of centre, one overhead fluorescent tube,
cold white key from above, no window light.

Action: he lifts a machined aluminium part into the light and turns
it once; she does not move. Sound design: fluorescent hum, the part
clicking down onto steel. No dialogue.

Label dalam kurung siku itu untuk Anda, bukan untuk modelnya — ia menandai wilayah yang Anda salin. Yang layak mendapat tempat dalam blok itu adalah apa pun yang asimetris atau rusak: rambutnya berbelah di sisi mana, manset mana yang berjumbai, pergelangan mana yang memakai jam, tangan mana yang memegang papan jalan. Simetri adalah tempat pergeseran bersembunyi, karena detail simetris yang tercermin tampak benar sendirian dan salah dalam sebuah potongan. Nama warna termasuk di sana, dan begitu pula cahayanya: arah, kekerasan, dan ketiadaan eksplisit sumber yang tidak Anda inginkan.

Tiga jaket kerja kanvas hijau pudar yang identik di sebuah rak menghadap beton telanjang, masing-masing dengan manset kiri berjumbai yang sama dan noda oli yang sama

Satu hal yang harus dijauhkan dari blok itu: label cetak, papan tanda, teks terbaca pada properti. Model card mencantumkan teks akurat di antara masalah terbuka, jadi properti yang harus terbaca sama di dua shot adalah jangkar paling tidak andal yang tersedia. Berjangkarlah pada bentuk dan noda saja.

Perpanjangan berjalan maju, jadi rencanakan mundur

Rumusan Google tidak menyisakan ruang: "Video extension is limited to appending to the end of a video; prepending or extending the middle of a clip is not supported." Kelanjutan berjalan dalam langkah sepuluh detik "up to a total length of 40s", dan klip yang diunggah harus "10 seconds or less in length" sebelum bisa Anda perpanjang.

Konsekuensi perencanaannya lebih besar daripada kelihatannya: sebuah rantai tidak punya undo. Shot pertama menetapkan palet, cahaya, dan tata bahasa kamera untuk segala sesuatu yang ditambahkan padanya, jadi kesalahan di sana adalah sekuens yang Anda bangun ulang alih-alih shot yang Anda render ulang. Dan shot paling berisiko — gestur sulit, pantulan rumit — biasanya duduk di tengah, tepat di tempat yang tak bisa Anda jangkau.

Jadi ada pilihan struktural yang harus dibuat sebelum panggilan pertama:

  • Satu rantai perpanjangan membeli kelanjutan frame-ke-frame yang sungguhan dan sepuluh detik konteks yang benar-benar dibaca modelnya. Ia menghabiskan kemampuan Anda memperbaiki apa pun selain ekornya.
  • Generasi independen yang dijahit di editor, masing-masing berjangkar pada gambar referensi atau frame awal, menghabiskan sambungan mulusnya dan membeli kemampuan mengulang shot ketiga tiga puluh kali tanpa menyentuh shot pertama dan kedua.

Untuk aksi yang tidak boleh terlihat terpotong, perpanjang. Untuk sekuens yang toh punya potongan di dalamnya, hasilkan terpisah — itu juga opsi yang selamat dari catatan klien, dan sebagian besar sekuens mendapat satu.

Klip itu adalah satu generasi yang membawa reframe alih-alih dua shot yang disambung:

A two-shot in a cluttered garage workshop, 40mm lens at f/4, both
subjects sharp. A man in a faded green work jacket with a torn left
cuff stands at the bench; a woman in a grey knit sweater with a red
bandana tied at her neck stands to his right holding a clipboard.
The camera holds the wide two-shot for four seconds while he lifts
a machined aluminium part into the light and turns it. Then the
camera pushes in and reframes to a tighter two-shot from the same
axis - same jacket, same torn cuff, same bandana, same bench clutter
behind them, same overhead fluorescent light. No cut, no wardrobe
change, no relight. Sound: fluorescent hum and the part clicking
down onto steel.

Titik potong juga titik potong audio

Audio dihasilkan bersama gambarnya dan tidak ada sakelar untuk menolaknya. Itu biasanya masuk kategori sound design; untuk kontinuitas ia adalah sebuah batasan, karena potongan Anda mendarat di tengah trek suara yang tidak Anda gubah dan tidak bisa Anda pangkas di sumbernya.

Dua aturan mengikuti. Gambarkan ambience dengan kata-kata yang identik di kedua sisi potongan, sama seperti Anda mengulang blok wardrobe — "fluorescent hum" di kedua prompt, bukan "fluorescent hum" lalu "the buzz of the overhead light." Room tone yang bergeser di sambungannya lebih sulit diabaikan daripada jaket yang berganti rona, karena telinga tidak punya batas shot untuk bersembunyi di baliknya.

Lalu pilih tempat memotong dengan mempertimbangkan suaranya. Memotong di tengah gestur menuntut modelnya mereproduksi vektor gerakan yang sama di sisi seberang — persis kasus "complex motion" yang ditandai model card. Memotong pada pose yang sudah mapan, bagiannya sudah diletakkan dan tangannya diam, memberi generasi berikutnya kondisi awal yang tak ambigu dan memberi audionya sambungan alami. Ia menghabiskan satu beat tempo dan membeli sambungan yang bertahan.

Sepotong film 35mm dalam blok penyambung logam, sebilah silet tepat di garis frame, dua sambungan pita yang sudah jadi lebih jauh di sepanjangnya

Satu keputusan mendahului semua ini: rasio aspek. Modelnya menawarkan 16:9 dan 9:16 dan tidak ada yang lain. Karena perpanjangan hanya menambahkan di belakang dan gambar referensi mewarisi framing tempat mereka diambil, mengganti orientasi di tengah jalan bukanlah perubahan setelan — ia membatalkan setiap aset di hulunya. Pilih orientasinya dengan mempertimbangkan pengirimannya, pada shot pertama.

Berapa biaya sekuens empat shot

Perkakas kontinuitas pada model ini gratis. Panggilan reference-to-video dengan tujuh gambar berbiaya sama dengan panggilan text-to-video polos; frame yang Anda berikan ke start-end-frame-to-video tidak menambah apa pun. Anda membayar detik dan resolusi.

Empat shot delapan detik adalah tiga puluh dua detik. Pada tier teratas:

Di mana32 dtk pada 4K
E2X$5.76
Google, dari tarif token yang diterbitkan$9.73
fal$9.60
Runware$10.24
WaveSpeed$12.48

Selisih itu cerita pengali, bukan cerita diskon. Kedua tangga menanjak dengan cara yang sama dari 360p ke 1080p; pada anak tangga teratas Google melipattigakan tarif 720p-nya dan kami melipatduakan tarif kami, jadi rentangnya paling lebar tepat di tempat sekuens jadi dikirimkan. Hitungan tier demi tier, termasuk mengapa tier teratas adalah upscale, ada di tulisan 4K kami.

Sekarang terapkan itu pada bagaimana kerja kontinuitas sebenarnya berjalan. Tidak ada yang mendaratkan empat shot dalam empat generasi. Bila shot ketiga butuh enam percobaan dan shot keempat tiga, itu lima belas pekerjaan — $21.60 di sini melawan $36.49 langsung pada 4K. Itulah argumen terkuat untuk generasi independen dibanding satu rantai: sebuah pengulangan berbiaya satu shot, bukan ekor sekuensnya. Jalankan uji kontinuitas pada 360p, seperenam tarif 4K per detik, lalu naikkan take-nya.

Di mana ia masih tergelincir

Versi jujurnya, sebab model card memberi kita bahasanya.

Pembagiannya mengikuti apa yang bisa dikodekan kedua mekanismenya. Sebuah kalimat dan sebuah foto referensi membawa properti kasar yang bisa disebut namanya: siluet dan warna busana, panjang dan warna rambut, geometri ruangan, palet, arah dan kekerasan cahaya, penempatan kasar properti besar. Itu bisa dinyatakan sebuah blok kunci dan ditunjukkan sebuah gambar referensi.

Yang tidak dibawa keduanya adalah presisi di bawah tingkat sebuah nama — geometri wajah persis antara framing yang berjauhan, perhiasan, objek latar kecil, detail kain halus, dan apa pun yang tercetak, yang model card daftar terpisah sebagai tidak andal. Google menyebut polanya hanya dalam istilah umum, dan pengulas pihak ketiga menggambarkannya paling terasa pada pergantian adegan dan gerakan kamera alih-alih di dalam shot yang ditahan. Itu pembacaan kami atas dokumentasi dan laporannya, bukan klaim terukur; kami belum menjalankan rig yang bisa menaruh angka padanya.

Secara praktis: sekuens dengan hero close-up membutuhkan close-up itu dihasilkan dari sekumpulan referensi alih-alih diwarisi dari sebuah wide, sebab identitas selamat dari reframe lebih baik daripada dari perubahan skala. Teknik wajah dalam shot tunggal itu sendiri adalah tulisannya sendiri, dan kosakata kamera yang menjaga dua shot pada satu sumbu ada di tulisan kameranya.

Tidak ada yang boleh menjual narasi tiga puluh shot pada model ini dan menjanjikan wajah yang tidak pernah bergerak. Yang bisa Anda jual adalah sekuens yang pergeserannya cukup kecil untuk duduk di dalam sebuah potongan — terjangkau dengan referensi, blok kunci, dan titik potong yang dipilih pada kediaman.

Mulailah dari tabel di atas: sebutkan pergeserannya, pilih perkakasnya, tulis bloknya sekali, ulangi persis. Referensi API Google membawa bentuk tag untuk mengikat referensi berdasarkan nama, dan halaman kapabilitasnya membawa tarif dan skema terkini.

Harga dan ketentuan produk berubah. Periksa harga terkini tiap penyedia sebelum mengambil keputusan pembelian.

Pertanyaan yang sering diajukan

Bagaimana menjaga karakter tetap konsisten lintas shot di Gemini Omni 1.1 Flash?

Dua mekanisme bersamaan. Lewatkan karakternya sebagai gambar referensi melalui reference-to-video — skema kami menerima satu sampai tujuh, dan Runware mendokumentasikan plafon yang sama — dan ulangi blok fakta penampilan yang identik di setiap prompt, disalin alih-alih diparafrase. Referensi membawa identitas; teks yang diulang membawa wardrobe, properti, dan cahaya. Model card Google eksplisit bahwa konsistensi penuh lintas penyuntingan masih terbuka, jadi tak satu pun cukup sendirian.

Apakah seed menjaga karakter yang sama lintas dua prompt Gemini Omni?

Tidak. Seed mengunci sebuah sampel, bukan sebuah subjek. Dua prompt berbeda adalah dua undian berbeda terlepas dari seed-nya, dan satu kata yang disunting dalam prompt yang selain itu identik adalah sampel baru alih-alih sebuah variasi. Seed layak dipakai untuk merender ulang take yang disetujui pada resolusi lebih tinggi dan untuk mengisolasi satu kalimat yang diubah. Identitas lintas shot datang dari gambar referensi.

Kapabilitas Omni mana yang sebaiknya saya pakai untuk shot yang harus berakhir pada frame tertentu?

start-end-frame-to-video. Anda memasok gambar awal dan akhir, modelnya menghasilkan intervalnya, dan frame yang harus dicocokkan potongan berikutnya adalah yang Anda pilih. Di E2X ia berbiaya sama per detik dengan text-to-video biasa, jadi tidak ada alasan harga untuk menghindarinya.

Bisakah Gemini Omni 1.1 Flash memperpanjang video ke belakang?

Tidak. Dokumentasi Google mengatakan perpanjangan hanya menambahkan di ujung sebuah klip, tanpa cara menambahkan di depan atau memperpanjang bagian tengahnya. Kelanjutan berjalan dalam langkah sepuluh detik hingga total empat puluh detik, dan klip yang Anda perpanjang harus sepuluh detik atau lebih pendek. Jadi generasi pertama mengunci tampilan untuk semua yang mengikutinya, dan kesalahan awal tidak bisa diperbaiki tanpa membangun ulang rantainya.

Berapa banyak gambar referensi yang diterima Gemini Omni 1.1 Flash?

Skema reference-to-video kami menerima satu sampai tujuh, dan dokumentasi Runware menyatakan maksimum yang sama. Referensi Google sendiri tidak menerbitkan angka, meski contoh yang ia kerjakan mengikat enam gambar bertag dalam satu prompt — jadi perlakukan tujuh sebagai konsensus pihak ketiga, bukan jaminan terdokumentasi. Referensi video dibatasi terpisah oleh Google pada tiga klip masing-masing hingga tiga detik.

Di mana tempat terbaik memotong antara dua shot hasil generasi?

Pada kediaman alih-alih di tengah gerakan. Pose yang sudah mapan memberi generasi berikutnya kondisi awal yang tak ambigu; potongan di dalam sebuah gestur meminta modelnya mereproduksi vektor gerakan, kasus complex motion yang didaftar model card Google sebagai kelemahan yang diketahui. Dan karena setiap klip datang dengan trek suara yang tak bisa Anda tolak, gambarkan ambience-nya dengan kata-kata yang identik di kedua sisi sambungan atau room tone-nya akan bergeser di potongan.

Bisakah saya mencampur shot 16:9 dan 9:16 dalam satu sekuens Omni?

Tidak dengan berguna. Kedua rasio itu satu-satunya opsi, perpanjangan menambahkan dalam orientasi tempat ia mulai, dan gambar referensi membawa framing tempat mereka diambil — jadi mengganti orientasi di tengah jalan membatalkan setiap aset di hulunya. Putuskan lanskap atau potret terhadap format pengirimannya sebelum shot pertama.

Lebih murah membangun sekuens dengan memperpanjang atau dengan menghasilkan shot terpisah?

Tarif per detiknya identik pada keduanya — perpanjangan tidak membawa diskon — jadi bedanya adalah berapa biaya sebuah pengulangan. Dalam sebuah rantai, memperbaiki shot awal membuang semua yang ditambahkan padanya. Dengan generasi independen yang berjangkar pada gambar referensi atau frame awal, sebuah shot buruk berbiaya satu shot. Di E2X tiga puluh dua detik 4K adalah $5.76 melawan $9.73 langsung dari Google, dan selisih itu melebar dengan setiap take yang Anda buang.