Kata Kamera yang Dijalankan Gemini Omni 1.1 Flash, dan yang Diabaikannya
Bacalah materi prompting video milik Google cukup lama dan Anda akan menemukan dua kalimat yang terpisah beberapa paragraf. Yang satu menerbitkan daftar gerakan kamera — dolly, truck, pedestal, crane, whip pan, arc — seolah Anda sedang memesan dari sebuah menu. Yang lain memperingatkan bahwa "Some advanced camera angles are not officially supported. The results and reliability may vary depending on the overall prompt and your specific use case."
Keduanya benar, dan celah di antara keduanya adalah tempat sebagian besar klip yang mengecewakan berasal. Sebuah gerakan yang disebut namanya adalah permintaan yang kemungkinan besar dipenuhi modelnya, bukan parameter yang wajib ia jalankan. Tidak ada field camera pose pada gemini-omni-1.1-flash — tidak ada rig, tidak ada lensa, hanya kata-kata yang bersaing dengan kata-kata Anda yang lain. Tulisan ini tentang kata mana saja yang layak mendapat tempatnya, dikerjakan dari apa yang Google dokumentasikan, apa yang Runway laporkan, dan apa yang skemanya buka.

Kata-kata yang langsung gugur
Mulailah dengan pengurangan; ia tidak berbiaya apa pun dan membeli ruang prompt. Referensi camera prompting Runway blak-blakan soal dua kata paling umum dalam prompt video AI: "'Cinematic' and '4k' come out because they're doing no work. Neither one changes what the camera does, and the prompt space they occupy is better spent on the move."
Itu klaim tentang perkakas mereka, bukan milik Google, tetapi alasannya berpindah. "Cinematic" menggambarkan sebuah kesan, bukan sebuah titik pandang: ia tidak mengatakan di mana harus berdiri, seberapa jauh, apa yang harus tetap tajam, atau ke arah mana harus bergerak. Sama halnya dengan muatan yang mengekor di belakangnya — masterpiece, award-winning, 8k, ultra detailed — diwarisi dari budaya prompt model gambar, di mana token-token itu bekerja sebagai mantra kualitas terhadap distribusi pelatihan yang sangat berbeda.
Bentuk positifnya sama polosnya: sebutkan gerakan yang spesifik alih-alih meminta "dynamic cinematic camera", karena model-model ini memperlakukan "camera instructions as spatial direction, not decoration." Tidak ada apa pun di situ yang mengatakan "cinematic" merugikan. Yang dikatakan adalah kata itu menggeser sesuatu yang lebih baik, dan dalam prompt sepanjang beberapa lusin kata, penggeseran itulah seluruh permainannya.
Daftar Google, dan sejauh mana ia bisa dipercaya
Kosakata yang terdokumentasi mengalahkan apa pun yang beredar di utas-utas prompt:
| Kategori | Yang Google sebutkan |
|---|---|
| Gerakan | static · pan · tilt · dolly (in, out) · truck (kiri, kanan) · pedestal (naik, turun) · zoom · crane · aerial atau drone · handheld · whip pan · arc |
| Sudut dan skala | eye-level · rendah · tinggi · bird's-eye · Dutch · point-of-view · over-the-shoulder · extreme close-up · close-up · medium · full · wide atau establishing |
| Optik | wide-angle · telephoto · depth of field dangkal dan dalam · lens flare · rack focus · fisheye · dolly zoom |
Dua detail layak diperhatikan. Google memisahkan zoom dari dolly dengan sengaja, karena model mengaburkan keduanya: zoom adalah perubahan panjang fokus, dan "This is different from a dolly, as the camera itself doesn't move." Ingin latar belakang membesar relatif terhadap subjek Anda? Minta dolly. Ingin frame menyempit dengan geometri yang tidak berubah? Minta zoom. Tuliskan "zoom in slowly as the camera pushes forward" dan Anda telah memesan keduanya — sebuah dolly zoom, dan hampir tidak pernah itu yang dimaksud.
Kedua, istilah-istilah yang luas dikreditkan ke Google tidak ada di halaman-halamannya. Oner, push in, dan natural smartphone zoom muncul dalam panduan-panduan yang mengutip dokumentasi Google; kami tidak menemukannya di sana. Tidak terdokumentasi bukan berarti terlarang, tetapi istilah-istilah itu tidak membawa otoritas lebih besar daripada frasa yang Anda karang sendiri. Sintaks lengkap yang terdokumentasi ada di panduan prompting kami.
Satu gerakan per klip
Temuan paling tajam dalam referensi Runway bukan kata kerja mana yang bekerja, melainkan berapa banyak.
"Stacked verbs (unreliable): 'Orbit the subject and crane up and push in.' Phased description (reliable): 'The camera arcs around the seated figure, then rises above the table to reveal the empty chairs surrounding her.'"
Saran yang menyusul adalah menggambarkan apa yang mengisi frame di setiap tahap alih-alih menumpuk kata kerja, dan bila gerakan majemuk itu tetap gagal, "cut back to one move and generate the second beat as its own clip."
Omni memberi ini keunggulan mekanis, dari dokumentasi Google sendiri: modelnya menghasilkan beberapa shot secara default kecuali diberi tahu sebaliknya. Minta tiga gerakan serentak dan Anda telah memberinya jalan keluar — potongan. Orbit dua detik, potong, crane dua detik, potong, push in untuk sisanya. Setiap instruksi dipenuhi, tidak ada satu pun yang Anda inginkan. Perbaikan satu klausa, "In a single continuous shot" atau "No scene cuts", menghentikan modelnya menyelesaikan ambiguitas Anda dengan sebuah potongan.
Satu adegan, dihasilkan dua kali, hanya mengubah klausa kameranya:
Empat detik di tiap sisi pada 720p, tiga puluh enam sen masing-masing. Subjek, ruangan, cahaya, dan jalur suaranya identik; hanya kalimat pembukanya yang berbeda, frame terkunci melawan dolly in yang lambat. Klausa kamera adalah kalimat dengan daya ungkit tertinggi dalam sebuah prompt, dan yang paling sering ditulis terakhir.
Panjang fokus adalah arahan, bukan optik
Tidak ada lensa. Layak dikatakan terus terang, karena model mentalnya penting. Tulis "85mm" dan modelnya tidak sedang menghitung sudut pandang; ia meraih segala sesuatu dalam data pelatihan yang diberi label demikian, dan foto membawa label itu jutaan kali. Yang kembali adalah tampilan yang melekat pada angka itu: latar belakang termampat, subjek terpotong keluar dari bidang yang lembut, jarak yang mendatar. Pada lensa pendek, perspektif meregang, lebih banyak ruang dalam frame, tepian yang membengkok.
Itu menjadikan panjang fokus salah satu kata paling efisien yang tersedia, menggerakkan framing dan rasa sekaligus dalam empat karakter. Panduan yang beredar konsisten — kira-kira 24mm untuk konteks lebar, 35mm untuk rasa dokumenter, 50mm untuk penceritaan netral, 85mm untuk kerja intim yang termampat — bacalah sebagai arahan visual, bukan janji optik harfiah.

Dua kebiasaan mengikuti. Beri angka itu sebuah pekerjaan alih-alih membiarkannya menjadi kata sifat: "35mm" sendirian hanyalah sebuah token, sedangkan "35mm, bengkelnya terlihat di belakangnya sepanjang shot" mengatakan untuk apa lensa lebar itu, dan klausa itu bertahan bahkan bila angkanya diabaikan. Istilah optik terdokumentasi milik Google — depth of field dangkal, deep focus, rack focus, telephoto — melakukan pekerjaan yang sama dengan kata-kata biasa. Dan jangan pernah memasangkan panjang fokus dengan instruksi yang berlawanan: "85mm wide establishing shot of the valley" meminta pemampatan dan keluasan sekaligus.
Framing adalah hal paling andal yang bisa Anda tentukan
Urutkan bahasa kamera menurut seberapa andal ia mendarat dan sebuah pola muncul: properti statis mengalahkan properti temporal.
Skala shot — dari extreme close-up hingga wide establishing — adalah properti sebuah frame tunggal. Begitu pula sudut, dan begitu pula geometri sebuah two-shot atau over-the-shoulder. Modelnya bisa memenuhi salah satunya di frame pertama yang ia render lalu mempertahankannya.
Sebuah dolly in adalah klaim tentang frame pertama terhadap frame kesembilan puluh enam, dan ia harus bertahan melewati setiap frame di antaranya, dalam proses yang tidak punya representasi eksplisit tentang di mana kameranya berada. Itulah celah yang membuat literatur risetnya ada: CameraCtrl, karya rujukan tentang kontrol kamera dalam video diffusion, membuka dengan mencatat bahwa model-model yang ada "lack control of camera pose that serves as a cinematic language to express deeper narrative nuances", lalu menambahkan modul pose conditioning karena teks saja tidak cukup. Tidak ada API video produksi yang kami tahu membuka kanal itu.
Karena itu ada hierarki yang layak dihafal. Framing dan sudut: tentukan dengan bebas, harapkan kepatuhan. Satu gerakan yang disebut namanya: harapkan terjadi sebagian besar waktu. Dua gerakan, atau satu gerakan dengan kecepatan dan titik berhenti yang dinyatakan: harapkan beberapa take, atau pecah beat-nya.

Sebelum dan sesudah
Sebuah prompt yang ditulis seperti kebanyakan prompt kamera ditulis. Setiap kata di dalamnya pernah kami pakai.
Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.
Hitung apa yang bisa ditindaklanjuti. Tiga kata kerja bertumpuk yang tidak mungkin semuanya bertahan dalam satu take. Tidak ada skala shot, tidak ada panjang fokus, tidak ada instruksi soal jumlah shot — sehingga default multi-shot yang terdokumentasi bebas menyala, dan dengan tiga gerakan yang saling bersaing di meja, memotong adalah jalan dengan hambatan paling kecil.
Shot yang sama, ditulis ulang untuk hanya mengatakan apa yang bisa ditindaklanjuti modelnya:
In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.
Empat perubahan, menurut bobotnya. Klausa jumlah shot lebih dulu, sehingga ambiguitas tidak bisa dijawab dengan sebuah potongan. Tiga gerakan mengerucut jadi satu, framing pembuka dan penutupnya disebutkan — deskripsi bertahap yang direkomendasikan Runway, ditulis sebagai satu perjalanan tunggal. Panjang fokusnya datang melekat pada sebuah konsekuensi. Dan suara mendapat kalimatnya sendiri, sesuai panduan Google untuk menggambarkan audio secara terpisah, dengan negatif sebagai klausa pendek di ujung. Hasil tulis ulangnya lebih polos dan lebih membosankan dibaca, yang biasanya pertanda sebuah prompt telah berhenti menggambarkan suasana dan mulai menggambarkan sebuah shot.
Di mana kamera ditempatkan dalam prompt
Urutan adalah pertanyaan yang kami kira tidak akan punya jawaban. Ternyata punya, dari panduan Veo milik Google alih-alih halaman Omni: formulanya di sana berjalan sinematografi, subjek, aksi, konteks, gaya dan suasana — kamera lebih dulu, sebelum Anda menyebut siapa yang ada dalam shot — karena elemen itu "is the most powerful tool for conveying tone and emotion." Dokumentasi Omni sendiri mendaftar elemen secara berbeda, kamera di tengah daftar, jadi Google menerbitkan dua urutan dan kami belum menjalankan perbandingan terkendali.
Memimpin dengan kamera memang bertahan saat bersentuhan dengan perilaku terdokumentasi Omni yang lain, sebab instruksi jumlah shot harus mendarat sebelum modelnya mulai membangun narasi. Ia juga membuat sebuah prompt bisa diaudit: bila kalimat pertama tidak menggambarkan sebuah titik pandang, Anda belum mengarahkan sebuah shot.
Apa yang tidak akan diberikan skemanya
Dua batas struktural, keduanya tak terperbaiki oleh perumusan kata yang lebih baik.
Yang pertama adalah keterulangan. Dokumentasi API Google menyatakan bahwa "System instructions, temperature, top_p, stop sequences, and negative prompts are not supported", dan menyuruh Anda menuliskan negatif ke dalam prompt sebagai gantinya. Tidak ada sampler untuk dikencangkan. Yang tersisa adalah seed, sebuah integer opsional pada skema kami untuk model ini, dan itulah seluruh permukaan kendalinya.
Ini lebih penting untuk kerja kamera dibanding apa pun yang lain dalam sebuah prompt. Cahaya yang kembali sedikit berbeda adalah grade berbeda dari shot yang sama; sebuah dolly yang kembali sebagai pan adalah shot yang berbeda. Menjaga sebuah gerakan tetap stabil lintas take karena itu berarti mengunci seed dan tidak mengubah apa pun lagi — dan menyunting satu kata berarti mengambil sampel baru. Perlakukan seed yang bekerja sebagai aset dan tuliskan di samping prompt-nya.
Batas kedua adalah kecepatan kamera tidak punya kosakata. "Slow dolly in" adalah permukaan kendalinya: tanpa satuan, tanpa durasi, tanpa cara mengatakan bahwa dorongannya harus selesai pada detik kelima lalu ditahan. Sintaks timecode sedikit membantu — Omni menerima rentang dalam kurung siku — sehingga sebuah prompt bisa meminta kameranya berhenti pada detik keempat. Apakah ia melakukannya, itu soal lain.
Shutter angle dan motion blur duduk di kolom yang sama: keduanya tidak muncul dalam kosakata terdokumentasi Google. Frame rate nyaris masuk — 24 fps hanya muncul di halaman Omni di dalam contoh timing yang dikerjakan, "12 frames at 24fps", bukan sebagai tuas prompt. Berguna untuk menalar soal timecode; bukan sesuatu untuk dituliskan dan diharapkan mengarahkan.
Berapa biaya eksperimen kamera, pada tier yang penting
Kerja kamera adalah bagian prompting yang tidak bisa Anda benarkan dalam satu jalan: Anda meminta perilaku sepanjang waktu tanpa parameter untuk membatasinya, jadi Anda menghasilkan, menonton, menyesuaikan, menghasilkan lagi. Angka yang penting adalah harga satu take.
Pada 4K, take delapan detik adalah $1.44 di sini dibanding $2.43 memanggil Google langsung. Enam take untuk mendapatkan satu gerakan — angka sederhana untuk apa pun dengan perjalanan spesifik — adalah $8.64 dibanding $14.60. Jarak itu 41%, dengan selisih lebar yang terbesar dari empat resolusi dan alasan baris 4K menjadi satu-satunya yang layak diperdebatkan. Di tempat lain, satu detik 4K adalah $0.30 di fal, $0.32 di Runware, dan $0.39 di WaveSpeed, melawan $0.18 di sini; Replicate mencantumkan modelnya tanpa tarif per detik sama sekali.
Namun cara membelanjakan lebih sedikit bukanlah detik 4K yang lebih murah, melainkan berhenti menguji gerakan kamera pada 4K. Sepuluh draf delapan detik di tier 360p berbiaya $2.38, dan 360p sudah cukup untuk melihat apakah kameranya melakukan yang Anda minta — sebuah gerakan terbaca pada resolusi apa pun, dan itulah yang membuatnya murah untuk diuji. Sepuluh draf plus satu take 4K yang disimpan adalah $3.82, melawan $14.40 untuk sepuluh take 4K.
Dua anak tangga teratas adalah upscale, bukan render native — referensi model Google melabelinya "1080p output (upscaled)" dan "4K output (upscaled)" — jadi sebuah take 4K membeli dimensi pengiriman, bukan detail tambahan pada shot yang sedang Anda audit. Tulisan kami tentang adegan empat puluh detik membahas di mana itu tetap layak dibayar.
Harga dan ketentuan produk bisa berubah. Periksa harga terkini tiap penyedia sebelum mengambil keputusan pembelian.
Versi ringkasnya
Sebut jumlah shot lebih dulu, lalu satu gerakan, lalu framing tempat ia mulai dan berakhir. Beri panjang fokus alasan untuk ada di sana. Taruh audio dalam kalimatnya sendiri. Hapus setiap kata yang menggambarkan bagaimana videonya seharusnya membuat seseorang merasa, dan belanjakan ruang itu untuk di mana kameranya berada.
Apa yang dikirim pada 1.1 ada di tulisan peluncuran, dan audit harga penyedia menjelaskan mengapa bobot yang identik berharga berbeda menurut halamannya. Parameter dan tarif terkini ada di halaman model text-to-video. Untuk satu gerakan tunggal yang tidak menjadi tumpuan apa pun, hitung dulu Veo 3.1 Fast pada satu sen per detik — kosakata kameranya berasal dari panduan yang Google terbitkan untuk keduanya, jadi prakteknya berpindah.
Pertanyaan yang sering diajukan
Istilah gerakan kamera apa saja yang dipahami Gemini Omni 1.1 Flash?
Google menyebutkan sebuah kosakata gerakan — static, pan dan tilt, pasangan dolly, truck dan pedestal, zoom, crane, drone atau aerial, handheld, whip pan, arc — plus istilah sudut, skala shot, dan optik. Ia juga memperingatkan bahwa beberapa sudut kamera lanjutan tidak didukung secara resmi dan keandalannya bervariasi menurut prompt, jadi bacalah sebuah gerakan yang disebut namanya sebagai permintaan, bukan sebagai parameter.
Apakah menulis "cinematic" dalam prompt video ada gunanya?
Sendirian, tidak banyak. Referensi camera prompting Runway membuang baik "cinematic" maupun "4k", dengan alasan keduanya tidak mengubah apa yang dilakukan kameranya dan ruangnya lebih baik dipakai menyebut sebuah gerakan. Kata itu menggambarkan kesan alih-alih titik pandang, jadi ia tidak memberi modelnya apa pun untuk ditindaklanjuti — sama seperti "masterpiece", "8k", dan sisa muatan dari prompting gambar.
Apakah angka panjang fokus seperti 35mm atau 85mm mengubah output?
Mereka menggeser tampilannya, karena foto dalam data pelatihan membawa panjang fokus di metadatanya dan angkanya terbaca sebagai isyarat gaya. Lensa panjang cenderung memampatkan latar belakang dan memisahkan subjek; lensa pendek meregangkan perspektif dan memasukkan lebih banyak ruangan. Perlakukan sebagai arahan visual alih-alih optik harfiah, dan lekatkan pada sebuah konsekuensi.
Di mana arahan kamera sebaiknya diletakkan dalam prompt Omni?
Panduan prompting Veo milik Google menaruh sinematografi lebih dulu, mendahului subjek, aksi, konteks, dan gaya, menyebutnya elemen paling kuat untuk menyampaikan nada. Dokumentasi Omni sendiri menempatkan istilah kamera di tengah daftar. Keduanya Google. Memimpin dengan kamera punya satu keunggulan praktis: instruksi jumlah shot adalah keputusan kamera dan perlu tercatat sebelum modelnya mulai membangun narasi.
Bisakah Anda mendapatkan gerakan kamera yang sama dua kali dari Gemini Omni 1.1 Flash?
Hanya dengan memakai ulang sebuah seed. Dokumentasi Google mengatakan temperature, top_p, system instructions, stop sequences, dan negative prompts tidak didukung, sehingga menyisakan seed — integer opsional pada skema kami — sebagai satu-satunya kendali keterulangan. Ubah satu kata dalam prompt dan Anda mengambil sampel baru, jadi catat seed yang menghasilkan gerakan yang Anda sukai tepat pada saat ia bekerja.
Mengapa kameranya memotong di tengah shot padahal saya minta satu gerakan?
Karena multi-shot adalah defaultnya. Google mendokumentasikan bahwa Omni akan mencoba beberapa shot dan membangun narasi kecuali diberi tahu sebaliknya, jadi prompt yang menumpuk dua atau tiga gerakan memberinya alasan untuk memenuhi masing-masing dalam potongan terpisah. Perbaikan yang terdokumentasi adalah sebuah klausa yang meminta satu adegan tak terputus, dan kembali ke satu gerakan yang disebut namanya menghapus insentifnya.
Bisakah shutter speed atau frame rate ditentukan dalam prompt Gemini Omni?
Tidak ada apa pun dalam kosakata kamera terdokumentasi Google yang mencakup shutter angle atau motion blur, dan kami tidak akan mengklaim istilah-istilah itu dipenuhi. Frame rate juga bukan tuas prompt: 24 fps muncul di halaman Omni milik Google di dalam sebuah contoh timing — "12 frames at 24fps" — bukan sebagai spesifikasi yang bisa Anda atur. Tangani frame rate di pascaproduksi.
Berapa biaya menguji prompt kamera pada 4K?
Take 4K delapan detik adalah $1.44 di E2X melawan $2.43 memanggil Google langsung, jadi enam take menjadi $8.64 alih-alih $14.60 — jarak 41%, terlebar dari empat resolusi. Namun menguji pada 4K biasanya sia-sia: sebuah gerakan terbaca pada 360p, di mana sepuluh draf delapan detik totalnya $2.38, dan satu take 4K yang disimpan membawa keseluruhannya ke $3.82.