Gemini Omni 1.1 Flash'in Uyguladığı Kamera Kelimeleri, Bir de Görmezden Geldikleri
Google'ın video prompt'lama materyalini yeterince uzun okuyun, birkaç paragraf arayla iki cümleye rastlarsınız. Biri bir kamera hareketleri listesi yayımlıyor — dolly, truck, pedestal, crane, whip pan, arc — sanki bir menüden sipariş veriyormuşsunuz gibi. Diğeri ise uyarıyor: "Bazı ileri düzey kamera açıları resmî olarak desteklenmiyor. Sonuçlar ve güvenilirlik, genel prompt'unuza ve spesifik kullanım senaryonuza göre değişebilir."
İkisi de doğru ve aradaki boşluk, hayal kırıklığı yaratan kliplerin çoğunun çıktığı yer. Adı konmuş bir hareket, modelin muhtemelen yerine getireceği bir istektir; yürütmek zorunda olduğu bir parametre değil. gemini-omni-1.1-flash üzerinde kamera pozu alanı yok — ne rig var ne lens; yalnızca diğer kelimelerinizle yarışan kelimeler var. Bu yazı, o kelimelerden hangilerinin yerini hak ettiği üzerine; Google'ın belgelediklerinden, Runway'in aktardıklarından ve şemanın açtıklarından çalışıldı.

Doğrudan elenen kelimeler
Çıkarmayla başlayın; hiçbir maliyeti yok ve size prompt alanı kazandırıyor. Runway'in kamera prompt'lama referansı, yapay zekâ video prompt'larının en yaygın iki kelimesi konusunda açık sözlü: "'Cinematic' ve '4k' eleniyor, çünkü hiçbir iş yapmıyorlar. İkisi de kameranın ne yaptığını değiştirmiyor ve kapladıkları prompt alanı, hareketi tarif etmeye harcansa daha iyi olur."
Bu, Google'ın değil kendi araçlarına dair bir iddia, ama gerekçe taşınıyor. "Cinematic" bir izlenimi tarif ediyor, bir bakış noktasını değil: nerede durulacağını, ne kadar uzakta olunacağını, neyin net kalacağını ya da hangi yöne gidileceğini söylemiyor. Peşine takılan yük için de aynısı geçerli — masterpiece, award-winning, 8k, ultra detailed — hepsi, o token'ların çok farklı bir eğitim dağılımına karşı kalite büyüsü olarak işe yaradığı görsel modeli prompt kültüründen devralındı.
Olumlu biçimi de aynı ölçüde yalın: "dinamik sinematik kamera" istemek yerine spesifik bir hareketin adını koyun, çünkü bu modeller "kamera talimatlarını süs olarak değil, mekânsal yönlendirme olarak" ele alıyor. Orada "cinematic" zarar verir diyen hiçbir şey yok. Söylenen şu: kelime daha iyi bir şeyin yerini alıyor ve birkaç düzine kelimelik bir prompt'ta yer değiştirmenin kendisi bütün mesele.
Google'ın listesi ve ona ne kadar güvenmeli
Belgelenmiş sözlük, prompt başlıklarında dolaşan her şeyi geride bırakıyor:
| Kategori | Google'ın adını koydukları |
|---|---|
| Hareket | statik · pan · tilt · dolly (in, out) · truck (sola, sağa) · pedestal (yukarı, aşağı) · zoom · crane · havadan veya drone · elde · whip pan · arc |
| Açı ve ölçek | göz hizası · alçak · yüksek · kuş bakışı · Dutch · öznel bakış · omuz üstü · aşırı yakın plan · yakın plan · orta plan · boy planı · geniş veya tanıtım planı |
| Optik | geniş açı · telefoto · sığ ve derin alan derinliği · lens flare · rack focus · balıkgözü · dolly zoom |
İki detay dikkati hak ediyor. Google, zoom ile dolly'yi bilinçli olarak ayırıyor, çünkü modeller ikisini karıştırıyor: zoom bir odak uzaklığı değişimi ve "Bu bir dolly'den farklıdır, çünkü kameranın kendisi hareket etmez." Arka planın öznenize göre büyümesini mi istiyorsunuz? Dolly isteyin. Geometri değişmeden kadrajın daralmasını mı? Zoom isteyin. "Kamera ileri iterken yavaşça zoom yap" yazarsanız ikisini birden sipariş etmiş olursunuz — bir dolly zoom — ve kastedilen neredeyse hiçbir zaman bu değildir.
İkincisi, yaygın biçimde Google'a atfedilen terimler onun sayfalarında yok. Oner, push in ve natural smartphone zoom, Google dokümantasyonunu kaynak gösteren rehberlerde geçiyor; biz orada bulamadık. Belgelenmemiş olmak yasak olmak değil, ama bu terimler sizin uyduracağınız bir ifadeden daha fazla otorite taşımıyor. Belgelenmiş sözdiziminin tamamı prompt rehberimizde.
Klip başına tek hareket
Runway'in referansındaki en keskin bulgu, hangi fiillerin işe yaradığı değil, kaç tanesinin işe yaradığı.
"Üst üste yığılmış fiiller (güvenilmez): 'Orbit the subject and crane up and push in.' Aşamalı tarif (güvenilir): 'The camera arcs around the seated figure, then rises above the table to reveal the empty chairs surrounding her.'"
Devamındaki tavsiye, fiil yığmak yerine her aşamada kadrajı neyin doldurduğunu tarif etmek; bileşik hareket yine de başarısız olursa "tek bir harekete geri dönün ve ikinci beat'i kendi klibi olarak üretin."
Omni buna, Google'ın kendi dokümantasyonundan gelen mekanik bir avantaj ekliyor: model, aksi söylenmedikçe varsayılan olarak birkaç plan üretiyor. Üç eşzamanlı hareket isteyin, ona bir kaçış yolu vermiş olursunuz — kesme. İki saniye arc, kes, iki saniye crane, kes, kalan sürede push in. Her talimat yerine getirildi, istediğiniz hiçbir şey olmadı. Tek cümlecikli çözüm — "In a single continuous shot" ya da "No scene cuts" — modelin belirsizliğinizi bir kurgu kararıyla çözmesini engelliyor.
Tek bir sahne, iki kez üretildi; yalnızca kamera cümlesi değişti:
Her biri 720p'de dört saniye, otuz altışar sent. Özne, oda, ışık ve ses hattı birebir aynı; yalnızca açılış cümlesi farklı — sabitlenmiş bir kadraja karşı yavaş bir dolly in. Kamera cümlesi, prompt'un en yüksek kaldıraçlı cümlesi ve çoğu insanın en son yazdığı cümle.
Odak uzaklığı optik değil, yönetmenliktir
Lens diye bir şey yok. Bunu açıkça söylemeye değer, çünkü zihinsel model önemli. "85mm" yazdığınızda model bir görüş açısı hesaplamıyor; eğitim verisinde böyle etiketlenmiş her şeye uzanıyor ve fotoğraflar bu etiketi milyonlarca kez taşıyor. Geri dönen şey, sayıya iliştirilmiş görünüm: sıkışmış arka plan, yumuşak bir alandan kesilip çıkarılmış özne, düzleşmiş mesafe. Kısa lenste ise gerilmiş perspektif, kadrajda daha fazla yer, bükülen kenarlar.
Bu da odak uzaklığını mevcut en verimli kelimelerden biri yapıyor: dört karakterde kadrajı ve hissi birlikte oynatıyor. Dolaşımdaki tavsiye tutarlı — geniş bağlam için kabaca 24mm, belgesel hissi için 35mm, nötr anlatım için 50mm, sıkışmış ve samimi işler için 85mm — bunu birebir optik vaadi olarak değil, görsel yönlendirme olarak okuyun.

Bundan iki alışkanlık çıkıyor. Sayıyı bir sıfat olarak bırakmak yerine ona bir iş verin: tek başına "35mm" bir token, oysa "35mm, atölye boyunca arkasında görünür halde" o geniş lensin ne işe yaradığını söylüyor ve o cümlecik, sayı göz ardı edilse bile ayakta kalıyor. Google'ın belgelediği optik terimler — sığ alan derinliği, derin odak, rack focus, telefoto — aynı işi düz kelimelerle yapıyor. Ve bir odak uzaklığını asla onunla çelişen bir talimatla eşleştirmeyin: "vadinin 85mm geniş tanıtım planı" aynı anda hem sıkışma hem genişlik istiyor.
Kadraj, belirtebileceğiniz en güvenilir şey
Kamera dilini ne kadar güvenilir biçimde karşılık bulduğuna göre sıralayın, bir örüntü beliriyor: statik özellikler zamansal olanları yeniyor.
Çekim ölçeği — aşırı yakın plandan geniş tanıtım planına kadar — tek bir karenin özelliği. Açı da öyle; bir ikili planın ya da omuz üstü çekimin geometrisi de. Model bunların herhangi birini render ettiği ilk karede karşılayabilir, sonra da koruyabilir.
Bir dolly in ise birinci kareyle doksan altıncı kare arasında kurulan bir iddia ve aradaki her kareden sağ çıkmak zorunda — üstelik kameranın nerede olduğuna dair açık bir temsili bulunmayan bir süreçte. Araştırma literatürünün kapatmaya çalıştığı boşluk tam olarak bu: video difüzyonunda kamera kontrolünün referans çalışması CameraCtrl, mevcut modellerin "daha derin anlatısal nüansları ifade eden sinematik bir dil olarak kamera pozunun kontrolünden yoksun" olduğunu belirterek açılıyor, ardından bir poz koşullama modülü ekliyor, çünkü tek başına metin yetmiyordu. Bildiğimiz hiçbir üretim video API'si bu kanalı açmıyor.
Dolayısıyla ezberlenmeye değer bir hiyerarşi çıkıyor. Kadraj ve açı: serbestçe belirtin, uyum bekleyin. Adı konmuş tek bir hareket: çoğu zaman gerçekleşmesini bekleyin. İki hareket ya da hızı ve duracağı nokta belirtilmiş bir hareket: birkaç çekim bekleyin, ya da beat'i bölün.

Öncesi ve sonrası
Çoğu kamera prompt'unun yazıldığı biçimde yazılmış bir prompt. İçindeki her kelimeyi bir zamanlar biz de kullandık.
Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.
Uygulanabilir olanı sayın. Tek bir çekimde birlikte duramayacak üç yığılmış fiil. Çekim ölçeği yok, odak uzaklığı yok, plan sayısına dair talimat yok — dolayısıyla belgelenmiş çoklu plan varsayılanı serbestçe devreye giriyor ve masada birbiriyle yarışan üç hareket varken kesmek en az direnç gösteren yol oluyor.
Aynı çekim, yalnızca modelin uygulayabileceklerini söyleyecek biçimde yeniden yazıldı:
In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.
Ağırlık sırasına göre dört değişiklik. Plan sayısı cümleciği en başa geçiyor, böylece belirsizlik bir kurgu kararıyla yanıtlanamıyor. Üç hareket tek harekete iniyor, açılış ve kapanış kadrajları adlandırılıyor — Runway'in önerdiği aşamalı tarif, tek bir seyahat olarak yazılmış halde. Odak uzaklığı bir sonuca iliştirilmiş biçimde geliyor. Ve ses, Google'ın sesi ayrı tarif etme önerisine uygun olarak kendi cümlelerini alıyor; negatifler kısa, sona eklenmiş cümlecikler halinde. Yeniden yazım okumak açısından daha yalın ve daha sıkıcı, ki bu genellikle bir prompt'un bir ruh hali tarif etmeyi bırakıp bir çekim tarif etmeye başladığının işaretidir.
Kamera prompt'un neresine giriyor
Sıralama, yanıtı olmayacağını beklediğimiz soruydu. Yanıtı var; Omni sayfasından değil, Google'ın Veo rehberinden geliyor: oradaki formül sinematografi, özne, aksiyon, bağlam, stil ve atmosfer diye ilerliyor — kamera önce, çekimde kimin olduğunu söylemeden önce — çünkü o öğe "tonu ve duyguyu aktarmak için en güçlü araç." Omni'nin kendi dokümantasyonu öğeleri farklı sıralıyor, kamera listenin ortasında; yani Google iki ayrı sıralama yayımlıyor ve biz kontrollü bir karşılaştırma yapmadık.
Kamerayla başlamak, Omni'nin diğer belgelenmiş davranışıyla temas ettiğinde ayakta kalıyor, çünkü plan sayısı talimatının, model bir anlatı kurmaya başlamadan önce yerine oturması gerekiyor. Ayrıca prompt'u denetlenebilir kılıyor: ilk cümle bir bakış noktası tarif etmiyorsa, bir çekim yönetmemişsiniz demektir.
Şemanın size vermeyeceği şeyler
İki yapısal sınır; ikisi de daha iyi bir ifadeyle çözülmüyor.
Birincisi tekrarlanabilirlik. Google'ın API dokümantasyonu "Sistem talimatları, temperature, top_p, stop dizileri ve negatif prompt'lar desteklenmiyor" diyor ve negatiflerinizi bunun yerine prompt'un içine yazmanızı söylüyor. Sıkıştırılacak bir sampler yok. Geriye kalan seed; bu model için şemamızda opsiyonel bir tam sayı, ve kontrol yüzeyinin tamamı bundan ibaret.
Bu, bir prompt'taki başka her şeyden çok kamera işi için önemli. Biraz farklı dönen bir ışık, aynı çekimin farklı bir renk düzenlemesidir; pan olarak dönen bir dolly ise farklı bir çekimdir. Dolayısıyla bir hareketi çekimler boyunca sabit tutmak, seed'i sabitleyip başka hiçbir şeyi değiştirmemek demek — ve tek bir kelimeyi düzenlemek yeniden örneklemek demek. İşe yarayan bir seed'i bir varlık gibi görün ve prompt'un yanına yazın.
İkinci sınır, kamera hızının bir sözlüğünün olmaması. "Slow dolly in" kontrol yüzeyinin kendisi: birim yok, süre yok, itmenin beşinci saniyede bitip sabitlenmesini söylemenin yolu yok. Zaman kodu sözdizimi biraz yardımcı oluyor — Omni köşeli parantezli aralıkları kabul ediyor — dolayısıyla bir prompt kameranın dördüncü saniyede yerleşmesini isteyebilir. Yapıp yapmayacağı ayrı bir mesele.
Enstantane açısı ve hareket bulanıklığı aynı sütunda oturuyor: ikisi de Google'ın belgelediği sözlükte geçmiyor. Kare hızı kıl payı kaçırıyor — 24 fps, Omni sayfasında yalnızca işlenmiş bir zamanlama örneğinin içinde, "12 frames at 24fps" olarak görünüyor; bir prompt kaldıracı olarak değil. Zaman kodları üzerine düşünmek için faydalı; yazıp yönlendirmesini bekleyeceğiniz bir şey değil.
Kamera denemeleri, önemli olan katmanda ne tutuyor
Kamera işi, prompt'lamanın tek geçişte doğru yapamayacağınız kısmı: zaman içindeki bir davranışı, onu kısıtlayacak bir parametre olmadan istiyorsunuz; dolayısıyla üretiyor, izliyor, ayarlıyor, yeniden üretiyorsunuz. Önemli olan rakam, tek bir çekimin fiyatı.
4K'da sekiz saniyelik bir çekim burada $1.44, doğrudan Google'ı çağırdığınızda $2.43. Bir hareketi tutturmak için altı çekim — belirli bir seyahati olan herhangi bir iş için mütevazı bir sayı — burada $8.64, orada $14.60. Bu fark %41; dört çözünürlüğün açık ara en büyüğü ve 4K satırının tartışmaya değer tek satır olmasının sebebi. Başka yerlerde 4K saniyesi fal'de $0.30, Runware'de $0.32 ve WaveSpeed'de $0.39; burada $0.18. Replicate modeli listeliyor, ama saniye başına hiçbir oran vermiyor.
Yine de daha az harcamanın yolu daha ucuz bir 4K saniyesi değil, kamera hareketlerini 4K'da denemeyi bırakmak. 360p katmanında sekiz saniyelik on taslak $2.38 tutuyor ve 360p, kameranın istediğinizi yapıp yapmadığını görmeye yetiyor — bir hareket her çözünürlükte okunur, denemesini ucuzlatan da bu. On taslak artı saklanacak bir 4K çekim $3.82; on adet 4K çekimin $14.40'ına karşı.
Üstteki iki basamak natif render değil, upscale — Google'ın model referansı bunları "1080p output (upscaled)" ve "4K output (upscaled)" diye etiketliyor — dolayısıyla bir 4K çekim size teslim boyutları alıyor, denetlediğiniz çekimde fazladan detay değil. Kırk saniyelik sahneler üzerine yazımız bunun buna rağmen nerede ödemeye değdiğini ele alıyor.
Fiyatlar ve ürün koşulları değişebilir. Satın alma kararı vermeden önce her sağlayıcının güncel fiyatlandırmasını kontrol edin.
Kısa versiyonu
Önce plan sayısını söyleyin, sonra tek bir hareketi, sonra o hareketin başladığı ve bittiği kadrajı. Odak uzaklığına orada olmak için bir sebep verin. Sesi kendi cümlelerine koyun. Videonun birine ne hissettirmesi gerektiğini tarif eden her kelimeyi silin ve o alanı kameranın nerede olduğuna harcayın.
1.1'de neyin geldiği lansman yazısında; sağlayıcı fiyat denetimi ise aynı ağırlıkların sayfadan sayfaya neden farklı tuttuğunu açıklıyor. Parametreler ve güncel oranlar text-to-video model sayfasında. Hiçbir şeyin bağlı olmadığı tek bir hareket için önce saniyesi bir sent olan Veo 3.1 Fast'ı fiyatlayın — kamera sözlüğü Google'ın ikisi için birden yayımladığı rehberden geliyor, dolayısıyla pratik taşınıyor.
Sıkça sorulan sorular
Gemini Omni 1.1 Flash hangi kamera hareketi terimlerini anlıyor?
Google bir hareket sözlüğünün adını koyuyor — statik, pan ve tilt, dolly, truck ve pedestal ikilileri, zoom, crane, drone veya havadan çekim, elde, whip pan, arc — ayrıca açı, çekim ölçeği ve optik terimler. Aynı zamanda bazı ileri düzey kamera açılarının resmî olarak desteklenmediğini ve güvenilirliğin prompt'a göre değiştiğini de uyarıyor; dolayısıyla adı konmuş bir hareketi bir parametre olarak değil, bir istek olarak okuyun.
Bir video prompt'una "cinematic" yazmanın bir etkisi var mı?
Tek başına pek yok. Runway'in kamera prompt'lama referansı hem "cinematic" hem "4k" kelimelerini eliyor; gerekçesi, ikisinin de kameranın ne yaptığını değiştirmemesi ve o alanın bir hareketin adını koymaya harcanmasının daha iyi olması. Kelime bir bakış noktası değil bir izlenim tarif ediyor, dolayısıyla modele uygulayacak bir şey vermiyor — "masterpiece", "8k" ve görsel prompt'lamadan devralınan diğer yükler gibi.
35mm ya da 85mm gibi odak uzaklığı sayıları çıktıyı değiştiriyor mu?
Görünümü kaydırıyorlar, çünkü eğitim verisindeki fotoğraflar metaverilerinde odak uzaklığını taşıyor ve sayı bir stil ipucu olarak okunuyor. Uzun bir lens arka planı sıkıştırma ve özneyi ayırma eğiliminde; kısa bir lens perspektifi geriyor ve odaya dair daha fazlasını kadraja alıyor. Bunu birebir optik olarak değil görsel yönlendirme olarak ele alın ve bir sonuca iliştirin.
Bir Omni prompt'unda kamera yönlendirmesi nereye yazılmalı?
Google'ın Veo prompt rehberi sinematografiyi özne, aksiyon, bağlam ve stilin önüne, en başa koyuyor ve onu tonu aktaran en güçlü öğe olarak niteliyor. Omni'nin kendi dokümantasyonu kamera terimlerini listenin ortasına yerleştiriyor. İkisi de Google. Kamerayla başlamanın pratik bir avantajı var: plan sayısı talimatı bir kamera kararı ve model bir anlatı kurmaya başlamadan önce kaydedilmesi gerekiyor.
Gemini Omni 1.1 Flash'ten aynı kamera hareketini iki kez alabilir misiniz?
Yalnızca bir seed'i yeniden kullanarak. Google'ın dokümantasyonu temperature, top_p, sistem talimatları, stop dizileri ve negatif prompt'ların desteklenmediğini söylüyor; geriye tekrarlanabilirliğin tek kontrolü olarak seed kalıyor — şemamızda opsiyonel bir tam sayı. Prompt'un tek bir kelimesini değiştirdiğinizde yeniden örnekliyorsunuz; dolayısıyla beğendiğiniz bir hareketi üreten seed'i tam işe yaradığı anda kaydedin.
Tek bir hareket istediğim halde kamera neden çekimin ortasında kesiyor?
Çünkü varsayılan olan çoklu plan. Google, Omni'nin aksi söylenmedikçe birkaç plan deneyeceğini ve bir anlatı kuracağını belgeliyor; dolayısıyla iki üç hareket yığan bir prompt, modele her birini ayrı bir kesmede karşılama bahanesi veriyor. Belgelenmiş çözüm, tek ve kesintisiz bir sahne isteyen bir cümlecik; adı konmuş tek bir harekete geri dönmek de teşviki ortadan kaldırıyor.
Bir Gemini Omni prompt'unda enstantane hızı ya da kare hızı belirtilebilir mi?
Google'ın belgelediği kamera sözlüğünde enstantane açısını ya da hareket bulanıklığını kapsayan hiçbir şey yok ve bu terimlerin yerine getirildiğini iddia etmeyiz. Kare hızı da bir prompt kaldıracı değil: 24 fps, Google'ın Omni sayfasında bir zamanlama örneğinin içinde geçiyor — "12 frames at 24fps" — ayarlayabileceğiniz bir spesifikasyon olarak değil. Kare hızını post prodüksiyonda ele alın.
4K'da kamera prompt'ları denemek ne tutuyor?
Sekiz saniyelik 4K bir çekim E2X'te $1.44, doğrudan Google'ı çağırdığınızda $2.43; dolayısıyla altı çekim $14.60 yerine $8.64 tutuyor — %41'lik bir fark, dört çözünürlüğün en genişi. Yine de 4K'da denemek genellikle israf: bir hareket 360p'de okunuyor, orada sekiz saniyelik on taslak toplam $2.38 ve saklanacak bir 4K çekim eklendiğinde tur $3.82'ye çıkıyor.