Gemini Omni Prompt'lama: Google'ın Belgelediği, Kimsenin Aktarmadığı Tag Sözdizimi
Bu hafta yayımlanan Omni prompt'lama tavsiyelerinin çoğu uydurma.
Yarım düzine rehberin aktardığı "Google'ın resmî dokümantasyonundaki beş öğeli çerçeve" bulabildiğimiz hiçbir Google sayfasında yok ve onu alıntılayan rehberler beş öğe mi altı öğe mi olduğu konusunda bile anlaşamıyor. Diyaloğu tırnak içine almanın modeli bir lip-sync moduna geçirdiği iddiası da hiçbir Google belgesinde geçmiyor — Google'ın örneklerinde tırnak işaretleri yalnızca ekranda render edilen metin için görünüyor.
Google'ın gerçekten belgelediği şey daha faydalı ve neredeyse kimse yazmamış: tek bir prompt'un belirli görselleri ve klipleri isimle adreslemesini sağlayan bir tag sözdizimi. Bu rehber oradan başlıyor.

Devamı hakkında iki not
Burada alıntılanan her şey Google'ın kendi sayfalarından geliyor — Gemini Omni API dokümantasyonunun prompt rehberi bölümü ve Omni ile Veo'yu birlikte kapsayan ortak prompt rehberi. Google'ın sessiz kaldığı yerlerde, boşluğu otoriter duran bir şeyle doldurmak yerine bunu söylüyoruz.
Aşağıdaki klipler Omni'yle değil, kendi API'mizde Veo 3.1 Fast ile üretildi. Gemini Omni 1.1 Flash henüz E2X'te değil ve bir rehberi bir modelin görüntüsüyle resmedip başka bir modelden geldiğini iddia etmeyeceğiz. Gösterdikleri teknikler — kamera sözlüğü, tek plan talimatı, ses yönetimi — Google'ın her iki model için yayımladığı prompt rehberinden geliyor, dolayısıyla taşınıyorlar. Sonraki bölümdeki tag sözdizimi taşınmıyor: o kısım yalnızca Omni'ye ait ve onu çıktı olarak değil sözdizimi olarak gösteriyoruz.
Tag sözdizimi
Omni, belirli girdileri işaret eden satır içi tag'leri kabul ediyor. Dokümantasyonun üçüncü taraflarca en az işlenmiş ve okunduğunda en çok kazandıran kısmı burası.
Kareler için:
<FIRST_FRAME> a woman is walking
<LAST_FRAME> inilecek kareyi işaretliyor ve Google, onun <FIRST_FRAME> "ile birlikte kullanılması gerektiğini" açıkça söylüyor. Bir prompt konumun belirsizleşeceği kadar karmaşıklaştığında, açık bir bildirim biçimi var:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image2]
Her iki tag'i aynı görsele yöneltin, bir döngü elde edersiniz. Google bunu doğrudan belgeliyor — klip başladığı yere dönüyor:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image1]
Referanslar için tag'ler numaralı ve sıfırdan başlıyor:
in the style of <IMAGE_REF_0> a woman <IMAGE_REF_1> is walking
O tek satır, stili bir görselden, özneyi başka bir görselden çekiyor. Video karşılığı, yine sıfırdan indeksli <VIDEO_REF_0> ve sert bir sınırı var: "Video referansları en fazla 3 klibi, her biri 3 saniyeye kadar destekler"; ayrıca bir referans klipteki ses yok sayılıyor.
Buradaki hata biçimi, modelin bir referansı gerçek bir açılış karesi gibi ele alması. Google'ın çözümü, prompt'un sonuna eklenen bir talimat:
Use the given image(s) as references for video generation.
The images should not be used as literal initial frames.
Etrafında tasarım yapmadan önce bilinmeye değer bir sınır: "Birden fazla video arasında referans verme veya akıl yürütme desteklenmiyor." Birden fazla görsel referansı sorun değil — Google'ın kendi örneği altı tane çalıştırıyor — ama çoklu video prompt'lama bozuluyor.
Durdurmazsanız Omni klibinizi birkaç plana bölüyor
Dokümantasyondaki en şaşırtıcı tek satır bu ve kafa karıştıran çıktıların çoğunu açıklıyor:
"Omni Flash varsayılan olarak birkaç farklı plan içeren bir video oluşturmaya çalışacaktır. Prompt'a dayalı ilginç bir anlatı kurmaya girişecektir. Çıktı videonun tek bir sahne içermesi gerekiyorsa, bunu prompt'ta belirtmeniz gerekir"
Bir kişinin kapıdan geçtiği sekiz saniye isteyin, bunun üç kesmesini alabilirsiniz. Model sizi yanlış okumuyor. Varsayılanının gereğini yapıyor.
Çözüm tek bir cümlecik ve Google üç ifade veriyor: "Tek, kesintisiz bir sahnede", "Tek, sürekli bir planda" veya "Sahne kesmesi yok".
İşte o talimat iş başında; belgelenmiş bir kamera hareketi ve iliştirilmiş bir ses satırıyla:
In a single continuous shot, no scene cuts. Slow dolly in on a battered
enamel coffee pot sitting on a cast-iron stove in a dim cabin kitchen.
Steam rises and catches a hard shaft of morning light from a window to the
left. Medium shot, shallow depth of field, warm amber and deep green
palette. Sound design: the low hiss of steam and a wood fire ticking.
No dialogue.
Dört saniye, 720p, saniyesi bir sente Veo 3.1 Fast ile üretildi. O prompt'un ne kadar azının sıfat, ne kadar çoğunun modelin uygulayabileceği talimat olduğuna dikkat edin.
Ses kendi cümleleriyle yönetiliyor
Ses görüntüyle birlikte üretiliyor ve Google'ın önerisi onu ayrıca tarif etmek: "Prompt'unuzda sesi tarif etmek için ayrı cümleler kullanmanızı öneririz." Dokümantasyon bunu üçe ayırıyor — ses efektleri, ortam sesi ve diyalog — her biri için ayrı örneklerle.
Folklorun yanıldığı yer diyalog. Belgelenmiş kural, iki nokta üst üste ve tırnaksız:
the man in the red hat says: Where is the rabbit?
Google'ın daha uzun örneği tek bir prompt'ta iki konuşmacı çalıştırıyor ve ortam sesiyle kapanıyor:
A medium shot in a dimly lit interrogation room. The seasoned detective
says: Your story has holes. The nervous informant, sweating under a single
bare bulb, replies: I'm telling you everything I know. The only other
sounds are the slow, rhythmic ticking of a wall clock and the faint sound
of rain against the window
Omni'nin kendi örnekleri konuşma dışı sesin başına Sound design: koyuyor; "Sound design: Gentle breeze, distant bird chirps. No dialogue." örneğinde olduğu gibi. Özellikle müzik istiyorsanız bunu söyleyin — Google bunu atlanma ihtimali en yüksek durum olarak işaretliyor: "Bu, videonuzda müzik istiyorsanız özellikle önemlidir".
Etrafında tasarım yapılacak iki kısıt: ses düzenleme desteklenmiyor ve "API'nin mevcut sürümünde ses referansı yüklemek desteklenmiyor". Sesi ya kelimelerle yönetirsiniz ya da hiç.
Zaman kodları çalışıyor ve uzatınca yeniden hizalanıyor
Zamanlamanın özel bir sözdizimine ihtiyacı yok — "kesin bir sözdizimi gerekmiyor ve doğal dil kullanabilirsiniz", dolayısıyla "5. saniyede arka plan sesinde nakarat başlıyor" geçerli bir talimat. Bir de köşeli parantezli zaman kodu biçimi var:
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
Şimdi tuzak, ki gerçek bir tuzak. Mevcut bir klibi uzattığınızda 0s artık videonun başlangıcı anlamına gelmiyor. Uzatmanın başlangıcı anlamına geliyor. Google bunu açıkça yazıyor:
"Zaman damgaları veya bir zaman kodu sözdizimi kullanıyorsanız, 0s videonun uzatılan kısmının başlangıcını ifade eder. 10 saniyelik bir videoyu uzatıyorsanız, bu prompt'taki sahne kesmesi 12. saniyeden sonra gerçekleşecektir"
Yani After 2s cut to a new scene bitmiş parçanın on ikinci saniyesine denk geliyor. Mutlak zaman kodlarına göre çekim listesi kuran herkes bunu bir kez yanlış yapar, sonra bir daha asla.
Hazır oradayken: uzatma prompt'ları bütün sahneyi yeniden anlatmalı değil, devamı tarif etmeli. Google'ın önerdiği biçimler "Extend this video" veya "The scene continues" kadar kısa; eklemeler yalnızca bir şey değiştiğinde geliyor — ses için "The music continues into the chorus", bir kesme için "Show the same characters in the next scene". Uzatma yalnızca sona ekliyor; öne ekleyemez ya da ortaya montajlayamazsınız.

Düzenleme daha çok değil, daha az kelime istiyor
Yukarıdaki her şey detayı ödüllendiriyor. Düzenleme bunu tersine çeviriyor: "Video düzenlemede basit prompt'lar en iyi sonucu verir. Aşırı betimleyici prompt'lar istenmeyen değişikliklere yol açabilir."
Google kendi öncesi-sonrası çiftlerini yayımlıyor ve bunlar iki örnek olarak değil, bir kalıp olarak okunmayı hak ediyor:
Avoid: In the video of the man sitting on the sofa, please add a small
black cat that runs from the right side of the screen, jumps onto
his lap, and then he starts to stroke its head while looking down.
Simplify: Add a cat that jumps onto his lap, he begins to pet it.
Keep everything else the same.
Avoid: Please remove the cell phone that the person is holding in their
hand and fill in the background so it looks like they are just
holding their hand empty.
Simplify: Make the phone invisible. Keep everything else the same.
İkisinde de işi yapan cümlecik "Keep everything else the same"; Google bunu bir çekimin tek bir yönünü düzenlediğiniz her seferde eklemenizi öneriyor. Verdiğiniz her fazladan detay, modelin yeniden üretmeye karar verebileceği bir şey daha demek.
Image-to-video yine ters yönde çalışıyor: "'Hareket ettir' gibi muğlak prompt'lar, kamera hareketinin, özne hareketinin ve çevresel efektlerin detaylı tariflerinden daha az etkileyici sonuçlar üretir." Üretim için detay, düzenleme için kısalık.
Google'ın gerçekten adını koyduğu kamera kelimeleri
Google bir sözlük listesi yayımlıyor ve bu, prompt ipucu başlıklarında dolaşan terimlerden daha güvenilir. Adını koyduğu hareketler: statik, pan, tilt, dolly in ve out, truck sola ve sağa, pedestal yukarı ve aşağı, zoom, crane, havadan veya drone, elde, whip pan, arc. Açılar: göz hizası, alçak, yüksek, kuş bakışı, solucan bakışı, Dutch, yakın plan ve aşırı yakın plan, orta plan, boy planı, geniş veya tanıtım planı, omuz üstü, öznel bakış. Optik efektler: geniş açı, telefoto, sığ ve derin alan derinliği, lens flare, rack focus, balıkgözü ve vertigo efekti — yani dolly zoom.
Google zoom ile dolly'yi de açıkça ayırıyor, çünkü modeller ikisini karıştırıyor: zoom odak uzaklığını değiştiriyor ve "Bu bir dolly'den farklıdır, çünkü kameranın kendisi hareket etmez."
Yine de Google'ın iki kez belirttiği uyarıyı yanınıza alın: "Bazı ileri düzey kamera açıları resmî olarak desteklenmiyor. Sonuçlar ve güvenilirlik, genel prompt'unuza ve spesifik kullanım senaryonuza göre değişebilir." Bir hareketin adını koymak bir istektir, garanti değil.
İşte belgelenmiş hareketlerden biri olan bir arc çekimi, düz biçimde prompt'lanmış:
Slow arc shot travelling left around a weathered brass sextant resting on
an unrolled nautical chart on a scuffed wooden table. Low winter sunlight
rakes in from the right and the brass catches moving highlights as the
camera travels. Single continuous shot, no scene cuts, shallow depth of
field. Sound design: faint harbour ambience, rigging tapping in wind.
No dialogue.
Sinematik ve kurgu terimleri de belgelenmiş — match cut, jump cut, tanıtım planı dizisi, montaj, split diopter efekti. Google'a atfedildiğini görmüş olabileceğiniz ama iki sayfanın hiçbirinde olmayan terimler: oner, push in ve natural smartphone zoom.
Negatif prompt'lar: iki Google sayfası çelişiyor
Omni'nin negatif prompt parametresi yok. API dokümantasyonu açık sözlü: "Sistem talimatları, temperature, top_p, stop dizileri ve negatif prompt'lar desteklenmiyor (negatiflerinizi normal prompt'a koyabilirsiniz: örneğin, 'Do not do X')."
Omni prompt rehberi de tam olarak bunu öneriyor; "No dialogue", "No embellishments", "No extra sound effects" gibi ifadeler veriyor.
Google'ın ortak Omni ve Veo rehberi ifade konusunda tam tersini söylüyor:
"Önerilmez: emir kipinde dil ya da 'hayır' veya 'yapma' gibi kelimeler kullanmak. Örneğin 'duvar yok' ya da 'duvarları gösterme' gibi prompt'lardan kaçının. Önerilir: Görmek istemediğiniz şeyi tarif edin. Örneğin, 'duvar, çerçeve'"
Bunu çözdüğümüz iddiasında bulunmayacağız. En olası açıklama, ikinci sayfanın Veo'nun kendine ait negativePrompt alanını tarif ediyor olması — ki Omni'de böyle bir alan yok — Omni sayfasının ise Omni'nin sunduğu tek şey olan düzyazı negatifleri tarif etmesi. Bu bir çıkarım, Google'ın söylediği bir şey değil. Pratikte: Omni için Omni sayfasının ifadesini kullanın ve bir negatif göz ardı ediliyorsa, modelin bunu yapamadığını varsaymadan önce diğer biçimi deneyin.
Bir dürüst çelişki daha, çünkü bir müşteriye ne söz verebileceğinizi etkiliyor. Omni prompt rehberi, modelin ekran üstü metni "doğru ve okunabilir biçimde" render ettiğini söylüyor. DeepMind model kartı ise "kusursuz doğrulukta metin render etmeyi", "hâlâ bir zorluk olmaya devam eden" şeyler arasında sayıyor. İkisi de Google. Söz vermeden önce test edin.
Gerçekten kullanabileceğiniz bir kontrol listesi
Yukarıdakilerden hareketle, modelin nasıl davrandığına saygı gösteren bir prompt genellikle şunları taşıyor:
- Bir plan sayısı talimatı, çünkü çoklu plan varsayılan ve muhtemelen istediğiniz şey değil
- Özne ve hareketi, spesifik olarak — "hareket ettir" değil
- Google'ın listesinden adı konmuş tek bir kamera hareketi
- Işık: yön, nitelik, renk
- Ses için ayrı bir cümle; diyalog değilse başına
Sound design: - Diyalog
speaker says: linebiçiminde, iki nokta üst üste, tırnaksız - Negatifler sona kısa düzyazı cümlecikleri olarak
- Yalnızca düzenlemeler için: yukarıdakilerin çoğunu atın ve "Keep everything else the same" ekleyin
Google'ın yapıya dair kendi özeti daha uzun — özne, eylem, mekân, kamera açısı, kamera hareketi, lens, görsel stil, zamansal öğeler, ses, sinematik terimler, negatifler — ve şu güvenceyle birlikte geliyor: "Her prompt'ta bütün öğeleri kullanmanız gerekmiyor".
Bunu bugün nerede çalıştırmalı
Prompt'lama, tekrar tekrar başarısız olarak edinilen bir beceri; bu da başarısızlık başına fiyatı en çok önem taşıyan rakam hâline getiriyor. Veo 3.1 Fast üzerinde dört saniyelik bir test dört sent tutuyor. Aynı test, 28 Ağustos 2026'dan beri burada saniyesi dokuz sente çalışan Gemini Omni 1.1 Flash üzerinde otuz altı sent — ya da önce 360p'de taslak çıkarırsanız yaklaşık on iki; ki bu katman 1.1 sürümüne tam da bunun için eklendi. Bir kamera talimatının tam olarak nerede dinlenmemeye başladığını öğrenmekle geçen bir öğleden sonrada bu fark, kaç kez yanılma hakkınız olduğunu belirliyor.
O yüzden taşınabilir yarıyı ucuza çalışın — plan sayısı, kamera sözlüğü, ses yönetimi, negatifler; hepsi Google'ın her iki model için yayımladığı rehberden geliyor. Yukarıdaki iki klip de tam olarak böyle üretildi. Omni ailesine, yalnızca onun yapabildiği şeye ihtiyacınız olduğunda çıkın: tag sözdizimi, uzatma ve referansa dayalı tutarlılık. Bu rehberin en çok üzerinde durduğu kare tag'leri için bir not — artık kendi endpoint'leri de var: start-end-frame-to-video iki kareyi tag yerine alan olarak alıyor, image-to-video da tek bir açılış karesi için aynısını yapıyor. Veo 3.1 Fast bu yol boyunca image-to-video ve ilk ve son kare pratiğini karşılamaya devam edecek. Güncel ücretler 28 Ağustos 2026 itibarıyla.
1.1'de neyin yayınlandığını ve sıralama tablolarının bu konuda gerçekte ne dediğini ayrıca yazdık. İşe göre text-to-video üzerinden göz atın ya da düzyazı yerine parametreleri karşılaştırmayı tercih ediyorsanız makine tarafından okunabilir spec'i okuyun.
Fiyatlar ve ürün koşulları değişebilir. Satın alma kararı öncesinde her sağlayıcının güncel fiyatlarını kontrol edin.
Sıkça sorulan sorular
Gemini Omni 1.1 Flash için prompt nasıl yazılır?
Önce plan sayısını söyleyin, çünkü Omni varsayılan olarak birden fazla plan üretiyor ve siz genellikle tek plan istiyorsunuz. Sonra özneyi ve hareketini, adı konmuş tek bir kamera hareketini ve ışığı tarif edin. Sesi kendi cümlesine koyun, konuşma dışıysa başına "Sound design:" ekleyin ve diyaloğu iki nokta üst üste ile, tırnaksız olarak "speaker says: line" biçiminde yazın. Negatifleri sona kısa cümlecikler olarak ekleyin.
Gemini Omni'de FIRST_FRAME tag'i nedir?
Omni'ye verilen bir görseli açılış karesi olarak kullanmasını söyleyen satır içi bir tag; tag'in ardından tarifinizi yazarak kullanılıyor. Eşi olan LAST_FRAME inilecek kareyi işaretliyor ve Google'ın dokümantasyonuna göre FIRST_FRAME ile birlikte kullanılmak zorunda. Her iki tag'i aynı görsele yöneltmek döngüsel bir klip üretiyor.
Gemini Omni negatif prompt'ları destekliyor mu?
Parametre olarak hayır. Google'ın API dokümantasyonu negatif prompt'ların desteklenmediğini belirtiyor ve negatifleri bunun yerine normal prompt'a koymanızı söylüyor; "Do not do X" gibi. Omni prompt rehberi "No dialogue" veya "No extra sound effects" gibi kısa cümlecikler öneriyor. Google'ın ortak Omni ve Veo rehberi bu ifadeye karşı çıkıyor; o rehber Omni'yi değil, Veo'nun ayrı negatif prompt alanını tarif ediyor gibi görünüyor.
Gemini Omni neden istemediğim sahne kesmeleri ekliyor?
Çünkü varsayılan çoklu plan. Google'ın dokümantasyonu, aksi söylenmedikçe Omni'nin birkaç planlı bir video oluşturmaya ve prompt'unuzdan bir anlatı kurmaya çalışacağını söylüyor. Prompt'a "In a single continuous shot" ya da "No scene cuts" eklemek, belgelenmiş çözüm.
Bir Omni videosunu uzatırken zaman damgaları nasıl çalışıyor?
Yeniden hizalanıyorlar. Bir klibi uzattığınızda 0s, orijinalin başlangıcını değil uzatmanın başlangıcını ifade ediyor. Google'ın örneği: 10 saniyelik bir videoyu 2. saniyede bir talimatla uzatmak, o anı bitmiş parçanın 12. saniyesine yerleştiriyor. Uzatma yalnızca sona ekliyor — içeriği öne ekleyemez ya da bir klibin ortasını düzenleyemezsiniz.
Gemini Omni'de diyalog tırnak içine alınmalı mı?
Hayır. Google'ın belgelediği biçim "speaker says: line" — iki nokta üst üste, tırnaksız. Tırnak işaretlerinin bir lip-sync modunu tetiklediğine dair yaygın olarak tekrarlanan iddia hiçbir Google dokümantasyonunda geçmiyor. Tırnak işaretleri Google'ın örneklerinde yalnızca ekranda render edilmesi istenen metin için görünüyor; kafa karışıklığı büyük olasılıkla oradan çıkmış.
Omni prompt'lama pratiği yapmak ne kadar tutuyor?
API'mizde Gemini Omni 1.1 Flash 720p'de saniye başına $0.09 ile çalışıyor, yani 28 Ağustos 2026 itibarıyla dört saniyelik bir test $0.36 — 360p'de taslak çıkarırsanız yaklaşık $0.12. Veo 3.1 Fast saniye başına $0.01, aynı testi dört sente indiriyor. Kamera, plan sayısı ve ses teknikleri Google'ın her iki model için yayımladığı prompt rehberinden geldiğine göre, ucuz olanda pratik yapmak dokuzda bir maliyetle aynı alışkanlıkları çalıştırıyor.