Gemini Omni prompting: वह tag syntax जो Google दर्ज करता है और कोई उद्धृत नहीं करता
इस हफ़्ते छपी ज़्यादातर Omni prompting सलाह गढ़ी हुई है।
"Google के आधिकारिक दस्तावेज़ों वाला पाँच-तत्व फ़्रेमवर्क", जिसका हवाला आधा दर्जन गाइड देते हैं, Google के किसी भी पेज पर हमें नहीं मिला, और उसे उद्धृत करने वाली गाइडें आपस में इस पर सहमत नहीं हैं कि तत्व पाँच हैं या छह। यह दावा कि संवाद को उद्धरण चिह्नों में रखने से मॉडल lip-sync मोड में चला जाता है, भी किसी Google दस्तावेज़ में नहीं है — Google के उदाहरणों में उद्धरण चिह्न सिर्फ़ उस टेक्स्ट के लिए आते हैं जो स्क्रीन पर दिखाया जाना है।
Google जो दर्ज करता है वह ज़्यादा काम का है और उस पर लगभग किसी ने नहीं लिखा: एक tag syntax, जिससे एक ही prompt ख़ास इमेज और clips को नाम लेकर संबोधित कर सकता है। यह गाइड वहीं से शुरू होती है।

आगे जो है उस पर दो बातें
यहाँ उद्धृत सब कुछ Google के अपने पेजों से आया है — Gemini Omni API दस्तावेज़ का prompt guide हिस्सा, और वह साझा prompting गाइड जो Omni और Veo दोनों को कवर करती है। जहाँ Google ख़ामोश है, हम वह कह देते हैं, बजाय इसके कि ख़ाली जगह को आधिकारिक सुनाई देने वाली किसी चीज़ से भर दें।
नीचे की clips हमारे अपने API पर Veo 3.1 Fast से बनी हैं, Omni से नहीं। Gemini Omni 1.1 Flash अभी E2X पर नहीं है, और हम एक गाइड को किसी एक मॉडल के footage से सजाकर यह दिखावा नहीं करेंगे कि वह किसी और से आया है। ये जो तकनीकें दिखाती हैं — कैमरा शब्दावली, single-shot निर्देश, आवाज़ का निर्देशन — वे उसी prompt guide से आती हैं जो Google दोनों मॉडलों के लिए छापता है, इसलिए वे transfer होती हैं। अगले हिस्से वाली tag syntax नहीं होती: वह हिस्सा सिर्फ़ Omni का है, और हम उसे output के बजाय syntax के रूप में दिखा रहे हैं।
tag syntax
Omni ऐसे inline tags लेता है जो ख़ास inputs की तरफ़ इशारा करते हैं। दस्तावेज़ का यही हिस्सा है जिस पर तीसरे पक्ष की कवरेज सबसे कम है और जिसे पढ़ने से सबसे ज़्यादा मिलता है।
frames के लिए:
<FIRST_FRAME> a woman is walking
<LAST_FRAME> उस frame को चिह्नित करता है जिस पर उतरना है, और Google साफ़-साफ़ कहता है कि इसे <FIRST_FRAME> के साथ ही इस्तेमाल करना चाहिए — "must be used with"। जब prompt इतना पेचीदा हो जाए कि स्थिति से मतलब साफ़ न रहे, तो एक स्पष्ट घोषणा वाला रूप भी है:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image2]
दोनों tags एक ही इमेज पर लगा दीजिए और आपको loop मिलेगा। Google इसे सीधे दर्ज करता है — clip वहीं लौट आती है जहाँ से शुरू हुई थी:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image1]
references के लिए tags पर नंबर होते हैं और वे शून्य से शुरू होते हैं:
in the style of <IMAGE_REF_0> a woman <IMAGE_REF_1> is walking
वह एक लाइन एक इमेज से style खींचती है और दूसरी से विषय। वीडियो वाला समतुल्य <VIDEO_REF_0> है, वह भी शून्य से गिना जाता, और एक पक्की सीमा के साथ: "Video references support a maximum of 3 clips, up to 3 seconds each", और reference clip में मौजूद कोई भी ऑडियो अनदेखा कर दिया जाता है।
यहाँ फ़ेल होने का तरीक़ा यह है कि मॉडल reference को अक्षरशः शुरुआती frame मान लेता है। Google का इलाज prompt के आख़िर में जोड़ा गया एक निर्देश है:
Use the given image(s) as references for video generation.
The images should not be used as literal initial frames.
इसके इर्द-गिर्द डिज़ाइन करने से पहले एक हद जान लेना ज़रूरी है: "Referencing or reasoning across multiple videos is not supported." कई इमेज references चलते हैं — Google का अपना उदाहरण छह चलाता है — मगर कई वीडियो वाली prompting का दर्जा गिर जाता है।
Omni आपकी clip को कई shots में काट देता है, जब तक आप रोकें नहीं
दस्तावेज़ की यह अकेली लाइन सबसे ज़्यादा चौंकाती है, और यह उलझे हुए बहुत सारे output की व्याख्या कर देती है:
"By default Omni Flash will try to create a video with a few different shots. It'll attempt to craft an interesting narrative based on the prompt. If you need the output video to contain a single scene, you must prompt for that"
दरवाज़े से गुज़रते हुए किसी शख़्स के आठ सेकंड माँगिए और मुमकिन है आपको उसके तीन कट मिलें। मॉडल आपको ग़लत नहीं पढ़ रहा। वह वही कर रहा है जो उसका डिफ़ॉल्ट है।
इलाज एक ही clause है, और Google तीन शब्द-रूप देता है: "In a single unbroken scene", "In a single continuous shot", या "No scene cuts"।
यह रहा वही निर्देश अपना काम करते हुए, साथ में एक दर्ज किया हुआ camera move और एक sound लाइन जुड़ी हुई:
In a single continuous shot, no scene cuts. Slow dolly in on a battered
enamel coffee pot sitting on a cast-iron stove in a dim cabin kitchen.
Steam rises and catches a hard shaft of morning light from a window to the
left. Medium shot, shallow depth of field, warm amber and deep green
palette. Sound design: the low hiss of steam and a wood fire ticking.
No dialogue.
चार सेकंड, 720p, Veo 3.1 Fast से एक सेंट प्रति सेकंड पर बनाया गया। ध्यान दीजिए कि उस prompt में विशेषण कितने कम हैं और ऐसे निर्देश कितने ज़्यादा जिन पर मॉडल अमल कर सकता है।
आवाज़ का निर्देशन अपने अलग वाक्यों में होता है
ऑडियो तस्वीर के साथ ही बनता है, और Google की सलाह है कि उसका वर्णन अलग से किया जाए: "We recommend that you use separate sentences in your prompt to describe the audio." दस्तावेज़ इसे तीन हिस्सों में बाँटता है — sound effects, ambient noise, और dialogue — हर एक के लिए अलग उदाहरण के साथ।
संवाद वही जगह है जहाँ लोक-मान्यता ग़लत है। दर्ज किया हुआ चलन है एक colon और कोई उद्धरण चिह्न नहीं:
the man in the red hat says: Where is the rabbit?
Google का लंबा उदाहरण एक ही prompt में दो वक्ता चलाता है और माहौल की आवाज़ पर ख़त्म होता है:
A medium shot in a dimly lit interrogation room. The seasoned detective
says: Your story has holes. The nervous informant, sweating under a single
bare bulb, replies: I'm telling you everything I know. The only other
sounds are the slow, rhythmic ticking of a wall clock and the faint sound
of rain against the window
Omni के अपने उदाहरण ग़ैर-संवाद ऑडियो से पहले Sound design: लगाते हैं, जैसे "Sound design: Gentle breeze, distant bird chirps. No dialogue." और जब आपको ख़ास तौर पर संगीत चाहिए, तो वह कहिए — Google इसे उस मामले के रूप में चिह्नित करता है जिसके छूट जाने की सबसे ज़्यादा आशंका है: "This is especially important if you want music in your video"।
दो बंदिशें जिनके इर्द-गिर्द डिज़ाइन करना होगा: आवाज़ की एडिटिंग समर्थित नहीं है, और "Uploading audio references is unsupported in the current version of the API"। आवाज़ का निर्देशन आप शब्दों से करेंगे, या बिल्कुल नहीं।
Timecodes काम करते हैं, और extension पर उनका आधार बदल जाता है
समय के लिए किसी ख़ास syntax की ज़रूरत नहीं — "there is no precise syntax needed and you can use natural language", इसलिए "At 5s the chorus starts in the background audio" एक वैध निर्देश है। एक bracket वाला timecode रूप भी है:
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
अब वह जाल, और यह सचमुच का है। जब आप किसी मौजूदा clip को बढ़ाते हैं, तो 0s का मतलब वीडियो की शुरुआत नहीं रह जाता। उसका मतलब extension की शुरुआत होता है। Google इसे साफ़-साफ़ लिखता है:
"If using timestamps or a timecode syntax, 0s refers to the beginning of the extended part of the video. If extending a 10s video, the scene cut in this prompt will happen after 12s"
यानी After 2s cut to a new scene तैयार टुकड़े में बारह-सेकंड के निशान पर उतरता है। जो भी absolute timecodes के हिसाब से shot list बनाएगा, वह यह ग़लती एक बार करेगा और फिर कभी नहीं।
चलते-चलते: extension के prompt को continuation का वर्णन करना चाहिए, पूरा दृश्य दोबारा नहीं बताना चाहिए। Google के सुझाए रूप "Extend this video" या "The scene continues" जितने छोटे हैं, और जोड़ सिर्फ़ वहाँ जहाँ कुछ बदल रहा हो — ऑडियो के लिए "The music continues into the chorus", कट के लिए "Show the same characters in the next scene"। Extension सिर्फ़ आगे जोड़ता है; आप न आगे कुछ लगा सकते हैं, न बीच में कुछ घुसा सकते हैं।

एडिटिंग को ज़्यादा नहीं, कम शब्द चाहिए
ऊपर की हर चीज़ तफ़सील का इनाम देती है। एडिटिंग इसे उलट देती है: "Simple prompts work best for video editing. Overly descriptive prompts can lead to unintended changes."
Google अपने ख़ुद के पहले-और-बाद वाले जोड़े छापता है, और उन्हें दो उदाहरणों के बजाय एक पैटर्न की तरह पढ़ना चाहिए:
Avoid: In the video of the man sitting on the sofa, please add a small
black cat that runs from the right side of the screen, jumps onto
his lap, and then he starts to stroke its head while looking down.
Simplify: Add a cat that jumps onto his lap, he begins to pet it.
Keep everything else the same.
Avoid: Please remove the cell phone that the person is holding in their
hand and fill in the background so it looks like they are just
holding their hand empty.
Simplify: Make the phone invisible. Keep everything else the same.
दोनों में असल काम जो clause कर रहा है वह है "Keep everything else the same", जिसे Google हर उस मौक़े पर शामिल करने की सलाह देता है जब आप किसी shot का एक पहलू एडिट कर रहे हों। आप जो भी अतिरिक्त तफ़सील देंगे, वह एक और चीज़ है जिसे मॉडल दोबारा बनाने का फ़ैसला कर सकता है।
Image-to-video फिर दूसरी दिशा में चलता है: "Vague prompts like 'make it move' produce less compelling results than detailed descriptions of the camera movement, subject motion, and environmental effects." generation के लिए तफ़सील, एडिटिंग के लिए संक्षेप।
कैमरे के वे शब्द जिनके नाम Google सचमुच लेता है
Google एक शब्दावली सूची छापता है, जो prompt-tip वाले thread में घूमते शब्दों से ज़्यादा भरोसेमंद है। जिन movements के नाम वह लेता है: static, pan, tilt, dolly in और out, truck left और right, pedestal up और down, zoom, crane, aerial या drone, handheld, whip pan, arc। कोण: eye-level, low, high, bird's-eye, worm's-eye, Dutch, close-up और extreme close-up, medium, full, wide या establishing, over-the-shoulder, point-of-view। ऑप्टिकल प्रभाव: wide-angle, telephoto, shallow और deep depth of field, lens flare, rack focus, fisheye, और vertigo effect — यानी dolly zoom।
Google zoom और dolly का फ़र्क़ भी साफ़-साफ़ बताता है, क्योंकि मॉडल इन्हें गड्डमड्ड कर देते हैं: zoom focal length बदलता है, और "This is different from a dolly, as the camera itself doesn't move."
हालाँकि वह चेतावनी साथ रखिए जो Google दो बार देता है: "Some advanced camera angles are not officially supported. The results and reliability may vary depending on the overall prompt and your specific use case." किसी move का नाम लेना एक निवेदन है, गारंटी नहीं।
यह रहा एक arc shot, दर्ज की गई movements में से एक, सीधे-सादे prompt के साथ:
Slow arc shot travelling left around a weathered brass sextant resting on
an unrolled nautical chart on a scuffed wooden table. Low winter sunlight
rakes in from the right and the brass catches moving highlights as the
camera travels. Single continuous shot, no scene cuts, shallow depth of
field. Sound design: faint harbour ambience, rigging tapping in wind.
No dialogue.
सिनेमाई और एडिटिंग के शब्द भी दर्ज हैं — match cut, jump cut, establishing shot sequence, montage, split diopter effect। वे शब्द जो आपने शायद Google के नाम से देखे हों मगर जो इनमें से किसी पेज पर नहीं हैं: oner, push in, और natural smartphone zoom।
Negative prompts: Google के दो पेज आपस में असहमत हैं
Omni में negative-prompt वाला कोई parameter नहीं है। API दस्तावेज़ बेलाग है: "System instructions, temperature, top_p, stop sequences, and negative prompts are not supported (you can put your negatives in the regular prompt: e.g., 'Do not do X')."
और Omni prompt guide ठीक यही सलाह देती है, "No dialogue", "No embellishments", "No extra sound effects" जैसे रूप सुझाते हुए।
Google की साझा Omni-और-Veo गाइड शब्दों के बारे में इसका उलटा कहती है:
"Not recommended: using instructive language or words such as 'no' or 'don't'. For example, avoid prompts such as 'no walls' or 'don't show walls'. Recommended: Describe what you don't want to see. For example, 'wall, frame'"
हम इसे सुलझा लेने का दिखावा नहीं करेंगे। सबसे संभावित व्याख्या यह है कि दूसरा पेज Veo के अलग negativePrompt फ़ील्ड की बात कर रहा है — जो Omni के पास नहीं है — जबकि Omni वाला पेज गद्य में लिखे negatives की बात कर रहा है, और Omni के पास बस वही है। यह अनुमान है, Google का कहा हुआ नहीं। व्यवहार में: Omni के लिए Omni वाले पेज के शब्द इस्तेमाल कीजिए, और अगर कोई negative अनदेखा हो रहा हो, तो यह मान लेने से पहले कि मॉडल यह कर ही नहीं सकता, दूसरा रूप आज़मा लीजिए।
एक और ईमानदार विरोधाभास, क्योंकि इससे तय होता है कि आप क्लाइंट से क्या वादा कर सकते हैं। Omni prompt guide कहती है कि मॉडल स्क्रीन पर दिखने वाला टेक्स्ट "in a way that is correct and readable" बनाता है। DeepMind model card "rendering perfectly accurate text" को उन चीज़ों में गिनाता है जो "remain a challenge"। दोनों Google हैं। वादा करने से पहले जाँच लीजिए।
एक चेकलिस्ट जो सचमुच काम आती है
ऊपर की बातों से चलते हुए, जो prompt मॉडल के बर्ताव का लिहाज़ करता है, उसमें आमतौर पर होता है:
- shot-गिनती का एक निर्देश, क्योंकि multi-shot डिफ़ॉल्ट है और शायद वही नहीं है जो आप चाहते हैं
- विषय और उसकी गति, ख़ास तौर पर — "make it move" नहीं
- Google की सूची से नाम लिया हुआ एक दर्ज camera move
- रोशनी: दिशा, गुणवत्ता, रंग
- आवाज़ के लिए एक अलग वाक्य, संवाद न हो तो
Sound design:से शुरू होता हुआ - संवाद
speaker says: lineके रूप में, colon के साथ, उद्धरण चिह्नों के बिना - कोई भी negatives आख़िर में छोटे गद्य clauses की तरह
- सिर्फ़ एडिट के लिए: ऊपर की ज़्यादातर चीज़ें हटा दीजिए और जोड़िए "Keep everything else the same"
Google का अपना संरचना-सारांश इससे लंबा है — subject, action, scene, camera angle, camera movement, lens, visual style, temporal elements, audio, cinematic terms, negatives — साथ में यह तसल्ली कि "You don't need to use all elements in every prompt"।
इसे आज कहाँ चलाएँ
prompting ऐसा हुनर है जो बार-बार फ़ेल होकर आता है, जिससे सबसे ज़्यादा मायने रखने वाला नंबर बन जाता है प्रति नाकामी दाम। Veo 3.1 Fast पर चार सेकंड का एक टेस्ट चार सेंट का पड़ता है। वही टेस्ट Gemini Omni 1.1 Flash पर छत्तीस सेंट का — जो 28 अगस्त 2026 से यहाँ लाइव है, नौ सेंट प्रति सेकंड पर — या क़रीब बारह सेंट का अगर आप उसे पहले 360p पर draft कर लें, और यही वह टियर है जो 1.1 की रिलीज़ ठीक इसी काम के लिए लाई है। यह सीखने में बिताई एक दोपहर में, जहाँ आप पता लगाते हैं कि कैमरे का निर्देश कहाँ जाकर मानना बंद होता है, वही फ़र्क़ तय करता है कि आपको कितनी बार ग़लत होने का मौक़ा मिलेगा।
तो जो आधा हिस्सा transfer होता है उसे सस्ते में रटिए — shot गिनती, कैमरा शब्दावली, आवाज़ का निर्देशन, negatives — ये सब उसी गाइड से आते हैं जो Google दोनों मॉडलों के लिए छापता है। ऊपर की दोनों clips ठीक इसी तरह बनी हैं। Omni परिवार पर तब जाइए जब आपको वही चाहिए जो सिर्फ़ वह करता है: tag syntax, extension, और reference से चलने वाली consistency। जिन frame tags पर यह गाइड सबसे ज़्यादा वक़्त ख़र्च करती है, उन पर एक बात — अब उनका अपना endpoint है, start-end-frame-to-video, जो दोनों frames को इसके बजाय fields की तरह लेता है, और image-to-video अकेली शुरुआती तस्वीर के लिए वही करता है। रास्ते में Veo 3.1 Fast फिर भी image-to-video और पहला और आख़िरी frame का अभ्यास सँभाल लेगा। मौजूदा दरें 28 अगस्त 2026 तक की हैं।
1.1 में क्या आया और leaderboards असल में उसके बारे में क्या कहते हैं, ये हमने अलग से लिखे हैं। काम के हिसाब से text-to-video से देखिए, या अगर आप गद्य के बजाय parameters की तुलना करना पसंद करें तो मशीन-पठनीय spec पढ़िए।
दाम और प्रोडक्ट की शर्तें बदल सकती हैं। ख़रीद का फ़ैसला करने से पहले हर provider की मौजूदा pricing जाँच लीजिए।
अक्सर पूछे जाने वाले सवाल
Gemini Omni 1.1 Flash के लिए prompt कैसे लिखें?
पहले shot की गिनती बताइए, क्योंकि Omni डिफ़ॉल्ट रूप से कई shots बनाता है और आपको आमतौर पर एक ही चाहिए। फिर विषय और उसकी गति, एक नामित camera move, और रोशनी का वर्णन कीजिए। ऑडियो को उसके अपने वाक्य में रखिए, ग़ैर-संवाद के लिए उससे पहले "Sound design:" लगाइए, और संवाद को "speaker says: line" के रूप में लिखिए, colon के साथ और उद्धरण चिह्नों के बिना। कोई भी negatives आख़िर में छोटे clauses की तरह जोड़िए।
Gemini Omni में FIRST_FRAME tag क्या है?
यह एक inline tag है जो Omni को बताता है कि दी गई इमेज को शुरुआती frame की तरह इस्तेमाल करे, और इसे tag के बाद अपने वर्णन के साथ लिखा जाता है। इसका साथी LAST_FRAME उस frame को चिह्नित करता है जिस पर ख़त्म होना है और, Google के दस्तावेज़ के मुताबिक़, उसे FIRST_FRAME के साथ ही इस्तेमाल करना ज़रूरी है। दोनों tags एक ही इमेज पर लगाने से loop वाली clip बनती है।
क्या Gemini Omni negative prompts का समर्थन करता है?
parameter के रूप में नहीं। Google का API दस्तावेज़ कहता है कि negative prompts समर्थित नहीं हैं और आपसे कहता है कि negatives को आम prompt में ही रखिए, जैसे "Do not do X"। Omni prompt guide "No dialogue" या "No extra sound effects" जैसे छोटे clauses सुझाती है। Google की साझा Omni और Veo गाइड उस शब्द-रूप के ख़िलाफ़ सलाह देती है, जो लगता है कि Omni के बजाय Veo के अलग negative-prompt फ़ील्ड की बात कर रही है।
Gemini Omni ऐसे scene cuts क्यों जोड़ देता है जो मैंने माँगे ही नहीं?
क्योंकि कई shots ही डिफ़ॉल्ट हैं। Google का दस्तावेज़ कहता है कि Omni कई shots वाला वीडियो बनाने की कोशिश करेगा और आपके prompt से एक कथा गढ़ेगा, जब तक उसे कुछ और न कहा जाए। prompt में "In a single continuous shot" या "No scene cuts" जोड़ना ही दर्ज किया हुआ इलाज है।
Omni वीडियो बढ़ाते समय timestamps कैसे काम करते हैं?
उनका आधार बदल जाता है। clip बढ़ाने के बाद 0s का मतलब मूल वीडियो की शुरुआत नहीं, extension की शुरुआत होता है। Google का उदाहरण: 10 सेकंड के वीडियो को 2s पर दिए निर्देश के साथ बढ़ाने पर वह पल तैयार टुकड़े में 12 सेकंड पर आता है। Extension सिर्फ़ आगे जोड़ता है — आप न पहले कुछ लगा सकते हैं, न clip के बीच में एडिट कर सकते हैं।
क्या Gemini Omni के लिए संवाद उद्धरण चिह्नों में लिखना चाहिए?
नहीं। Google का दर्ज किया हुआ रूप "speaker says: line" है — एक colon, उद्धरण चिह्नों के बिना। यह व्यापक रूप से दोहराया गया दावा कि उद्धरण चिह्न lip-sync मोड चालू कर देते हैं, किसी Google दस्तावेज़ में नहीं आता। Google के उदाहरणों में उद्धरण चिह्न सिर्फ़ उस टेक्स्ट के लिए दिखते हैं जो स्क्रीन पर दिखाया जाना है, और भ्रम की शुरुआत शायद वहीं से हुई।
Omni prompting का अभ्यास करने में कितना ख़र्च आता है?
हमारे API पर Gemini Omni 1.1 Flash 720p पर $0.09 प्रति सेकंड चलता है, इसलिए चार सेकंड का टेस्ट $0.36 का पड़ता है, या 360p पर draft करें तो क़रीब $0.12 का, 28 अगस्त 2026 तक। Veo 3.1 Fast $0.01 प्रति सेकंड है, जिससे वही टेस्ट चार सेंट का हो जाता है। चूँकि कैमरा, shot-गिनती और ऑडियो की तकनीकें उसी prompt guide से आती हैं जो Google दोनों मॉडलों के लिए छापता है, इसलिए सस्ते वाले पर अभ्यास करना नौवें हिस्से का ख़र्च है और वही आदतें पक्की कराता है।