Gemini Omni 1.1 Flash आज आ गया। ख़बर generation नहीं, एडिटिंग है
Google ने आज gemini-omni-1.1-flash को आम तौर पर उपलब्ध कर दिया। फ़ीचर की सूची पढ़िए और एक बात उभरकर सामने आती है: इसमें लगभग कुछ भी आठ सेकंड की बेहतर clip बनाने के बारे में नहीं है।
ऐसा scene extension जो एक सेकंड के बजाय दस सेकंड का संदर्भ पढ़ता है। मॉडल को एक पहला frame और एक आख़िरी frame थमाकर बीच का हिस्सा उससे बनवा लेने की क्षमता। ऐसे reference clips जो एक किरदार को कई shots के आर-पार ले जाते हैं। ये सब continuity के फ़ीचर हैं। ये वे चीज़ें हैं जिनकी ज़रूरत तब पड़ती है जब clip ख़ुद deliverable नहीं, बल्कि उसका एक टुकड़ा हो — और इन्हें एक साथ रिलीज़ करना किसी भी क्वालिटी के दावे से ज़्यादा साफ़ दिशा-सूचक है।

असल में नया क्या है
इससे पहले वाला मॉडल है Gemini Omni Flash — gemini-omni-flash-preview, जो 30 जून 2026 से API preview में है। नाम पर ध्यान दीजिए, क्योंकि इंटरनेट अभी से इसे ग़लत लिख रहा है: "Omni Flash 1.0" नाम का कोई प्रोडक्ट है ही नहीं। Google का अपना string "Gemini Omni 1.1 Flash" है, और जिसकी जगह यह ले रहा है वह सीधे-सीधे Gemini Omni Flash है।
| क्षमता | Gemini Omni Flash (preview) | Gemini Omni 1.1 Flash |
|---|---|---|
| Scene extension का संदर्भ | clip का आख़िरी सेकंड | पिछले footage के 10 सेकंड तक |
| कुल बढ़ाई गई लंबाई | — | 40 सेकंड, 3–10s की continuations में बनी |
| पहला-और-आख़िरी frame | — | दोनों दीजिए, मॉडल बीच का हिस्सा बनाता है |
| Reference clips | — | 3 clips तक, हर एक 3 सेकंड की |
| Resolutions | 720p | 360p, 720p, 1080p और 4K (ऊपर के दो upscaled) |
| प्रति generation अवधि | 3–10 सेकंड | 3–10 सेकंड |
extension वाला बदलाव दो बार पढ़ने लायक़ है। जो मॉडल सिर्फ़ उस चीज़ का आख़िरी frame देखता है जिसे वह आगे बढ़ा रहा है, उसे पता ही नहीं होता कि कैमरा क्या कर रहा था, इसलिए extensions बहक जाते हैं — रोशनी खिसक जाती है, jacket का रंग बदल जाता है, बाईं तरफ़ चल रही dolly रुक जाती है। दस सेकंड का संदर्भ इतना है कि एक camera move और एक lighting setup जोड़ के पार ले जाया जा सके। Google इन continuations को 3–10 सेकंड के segments बताता है जो कुल 40 सेकंड तक जाते हैं, यानी यह कोई तय block size नहीं है; आप बदलती लंबाई के टुकड़े जोड़ रहे हैं।
एक 360p मोड भी है, जिसके बारे में Google कहता है कि यह 720p के एक-तिहाई ख़र्च पर 60% तक तेज़ चलता है। यह आँकड़ा API reference के बजाय announcement ब्लॉग से आया है, इसलिए इसे नापे हुए नंबर के बजाय vendor का दावा मानिए — लेकिन इसकी बनावट ज़ाहिर तौर पर सही है, और एक सस्ता draft टियर ठीक वही चीज़ है जिसकी कमी दोहराव वाले वीडियो काम में खलती रही है।
सीधे Google से इसका दाम क्या है
वीडियो output का बिल $17.50 प्रति दस लाख tokens बनता है, और Google का pricing footnote आपके लिए इसका हिसाब कर देता है: 720p वीडियो के हर सेकंड के 5,792 tokens, "an effective price of approximately $0.10 per second." Input $1.50 प्रति दस लाख है। वीडियो output के लिए कोई मुफ़्त टियर नहीं है।
बाक़ी resolutions भी छपे हुए हैं, बस उस footnote के आसपास कहीं नहीं, इसीलिए इन्हें लगभग कोई उद्धृत नहीं करता। Google की लॉन्च घोषणा में दाम की तालिका एक इमेज की तरह पड़ी है, और उसके Cloud pricing पेज पर वही चीज़ ठीक-ठीक एक वाक्य में है: Omni का बिल 360p पर 1,931 tokens प्रति सेकंड, 720p पर 5,792, 1080p पर 8,688 और 4K पर 17,376 बनता है। $17.50 प्रति दस लाख के हिसाब से यह हुआ $0.0338, $0.1014, $0.1520 और $0.3041 प्रति सेकंड। अंकों के बजाय आकार देखिए — 720p के मुक़ाबले ये token गिनतियाँ ठीक एक-तिहाई, एक, डेढ़ और तीन हैं। यह सीढ़ी 720p से 4K तक तिगुनी हो जाती है, जो याद रखने लायक़ है जब आपका मन पहला ड्राफ़्ट पूरी resolution पर ही रेंडर करने का करे।
एक सेकंड के दस सेंट पर एक पल ठहरना बनता है। 720p पर extensions से जोड़ा गया चालीस सेकंड का एक sequence, एक भी वैकल्पिक take बनाने से पहले ही, क़रीब चार डॉलर का output है। वीडियो की pricing इमेज की pricing नहीं है, और जो दोहराव की आदतें एक सेंट के अंश प्रति इमेज पर चलती हैं, वे यहाँ अकाउंट ख़ाली कर देंगी।
आज इसे कहाँ से कॉल किया जा सकता है
- Gemini API (
generativelanguage.googleapis.com) — GA - Google AI Studio — GA
- Gemini Enterprise Agent Platform — एंटरप्राइज़ API एक्सेस के लिए
- Google Flow — AI Plus, Pro और Ultra सब्सक्राइबरों के लिए
- Gemini app — Plus, Pro और Ultra के लिए scene extension
Vertex AI नहीं। उसके release notes में Omni का ज़िक्र तक नहीं है, और Google की घोषणा एंटरप्राइज़ यूज़र्स को इसके बजाय Agent Platform की तरफ़ भेजती है। अगर आपने इसके उलट कहीं पढ़ा है, तो वह पेज अंदाज़ा लगा रहा है।
इस सबके नीचे एक तारीख़ वाली बात दबी हुई है: preview endpoint gemini-omni-flash-preview को 30 सितंबर 2026 को deprecate किया जाना तय है। गर्मियों में आपने preview पर जो भी बनाया, उसके पास क़रीब एक महीने का रास्ता बचा है।

विशिष्टताएँ, एक ही जगह
प्रति generation output 24 FPS पर 3 से 10 सेकंड का चलता है, 16:9 या 9:16 में — यही दो aspect ratio हैं, इसलिए चौकोर और vertical-cinema framings बाहर हैं। ऑडियो तस्वीर के साथ-साथ मूल रूप से ही बनता है, और उसे दिशा देने के लिए आप कोई ऑडियो reference अपलोड नहीं कर सकते। एडिटिंग या extension के लिए आप जो भी वीडियो देंगे, वह 10 सेकंड या उससे छोटा होना चाहिए।
हर frame पर SynthID है, Google का अदृश्य provenance watermark। यह दर्शकों को दिखता नहीं और किसी भी provider द्वारा बंद नहीं किया जा सकता, जो सिर्फ़ तभी मायने रखता है जब आपका कोई ऐसा contract हो जो watermark वाले deliverables मना करता हो।
Google model card में इस बारे में भी साफ़गोई बरतता है कि अभी क्या काम नहीं करता:
"Maintaining complete consistency throughout edits, generating scenes with complex motion, or rendering perfectly accurate text remains a challenge."
इसे फ़ीचर सूची के बग़ल में रखकर पढ़िए तो एक काम का तनाव दिखता है। सुर्ख़ी वाले नए फ़ीचर consistency के फ़ीचर हैं; model card कहता है कि consistency अब भी मुश्किल हिस्सा है। दोनों बातें सच हैं, और जो लॉन्च पोस्ट सिर्फ़ पहली बात उद्धृत करती, वह आपको कुछ बेच रही होती।
एक क्षमता जान-बूझकर रोकी गई है। यह मॉडल रिकॉर्ड की गई आवाज़ बदल सकता है, और Google ने उसे रिलीज़ न करने का फ़ैसला किया है:
"Gemini Omni Flash is capable of changing people's speech. For now, we are restricting this capability and working to better understand how to safely and responsibly bring it to our users."
क्षेत्रीय पाबंदियाँ भी हैं: EEA, स्विट्ज़रलैंड और यूके में आप ऐसी इमेज अपलोड या एडिट नहीं कर सकते जिनमें नाबालिग़ या कुछ पहचाने जाने लायक़ लोग हों।
E2X पर इसका क्या मतलब है
हमने कहा था कि इस पर कोई तारीख़ नहीं डालेंगे। यह अगले ही दिन आ गया। Gemini Omni 1.1 Flash 28 अगस्त 2026 को E2X पर लाइव हो गया, और इसकी चारों capabilities उसी endpoint आकार से कॉल की जा सकती हैं जो कैटलॉग की बाक़ी हर चीज़ में है।
एक ही दाम चारों को ढँकता है: 720p पर text-to-video, image-to-video, start-end-frame-to-video और reference-to-video के लिए $0.09 प्रति सेकंड, 28 अगस्त 2026 को जाँचा गया। 4, 6, 8 और 10 सेकंड की अवधि, 360p, 720p, 1080p या 4K पर — draft टियर पर $0.0297 प्रति सेकंड, 4K पर $0.18। बीच के दोनों यहाँ नए हैं: पिछली पीढ़ी ने इस प्लैटफ़ॉर्म पर सिर्फ़ text-to-video और reference-to-video ही भेजे थे, इसलिए किसी स्थिर तस्वीर में जान डालना और पहले व आख़िरी frame के बीच interpolate करना, दोनों इस परिवार के लिए पहली बार हैं।
इसे Google की अपनी प्रति-सेकंड दरों के सामने रखिए और फ़र्क़ असल में गुणकों का फ़र्क़ है। ऊपर चढ़ते हुए Google $0.0338, $0.1014, $0.1520 और $0.3041 चलता है; हम $0.0297, $0.09, $0.135 और $0.18 चलते हैं। दोनों सीढ़ियाँ एक ही आकार से शुरू होती हैं — 360p पर 720p दर का एक-तिहाई, 1080p पर उसका डेढ़ गुना — और फिर ऊपर जाकर अलग हो जाती हैं, जहाँ Google तिगुना करता है और हम दोगुना। इससे हम हर पायदान पर Google के नीचे रहते हैं: 360p पर क़रीब बारह फ़ीसदी, 720p और 1080p पर ग्यारह, और 4K पर इकतालीस। दाम इसके अलावा जो ख़रीदता है वह है हमारे कैटलॉग के हर मॉडल के लिए एक ही API सतह और एक ही credentials का सेट, जिसकी क़ीमत है, बिना यह दावा किए कि हम हर configuration में सबसे सस्ते हैं।
सचमुच सस्ता विकल्प इसके बग़ल में ही है, और ज़्यादातर पाठकों को पहले उसी को देखना चाहिए। Veo 3.1 Fast text-to-video $0.01 प्रति सेकंड है — Omni 1.1 Flash का नौवाँ हिस्सा। इस पेज पर यही एक आँकड़ा है जिस पर कोई बहस नहीं: Google की अपनी तालिका में Veo 3.1 Fast 720p पर $0.10 प्रति सेकंड है, यानी वही मॉडल यहाँ वहाँ के मुक़ाबले दसवें हिस्से का पड़ता है। बिना एडिटिंग, बिना extension और बिना किरदार की continuity वाले सीधे text-to-video shot के लिए, उस पर नौ गुना प्रीमियम आपको बहुत कम देता है। हम चाहेंगे कि आप नौ के बजाय एक डॉलर ख़र्च करें और लौटकर आएँ।
Omni जहाँ यह फ़र्क़ कमाता है वह ठीक वही है जिधर 1.1 के फ़ीचर इशारा करते हैं: continuation, पहले-और-आख़िरी frame का कंट्रोल, और किसी विषय को कई shots के आर-पार ले जाना। अगर आपका काम एक बार में एक clip का है, तो Veo 3.1 Fast बेहतर विकल्प है, और वह image-to-video, reference-to-video और start-and-end-frame काम भी सँभालता है।
दाम और प्रोडक्ट की शर्तें बदल सकती हैं। ख़रीद का फ़ैसला करने से पहले हर provider की मौजूदा pricing जाँच लीजिए। यह एक सीमित दायरे की तुलना है, यह दावा नहीं कि हर configuration में E2X सबसे सस्ता विकल्प है।
इस हफ़्ते क्या करें
अगर आप preview endpoint पर थे, तो 30 सितंबर की तारीख़ कैलेंडर में डालिए और हटिए। अगर आप पहली बार कोई वीडियो मॉडल चुन रहे हैं, तो Veo 3.1 Fast से एक सेंट प्रति सेकंड पर शुरू कीजिए और तभी ऊपर जाइए जब किसी काम को सचमुच continuity चाहिए हो। और अगर आप गद्य पढ़ने के बजाय schemas की तुलना करना चाहते हैं, तो हर मॉडल एक मशीन-पठनीय spec छापता है — Omni 1.1 Flash वाला हर parameter, बंदिश और मौजूदा दाम गिनाता है।
बाक़ी को काम के हिसाब से text-to-video या reference-to-video से देखिए।
अक्सर पूछे जाने वाले सवाल
Gemini Omni 1.1 Flash क्या है?
Gemini Omni 1.1 Flash, Google का वीडियो generation और एडिटिंग मॉडल है, जिसे 27 अगस्त 2026 को API id gemini-omni-1.1-flash के तहत आम तौर पर उपलब्ध किया गया। यह 24 FPS पर मूल ऑडियो के साथ 3 से 10 सेकंड की clips बनाता है, और वे एडिटिंग फ़ीचर जोड़ता है जो इससे पहले वाले में नहीं थे: 40 सेकंड तक scene extension, पहले-और-आख़िरी frame के बीच interpolation, और किरदार की consistency के लिए reference clips।
Gemini Omni 1.1 Flash कब रिलीज़ हुआ?
27 अगस्त 2026 को, preview के बजाय आम तौर पर उपलब्ध मॉडल के रूप में। Google का API changelog इसे इस तरह दर्ज करता है: "Gemini Omni Flash generally available (GA): Released gemini-omni-1.1-flash"। इससे पहले वाला preview मॉडल, gemini-omni-flash-preview, 30 जून 2026 से उपलब्ध था और 30 सितंबर 2026 को deprecate होना तय है।
क्या कोई Omni Flash 1.0 है?
नहीं। Google ने Omni Flash 1.0 नाम का कोई प्रोडक्ट कभी नहीं निकाला। Gemini Omni 1.1 Flash से पहले वाले मॉडल का नाम Gemini Omni Flash है, जिसका API id gemini-omni-flash-preview है, और वह एक preview रिलीज़ था। जो पेज "Omni Flash 1.0" का ज़िक्र करते हैं, वे एक ऐसा version नंबर गढ़ रहे हैं जो है ही नहीं।
Gemini Omni 1.1 Flash का दाम कितना है?
Google को सीधे कॉल करने पर, वीडियो output का बिल $17.50 प्रति दस लाख tokens बनता है, input $1.50 प्रति दस लाख और वीडियो के लिए कोई मुफ़्त टियर नहीं। Google का Cloud pricing पेज हर resolution पर एक सेकंड की token लागत देता है — 360p पर 1,931, 720p पर 5,792, 1080p पर 8,688 और 4K पर 17,376 — जो हिसाब लगाने पर $0.0338, $0.1014, $0.1520 और $0.3041 प्रति सेकंड बैठता है। E2X पर वही टियर $0.0297, $0.09, $0.135 और $0.18 हैं, जिससे डिफ़ॉल्ट आठ-सेकंड की 720p clip $0.72 की पड़ती है।
Gemini Omni 1.1 Flash का वीडियो कितना लंबा हो सकता है?
एक generation 3 से 10 सेकंड बनाता है। scene extension से आप कुल 40 सेकंड तक बना सकते हैं, मौजूदा clip में 3 से 10 सेकंड की continuations जोड़ते हुए। एडिटिंग या extension के लिए आप जो वीडियो input के रूप में देंगे, वह ख़ुद 10 सेकंड या उससे छोटा होना चाहिए।
क्या मैं Gemini Omni 1.1 Flash को Vertex AI पर इस्तेमाल कर सकता हूँ?
27 अगस्त 2026 तक नहीं। Vertex AI के release notes में Omni परिवार का कोई ज़िक्र नहीं है। Google की घोषणा एंटरप्राइज़ API यूज़र्स को Gemini Enterprise Agent Platform की तरफ़ भेजती है, और मॉडल Gemini API, AI Studio, Flow और Gemini app के ज़रिए भी उपलब्ध है।
क्या Gemini Omni 1.1 Flash E2X पर उपलब्ध है?
हाँ, 28 अगस्त 2026 से, चारों capabilities पर: text-to-video, image-to-video, start-end-frame-to-video और reference-to-video। 720p पर यह $0.09 प्रति सेकंड है, 360p पर $0.0297, 1080p पर $0.135 और 4K पर $0.18, और अवधि 4, 6, 8 और 10 सेकंड। यह हर टियर पर Google की अपनी प्रति-सेकंड दर से नीचे बैठता है — 360p पर क़रीब बारह फ़ीसदी, 720p और 1080p पर ग्यारह फ़ीसदी, और 4K पर इकतालीस फ़ीसदी। ऑडियो नेटिव तौर पर बनता है और उसे बंद नहीं किया जा सकता। बिना एडिटिंग या continuity की ज़रूरत वाली अकेली clips के लिए, $0.01 प्रति सेकंड वाला Veo 3.1 Fast आमतौर पर अब भी बेहतर मोल है।