Loading...
Loading...
Gemini Omni 1.1 Flash generates video from a text prompt, a single image, a start and end frame, or up to seven reference images. Clips run 4 to 10 seconds at resolutions from 360p to 4K.
मॉडल चलाने के लिए साइन इन करें
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)अवधि और रिज़ॉल्यूशन के अनुसार प्रति जनरेशन अनुमानित लागत। आप केवल उसी के लिए भुगतान करते हैं जो आप चलाते हैं।
Omni 1.1 Flash 27 अगस्त 2026 को Google पर generally available हुआ — Veo नहीं, Gemini फ़ैमिली का मॉडल। हम इसकी सिर्फ़-prompt वाली capability को google/omni-1.1-flash/text-to-video के रूप में चलाते हैं, और बिलिंग output के प्रति सेकंड होती है: 720p पर $0.09, यानी $0.15 की लिस्ट कीमत पर लगातार चलने वाली 40% छूट के बाद। डिफ़ॉल्ट आठ सेकंड $0.72 के। पूरा payload बस एक prompt है।
एक आँकड़ा यहाँ ऊपर गया है। पूर्ववर्ती मॉडल, Gemini Omni Flash text-to-video, इस प्लेटफ़ॉर्म पर $0.0825 प्रति सेकंड पर बिल होता है; यह पेज $0.09 पर। नौ प्रतिशत ज़्यादा, और यह बात बिल से अंदाज़ा लगाने के बजाय यहीं पढ़ लेना बेहतर है। वे नौ प्रतिशत आपको बेहतर एक सेकंड का वीडियो नहीं देते। वे देते हैं $0.0297 वाला ड्राफ़्ट टियर, जिसके लिए पुराने मॉडल के resolution enum में जगह तक नहीं है; दस सेकंड तक जाने वाले clips; और दो ऐसी capability जो पूर्ववर्ती ने E2X पर कभी जारी ही नहीं कीं। बाक़ी सब 1.1 रिलीज़ पर हमारे नोट्स में है।
अब वह वाक्य जो हमारे अपने बिल के ख़िलाफ़ जाता है। Veo 3.1 Fast text-to-video इसी प्लेटफ़ॉर्म पर $0.01 प्रति सेकंड चलता है — इस पेज की कीमत का नौवाँ हिस्सा। एक वाक्य से एक clip, और आगे उस पर कुछ टिका नहीं है? वहीं जाइए। यहाँ का प्रीमियम आपको दस सेकंड, 4K, एक सस्ता draft मोड और आपस में जुड़े हुए shots देता है। इनमें से कुछ नहीं चाहिए, तो आपने कुछ भी नहीं ख़रीदा।
दूसरा मटीरियल, दूसरा endpoint: कोई still जो frame one बनेगी, उसके लिए image-to-video; दो सिरे और बीच में खाली जगह, तो start-end-frame-to-video; बार-बार लौटता एक चेहरा, तो reference-to-video।
नीचे का हर आँकड़ा 28 अगस्त 2026 को उस provider के अपने version 1.1 पेज से पढ़ा गया:
| कहाँ से कॉल करते हैं | 720p, प्रति सेकंड | आठ सेकंड | हमारे रेट के मुक़ाबले |
|---|---|---|---|
| E2X | $0.09 | $0.72 | — |
| fal.ai | $0.10 | $0.80 | हम 10% कम |
| Runware | $0.10 | $0.80 | हम 10% कम |
| Google Gemini API | $0.1014 | $0.81 | हम 11% कम |
| Wavespeed AI | $0.13 | $1.04 | हम 31% कम |
Google की पंक्ति उसका अपना हिसाब है और उसके अपने मूल्य पृष्ठ पर छपी है: प्रति मिलियन output tokens $17.50, 720p के एक सेकंड में 5,792 tokens, यानी $0.1014 — इसीलिए वहाँ का फ़ुटनोट “क़रीब $0.10 प्रति सेकंड” पर आकर टिकता है। हर पंक्ति में आवाज़ शामिल है, इसलिए तुलना बराबरी की है। इस मॉडल में audio का कोई toggle है ही नहीं — संवाद और room tone तस्वीर के साथ ही बनते हैं, और उस सूची में कोई भी उन्हें अलग से नहीं लेता। Google हर resolution के लिए वही रेट token गिनती के रूप में छापता है: 360p पर प्रति सेकंड 1,931 tokens, 720p पर 5,792, 1080p पर 8,688, 4K पर 17,376 — चारों में audio शामिल। इसलिए नीचे की सीढ़ी ऊपर तक बराबरी की तुलना करती है।
हमें ज़रूर जाँचिए, बस version string पढ़कर। fal.ai दो listings रखता है: एक बिना version वाला google/gemini-omni-flash पेज, जो पुराने preview weights की कीमत क़रीब $0.125 प्रति सेकंड बताता है, और एक v1.1 पेज $0.10 पर। हमारा v1.1 है। Wavespeed पर उल्टी सावधानी लागू होती है — $0.13 सिर्फ़ उसके text-to-video वेरिएंट के लिए पक्का है, इसलिए उसके बाक़ी आँकड़े बाहर ही रहते हैं।
720p का रेट दिलचस्प आधा हिस्सा नहीं है। दिलचस्प यह है:
| Resolution | E2X | fal.ai | Runware | Wavespeed | |
|---|---|---|---|---|---|
| 360p | $0.0297 | $0.0338 | $0.03 | $0.036 | $0.039 |
| 720p | $0.09 | $0.1014 | $0.10 | $0.10 | $0.13 |
| 1080p | $0.135 | $0.1520 | $0.15 | $0.16 | $0.195 |
| 4K | $0.18 | $0.3041 | $0.30 | $0.32 | $0.39 |
720p से 4K तक हमारा गुणक 2× है। Google का ठीक 3× है — उसकी अपनी token गिनती 5,792 से 17,376 तक जाती है। सबसे नीचे दोनों सीढ़ियों का आकार एक ही है: 360p तक का क़दम दोनों तरफ़ 0.33× है। ऊपर चढ़ते-चढ़ते दोनों अलग हो जाती हैं, और 4K तक आते-आते Google अपना 720p रेट तिगुना कर चुका होता है जबकि हमने अपना दुगुना किया होता है। चारों स्तरों पर हम Google से नीचे रहते हैं, वजह यही है: 360p पर बारह प्रतिशत, 720p और 1080p पर ग्यारह प्रतिशत, और 4K पर इकतालीस प्रतिशत। Runware पर भी एक नज़र बनती है: 720p पर Google के बराबर, फिर 1080p पर $0.16 और 4K पर $0.32 — दोनों जगह Google के अपने रेट से ऊपर। जाँचने वालों के लिए एक नोट: Google की घोषणा वाली तालिका इन आँकड़ों को $0.03, $0.10, $0.15 और $0.30 पर गोल कर देती है। ऊपर के आँकड़े उसकी अपनी प्रति-resolution token गिनती से आते हैं, और बिल उन्हीं पर बनता है।
कीमतें और प्रोडक्ट की शर्तें समय के साथ बदल सकती हैं; खरीद का फ़ैसला लेने से पहले हर provider की मौजूदा कीमत जाँच लें। Google Batch या Flex प्राइसिंग किसी स्टैंडर्ड on-demand API request के सीधे बराबर नहीं है, क्योंकि उसमें scheduling, उपलब्धता और प्रोसेसिंग की शर्तें अलग होती हैं; इसलिए उसे इस तुलना में शामिल नहीं किया गया है। यह एक सीमित दायरे की तुलना है — यह दावा नहीं किया जा रहा कि E2X हर कॉन्फ़िगरेशन में दुनिया का सबसे सस्ता विकल्प है।
खाता कोई एक generation नहीं, दोहराव खाली करता है: सातवीं कोशिश की कीमत उतनी ही है जितनी पहली की थी।
360p पर चार सेकंड $0.1188 के हैं; वही चार सेकंड 720p पर $0.36 के। छह सस्ते drafts और डिफ़ॉल्ट पर एक render मिलाकर $1.07 पड़ते हैं, जबकि पूरी कीमत वाले सात passes $2.52 के। Google यह भी कहता है कि 360p 60% तक तेज़ लौटता है — उसका आँकड़ा, हमारा नहीं।
| अवधि | 360p draft | 720p फ़ाइनल |
|---|---|---|
| 4 सेकंड | $0.1188 | $0.36 |
| 6 सेकंड | $0.1782 | $0.54 |
| 8 सेकंड (डिफ़ॉल्ट) | $0.2376 | $0.72 |
| 10 सेकंड | $0.297 | $0.90 |
4K पर दस सेकंड, $0.18 प्रति सेकंड के हिसाब से, $1.80 — इस पेज का सबसे बड़ा इकलौता बिल।
dashboard से एक key बनाइए, उसे client से दूर रखिए, और job पोस्ट कीजिए। prompt इकलौता ज़रूरी field है।
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/text-to-video",
"input": {
"prompt": "एक वेल्डर अपना मास्क नीचे करती है, चिंगारियाँ चिने हुए स्टील पर नीली रोशनी फेंकती हैं। धीमा dolly left। आर्क की चटचटाहट, frame के बाहर एक पंखा।",
"resolution": "360p",
"duration": "6",
"seed": 20260828
}
}'
यह एक draft pass है: 360p पर छह सेकंड, $0.1782। resolution को 720p कर दीजिए तो यही $0.54 का पड़ेगा।
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/text-to-video",
input: { prompt: "रात में एक बस शेल्टर पर बारिश ज़ोर से पड़ रही है।", duration: "4" },
}),
}).then((r) => r.json());
for (let attempt = 0; attempt < 360; attempt++) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
const { status } = job.data;
if (status === "completed") { await archive(job.data.outputs[0].url); break; }
if (status === "failed" || status === "cancelled") throw new Error(status);
await new Promise((r) => setTimeout(r, 5000));
}
हर job के लिए चार मिनट मानकर चलिए, या एक webhookUrl भेज दीजिए। दो जाल: duration और resolution strings की तरह सफ़र करते हैं, 10 नहीं बल्कि "10"; और लौटा हुआ URL एक्सपायर हो जाता है, इसलिए पढ़ते ही फ़ाइल को कहीं स्थायी जगह कॉपी कर लीजिए। हर field machine-readable spec में मौजूद है।
सबसे सस्ता पहले:
| मॉडल | कब कॉल करें | 720p पर 8 सेकंड |
|---|---|---|
| Veo 3.1 Fast text-to-video | एक अकेला clip, जो अपने दम पर खड़ा है | $0.08 |
| Omni 1.1 Flash text-to-video | दस सेकंड, 4K, या 360p वाला draft लूप | $0.72 |
| Omni 1.1 Flash start-end-frame | दोनों सिरे पहले से मौजूद हैं | $0.72 |
| Omni 1.1 Flash reference-to-video | एक ही subject कई clips में लौटता है | $0.72 |
| Omni Flash text-to-video | कभी नहीं; Google इसे 30 सितंबर 2026 को बंद कर रहा है | $0.66 |
पहली पंक्ति को दूसरी के सामने रखकर पढ़िए। जिस clip को कोई किसी और चीज़ के साथ काटेगा ही नहीं, उसके लिए नौ गुना कीमत बहुत है; प्रीमियम असल में निरंतरता ख़रीदता है। prompt को फ़ुटेज में बदलने वाला बाक़ी सब कुछ text-to-video के नीचे है; हम जो भी मॉडल चलाते हैं वे सब एक ही पेज पर हैं।
Output तय है: 24 fps, तीन से दस सेकंड, 16:9 या 9:16। वह दस मायने रखता है, क्योंकि Veo आठ पर रुक जाता है। मॉडल कार्ड तीन कमज़ोरियाँ गिनाता है:
“एडिट के दौरान पूरी निरंतरता बनाए रखना, जटिल गति वाले सीन बनाना, या बिलकुल सही टेक्स्ट रेंडर करना अब भी एक चुनौती है।”
स्क्रीन पर दिखने वाला टेक्स्ट लोगों को सबसे ज़्यादा फँसाता है: दुकान का साइनबोर्ड माँगिए और ऐसे अक्षर मिलेंगे जो ग़ौर से देखते ही बिखर जाते हैं। भीड़, पानी और हाथ — गति के असली इम्तिहान यही हैं।
SynthID हर frame पर अदृश्य निशान छोड़ता है और उसे कोई हटा नहीं सकता। prompt की सिर्फ़ अंग्रेज़ी भाषा का मूल्यांकन Google ने किया है, और Google ने 22 अप्रैल 2026 को Vertex AI को Gemini Enterprise Agent Platform में मिला दिया — एंटरप्राइज़ खरीदारों के लिए यह मॉडल वहीं सूचीबद्ध है।
मॉडल के पास आपके शब्द और एक seed है; जो आप नहीं कहते, वह उसका फ़ैसला बन जाता है। एक shot बताइए, कभी सीक्वेंस नहीं — आठ सेकंड में तीन बीट माँगेंगे तो या तो ख़राब कट मिलेगा या धुँधलापन।
Camera तय कीजिए। “Locked-off wide”, “slow dolly left”, “handheld follow”। बिना बताया गया camera अपने आप बहकता है।
रोशनी तय कीजिए। सोडियम स्ट्रीटलैंप, बादलों भरी दोपहर, एक practical लाइट। लाइटिंग ही सोच-समझकर बनाए गए frame को महज़ एक render से अलग करती है।
आवाज़ तय कीजिए। audio की कीमत आप चुकाते हैं, चाहे उसकी योजना बनाई हो या नहीं, इसलिए ambience और कोई भी बोला हुआ वाक्य ख़ुद बताइए — वरना मॉडल एक ऐसा साउंड बेड गढ़ देगा जो आपके एडिट से लड़ेगा।
फिर seed को पकड़े रखिए और एक बार में एक ही उपवाक्य बदलिए। हमारी Gemini Omni prompting गाइड इससे आगे जाती है।
720p output के प्रति सेकंड $0.09 — डिफ़ॉल्ट आठ सेकंड के लिए $0.72, और दस सेकंड की छत पर $0.90। यह $0.15 की लिस्ट कीमत पर 40% छूट है, 28 अगस्त 2026 को जाँची गई। बाक़ी tiers: 360p पर $0.0297, 1080p पर $0.135, 4K पर $0.18, audio शामिल।
चारों स्तरों पर। Google वीडियो को output tokens पर बिल करता है — प्रति मिलियन $17.50, और प्रति सेकंड 360p के लिए 1,931 tokens, 720p के लिए 5,792, 1080p के लिए 8,688 और 4K के लिए 17,376 — जो प्रति सेकंड $0.0338, फिर $0.1014, $0.1520 और $0.3041 बैठता है, हर स्तर पर audio समेत। घोषणा की तालिका इन्हें $0.03, $0.10, $0.15 और $0.30 पर गोल कर देती है; बिल बिना गोल किए आँकड़ों पर बनता है। इसके मुक़ाबले हम 360p पर क़रीब बारह प्रतिशत सस्ते हैं, 720p और 1080p पर ग्यारह प्रतिशत, और 4K पर इकतालीस प्रतिशत सस्ते। दोनों सीढ़ियाँ 360p तक एक ही 0.33× क़दम से उतरती हैं; फ़र्क़ ऊपर है, जहाँ Google अपना 720p रेट तिगुना करता है और हम अपना दुगुना।
नहीं — यह महँगा है। Omni Flash text-to-video यहाँ $0.0825 प्रति सेकंड चलता है और यह पेज $0.09 पर, तो आठ सेकंड वहाँ $0.66 और यहाँ $0.72 पड़ते हैं। नौ प्रतिशत का फ़र्क़। पुराने मॉडल में 360p टियर नहीं है और उसने E2X पर न image-to-video जारी किया न start-end-frame-to-video; फ़र्क़ वहीं जाता है। सीधे Google को कॉल करना अलग सवाल है: उसका प्रकाशित रेट 720p पर $0.1014 प्रति सेकंड बैठता है, इसलिए यह पेज और पुराना पेज, दोनों उससे नीचे रहते हैं। यह फ़र्क़ इसलिए नहीं कि उत्पाद महँगा है: तीनों एक ही $0.15 सूची दर पर खड़े हैं, बदलती है तो सिर्फ़ स्थायी छूट — यहाँ 40%, पुराने पन्नों पर 45% और 50%।
लगभग हमेशा Veo 3.1 Fast — उसी API पर $0.01 प्रति सेकंड, इसलिए आठ सेकंड $0.72 नहीं, $0.08 के पड़ते हैं। यहाँ तब लौटिए जब clip को दस सेकंड तक जाना हो, 4K चाहिए हो, या उसे दूसरी फ़ुटेज से मेल खाना हो।
दोहराव के। 360p पर चार सेकंड $0.1188 के हैं, जबकि 720p पर $0.36 के, इसलिए जो takes आप फेंक देते हैं उनकी कीमत उस एक take के अंश जितनी होती है जिसे आप रखते हैं।
तीन से दस सेकंड, 24 fps पर। duration enum 4, 6, 8 और 10 दिखाता है, strings के रूप में। इससे लंबे टुकड़े कई calls से बनते हैं — 1.1 की निरंतरता वाली ख़ूबियाँ इसी को झेलने लायक़ बनाने के लिए हैं।
हाँ, इस पेज की हर तुलना की हर पंक्ति में। audio का कोई toggle है ही नहीं — संवाद और परिवेश तस्वीर के साथ ही बनते हैं, और उस सूची का कोई भी प्रदाता उन्हें अलग से नहीं जोड़ता।
आम तौर पर इसलिए कि वह दूसरा मॉडल है। fal.ai की बिना version वाली google/gemini-omni-flash listing बंद हो रहे preview weights की कीमत क़रीब $0.125 प्रति सेकंड रखती है; उसका v1.1 पेज $0.10 पढ़ता है, और हमारी टेबल v1.1 इस्तेमाल करती है। पहले version और तारीख़ जाँचिए।