Loading...
Loading...
Generate smooth video transitions between two key frames with Gemini Omni 1.1 Flash. Provide a start frame, an end frame and a text prompt to guide the in-between motion.
मॉडल चलाने के लिए साइन इन करें
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/start-end-frame-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)अवधि और रिज़ॉल्यूशन के अनुसार प्रति जनरेशन अनुमानित लागत। आप केवल उसी के लिए भुगतान करते हैं जो आप चलाते हैं।
Gemini Omni 1.1 Flash असल में Google का gemini-omni-1.1-flash है, 27 अगस्त 2026 से GA, और Veo नहीं बल्कि Gemini फ़ैमिली का मॉडल। हम इसकी दो-frame वाली capability को google/omni-1.1-flash/start-end-frame-to-video के रूप में चलाते हैं और output के प्रति सेकंड बिल करते हैं — 720p पर $0.09, यानी $0.15 की लिस्ट कीमत पर लगातार चलने वाली 40% छूट। डिफ़ॉल्ट आठ-सेकंड clip $0.72 का।
अंदर तीन fields जाती हैं: एक start frame, एक end frame, एक prompt। आपकी पहली इमेज frame one बनती है, दूसरी आख़िरी, और बीच का सब कुछ गढ़ा जाता है। यह clip की माँग नहीं, पुल की माँग है — और पुल की कीमत उतनी ही होती है जितनी उसके दोनों किनारों की।
यह भी यहाँ नया है — पिछली Omni Flash पीढ़ी इसके बिना आई थी, और 1.1 रिलीज़ पर हमारे लेख की दलील का यही सबसे सीधा सबूत है। यह निरंतरता की रिलीज़ है, क्वालिटी की नहीं।
हमारे रेट, 28 अगस्त 2026 को जाँचे गए:
| अवधि | 360p | 720p | 1080p | 4K |
|---|---|---|---|---|
| 4 सेकंड | $0.1188 | $0.36 | $0.54 | $0.72 |
| 6 सेकंड | $0.1782 | $0.54 | $0.81 | $1.08 |
| 8 सेकंड (डिफ़ॉल्ट) | $0.2376 | $0.72 | $1.08 | $1.44 |
| 10 सेकंड | $0.297 | $0.90 | $1.35 | $1.80 |
1080p और 4K upscale किए हुए हैं, नेटिव नहीं।
Tweening यहाँ ग़लत मानसिक मॉडल है। कोई tweening टूल पिक्सल A को पिक्सल B की तरफ़ घोलता है। यह मॉडल दोनों इमेज पढ़ता है, तय करता है कि सीन को एक से दूसरे तक कौन-सी घटना भरोसेमंद ढंग से ले जा सकती थी, और वही render करता है — audio समेत, जो उसी prompt से नेटिवली बनता है। न कोई has_sound field, न कोई म्यूट स्विच।
24 fps पर चार-सेकंड का पुल छियानबे frames का होता है, जिनमें से दो आपने दिए। बाक़ी चौरानबे भौतिकी पर एक दलील हैं, जो सही हो या न हो, रखी ज़रूर जाती है। Framing 16:9 या 9:16; हर job के लिए चार मिनट मानकर चलिए।
तीन सवाल इस जोड़ी का फ़ैसला कर देते हैं। वही subject? मिलता-जुलता नहीं — वही। वही रोशनी? Key की दिशा, रंग का तापमान, कंट्रास्ट। क्या कोई camera सचमुच वह move कर सकता था? अगर आप उसे एक ऐसे वाक्य में नहीं कह सकते जिस पर कोई ऑपरेटर अमल कर ले, तो मॉडल भी नहीं कर सकता।
जवाब ना हो तो कोई error नहीं आती — मॉडल उस खाई पर परदा डाल देता है, चार शक्लों में:
जो clip आप इस्तेमाल नहीं कर सकते, उसकी कीमत उतनी ही है जितनी काम की clip की।
$0.0297 प्रति सेकंड पर चार-सेकंड का 360p टेस्ट $0.1188 का है; आठ-सेकंड का 720p फ़ाइनल $0.72 का, यानी पाँच गुना ज़्यादा। और 360p, जो चेहरा परखने के लिए बहुत छोटा है, बीच का हिस्सा परखने के लिए काफ़ी है। कट किसी भी resolution पर कट ही रहता है। Morph, morph ही। Google यह भी कहता है कि यह tier 60% तक तेज़ चलता है — यह लॉन्च ब्लॉग की भाषा है, API रेफ़रेंस का आँकड़ा नहीं।
इससे स्टोरीबोर्ड का काम दोहराने लायक़ सस्ता हो जाता है। हर बीट पर दो key frames, पूरी shot list चार सेकंड और 360p पर चलाकर एनिमैटिक की तरह देखिए — बारह बीट क़रीब $1.73 में। नाकामी लगभग हमेशा frame-जोड़ी की समस्या होती है, जो prompt को पाँच बार दोबारा लिखने के बजाय एक बोर्ड दोबारा बनाने से ठीक होती है। सिर्फ़ बचे हुए shots render कीजिए। Veo 3.1 Fast start-end-frame-to-video में draft tier है ही नहीं।
duration 4, 6, 8 या 10 लेता है, string के रूप में। हर सेकंड की कीमत एक जैसी है, इसलिए यह बजट का नॉब लगता है। असल में यह डायरेक्शन का नॉब है।
वही दो frames चार सेकंड में और दस सेकंड में दो अलग shots हैं। चार सेकंड सफ़र को मजबूर करते हैं — camera फ़ैसला ले लेता है, गढ़ने की गुंजाइश कम बचती है। दस सेकंड भरने पड़ते हैं, और मॉडल भरने का सामान ख़ुद ढूँढ़ लेगा: कोई बहाव, कोई ठहरा हुआ पल, कोई दूसरा हावभाव। यही गढ़ी हुई हरकत यहाँ का सबसे कम भरोसेमंद output है।
लंबाई को फ़ासले से मिलाइए: तीस डिग्री की दूरी पर रखे दो प्रोडक्ट कोणों को दस सेकंड तक खींचिए और आपको रेंगती हुई गति और ख़ाली हवा मिलेगी। दस Omni की छत है और एक असली बढ़त — Veo आठ पर रुक जाता है।
Key बनाइए, उसे server-side रखिए, job सबमिट कीजिए। prompt, start_frame_url और end_frame_url ज़रूरी हैं, और हम दोनों इमेज ख़ुद fetch करते हैं, इसलिए हर URL को बिना ऑथेंटिकेशन वाली request का जवाब देना होगा।
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/start-end-frame-to-video",
"input": {
"prompt": "भाप बढ़ते ही camera एस्प्रेसो मशीन के चारों ओर दाईं तरफ़ arc करता है। ग्राइंडर की गुनगुनाहट, कैफ़े की बातचीत।",
"start_frame_url": "https://example.com/07a-left.jpg",
"end_frame_url": "https://example.com/07b-right.jpg",
"duration": "6",
"resolution": "360p"
}
}'
Job id को poll कीजिए, या एक webhookUrl भेज दीजिए:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/start-end-frame-to-video",
input: {
prompt: "छत की रेलिंग से आँगन की मेज़ तक एक धीमा crane down। एक ही सतत move।",
start_frame_url: "https://example.com/12a-roof.jpg",
end_frame_url: "https://example.com/12b-courtyard.jpg",
duration: "10",
resolution: "720p",
},
}),
}).then((r) => r.json());
let url = null;
while (!url) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") url = job.data.outputs[0].url;
else if (["failed", "cancelled"].includes(job.data.status))
throw new Error(job.data.error?.message ?? job.data.status);
else await new Promise((r) => setTimeout(r, 5000));
}
Status pending, processing, completed से गुज़रता है, या failed/cancelled पर आकर रुक जाता है। Schema के दो जाल: duration और resolution strings हैं, और fields start_frame_url तथा end_frame_url हैं, वह अकेला image_url नहीं जो बाक़ी जगह चलता है। लाइव वैल्यूज़ machine-readable spec में हैं।
Veo 3.1 Fast यही काम नौवें हिस्से पैसे में कर देता है:
| Endpoint | 720p पर 8 सेकंड | कब चुनें |
|---|---|---|
| Veo 3.1 Fast start-end-frame-to-video | $0.08 | Frames आपस में जुड़ते हैं और आठ सेकंड काफ़ी हैं |
| Omni 1.1 Flash start-end-frame-to-video | $0.72 | दस सेकंड, 4K, या एक draft pass चाहिए |
| Omni 1.1 Flash image-to-video | $0.72 | Shot का सिर्फ़ एक सिरा तय है |
| Omni 1.1 Flash reference-to-video | $0.72 | एक subject को कई shots में वही बने रहना है |
| Omni 1.1 Flash text-to-video | $0.72 | कोई सोर्स frame है ही नहीं |
कीमतें और प्रोडक्ट की शर्तें समय के साथ बदल सकती हैं; खरीद का फ़ैसला लेने से पहले हर provider की मौजूदा कीमत जाँच लें। Google Batch या Flex प्राइसिंग किसी स्टैंडर्ड on-demand API request के सीधे बराबर नहीं है, क्योंकि उसमें scheduling, उपलब्धता और प्रोसेसिंग की शर्तें अलग होती हैं; इसलिए उसे इस तुलना में शामिल नहीं किया गया है। यह एक सीमित दायरे की तुलना है — यह दावा नहीं किया जा रहा कि E2X हर कॉन्फ़िगरेशन में दुनिया का सबसे सस्ता विकल्प है।
शुरुआत Veo से कीजिए। यहाँ तब लौटिए जब उसकी आठ-सेकंड वाली दीवार रास्ता रोक ले, जब डिलिवरेबल 4K हो, या जब draft pass अपनी लागत से ज़्यादा बचा दे। बाक़ी सब image-to-video और text-to-video के नीचे बैठता है, और पूरा मॉडल कैटलॉग एक ही पेज पर है।
सफ़र का वर्णन कीजिए, नज़ारे का नहीं — दोनों सिरे मॉडल पहले ही देख चुका है। उन्हें जोड़ने वाले move का नाम लीजिए (“arc right”, “crane down”, “दूर वाली खिड़की पर rack focus”), फिर बताइए कि वह सुनाई कैसा दे — audio उसी पंक्ति से लिखा जाता है। ऐसी घटनाएँ मत माँगिए जिनका इशारा दोनों में से किसी frame में नहीं है। Camera की और शब्दावली हमारी Omni prompting गाइड में है; prompt की सिर्फ़ अंग्रेज़ी भाषा का मूल्यांकन हुआ है।
यह किसी क्लाइंट तक पहुँचे, उससे पहले तीन बातें। हर frame पर SynthID है, Google का अदृश्य provenance निशान, जिसे कोई provider हटा नहीं सकता। Google का मॉडल कार्ड साफ़ कहता है कि “एडिट के दौरान पूरी निरंतरता बनाए रखना, जटिल गति वाले सीन बनाना, या बिलकुल सही टेक्स्ट रेंडर करना अब भी एक चुनौती है” — और frames के बीच चौड़ी खाई माँगती ही जटिल गति है। EEA, स्विट्ज़रलैंड और UK में आप ऐसी इमेज अपलोड नहीं कर सकते जिनमें नाबालिग या कुछ पहचाने जाने वाले लोग हों — यह आपके inputs पर लगी सीमा है। रिज़ल्ट URLs अस्थायी हैं: उन्हें completion handler में ही दोबारा होस्ट कीजिए।
हम 720p output के हर सेकंड के लिए $0.09 लेते हैं, इसलिए आठ-सेकंड clip $0.72 का और दस सेकंड की अधिकतम लंबाई $0.90 की — $0.15 की लिस्ट कीमत पर 40% छूट। Resolution इसे गुणा करता है, जिससे चार-सेकंड का 360p draft $0.1188 का और दस-सेकंड का 4K render $1.80 का पड़ता है। 28 अगस्त 2026 को जाँचा गया।
वही subject, वही लाइटिंग सेटअप, और ऐसा camera move जो माँगे गए समय में एक से दूसरे तक भौतिक रूप से पहुँच सके। एक ही शूट की दो stills, कुछ मिनट के फ़ासले पर, लगभग हमेशा चलती हैं। अलग-अलग हालात में खींचे गए frames मॉडल को वह फ़र्क़ स्क्रीन पर सुलझाने को मजबूर करते हैं।
कोई error नहीं आती। आपको ऐसा clip मिलता है जो खाई को चार में से किसी एक तरीक़े से छिपाता है: गढ़ा हुआ कट, असंभव ज्यामिति से गुज़रता morph, रोशनी का झटका, या शून्य से उभरती आकृतियाँ। इन सबका बिल अच्छे render जितना ही आता है, और इसीलिए $0.1188 वाला draft अपनी कीमत वसूल कर लेता है।
ज़्यादातर मामलों में पहले Veo 3.1 Fast — वह start और end frames का काम हमारे $0.09 के मुक़ाबले $0.01 प्रति सेकंड पर करता है, यानी आठ सेकंड $0.72 नहीं, $0.08 के। Omni यह फ़ासला तीन जगह वसूल करता है: दस-सेकंड की अवधि, 4K output, और 360p वाला टेस्ट tier।
हर कॉल पर तीन से दस सेकंड। duration enum में 4, 6, 8, 10 हैं, सब strings। दस सख़्त छत है, और इससे लंबा कुछ भी कई jobs जोड़कर बनता है।
हाँ। दोनों server-side fetch होते हैं, इसलिए job पूरी होने तक हर एक को बिना ऑथेंटिकेशन वाली request का जवाब देना होगा। कम अवधि वाले signed URLs, प्राइवेट buckets, localhost पते और data URIs फ़ेल होते हैं।
हाँ — हर frame पर SynthID का निशान है, Google का अगोचर provenance संकेत, दर्शकों को अदृश्य और उनके टूल्स से जाँचा जा सकने वाला। कोई provider इसे बंद नहीं कर सकता। अगर किसी कॉन्ट्रैक्ट में लेबल किए गए AI assets की मनाही है, तो यह बात क्लाइंट के साथ पहले तय कर लीजिए।