Loading...
Loading...
टेक्स्ट प्रॉम्प्ट या रेफ़रेंस इमेज से क्लिप बनाने वाला Google का वीडियो जनरेशन परिवार, जो तेज़ नतीजों के लिए तैयार किया गया है।
0/7 आइटम्स
मॉडल चलाने के लिए साइन इन करें
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)अवधि और रिज़ॉल्यूशन के अनुसार प्रति जनरेशन अनुमानित लागत। आप केवल उसी के लिए भुगतान करते हैं जो आप चलाते हैं।
Omni Flash Google का gemini-omni-flash-preview है — Veo नहीं, बल्कि Gemini फ़ैमिली का एक वीडियो मॉडल — और DeepMind की अपनी पिच एक ही वाक्य की है: "Gemini Omni को Nano Banana की तरह समझिए, बस वीडियो के लिए।" हम इसकी reference-to-video capability को google/omni-flash/reference-to-video के रूप में चलाते हैं, और हम तैयार 720p वीडियो के हर सेकंड के लिए $0.10 लेते हैं। इसलिए डिफ़ॉल्ट 8-सेकंड clip $0.80 का पड़ता है, audio सहित।
यूनिट पर ध्यान दीजिए। यहाँ कोई भी clip को एकमुश्त कीमत पर नहीं बेचता, इसलिए तुलना में रखा गया हर आँकड़ा उस लंबाई से गुणा करना होगा जितनी आप render करने वाले हैं।
स्क्रिप्ट तैयार है, लेकिन shot में ले जाने के लिए कोई इमेज नहीं? तब Veo 3.1 Fast text-to-video ही आपका endpoint है — वह सिर्फ़ prompt से शुरू होता है, और हमारे प्लेटफ़ॉर्म पर उसकी कीमत नाटकीय रूप से कम है। नीचे हम इस पर ईमानदारी से लौटेंगे।
जिन दूसरी जगहों से आप यह मॉडल कॉल कर सकते हैं, उनके सामने हमारी स्थिति, 26 अगस्त 2026 को जाँची गई:
| API provider | प्रति सेकंड (720p) | 8-सेकंड clip | E2X के मुक़ाबले |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | हम 23% कम |
| Atlas Cloud | $0.135 | $1.08 | हम 26% कम |
| Runware | $0.10 | $0.80 | बराबरी |
| Google Gemini API | $0.10 | $0.80 | बराबरी |
कीमतें और प्रोडक्ट की शर्तें समय के साथ बदल सकती हैं; खरीद का फ़ैसला लेने से पहले हर provider की मौजूदा कीमत जाँच लें। Google Batch या Flex प्राइसिंग किसी स्टैंडर्ड on-demand API request के सीधे बराबर नहीं है, क्योंकि उसमें scheduling, उपलब्धता और प्रोसेसिंग की शर्तें अलग होती हैं; इसलिए उसे इस तुलना में शामिल नहीं किया गया है। यह एक सीमित दायरे की तुलना है — यह दावा नहीं किया जा रहा कि E2X हर कॉन्फ़िगरेशन में दुनिया का सबसे सस्ता विकल्प है।
हम इसे सजाकर नहीं दिखाएँगे: इस मॉडल पर हम Google के रेट से नीचे जाने के बजाय उसकी बराबरी करते हैं, और बचत सिर्फ़ fal.ai और Atlas के मुक़ाबले असली है। Reference images का असर न के बराबर है — Google एक इमेज को 2,040 tokens गिनता है, यानी तीन images की कीमत लगभग एक सेंट। आपका बिल जिस field से हिलता है, वह duration है।
इस endpoint का पूरा मक़सद निरंतरता है। मॉडल को एक subject दीजिए — एक इंसान, एक प्रोडक्ट, एक सेट, एक look — फिर ऐसा सीन बताइए जिसमें उसकी कभी फ़ोटो नहीं खींची गई, और subject वह सफ़र सलामत पार कर लेता है।
आप एक नहीं, कई references जोड़ सकते हैं। Google के प्रकाशित उदाहरण छह तक जाते हैं; कोई आधिकारिक अधिकतम सीमा प्रकाशित नहीं की गई है, और बाहरी स्रोतों के आँकड़े आपस में उलटे पड़ते हैं, इसलिए हम कोई संख्या नहीं छापेंगे। मुट्ठी भर references मानकर बनाइए, और अपनी सीमा ख़ुद टेस्ट कीजिए।
Audio तस्वीर के साथ ही बनता है, बाद में चिपकाया नहीं जाता। वह एक्शन के साथ sync रहता है, और आप उसे उसी prompt से चलाते हैं — टीन की छत पर बारिश और एक धीमा room tone माँगिए, वही वापस आएगा। बाद में एडिट करने के लिए कोई अलग audio track होता ही नहीं।
दस सेकंड छत है। हमारा duration enum 4, 6, 8 और 10 दिखाता है; Google का मॉडल 3 से 10 सेकंड तक चलता है, और 10 सख़्त सीमा है। न कोई extension endpoint, न interpolation। इससे लंबा कुछ भी आपके अपने एडिटर में जोड़ने का काम है — और तब कट्स के बीच की निरंतरता आपकी समस्या बन जाती है।
720p, 24 fps, और सूची यहीं ख़त्म। हमारे resolution field में 1080p और 4k values मौजूद हैं और Google ऊँचे resolutions को coming soon बताता है, लेकिन आज मॉडल 720p ही लौटाता है। इसे डिफ़ॉल्ट पर ही रहने दीजिए। यहाँ 1080p का विज्ञापन करता कोई भी provider page Google के अपने दस्तावेज़ों से आगे निकला हुआ है।
एक स्टैंडर्ड clip के लिए क़रीब 45 सेकंड की processing मानकर चलिए — यह eachlabs का मापा हुआ p50 है, कोई आधिकारिक आँकड़ा नहीं, इसलिए इसे प्लानिंग में रखिए, वादे में नहीं।
दो fields ज़रूरी हैं: image_urls और prompt। अपने dashboard से एक key बनाइए, उसे अपने नियंत्रण वाले server पर रखिए, फिर job पोस्ट कीजिए।
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "इमेज 1 वाला sneaker गीले डामर पर रखा है, पीछे से एक बस निकल जाती है। धीमा push-in। ट्रैफ़िक की ambience और हल्की बारिश, कोई म्यूज़िक नहीं।",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
जवाब में एक job ID आती है। वीडियो में मिनट लगते हैं, इसलिए धीरे-धीरे poll कीजिए — या polling छोड़कर submit body में एक webhookUrl भेज दीजिए:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"reference वाली महिला रात के बाज़ार से गुज़रती है, neon साइनेज उसकी जैकेट पर झिलमिलाता है। Handheld। भीड़ की गुनगुनाहट और दूर कहीं तलने की आवाज़।",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
Statuses pending → processing → completed की तरफ़ बढ़ते हैं, या failed या cancelled पर आकर रुक जाते हैं। लाइव schema और कीमत machine-readable spec में हैं, अगर आप उन्हें प्रोग्रामेटिक तरीक़े से पढ़ना चाहें।
वह तुलना जो असल में मायने रखती है, और जो इस पेज के हक़ में नहीं जाती:
| मॉडल | हमारी कीमत (8s, 720p, audio) | कब चुनें |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | कई references को एक जैसा बनाए रखना हो, या 10-सेकंड clip चाहिए |
| Veo 3.1 Fast reference-to-video | $0.12 | तीन references तक, 8 सेकंड, और बिल कम रखना हो |
| Veo 3.1 Fast image-to-video | $0.12 | एक still frame है जिसे एनिमेट करना है |
| Veo 3.1 Fast text-to-video | $0.12 | कोई सोर्स मटीरियल है ही नहीं |
हमारे प्लेटफ़ॉर्म पर Veo 3.1 Fast की कीमत Omni Flash के एक अंश जितनी है, और वह 1080p व 4K तक पहुँचता है, जो Omni Flash फ़िलहाल नहीं कर सकता। Google की अपनी लिस्ट कीमत पर दोनों 720p के लिए $0.10 प्रति सेकंड पर बैठते हैं — यह फ़ासला हमारी डिस्काउंटिंग से खुलता है। इसलिए शुरुआत Veo Fast से कीजिए। यहाँ तब लौटिए जब उसकी तीन-reference वाली सीमा आपको रोक रही हो, जब वे दो अतिरिक्त सेकंड चाहिए हों, या जब आपको "Nano Banana for video" वाली फ़्रेमिंग के पीछे का वीडियो-एडिटिंग बर्ताव चाहिए। और विकल्प reference-to-video कैटेगरी में हैं, और पूरा मॉडल कैटलॉग एक ही पेज पर है।
Public Preview का मतलब है कि खुरदुरे किनारे छिपाए नहीं, दर्ज किए गए हैं। बनाना शुरू करने से पहले ये पढ़ लीजिए:
shot लिखिए, कहानी नहीं। एक subject, एक camera move, एक lighting condition — और फिर बताइए कि वह सुनाई कैसा देता है, क्योंकि audio उसी prompt से निकलता है और ख़ामोशी भी एक ऐसा चुनाव है जो बोलकर करना पड़ता है।
एक से ज़्यादा attachment भेजें तो उन्हें लेबल कीजिए: "image 1 is the bottle, image 2 is the label close-up." मॉडल को और कुछ नहीं बताता कि हीरो reference कौन-सा है। Camera की भाषा सीधी रखिए — "slow push-in", "locked off", "handheld follow" सिनेमैटोग्राफ़ी के पूरे पैराग्राफ़ से बेहतर काम करते हैं।
हर clip पर एक SynthID watermark होता है — दर्शकों को अदृश्य, प्रोग्राम से पकड़ में आने वाला — और C2PA content credentials डिफ़ॉल्ट रूप से जुड़े रहते हैं। इस मॉडल को चलाने वाला कोई भी provider इन्हें बंद नहीं कर सकता, हम भी नहीं। अगर किसी क्लाइंट का कॉन्ट्रैक्ट लेबल किए गए AI assets की मनाही करता है, तो इंटीग्रेट करने से पहले वह बात तय कर लीजिए।
अपने outputs को completion handler के अंदर ही अपनी storage पर दोबारा होस्ट कीजिए। रिज़ल्ट URLs स्थायी पते नहीं हैं, और जो वीडियो आप वापस नहीं ला सकते, उसकी कीमत आप दो बार चुकाते हैं।
यह Google का gemini-omni-flash-preview है, Veo फ़ैमिली का नहीं बल्कि Gemini फ़ैमिली का एक वीडियो जनरेशन और एडिटिंग मॉडल। DeepMind इसे "Nano Banana, but for video" कहता है — ज़ोर references को एक जैसा बनाए रखने और मौजूदा फ़ुटेज एडिट करने पर है, जबकि Veo का निशाना शून्य से सिनेमैटिक जनरेशन है। यह Public Preview में है।
$0.80। हम 720p output के प्रति सेकंड $0.10 लेते हैं, इसलिए बिल लंबाई से तय होता है — 4-सेकंड clip $0.40 का, और अधिकतम 10 सेकंड $1.00 के। 26 अगस्त 2026 की जाँच पर यही हमारा रेट था।
एक से ज़्यादा, और Google के दस्तावेज़ी उदाहरण छह तक जाते हैं — लेकिन कोई आधिकारिक अधिकतम सीमा प्रकाशित नहीं की गई है। Google के बाहर के स्रोत अलग-अलग सीमाएँ बताते हैं और आपस में उलटे पड़ते हैं, इसलिए हम ऐसा कोई नंबर नहीं दोहराएँगे जिसे हम वेरिफ़ाई नहीं कर सकते। किसी ख़ास संख्या के आसपास डिज़ाइन करने से पहले अपने payloads ख़ुद टेस्ट कीजिए।
आज नहीं। यह 24 fps पर 720p देता है, और Google ऊँचे resolutions को coming soon बताता है। अगर आपको अभी 1080p या 4K चाहिए, तो Veo 3.1 Fast दोनों तक पहुँचता है।
ज़्यादातर कामों के लिए Veo 3.1 Fast। हमारे प्लेटफ़ॉर्म पर audio के साथ 8-सेकंड clip उसके साथ $0.12 का पड़ता है, यहाँ $0.80 का, और वह 4K तक जाता है। Omni Flash तब चुनिए जब आपको तीन से ज़्यादा reference images चाहिए, 10-सेकंड duration चाहिए, या उसका वीडियो-एडिटिंग बर्ताव चाहिए।
हाँ, नेटिवली और स्क्रीन पर चल रहे एक्शन के साथ sync में। आप उसे उसी prompt से निर्देशित करते हैं — ambience का नाम लीजिए, effects बताइए, या म्यूज़िक माँगिए। API के ज़रिए audio को बाद में एडिट नहीं किया जा सकता, इसलिए बदलाव का मतलब है दोबारा render।
हाँ। हर output पर एक SynthID watermark होता है जो दर्शकों को दिखता नहीं लेकिन डिटेक्शन टूल्स पढ़ लेते हैं, साथ ही C2PA content credentials डिफ़ॉल्ट रूप से चालू रहते हैं। इनमें से किसी को भी बंद करने का parameter कोई provider नहीं देता।
सिर्फ़ EEA, स्विट्ज़रलैंड और UK के बाहर — Google इन क्षेत्रों में अपलोड किए गए वीडियो की एडिटिंग पर पाबंदी लगाता है। reference-to-video जनरेशन ख़ुद इससे प्रभावित नहीं होता। यह भी ध्यान रखिए कि वीडियो references schema स्वीकार तो करता है, लेकिन वे सही तरह प्रोसेस नहीं होते, इसलिए images भेजिए।