मॉडल्स पर वापस जाएं

Omni Flash

टेक्स्ट प्रॉम्प्ट या रेफ़रेंस इमेज से क्लिप बनाने वाला Google का वीडियो जनरेशन परिवार, जो तेज़ नतीजों के लिए तैयार किया गया है।

रेफरेंस से वीडियोसे$0.075टेक्स्ट टू वीडियोसे$0.075
प्राइसिंगशुरुआत $0.075/रिक्वेस्ट
लेटेंसी~240 सेकंड औसत
रिज़ॉल्यूशन4K/720P/1080P
सर्वश्रेष्ठ उपयोगvideo, google, high-fidelity

पैरामीटर्स

0/7 आइटम्स

अनुमानित लागत

आप इस मॉडल पर 50% बचाते हैं
प्रति second बेस कॉस्ट$0.15
छूट-50%
आपका कुल$0.075
आप प्रति रिक्वेस्ट $0.075 बचाते हैं

मॉडल चलाने के लिए साइन इन करें

Output Preview

Ready

No output yet

Run the model to see generated results.

नमूना आउटपुट

API उदाहरण— वर्तमान पैरामीटर

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/omni-flash/reference-to-video',
  'input': {}
}
)

जॉब प्राप्त करें— परिणाम के लिए पोल करें

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

मूल्य विवरण

अवधि और रिज़ॉल्यूशन के अनुसार प्रति जनरेशन अनुमानित लागत। आप केवल उसी के लिए भुगतान करते हैं जो आप चलाते हैं।

अवधि
4K
720P
1080P
4
$1.20
$0.60
$0.90
6
$1.80
$0.90
$1.35
8
$2.40
$1.20
$1.80
10
$3.00
$1.50
$2.25
विकल्प देखें

संबंधित मॉडल

रेफरेंस से वीडियो के लिए अन्य AI मॉडल देखें

सभी मॉडल देखें

Gemini Omni Flash Reference-to-Video API E2X पर

Omni Flash Google का gemini-omni-flash-preview है — Veo नहीं, बल्कि Gemini फ़ैमिली का एक वीडियो मॉडल — और DeepMind की अपनी पिच एक ही वाक्य की है: "Gemini Omni को Nano Banana की तरह समझिए, बस वीडियो के लिए।" हम इसकी reference-to-video capability को google/omni-flash/reference-to-video के रूप में चलाते हैं, और हम तैयार 720p वीडियो के हर सेकंड के लिए $0.10 लेते हैं। इसलिए डिफ़ॉल्ट 8-सेकंड clip $0.80 का पड़ता है, audio सहित।

यूनिट पर ध्यान दीजिए। यहाँ कोई भी clip को एकमुश्त कीमत पर नहीं बेचता, इसलिए तुलना में रखा गया हर आँकड़ा उस लंबाई से गुणा करना होगा जितनी आप render करने वाले हैं।

स्क्रिप्ट तैयार है, लेकिन shot में ले जाने के लिए कोई इमेज नहीं? तब Veo 3.1 Fast text-to-video ही आपका endpoint है — वह सिर्फ़ prompt से शुरू होता है, और हमारे प्लेटफ़ॉर्म पर उसकी कीमत नाटकीय रूप से कम है। नीचे हम इस पर ईमानदारी से लौटेंगे।

जिन दूसरी जगहों से आप यह मॉडल कॉल कर सकते हैं, उनके सामने हमारी स्थिति, 26 अगस्त 2026 को जाँची गई:

API providerप्रति सेकंड (720p)8-सेकंड clipE2X के मुक़ाबले
E2X$0.10$0.80—
fal.ai$0.13$1.04हम 23% कम
Atlas Cloud$0.135$1.08हम 26% कम
Runware$0.10$0.80बराबरी
Google Gemini API$0.10$0.80बराबरी

कीमतें और प्रोडक्ट की शर्तें समय के साथ बदल सकती हैं; खरीद का फ़ैसला लेने से पहले हर provider की मौजूदा कीमत जाँच लें। Google Batch या Flex प्राइसिंग किसी स्टैंडर्ड on-demand API request के सीधे बराबर नहीं है, क्योंकि उसमें scheduling, उपलब्धता और प्रोसेसिंग की शर्तें अलग होती हैं; इसलिए उसे इस तुलना में शामिल नहीं किया गया है। यह एक सीमित दायरे की तुलना है — यह दावा नहीं किया जा रहा कि E2X हर कॉन्फ़िगरेशन में दुनिया का सबसे सस्ता विकल्प है।

हम इसे सजाकर नहीं दिखाएँगे: इस मॉडल पर हम Google के रेट से नीचे जाने के बजाय उसकी बराबरी करते हैं, और बचत सिर्फ़ fal.ai और Atlas के मुक़ाबले असली है। Reference images का असर न के बराबर है — Google एक इमेज को 2,040 tokens गिनता है, यानी तीन images की कीमत लगभग एक सेंट। आपका बिल जिस field से हिलता है, वह duration है।

Reference images असल में क्या ख़रीदती हैं

इस endpoint का पूरा मक़सद निरंतरता है। मॉडल को एक subject दीजिए — एक इंसान, एक प्रोडक्ट, एक सेट, एक look — फिर ऐसा सीन बताइए जिसमें उसकी कभी फ़ोटो नहीं खींची गई, और subject वह सफ़र सलामत पार कर लेता है।

आप एक नहीं, कई references जोड़ सकते हैं। Google के प्रकाशित उदाहरण छह तक जाते हैं; कोई आधिकारिक अधिकतम सीमा प्रकाशित नहीं की गई है, और बाहरी स्रोतों के आँकड़े आपस में उलटे पड़ते हैं, इसलिए हम कोई संख्या नहीं छापेंगे। मुट्ठी भर references मानकर बनाइए, और अपनी सीमा ख़ुद टेस्ट कीजिए।

Audio तस्वीर के साथ ही बनता है, बाद में चिपकाया नहीं जाता। वह एक्शन के साथ sync रहता है, और आप उसे उसी prompt से चलाते हैं — टीन की छत पर बारिश और एक धीमा room tone माँगिए, वही वापस आएगा। बाद में एडिट करने के लिए कोई अलग audio track होता ही नहीं।

दस सेकंड छत है। हमारा duration enum 4, 6, 8 और 10 दिखाता है; Google का मॉडल 3 से 10 सेकंड तक चलता है, और 10 सख़्त सीमा है। न कोई extension endpoint, न interpolation। इससे लंबा कुछ भी आपके अपने एडिटर में जोड़ने का काम है — और तब कट्स के बीच की निरंतरता आपकी समस्या बन जाती है।

720p, 24 fps, और सूची यहीं ख़त्म। हमारे resolution field में 1080p और 4k values मौजूद हैं और Google ऊँचे resolutions को coming soon बताता है, लेकिन आज मॉडल 720p ही लौटाता है। इसे डिफ़ॉल्ट पर ही रहने दीजिए। यहाँ 1080p का विज्ञापन करता कोई भी provider page Google के अपने दस्तावेज़ों से आगे निकला हुआ है।

एक स्टैंडर्ड clip के लिए क़रीब 45 सेकंड की processing मानकर चलिए — यह eachlabs का मापा हुआ p50 है, कोई आधिकारिक आँकड़ा नहीं, इसलिए इसे प्लानिंग में रखिए, वादे में नहीं।

API request: references अंदर, clip बाहर

दो fields ज़रूरी हैं: image_urls और prompt। अपने dashboard से एक key बनाइए, उसे अपने नियंत्रण वाले server पर रखिए, फिर job पोस्ट कीजिए।

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/omni-flash/reference-to-video",
    "input": {
      "prompt": "इमेज 1 वाला sneaker गीले डामर पर रखा है, पीछे से एक बस निकल जाती है। धीमा push-in। ट्रैफ़िक की ambience और हल्की बारिश, कोई म्यूज़िक नहीं।",
      "image_urls": [
        "https://example.com/sneaker-front.jpg",
        "https://example.com/sneaker-side.jpg"
      ],
      "duration": "8",
      "aspect_ratio": "16:9",
      "resolution": "720p"
    }
  }'

जवाब में एक job ID आती है। वीडियो में मिनट लगते हैं, इसलिए धीरे-धीरे poll कीजिए — या polling छोड़कर submit body में एक webhookUrl भेज दीजिए:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/omni-flash/reference-to-video",
    input: {
      prompt:
        "reference वाली महिला रात के बाज़ार से गुज़रती है, neon साइनेज उसकी जैकेट पर झिलमिलाता है। Handheld। भीड़ की गुनगुनाहट और दूर कहीं तलने की आवाज़।",
      image_urls: ["https://example.com/talent.jpg"],
      duration: "10",
      aspect_ratio: "9:16",
    },
  }),
}).then((r) => r.json());

const poll = async (id, attempt = 0) => {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") return job.data.outputs[0].url;
  if (job.data.status === "failed") throw new Error(job.data.error?.message);
  if (attempt > 90) throw new Error("Timed out waiting for the render");

  await new Promise((r) => setTimeout(r, 5000));
  return poll(id, attempt + 1);
};

const videoUrl = await poll(data.jobId);

Statuses pending → processing → completed की तरफ़ बढ़ते हैं, या failed या cancelled पर आकर रुक जाते हैं। लाइव schema और कीमत machine-readable spec में हैं, अगर आप उन्हें प्रोग्रामेटिक तरीक़े से पढ़ना चाहें।

हमारे वीडियो मॉडलों में से चुनाव

वह तुलना जो असल में मायने रखती है, और जो इस पेज के हक़ में नहीं जाती:

मॉडलहमारी कीमत (8s, 720p, audio)कब चुनें
Omni Flash reference-to-video$0.80कई references को एक जैसा बनाए रखना हो, या 10-सेकंड clip चाहिए
Veo 3.1 Fast reference-to-video$0.12तीन references तक, 8 सेकंड, और बिल कम रखना हो
Veo 3.1 Fast image-to-video$0.12एक still frame है जिसे एनिमेट करना है
Veo 3.1 Fast text-to-video$0.12कोई सोर्स मटीरियल है ही नहीं

हमारे प्लेटफ़ॉर्म पर Veo 3.1 Fast की कीमत Omni Flash के एक अंश जितनी है, और वह 1080p व 4K तक पहुँचता है, जो Omni Flash फ़िलहाल नहीं कर सकता। Google की अपनी लिस्ट कीमत पर दोनों 720p के लिए $0.10 प्रति सेकंड पर बैठते हैं — यह फ़ासला हमारी डिस्काउंटिंग से खुलता है। इसलिए शुरुआत Veo Fast से कीजिए। यहाँ तब लौटिए जब उसकी तीन-reference वाली सीमा आपको रोक रही हो, जब वे दो अतिरिक्त सेकंड चाहिए हों, या जब आपको "Nano Banana for video" वाली फ़्रेमिंग के पीछे का वीडियो-एडिटिंग बर्ताव चाहिए। और विकल्प reference-to-video कैटेगरी में हैं, और पूरा मॉडल कैटलॉग एक ही पेज पर है।

Google जो सीमाएँ प्रकाशित करता है

Public Preview का मतलब है कि खुरदुरे किनारे छिपाए नहीं, दर्ज किए गए हैं। बनाना शुरू करने से पहले ये पढ़ लीजिए:

  • तीन सेकंड तक के वीडियो references को API schema स्वीकार तो कर लेता है, लेकिन Google के अपने शब्दों में उन्हें "मॉडल सही ढंग से प्रोसेस नहीं करता।" वीडियो referencing को नाकारा मानिए और stills भेजिए — और ध्यान रहे कि कई वीडियो पर referencing या reasoning बिलकुल भी सपोर्टेड नहीं है।
  • अपलोड किए गए वीडियो की एडिटिंग EEA, स्विट्ज़रलैंड और UK में उपलब्ध नहीं है। अगर आपके यूज़र या आपका इन्फ़्रास्ट्रक्चर वहाँ हैं, तो मॉडल की आधी अपील आपके लिए बंद है।
  • सिर्फ़ अंग्रेज़ी पूरी तरह सपोर्टेड है। बाक़ी prompt भाषाओं का मूल्यांकन नहीं किया गया है।
  • एक ही generation में लंबा, कई सीन वाला नैरेटिव फ़ेल हो जाता है। यह मॉडल एक सतत shot रेंडर करता है; एक के बाद एक तीन माँगेंगे तो गड़बड़ ही मिलेगी।

तस्वीर और आवाज़ को साथ में prompt करना

shot लिखिए, कहानी नहीं। एक subject, एक camera move, एक lighting condition — और फिर बताइए कि वह सुनाई कैसा देता है, क्योंकि audio उसी prompt से निकलता है और ख़ामोशी भी एक ऐसा चुनाव है जो बोलकर करना पड़ता है।

एक से ज़्यादा attachment भेजें तो उन्हें लेबल कीजिए: "image 1 is the bottle, image 2 is the label close-up." मॉडल को और कुछ नहीं बताता कि हीरो reference कौन-सा है। Camera की भाषा सीधी रखिए — "slow push-in", "locked off", "handheld follow" सिनेमैटोग्राफ़ी के पूरे पैराग्राफ़ से बेहतर काम करते हैं।

शिप करने से पहले

हर clip पर एक SynthID watermark होता है — दर्शकों को अदृश्य, प्रोग्राम से पकड़ में आने वाला — और C2PA content credentials डिफ़ॉल्ट रूप से जुड़े रहते हैं। इस मॉडल को चलाने वाला कोई भी provider इन्हें बंद नहीं कर सकता, हम भी नहीं। अगर किसी क्लाइंट का कॉन्ट्रैक्ट लेबल किए गए AI assets की मनाही करता है, तो इंटीग्रेट करने से पहले वह बात तय कर लीजिए।

अपने outputs को completion handler के अंदर ही अपनी storage पर दोबारा होस्ट कीजिए। रिज़ल्ट URLs स्थायी पते नहीं हैं, और जो वीडियो आप वापस नहीं ला सकते, उसकी कीमत आप दो बार चुकाते हैं।

अक्सर पूछे जाने वाले सवाल

Gemini Omni Flash क्या है?

यह Google का gemini-omni-flash-preview है, Veo फ़ैमिली का नहीं बल्कि Gemini फ़ैमिली का एक वीडियो जनरेशन और एडिटिंग मॉडल। DeepMind इसे "Nano Banana, but for video" कहता है — ज़ोर references को एक जैसा बनाए रखने और मौजूदा फ़ुटेज एडिट करने पर है, जबकि Veo का निशाना शून्य से सिनेमैटिक जनरेशन है। यह Public Preview में है।

E2X पर 8-सेकंड के Omni Flash वीडियो की कीमत कितनी है?

$0.80। हम 720p output के प्रति सेकंड $0.10 लेते हैं, इसलिए बिल लंबाई से तय होता है — 4-सेकंड clip $0.40 का, और अधिकतम 10 सेकंड $1.00 के। 26 अगस्त 2026 की जाँच पर यही हमारा रेट था।

Omni Flash कितनी reference images स्वीकार करता है?

एक से ज़्यादा, और Google के दस्तावेज़ी उदाहरण छह तक जाते हैं — लेकिन कोई आधिकारिक अधिकतम सीमा प्रकाशित नहीं की गई है। Google के बाहर के स्रोत अलग-अलग सीमाएँ बताते हैं और आपस में उलटे पड़ते हैं, इसलिए हम ऐसा कोई नंबर नहीं दोहराएँगे जिसे हम वेरिफ़ाई नहीं कर सकते। किसी ख़ास संख्या के आसपास डिज़ाइन करने से पहले अपने payloads ख़ुद टेस्ट कीजिए।

क्या Omni Flash 1080p या 4K वीडियो बना सकता है?

आज नहीं। यह 24 fps पर 720p देता है, और Google ऊँचे resolutions को coming soon बताता है। अगर आपको अभी 1080p या 4K चाहिए, तो Veo 3.1 Fast दोनों तक पहुँचता है।

मुझे Omni Flash चुनना चाहिए या Veo 3.1 Fast?

ज़्यादातर कामों के लिए Veo 3.1 Fast। हमारे प्लेटफ़ॉर्म पर audio के साथ 8-सेकंड clip उसके साथ $0.12 का पड़ता है, यहाँ $0.80 का, और वह 4K तक जाता है। Omni Flash तब चुनिए जब आपको तीन से ज़्यादा reference images चाहिए, 10-सेकंड duration चाहिए, या उसका वीडियो-एडिटिंग बर्ताव चाहिए।

क्या जनरेट हुए वीडियो में आवाज़ होती है?

हाँ, नेटिवली और स्क्रीन पर चल रहे एक्शन के साथ sync में। आप उसे उसी prompt से निर्देशित करते हैं — ambience का नाम लीजिए, effects बताइए, या म्यूज़िक माँगिए। API के ज़रिए audio को बाद में एडिट नहीं किया जा सकता, इसलिए बदलाव का मतलब है दोबारा render।

क्या Omni Flash के वीडियो पर watermark होता है?

हाँ। हर output पर एक SynthID watermark होता है जो दर्शकों को दिखता नहीं लेकिन डिटेक्शन टूल्स पढ़ लेते हैं, साथ ही C2PA content credentials डिफ़ॉल्ट रूप से चालू रहते हैं। इनमें से किसी को भी बंद करने का parameter कोई provider नहीं देता।

क्या मैं इस मॉडल से अपलोड किया हुआ वीडियो एडिट कर सकता हूँ?

सिर्फ़ EEA, स्विट्ज़रलैंड और UK के बाहर — Google इन क्षेत्रों में अपलोड किए गए वीडियो की एडिटिंग पर पाबंदी लगाता है। reference-to-video जनरेशन ख़ुद इससे प्रभावित नहीं होता। यह भी ध्यान रखिए कि वीडियो references schema स्वीकार तो करता है, लेकिन वे सही तरह प्रोसेस नहीं होते, इसलिए images भेजिए।