Loading...
Loading...
तेज़ और किफ़ायती Veo 3.1 टियर, जिसमें टेक्स्ट-से-वीडियो, इमेज-से-वीडियो, रेफ़रेंस-से-वीडियो और शुरुआती-आख़िरी फ़्रेम ट्रांज़िशन शामिल हैं।
मॉडल चलाने के लिए साइन इन करें
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)अवधि और रिज़ॉल्यूशन के अनुसार प्रति जनरेशन अनुमानित लागत। आप केवल उसी के लिए भुगतान करते हैं जो आप चलाते हैं।
Veo 3.1 Fast, Google का स्पीड के लिए ट्यून किया गया Veo 3.1 है: वही resolutions, वही 4/6/8 सेकंड की अवधि, वही हमेशा चालू रहने वाला नेटिव ऑडियो — बस तेज़ी से लौटता है और कीमत कम है। हम इसे google/veo-3.1-fast/text-to-video के रूप में उपलब्ध कराते हैं और आउटपुट के प्रति सेकंड बिल करते हैं — $0.01 प्रति सेकंड, और ऑडियो ट्रैक चालू होने पर ×1.5। ध्वनि के साथ 8-सेकंड की 720p क्लिप $0.12 पड़ती है। अपलोड करने को कुछ नहीं। पूरा input एक prompt है।
आपके पास कोई स्टिल इमेज है जिसमें जान डालनी है? तब आपको Veo 3.1 Fast image-to-video चाहिए — वही मॉडल, एक शुरुआती फ़्रेम के साथ। चाहते हैं कि कई शॉट्स के आर-पार वही चेहरा और वही जैकेट बनी रहे? वह काम Veo 3.1 Fast reference-to-video का है।
इस मॉडल का हर संजीदा provider प्रति सेकंड बिल करता है, हम भी। इसलिए एकमात्र ईमानदार तुलना एक तय कॉन्फ़िगरेशन पर ही हो सकती है — यह रही, 720p पर ऑडियो चालू रखते हुए, 26 अगस्त 2026 को जाँची गई:
| API provider | बिलिंग | दर (720p, ऑडियो चालू) | 8-सेकंड क्लिप | बनाम हम |
|---|---|---|---|---|
| E2X (मौजूदा) | प्रति सेकंड | $0.01/s ×1.5 ऑडियो | $0.12 | — |
| Google Gemini API | प्रति सेकंड | $0.10/s | $0.80 | हमसे 6.7× |
| fal.ai | प्रति सेकंड | $0.15/s | $1.20 | हमसे 10× |
| Replicate | प्रति सेकंड | $0.15/s | $1.20 | हमसे 10× |
| E2X list (डिस्काउंट से पहले) | प्रति सेकंड | $0.10/s ×1.5 | $1.20 | हमारी बिना-छूट दर |
आख़िरी पंक्ति को fal.ai और Replicate के सामने रखकर पढ़िए। 8-सेकंड क्लिप के लिए हमारी list price $1.20 है — ठीक उतनी ही जितनी वे लेते हैं। आज आप उसका दसवाँ हिस्सा चुकाते हैं, और वही request Google के अपने API से भी 6.7× सस्ती पड़ती है।
बजट बनाते समय एक बारीकी याद रखिए: fal.ai और Replicate पर 720p → 1080p मुफ़्त है, जबकि Google उसके लिए प्रति सेकंड ज़्यादा लेता है। हमारी तरफ़ भी resolution एक multiplier है, इसलिए 1080p pipeline पर टिकने से पहले इस मॉडल की llms.txt से लाइव आँकड़ा उठा लीजिए।
कीमतें और प्रोडक्ट की शर्तें समय के साथ बदल सकती हैं; खरीद का फ़ैसला लेने से पहले हर provider की मौजूदा कीमत जाँच लें। Google Batch या Flex प्राइसिंग किसी स्टैंडर्ड on-demand API request के सीधे बराबर नहीं है, क्योंकि उसमें scheduling, उपलब्धता और प्रोसेसिंग की शर्तें अलग होती हैं; इसलिए उसे इस तुलना में शामिल नहीं किया गया है। यह एक सीमित दायरे की तुलना है — यह दावा नहीं किया जा रहा कि E2X हर कॉन्फ़िगरेशन में दुनिया का सबसे सस्ता विकल्प है।
ज़्यादातर text-to-video मॉडल आपको एक ख़ामोश MP4 थमाकर आवाज़ का ज़िम्मा आप पर छोड़ देते हैं। Veo 3.1 Fast ऐसा नहीं करता। Google का API ऑडियो नेटिव तरीक़े से बनाता है और वहाँ आप उसे बंद नहीं कर सकते — तस्वीर के साथ-साथ बनी और फ़्रेम्स से बँधी हुई सिंक्रोनाइज़्ड डायलॉग, foley और room tone। Google के अपने दस्तावेज़ी उदाहरण prompt में बोले गए संवाद हैं।
इससे एक कॉल की क़ीमत ही बदल जाती है। लिखिए "एक मछली विक्रेता क्रेट पटकता है और चिल्लाता है ताज़ा माल, पाँच मिनट पहले आया" — और आपको सही फ़्रेम्स पर वह पटकना और वह पुकार मिलती है, कोई मूक अभिनय नहीं जिस पर आपको बाद में आवाज़ चढ़ानी पड़े। सोशल कट्स और animatics के लिए post का एक पूरा चरण ग़ायब हो जाता है।
चुनने को आपके पास यह है:
has_sound, डिफ़ॉल्ट true, जो ×1.5 multiplier चलाता है।एक क्लिप की छत आठ सेकंड है। सीक्वेंस का मतलब है कई कॉल।
Dashboard में एक key बनाइए, उसे server-side रखिए, job पोस्ट कर दीजिए। सिर्फ़ prompt ज़रूरी है।
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/text-to-video",
"input": {
"prompt": "रात में बारिश से भीगी ओसाका की एक गली में हैंडहेल्ड शॉट, नीचे की ओर। एक रामेन विक्रेता noren उठाता है, भाप बाहर फैलती है, और वह पास से गुज़रते साइकिल सवार को पुकारता है: \"रात का आख़िरी कटोरा!\" नियॉन की परछाइयाँ पानी के गड्ढों में काँपती हैं।",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
हम एक job ID लौटाते हैं। चाहें तो poll कीजिए, चाहें तो नहीं:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/text-to-video",
input: {
prompt:
"लॉगबुक में लिखती हुई एक लाइटहाउस कीपर पर धीमा push-in। हवा शीशे को खड़खड़ाती है। वह बुदबुदाती है, \"तीसरी रात, अब भी कोई संकेत नहीं।\" हर चार सेकंड में लैंप की रोशनी उसके चेहरे से गुज़रती है।",
aspect_ratio: "9:16",
resolution: "720p",
duration: "6",
has_sound: "true",
seed: 41205,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Statuses pending → processing → completed चलते हैं, या failed / cancelled पर आकर रुक जाते हैं। इसके बजाय एक webhookUrl भेजिए और हम आपको कॉल कर लेंगे। प्रति job क़रीब चार मिनट का बजट रखिए; Google 11 सेकंड का फ़र्श और पीक ऑवर्स में 6 मिनट की छत बताता है, इसलिए छत के हिसाब से बनाइए।
Schema का एक जाल: duration और resolution strings हैं। "8", न कि 8।
एक ही weights, एक ही प्रति-सेकंड कीमत, तीन अलग दरवाज़े। फ़ैसला वही input करता है जो पहले से आपके पास है:
| Endpoint | 8s क्लिप, 720p + ऑडियो | कब चुनें |
|---|---|---|
| Veo 3.1 Fast text-to-video | $0.12 | आपके पास सिर्फ़ शब्द हैं — और आपको 4s या 6s चाहिए |
| Veo 3.1 Fast image-to-video | $0.12 | एक स्टिल मौजूद है और उसे पहला फ़्रेम बनना चाहिए |
| Veo 3.1 Fast reference-to-video | $0.12 | कोई व्यक्ति, प्रोडक्ट या जगह हर शॉट में एक जैसी रहनी चाहिए |
कीमत यह गुत्थी नहीं सुलझाएगी, इसलिए brief के पीछे चलिए। अगर क्लाइंट किसी key visual पर पहले ही मुहर लगा चुका है, तो उसे शुरुआती फ़्रेम के तौर पर भेजना उसे दोबारा शब्दों में बयान करने से बेहतर है। अगर छह क्लिप्स को एक ही कैंपेन जैसा दिखना है, तो तीन तक references चढ़ाइए — बस यह जान लीजिए कि reference-to-video 8 सेकंड पर बाध्य करता है, कोई अपवाद नहीं। यह endpoint छोटी अवधियाँ बचाकर रखता है, जिससे यह किसी storyboard को कच्ची मूवमेंट से भरने का सबसे सस्ता तरीक़ा बन जाता है। हम और क्या चलाते हैं, यह text-to-video कैटेगरी और पूरे मॉडल कैटलॉग में है।
Prompt को एक शॉट लिस्ट मानिए जिसके साथ साउंड मिक्स नत्थी है। विशेषणों से ज़्यादा फ़र्क़ ये चार चीज़ें डालती हैं:
कैमरा मूव का नाम लीजिए। "Locked-off wide", "slow dolly in", "handheld follow" — मॉडल इनका लिहाज़ करता है। धुँधली फ़्रेमिंग बदले में भटकती, बिना इरादे की मूवमेंट देती है।
संवाद उद्धरण चिह्नों में लिखिए। छोटी पंक्तियाँ, प्रति क्लिप एक या दो। आठ सेकंड लंबे नहीं होते। घुमा-फिराकर बताया गया इरादा ("वह कुछ हौसला बढ़ाने वाली बात कहता है") बुदबुदाती भरपाई ही देता है।
माहौल की आवाज़ माँगिए। टिन पर बारिश, फ़्रिज की गुनगुनाहट, दूर का ट्रैफ़िक। आप न बताएँ तो मॉडल अपनी तरफ़ से एक bed गढ़ लेता है, और वह आपके एडिट से मेल नहीं भी खा सकता।
बताइए रोशनी क्या कर रही है। बादलों वाली दोपहर, सोडियम स्ट्रीटलाइट, एक practical लैंप। लाइटिंग ही तय करती है कि Fast-tier क्लिप सोची-समझी लगती है या महज़ एक रेंडर।
अंग्रेज़ी पूरी तरह समर्थित है; बाक़ी भाषाओं का मूल्यांकन Google ने यहाँ नहीं किया है। संवाद उसी भाषा में लिखिए जिसमें बुलवाना है, और अंग्रेज़ी के बाहर ज़्यादा उतार-चढ़ाव की उम्मीद रखिए।
48 घंटे के भीतर डाउनलोड कर लीजिए। Google फ़ाइल को दो दिन रखता है — उनके शब्दों में, आपको अपना वीडियो जनरेट होने के 2 दिन के भीतर डाउनलोड करना होगा। जिस job में आप outputs[0].url पढ़ते हैं, उसी में हर आउटपुट को अपने bucket में कॉपी कीजिए। CDN लिंक कोई archive नहीं है।
हर फ़्रेम पर SynthID है। Google का अदृश्य watermark हर Veo आउटपुट पर लगता है और उनके verification प्लेटफ़ॉर्म पर जाँचा जा सकता है। इसे कोई बंद नहीं कर सकता, हम भी नहीं।
लोगों पर क्षेत्रीय नियम। EU, UK, स्विट्ज़रलैंड और MENA में personGeneration सिर्फ़ allow_adult तक सीमित है।
हम प्रति सेकंड बिल करते हैं: आउटपुट के प्रति सेकंड $0.01, और ऑडियो चालू होने पर उसे 1.5 से गुणा किया जाता है। ध्वनि के साथ 8-सेकंड की 720p क्लिप $0.12 है, 6-सेकंड की $0.09, और 4 सेकंड की $0.06। 720p से ऊपर के resolution का अपना multiplier लगता है।
जिस कॉन्फ़िगरेशन और तारीख़ पर हमने जाँचा — 8 सेकंड, 720p, ऑडियो चालू, 26 अगस्त 2026 — उस पर हाँ: हमारे यहाँ $0.12 बनाम वहाँ $1.20। हमारी अपनी बिना-छूट list price भी वही $1.20 है। यह फ़ासला एक डिस्काउंट है, कोई अलग प्रोडक्ट नहीं।
हमारा schema has_sound देता है और हम उसे true पर डिफ़ॉल्ट रखते हैं। Google का अपना Gemini API कोई off switch देता ही नहीं, इसलिए ऑडियो को इस मॉडल का हिस्सा ही मानना बेहतर है — यही बात हमारे image-to-video endpoint पर भी लागू है। ×1.5 वाले price multiplier की वजह भी यही है।
एक कॉल में आठ सेकंड। इस endpoint पर आप 4 या 6 भी माँग सकते हैं, लेकिन 1080p और 4k के लिए पूरे 8 चाहिए। लंबे सीक्वेंस का मतलब है कई jobs को ख़ुद जोड़ना, या reference-to-video से लुक को स्थिर रखना।
सिर्फ़ 16:9 और 9:16, 24fps पर, और 720p, 1080p या 4k में। हमारा डिफ़ॉल्ट 16:9 और 720p है। चौकोर या 4:5 का कोई विकल्प नहीं, इसलिए ज़रूरत पड़े तो post में क्रॉप कीजिए।
हाँ — हर Veo आउटपुट पर SynthID, Google का अदृश्य provenance मार्कर, लगा होता है और उसे उनके प्लेटफ़ॉर्म से जाँचा जा सकता है। इसे बंद करने के लिए कोई provider कोई पैरामीटर नहीं देता।
हम प्रति job क़रीब चार मिनट का बजट रखते हैं। Google न्यूनतम 11 सेकंड और पीक पर अधिकतम 6 मिनट बताता है, इसलिए बड़े काम के लिए कसे हुए polling loop के बजाय webhook इस्तेमाल कीजिए।