मॉडल्स पर वापस जाएं

Veo 3.1 Fast

तेज़ और किफ़ायती Veo 3.1 टियर, जिसमें टेक्स्ट-से-वीडियो, इमेज-से-वीडियो, रेफ़रेंस-से-वीडियो और शुरुआती-आख़िरी फ़्रेम ट्रांज़िशन शामिल हैं।

प्राइसिंगशुरुआत $0.01/रिक्वेस्ट
लेटेंसी~240 सेकंड औसत
रिज़ॉल्यूशन720P/1080P/4K
सर्वश्रेष्ठ उपयोगvideo, google, high-fidelity

पैरामीटर्स

अनुमानित लागत

आप इस मॉडल पर 90% बचाते हैं
प्रति second बेस कॉस्ट$0.10
छूट-90%
आपका कुल$0.01
आप प्रति रिक्वेस्ट $0.09 बचाते हैं

मॉडल चलाने के लिए साइन इन करें

Output Preview

Ready

No output yet

Run the model to see generated results.

नमूना आउटपुट

API उदाहरण— वर्तमान पैरामीटर

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/veo-3.1-fast/text-to-video',
  'input': {}
}
)

जॉब प्राप्त करें— परिणाम के लिए पोल करें

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

मूल्य विवरण

अवधि और रिज़ॉल्यूशन के अनुसार प्रति जनरेशन अनुमानित लागत। आप केवल उसी के लिए भुगतान करते हैं जो आप चलाते हैं।

अवधि
720P
1080P
4K
4
$0.40
$0.40
$0.60
6
$0.60
$0.60
$0.90
8
$0.80
$0.80
$1.20
विकल्प देखें

संबंधित मॉडल

टेक्स्ट टू वीडियो के लिए अन्य AI मॉडल देखें

सभी मॉडल देखें

Veo 3.1 Fast Text-to-Video API — E2X पर

Veo 3.1 Fast, Google का स्पीड के लिए ट्यून किया गया Veo 3.1 है: वही resolutions, वही 4/6/8 सेकंड की अवधि, वही हमेशा चालू रहने वाला नेटिव ऑडियो — बस तेज़ी से लौटता है और कीमत कम है। हम इसे google/veo-3.1-fast/text-to-video के रूप में उपलब्ध कराते हैं और आउटपुट के प्रति सेकंड बिल करते हैं — $0.01 प्रति सेकंड, और ऑडियो ट्रैक चालू होने पर ×1.5। ध्वनि के साथ 8-सेकंड की 720p क्लिप $0.12 पड़ती है। अपलोड करने को कुछ नहीं। पूरा input एक prompt है।

आपके पास कोई स्टिल इमेज है जिसमें जान डालनी है? तब आपको Veo 3.1 Fast image-to-video चाहिए — वही मॉडल, एक शुरुआती फ़्रेम के साथ। चाहते हैं कि कई शॉट्स के आर-पार वही चेहरा और वही जैकेट बनी रहे? वह काम Veo 3.1 Fast reference-to-video का है।

8-सेकंड की क्लिप की कीमत, हर जगह

इस मॉडल का हर संजीदा provider प्रति सेकंड बिल करता है, हम भी। इसलिए एकमात्र ईमानदार तुलना एक तय कॉन्फ़िगरेशन पर ही हो सकती है — यह रही, 720p पर ऑडियो चालू रखते हुए, 26 अगस्त 2026 को जाँची गई:

API providerबिलिंगदर (720p, ऑडियो चालू)8-सेकंड क्लिपबनाम हम
E2X (मौजूदा)प्रति सेकंड$0.01/s ×1.5 ऑडियो$0.12—
Google Gemini APIप्रति सेकंड$0.10/s$0.80हमसे 6.7×
fal.aiप्रति सेकंड$0.15/s$1.20हमसे 10×
Replicateप्रति सेकंड$0.15/s$1.20हमसे 10×
E2X list (डिस्काउंट से पहले)प्रति सेकंड$0.10/s ×1.5$1.20हमारी बिना-छूट दर

आख़िरी पंक्ति को fal.ai और Replicate के सामने रखकर पढ़िए। 8-सेकंड क्लिप के लिए हमारी list price $1.20 है — ठीक उतनी ही जितनी वे लेते हैं। आज आप उसका दसवाँ हिस्सा चुकाते हैं, और वही request Google के अपने API से भी 6.7× सस्ती पड़ती है।

बजट बनाते समय एक बारीकी याद रखिए: fal.ai और Replicate पर 720p → 1080p मुफ़्त है, जबकि Google उसके लिए प्रति सेकंड ज़्यादा लेता है। हमारी तरफ़ भी resolution एक multiplier है, इसलिए 1080p pipeline पर टिकने से पहले इस मॉडल की llms.txt से लाइव आँकड़ा उठा लीजिए।

कीमतें और प्रोडक्ट की शर्तें समय के साथ बदल सकती हैं; खरीद का फ़ैसला लेने से पहले हर provider की मौजूदा कीमत जाँच लें। Google Batch या Flex प्राइसिंग किसी स्टैंडर्ड on-demand API request के सीधे बराबर नहीं है, क्योंकि उसमें scheduling, उपलब्धता और प्रोसेसिंग की शर्तें अलग होती हैं; इसलिए उसे इस तुलना में शामिल नहीं किया गया है। यह एक सीमित दायरे की तुलना है — यह दावा नहीं किया जा रहा कि E2X हर कॉन्फ़िगरेशन में दुनिया का सबसे सस्ता विकल्प है।

असली सुर्ख़ी ऑडियो ट्रैक है

ज़्यादातर text-to-video मॉडल आपको एक ख़ामोश MP4 थमाकर आवाज़ का ज़िम्मा आप पर छोड़ देते हैं। Veo 3.1 Fast ऐसा नहीं करता। Google का API ऑडियो नेटिव तरीक़े से बनाता है और वहाँ आप उसे बंद नहीं कर सकते — तस्वीर के साथ-साथ बनी और फ़्रेम्स से बँधी हुई सिंक्रोनाइज़्ड डायलॉग, foley और room tone। Google के अपने दस्तावेज़ी उदाहरण prompt में बोले गए संवाद हैं।

इससे एक कॉल की क़ीमत ही बदल जाती है। लिखिए "एक मछली विक्रेता क्रेट पटकता है और चिल्लाता है ताज़ा माल, पाँच मिनट पहले आया" — और आपको सही फ़्रेम्स पर वह पटकना और वह पुकार मिलती है, कोई मूक अभिनय नहीं जिस पर आपको बाद में आवाज़ चढ़ानी पड़े। सोशल कट्स और animatics के लिए post का एक पूरा चरण ग़ायब हो जाता है।

चुनने को आपके पास यह है:

  • अवधि: 4, 6 या 8 सेकंड। हमारे तीनों Veo 3.1 Fast endpoints में यही अकेला है जहाँ यह चुनाव सचमुच खुला है। ऑडियो के साथ 4-सेकंड की 720p क्लिप $0.06 पड़ती है; 6 सेकंड $0.09।
  • Resolution: 720p (हमारा डिफ़ॉल्ट), 1080p या 4k, 24fps पर। 1080p और 4k सिर्फ़ 8 सेकंड पर मिलते हैं — यह Google की पाबंदी है, हमारी नहीं।
  • Aspect ratio: 16:9 (डिफ़ॉल्ट) या 9:16। न चौकोर, न 4:5।
  • has_sound, डिफ़ॉल्ट true, जो ×1.5 multiplier चलाता है।

एक क्लिप की छत आठ सेकंड है। सीक्वेंस का मतलब है कई कॉल।

API request: prompt अंदर, MP4 बाहर

Dashboard में एक key बनाइए, उसे server-side रखिए, job पोस्ट कर दीजिए। सिर्फ़ prompt ज़रूरी है।

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/veo-3.1-fast/text-to-video",
    "input": {
      "prompt": "रात में बारिश से भीगी ओसाका की एक गली में हैंडहेल्ड शॉट, नीचे की ओर। एक रामेन विक्रेता noren उठाता है, भाप बाहर फैलती है, और वह पास से गुज़रते साइकिल सवार को पुकारता है: \"रात का आख़िरी कटोरा!\" नियॉन की परछाइयाँ पानी के गड्ढों में काँपती हैं।",
      "aspect_ratio": "16:9",
      "resolution": "720p",
      "duration": "8",
      "has_sound": "true"
    }
  }'

हम एक job ID लौटाते हैं। चाहें तो poll कीजिए, चाहें तो नहीं:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/veo-3.1-fast/text-to-video",
    input: {
      prompt:
        "लॉगबुक में लिखती हुई एक लाइटहाउस कीपर पर धीमा push-in। हवा शीशे को खड़खड़ाती है। वह बुदबुदाती है, \"तीसरी रात, अब भी कोई संकेत नहीं।\" हर चार सेकंड में लैंप की रोशनी उसके चेहरे से गुज़रती है।",
      aspect_ratio: "9:16",
      resolution: "720p",
      duration: "6",
      has_sound: "true",
      seed: 41205,
    },
  }),
}).then((r) => r.json());

const jobId = submitted.data.jobId;

while (true) {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") {
    console.log(job.data.outputs[0].url);
    break;
  }
  if (job.data.status === "failed") {
    throw new Error(job.data.error?.message || "Generation failed");
  }
  await new Promise((r) => setTimeout(r, 5000));
}

Statuses pending → processing → completed चलते हैं, या failed / cancelled पर आकर रुक जाते हैं। इसके बजाय एक webhookUrl भेजिए और हम आपको कॉल कर लेंगे। प्रति job क़रीब चार मिनट का बजट रखिए; Google 11 सेकंड का फ़र्श और पीक ऑवर्स में 6 मिनट की छत बताता है, इसलिए छत के हिसाब से बनाइए।

Schema का एक जाल: duration और resolution strings हैं। "8", न कि 8।

हमारे Veo 3.1 Fast endpoints में से चुनाव

एक ही weights, एक ही प्रति-सेकंड कीमत, तीन अलग दरवाज़े। फ़ैसला वही input करता है जो पहले से आपके पास है:

Endpoint8s क्लिप, 720p + ऑडियोकब चुनें
Veo 3.1 Fast text-to-video$0.12आपके पास सिर्फ़ शब्द हैं — और आपको 4s या 6s चाहिए
Veo 3.1 Fast image-to-video$0.12एक स्टिल मौजूद है और उसे पहला फ़्रेम बनना चाहिए
Veo 3.1 Fast reference-to-video$0.12कोई व्यक्ति, प्रोडक्ट या जगह हर शॉट में एक जैसी रहनी चाहिए

कीमत यह गुत्थी नहीं सुलझाएगी, इसलिए brief के पीछे चलिए। अगर क्लाइंट किसी key visual पर पहले ही मुहर लगा चुका है, तो उसे शुरुआती फ़्रेम के तौर पर भेजना उसे दोबारा शब्दों में बयान करने से बेहतर है। अगर छह क्लिप्स को एक ही कैंपेन जैसा दिखना है, तो तीन तक references चढ़ाइए — बस यह जान लीजिए कि reference-to-video 8 सेकंड पर बाध्य करता है, कोई अपवाद नहीं। यह endpoint छोटी अवधियाँ बचाकर रखता है, जिससे यह किसी storyboard को कच्ची मूवमेंट से भरने का सबसे सस्ता तरीक़ा बन जाता है। हम और क्या चलाते हैं, यह text-to-video कैटेगरी और पूरे मॉडल कैटलॉग में है।

ऐसे prompts जो आवाज़ का हक़ अदा करें

Prompt को एक शॉट लिस्ट मानिए जिसके साथ साउंड मिक्स नत्थी है। विशेषणों से ज़्यादा फ़र्क़ ये चार चीज़ें डालती हैं:

कैमरा मूव का नाम लीजिए। "Locked-off wide", "slow dolly in", "handheld follow" — मॉडल इनका लिहाज़ करता है। धुँधली फ़्रेमिंग बदले में भटकती, बिना इरादे की मूवमेंट देती है।

संवाद उद्धरण चिह्नों में लिखिए। छोटी पंक्तियाँ, प्रति क्लिप एक या दो। आठ सेकंड लंबे नहीं होते। घुमा-फिराकर बताया गया इरादा ("वह कुछ हौसला बढ़ाने वाली बात कहता है") बुदबुदाती भरपाई ही देता है।

माहौल की आवाज़ माँगिए। टिन पर बारिश, फ़्रिज की गुनगुनाहट, दूर का ट्रैफ़िक। आप न बताएँ तो मॉडल अपनी तरफ़ से एक bed गढ़ लेता है, और वह आपके एडिट से मेल नहीं भी खा सकता।

बताइए रोशनी क्या कर रही है। बादलों वाली दोपहर, सोडियम स्ट्रीटलाइट, एक practical लैंप। लाइटिंग ही तय करती है कि Fast-tier क्लिप सोची-समझी लगती है या महज़ एक रेंडर।

अंग्रेज़ी पूरी तरह समर्थित है; बाक़ी भाषाओं का मूल्यांकन Google ने यहाँ नहीं किया है। संवाद उसी भाषा में लिखिए जिसमें बुलवाना है, और अंग्रेज़ी के बाहर ज़्यादा उतार-चढ़ाव की उम्मीद रखिए।

ship करने से पहले क्या जाँचें

48 घंटे के भीतर डाउनलोड कर लीजिए। Google फ़ाइल को दो दिन रखता है — उनके शब्दों में, आपको अपना वीडियो जनरेट होने के 2 दिन के भीतर डाउनलोड करना होगा। जिस job में आप outputs[0].url पढ़ते हैं, उसी में हर आउटपुट को अपने bucket में कॉपी कीजिए। CDN लिंक कोई archive नहीं है।

हर फ़्रेम पर SynthID है। Google का अदृश्य watermark हर Veo आउटपुट पर लगता है और उनके verification प्लेटफ़ॉर्म पर जाँचा जा सकता है। इसे कोई बंद नहीं कर सकता, हम भी नहीं।

लोगों पर क्षेत्रीय नियम। EU, UK, स्विट्ज़रलैंड और MENA में personGeneration सिर्फ़ allow_adult तक सीमित है।

अक्सर पूछे जाने वाले सवाल

E2X पर Veo 3.1 Fast text-to-video की कीमत कितनी है?

हम प्रति सेकंड बिल करते हैं: आउटपुट के प्रति सेकंड $0.01, और ऑडियो चालू होने पर उसे 1.5 से गुणा किया जाता है। ध्वनि के साथ 8-सेकंड की 720p क्लिप $0.12 है, 6-सेकंड की $0.09, और 4 सेकंड की $0.06। 720p से ऊपर के resolution का अपना multiplier लगता है।

क्या इस मॉडल पर E2X सचमुच fal.ai से दस गुना सस्ता है?

जिस कॉन्फ़िगरेशन और तारीख़ पर हमने जाँचा — 8 सेकंड, 720p, ऑडियो चालू, 26 अगस्त 2026 — उस पर हाँ: हमारे यहाँ $0.12 बनाम वहाँ $1.20। हमारी अपनी बिना-छूट list price भी वही $1.20 है। यह फ़ासला एक डिस्काउंट है, कोई अलग प्रोडक्ट नहीं।

क्या मैं ऑडियो बंद कर सकता हूँ?

हमारा schema has_sound देता है और हम उसे true पर डिफ़ॉल्ट रखते हैं। Google का अपना Gemini API कोई off switch देता ही नहीं, इसलिए ऑडियो को इस मॉडल का हिस्सा ही मानना बेहतर है — यही बात हमारे image-to-video endpoint पर भी लागू है। ×1.5 वाले price multiplier की वजह भी यही है।

एक जनरेट की गई क्लिप ज़्यादा से ज़्यादा कितनी लंबी हो सकती है?

एक कॉल में आठ सेकंड। इस endpoint पर आप 4 या 6 भी माँग सकते हैं, लेकिन 1080p और 4k के लिए पूरे 8 चाहिए। लंबे सीक्वेंस का मतलब है कई jobs को ख़ुद जोड़ना, या reference-to-video से लुक को स्थिर रखना।

कौन-से aspect ratios और resolutions समर्थित हैं?

सिर्फ़ 16:9 और 9:16, 24fps पर, और 720p, 1080p या 4k में। हमारा डिफ़ॉल्ट 16:9 और 720p है। चौकोर या 4:5 का कोई विकल्प नहीं, इसलिए ज़रूरत पड़े तो post में क्रॉप कीजिए।

क्या वीडियो पर watermark होता है?

हाँ — हर Veo आउटपुट पर SynthID, Google का अदृश्य provenance मार्कर, लगा होता है और उसे उनके प्लेटफ़ॉर्म से जाँचा जा सकता है। इसे बंद करने के लिए कोई provider कोई पैरामीटर नहीं देता।

एक generation में कितना समय लगता है?

हम प्रति job क़रीब चार मिनट का बजट रखते हैं। Google न्यूनतम 11 सेकंड और पीक पर अधिकतम 6 मिनट बताता है, इसलिए बड़े काम के लिए कसे हुए polling loop के बजाय webhook इस्तेमाल कीजिए।