Loading...
Loading...
Daha hızlı ve daha uygun maliyetli Veo 3.1 katmanı; metinden videoya, görselden videoya, referanstan videoya ve başlangıç-bitiş karesi geçişlerini kapsar.
Modelleri çalıştırmak için giriş yapın
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Süre ve çözünürlüğe göre tahmini üretim maliyeti. Yalnızca çalıştırdığınız için ödersiniz.
Aynı yüzün, aynı ceketin ya da aynı dükkân cephesinin bir dizi klip boyunca bozulmadan kalması gerektiğinde kullandığınız endpoint bu. Google'ın Veo 3.1 Fast'ini google/veo-3.1-fast/reference-to-video olarak çalıştırıyoruz, üçe kadar reference görsel içeren bir image_urls dizisi alıyor ve saniye üzerinden faturalıyoruz: saniye başına $0.01, ses açıkken ×1.5. Buradaki her klip 8 saniye, dolayısıyla 720p ve sesli fiyat klip başına $0.12.
Tek görsel yetiyor ve kısa bir klip işinize mi gelirdi? Veo 3.1 Fast image-to-video kullanın — tek bir başlangıç karesini canlandırıyor ve size 4 ya da 6 saniye veriyor. Yüklenecek hiçbir şey yok mu? Veo 3.1 Fast text-to-video tek başına bir prompt'la çalışıyor.
Bu modelde saniye bazlı ölçüm evrensel — Google, fal.ai ve Replicate hepsi öyle yapıyor, biz de. Reference-to-video 8 saniyeye sabitlenmiş olduğu için aşağıdaki tablo önemli olan tek konfigürasyon. Rakamlar 26 Ağustos 2026'da kontrol edildi, 720p ve ses açık:
| API sağlayıcısı | Faturalama | Ücret (720p, ses açık) | 8 saniyelik klip | Bize göre |
|---|---|---|---|---|
| E2X (güncel) | saniye başına | $0.01/s ×1.5 ses | $0.12 | — |
| Google Gemini API | saniye başına | $0.10/s | $0.80 | fiyatımızın 6.7 katı |
| fal.ai | saniye başına | $0.15/s | $1.20 | fiyatımızın 10 katı |
| Replicate | saniye başına | $0.15/s | $1.20 | fiyatımızın 10 katı |
| E2X liste (indirimsiz) | saniye başına | $0.10/s ×1.5 | $1.20 | indirimsiz ücretimiz |
Son satırı iki pazar yeriyle karşılaştırarak okuyun. Liste fiyatımız 8 saniyelik klip için $1.20 — tam olarak fal.ai ve Replicate'in faturaladığı rakam. Bugün bunun onda birini ödüyorsunuz ve bu hâlâ Google'ın kendi API'sinin 6.7 kat altında kalıyor. Aradaki fark, aynı model üzerinde işleyen canlı bir indirim; kırpılmış bir paket değil.
1080p'yi bilinçli fiyatlayın: fal.ai ve Replicate 720p → 1080p adımını ek ücretsiz veriyor, Google ise saniye başına daha yüksek bir ücret alıyor. Bizde de çözünürlük bir çarpan — güncel rakam bu modelin llms.txt dosyasında duruyor.
Fiyatlar ve ürün koşulları zamanla değişebilir; satın alma kararı öncesinde güncel fiyatları kontrol edin. Google Batch veya Flex fiyatlandırması, zamanlama, kapasite ve işleme koşulları farklı olduğu için standart on-demand API request'iyle birebir eşdeğer değildir ve bu tabloya dahil edilmemiştir. Bu karşılaştırma belirli bir kullanım senaryosuna aittir; E2X'in her koşulda "dünyanın en ucuzu" olduğu iddia edilmemektedir.
Google'ın sınırı açık: "İçeriği yönlendirmek için üçe kadar reference görsel kullanın" diyor ve schema'larında bunu "stil ve içerik reference'ı olarak kullanılacak üçe kadar görsel" şeklinde tarif ediyor. Üç. Dördüncüsü modelin kabul ettiği aralığın dışında.
Bu bütçe bir karar vermeye zorluyor ve bu endpoint'in ilginç kısmı da orası. Üç slot'u, kaymaması gereken şeye harcıyorsunuz. Bir kampanya çekimi genelde şöyle gidiyor: sunucunun temiz bir portresi, kıyafeti gösteren bir boy fotoğrafı, mekândan bir kare. Sonra setteki her klip aynı kişi, aynı kıyafet, aynı mekânla geri dönüyor — siz yalnızca prompt'u değiştiriyorsunuz.
Ürün işi farklı bölünüyor: nesnenin iki açısı, markanın renk işleminden bir kare. Aynı prensip. Kimliği reference'lar taşıyor, aksiyonu prompt.
Bu, image-to-video'nun işi değil. Orada görseliniz birinci karenin kendisi. Burada reference'lar yönlendirme, açılış karesi ise onlardan üretiliyor. Onaylanmış tam bir fotoğrafla başlayan bir klip mi lazım? O, diğer endpoint.
Google'ın kuralı şöyle: süre "extension, reference görseller ya da 1080p ve 4k çözünürlükler kullanılırken '8' olmalıdır." Reference görseller bu listede, dolayısıyla diğer iki endpoint'in sunduğu 4 ve 6 saniyelik seçenekler burada yok. Schema'mız duration enum'unu yine de gösteriyor; bu capability için geçerli tek değer "8".
Bütçenizi buna göre kurun. Altı kliplik bir sekans 48 saniye çıktı demek — bizde $0.72, fal.ai ya da Replicate'te $7.20.
Zorunlu alanlar: prompt ve image_urls.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/reference-to-video",
"input": {
"prompt": "1. görseldeki kadın, 2. görseldeki paltoyu giymiş hâlde 3. görseldeki lobiye giriyor ve üzerindeki yağmuru silkeliyor. Başını kaldırıp şöyle diyor: \"Beklemişsin.\" Sıcak tungsten ışık, mermerde yankı.",
"image_urls": [
"https://example.com/talent-portrait.jpg",
"https://example.com/wardrobe-coat.jpg",
"https://example.com/lobby-set.jpg"
],
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
Submit bir job ID döndürüyor; ister polling yapın, ister bir webhook kaydedin:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/reference-to-video",
input: {
prompt:
"1. görseldeki maskot, 2. görseldeki tezgâha zıplıyor, bir fincanı deviriyor ve donup kalıyor. Gıcırtılı ayak sesleri, bir seramik şıngırtısı, sonra sessizlik.",
image_urls: [
"https://example.com/mascot-turnaround.png",
"https://example.com/kitchen-set.jpg",
],
aspect_ratio: "9:16",
resolution: "720p",
duration: "8",
has_sound: "true",
seed: 60411,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Durum pending → processing → completed şeklinde ilerliyor ya da failed / cancelled üzerinde bitiyor. Job başına dört dakika kadar planlayın — Google'ın resmi penceresi 11 saniyelik bir taban ve yoğun saatte 6 dakika. Üretimlerin birbiriyle uyumlu çıkmasını istiyorsanız bir set boyunca aynı seed değerini tekrar kullanın.
Aynı ağırlıklar, aynı saniye fiyatı. Endpoint'i girdinizin biçimi seçiyor:
| Endpoint | Süre seçenekleri | 8s klip, 720p + ses | Şu durumda seçin |
|---|---|---|---|
| Veo 3.1 Fast reference-to-video | yalnızca 8s | $0.12 | 3'e kadar görsel, klipler boyunca bir yüzü, kıyafeti ya da mekânı sabitlemeli |
| Veo 3.1 Fast image-to-video | 4 / 6 / 8s | $0.12 | Bir fotoğraf harfiyen ilk kare olmalı |
| Veo 3.1 Fast text-to-video | 4 / 6 / 8s | $0.12 | Yalnızca prompt, yüklenecek bir şey yok |
| Omni Flash reference-to-video | — | $0.80 (varsayılan konfigürasyon) | Farklı bir aile; Veo'nun görünümü istediğiniz değilse |
Daha az harcamanızı tercih ederiz. Tek görsel işi görüyorsa image-to-video aynı fiyatta ve üstüne 4 ile 6 saniyelik klipleri açıyor — 4 saniyelik bir sürüm $0.06 tutuyor, burada ödediğiniz sabit 8 saniyenin yarısı. Bu endpoint'e, asıl gereksinim birden fazla klip boyunca tutarlılık olduğunda gelin; çünkü diğerlerinin yapamadığı tek şey bu. Kategorinin geri kalanı reference-to-video altında; diğer her şey model kataloğunda.
Model, etiketsiz bir dizi alıyor. Payload'da hiçbir şey ikinci slot'un ikinci bir karakter değil kostüm olduğunu söylemiyor — o hâlde bunu prompt'ta siz söyleyin.
İndeksleme işe yarıyor: "1. görseldeki kadın", "2. görseldeki palto", "3. görseldeki lobi". Birkaç kelime ve karışık çıktılar üreten muğlaklığın çoğu ortadan kalkıyor.
Üç alışkanlık daha:
Her reference'a tek bir iş verin. Aynı karede bir kişiyi, bir ürünü ve bir odayı barındıran kalabalık bir fotoğraf, modelden neyi önemsediğinizi tahmin etmesini istiyor. Sıkı kırpın.
Kimliği kelimelerle tekrarlayın. "Aynı kısa gümüş saç, aynı yuvarlak gözlük" ifadesi reference'ın gösterdiğini pekiştiriyor. Ucuz bir sigorta.
Diyaloğu açık açık yazın. Google sesi native olarak üretiyor ve API'lerinde kapatma anahtarı yok, dolayısıyla ses her hâlükârda oluyor — konuşma, efekt, ambiyans. Repliği tırnak içine alın, doğru karelere otursun.
Google İngilizceyi tam destekliyor ve bu model için başka hiçbir dili değerlendirmedi, dolayısıyla talimat metnini İngilizce tutun — tırnak içindeki diyalog sahnenin ihtiyacı olan dilde olabilir.
İndirmek için iki gün. Google'ın üretilen videodaki saklama süresi iki gün — "videonuzu üretimden sonraki 2 gün içinde indirmeniz gerekir." Bir hafta boyunca kurulan yirmi kliplik bir kampanya için bu bir dipnot değil, bir mimari karar. Bir job tamamlanır tamamlanmaz outputs[0].url adresini kendi depolamanıza kopyalayın.
Her çıktıda SynthID. Google'ın algılanamayan watermark'ı tüm Veo videosuna uygulanıyor ve kendi platformları üzerinden doğrulanabiliyor. Hiçbir sağlayıcı bunu devre dışı bırakamıyor.
İnsan üretimi bölgeyle sınırlı. AB, Birleşik Krallık, İsviçre ve MENA'da personGeneration yalnızca allow_adult ile sınırlı.
Reference setinizi versiyonlayın. Tutarlılık, her seferinde byte düzeyinde aynı reference'ları göndermenize bağlı. Batch'in ortasında yeniden export edilmiş bir portreye geçerseniz bu görüntüye yansır.
Çıktının saniyesi başına $0.01 faturalıyoruz, ses açıkken ×1.5. Bu endpoint 8 saniyeye sabit, dolayısıyla sesli 720p bir klip $0.12. Daha yüksek çözünürlüklerin kendi çarpanı var — 1080p bir batch planlamadan önce canlı model sayfasını kontrol edin.
En fazla üç. Google'ın dokümantasyonu içeriği yönlendirmek için üçe kadar reference görsel kullanabileceğinizi söylüyor ve schema'ları bunları stil ve içerik reference'ı olarak tarif ediyor. Daha azı sorun değil; ikisi yaygın.
Google, reference görseller devredeyken 8 saniye şart koşuyor — 1080p ve 4k'yı da kapsayan aynı kural. 4 ya da 6 saniye mi lazım? Onun yerine image-to-video veya text-to-video endpoint'ini kullanın: aynı model, aynı saniye fiyatı.
Image-to-video tek bir görseli harfiyen açılış karesi yapıyor. Reference-to-video ise üçe kadar görseli kimlik, kostüm, stil ya da mekân için yönlendirme olarak alıyor, sonra onlarla tutarlı bir açılış karesi üretiyor. Belirli bir ilk kareden çok, birkaç klip boyunca tutarlılık önemliyse reference kullanın.
Evet. Google diyaloğu, ses efektlerini ve ambiyansı native olarak üretiyor ve kendi API'lerinde bunu kapatmanın yolu yok. Biz has_sound alanını true varsayılanıyla sunuyoruz ve bu ayar ×1.5 fiyat çarpanını uyguluyor.
Tüm Veo çıktısı, Google'ın AI üretimi içerik için kullandığı algılanamaz işaret SynthID'yi taşıyor ve kendi platformlarında doğrulanabiliyor. Hiçbir sağlayıcı — biz dahil — bunu kapatamıyor.
Kabaca dört dakika bütçeliyoruz. Google 11 saniyelik bir minimum ve yoğun saatte 6 dakikalık bir maksimum yayınlıyor, dolayısıyla tam bir klip seti için polling döngülerini açık tutmak yerine bir webhookUrl kullanın.