Loading...
Loading...
Schnellere, günstigere Veo-3.1-Stufe für Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und Übergänge zwischen Start- und Endbild.
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.
Das ist der Endpoint, den Sie nehmen, wenn dasselbe Gesicht, dieselbe Jacke oder dieselbe Ladenfront eine ganze Serie von Clips überstehen muss. Wir betreiben Googles Veo 3.1 Fast als google/veo-3.1-fast/reference-to-video, er nimmt ein image_urls-Array mit bis zu drei Referenzbildern, und wir rechnen pro Sekunde ab: $0.01 pro Sekunde, ×1.5 mit Ton. Jeder Clip hier ist 8 Sekunden lang, der Preis liegt also bei $0.12 pro Clip in 720p mit Ton.
Reicht ein Bild, und ein kürzerer Clip wäre hilfreich? Nehmen Sie Veo 3.1 Fast image-to-video — es animiert ein einzelnes Startframe und gibt Ihnen 4 oder 6 Sekunden. Gar nichts hochzuladen? Veo 3.1 Fast text-to-video läuft allein auf einem Prompt.
Sekundenweise Messung ist bei diesem Modell universell — Google, fal.ai und Replicate machen es alle so, und wir auch. Da reference-to-video fest auf 8 Sekunden steht, ist die Tabelle unten die einzige Konfiguration, die zählt. Werte geprüft am 26. August 2026, bei 720p mit Ton:
| API-Anbieter | Abrechnung | Rate (720p, Ton an) | 8-Sekunden-Clip | vs. uns |
|---|---|---|---|---|
| E2X (aktuell) | pro Sekunde | $0.01/s ×1.5 Ton | $0.12 | — |
| Google Gemini API | pro Sekunde | $0.10/s | $0.80 | 6.7× unser Preis |
| fal.ai | pro Sekunde | $0.15/s | $1.20 | 10× unser Preis |
| Replicate | pro Sekunde | $0.15/s | $1.20 | 10× unser Preis |
| E2X Listenpreis (vor Rabatt) | pro Sekunde | $0.10/s ×1.5 | $1.20 | unsere Rate ohne Rabatt |
Lesen Sie die letzte Zeile gegen die beiden Marktplätze. Unser Listenpreis liegt bei $1.20 für einen 8-Sekunden-Clip — exakt das, was fal.ai und Replicate abrechnen. Sie zahlen heute ein Zehntel davon, und landen damit immer noch 6.7× unter Googles eigener API. Diese Lücke ist ein laufender Rabatt auf ein identisches Modell, kein abgespeckter Tarif.
Kalkulieren Sie 1080p bewusst: fal.ai und Replicate nehmen den Schritt von 720p auf 1080p ohne Aufpreis mit, während Google eine höhere Rate pro Sekunde berechnet. Auch bei uns ist die Auflösung ein Multiplikator — die aktuelle Zahl steht in der llms.txt dieses Modells.
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Googles Limit ist unmissverständlich: „Verwenden Sie bis zu drei Referenzbilder, um den Inhalt zu steuern“, in ihrem Schema beschrieben als „Bis zu drei Bilder, die als Stil- und Inhaltsreferenzen verwendet werden.“ Drei. Ein viertes liegt außerhalb dessen, was das Modell akzeptiert.
Dieses Budget erzwingt eine Entscheidung, und genau das ist der interessante Teil dieses Endpoints. Sie geben drei Slots für das aus, was nicht driften darf. Ein Kampagnen-Shooting läuft meist so: ein sauberes Porträt der präsentierenden Person, eine Ganzkörperaufnahme mit dem Outfit, ein Foto des Ortes. Jeder Clip des Sets kommt dann mit derselben Person, denselben Kleidern, demselben Ort zurück — Sie ändern nur den Prompt.
Produktarbeit teilt anders auf: zwei Perspektiven des Objekts, ein Frame mit der Farbwelt der Marke. Dasselbe Prinzip. Die Referenzen tragen die Identität, der Prompt trägt die Handlung.
Das ist nicht die Aufgabe von image-to-video. Dort ist Ihr Bild Frame eins. Hier sind die Referenzen Orientierung, und das Eröffnungsframe wird aus ihnen generiert. Brauchen Sie einen Clip, der auf einem exakt abgenommenen Standbild beginnt? Das ist der andere Endpoint.
Googles Regel lautet: duration „Muss '8' sein, wenn Extension, Referenzbilder oder die Auflösungen 1080p und 4k verwendet werden.“ Referenzbilder stehen auf dieser Liste, die 4- und 6-Sekunden-Optionen der anderen beiden Endpoints existieren hier also nicht. Unser Schema zeigt das duration-Enum weiterhin an; für diese Capability ist "8" der einzige gültige Wert.
Kalkulieren Sie entsprechend. Eine Sequenz aus sechs Clips sind 48 Sekunden Output — $0.72 bei uns, $7.20 bei fal.ai oder Replicate.
Pflichtfelder: prompt und image_urls.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/reference-to-video",
"input": {
"prompt": "Die Frau aus Bild 1, im Mantel aus Bild 2, betritt die Lobby aus Bild 3 und schüttelt den Regen ab. Sie blickt auf und sagt: \"Du hast gewartet.\" Warmes Wolframlicht, Hall auf Marmor.",
"image_urls": [
"https://example.com/talent-portrait.jpg",
"https://example.com/wardrobe-coat.jpg",
"https://example.com/lobby-set.jpg"
],
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
Der Submit gibt eine Job-ID zurück; pollen Sie sie oder registrieren Sie einen Webhook:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/reference-to-video",
input: {
prompt:
"Das Maskottchen aus Bild 1 hüpft auf die Theke aus Bild 2, stößt eine Tasse um und erstarrt. Quietschende Schritte, ein Klirren von Keramik, dann Stille.",
image_urls: [
"https://example.com/mascot-turnaround.png",
"https://example.com/kitchen-set.jpg",
],
aspect_ratio: "9:16",
resolution: "720p",
duration: "8",
has_sound: "true",
seed: 60411,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Der Status läuft pending → processing → completed, oder endet bei failed / cancelled. Planen Sie mit etwa vier Minuten pro Job — Googles offizielles Fenster ist ein Boden von 11 Sekunden und 6 Minuten zu Spitzenzeiten. Verwenden Sie über ein Set hinweg denselben seed, wenn die Generierungen aufeinander reimen sollen.
Identische Weights, identischer Sekundenpreis. Die Form Ihres Inputs wählt den Endpoint:
| Endpoint | Längenoptionen | 8s-Clip, 720p + Ton | Nehmen Sie ihn, wenn |
|---|---|---|---|
| Veo 3.1 Fast reference-to-video | nur 8s | $0.12 | Bis zu 3 Bilder ein Gesicht, Outfit oder einen Ort über Clips hinweg festnageln müssen |
| Veo 3.1 Fast image-to-video | 4 / 6 / 8s | $0.12 | Ein Standbild buchstäblich das erste Frame sein soll |
| Veo 3.1 Fast text-to-video | 4 / 6 / 8s | $0.12 | Nur ein Prompt da ist, nichts zum Hochladen |
| Omni Flash reference-to-video | — | $0.80 (Default-Konfiguration) | Eine andere Familie gefragt ist, weil Veos Look nicht der gewünschte ist |
Uns wäre lieber, Sie geben weniger aus. Reicht ein Bild, ist image-to-video derselbe Preis und schaltet 4- und 6-Sekunden-Clips frei — eine 4-Sekunden-Version kostet $0.06, die Hälfte der fixen 8 Sekunden, die Sie hier bezahlen. Kommen Sie zu diesem Endpoint, wenn Konsistenz über mehrere Clips die eigentliche Anforderung ist, denn das ist das eine, was die anderen nicht können. Der Rest der Kategorie liegt unter reference-to-video; alles Übrige steht im Modellkatalog.
Das Modell bekommt ein unbeschriftetes Array. Nichts im Payload sagt, dass Slot zwei die Garderobe war und nicht eine zweite Figur — sagen Sie es also im Prompt.
Indizierung funktioniert: „die Frau aus Bild 1“, „der Mantel aus Bild 2“, „die Lobby aus Bild 3“. Ein paar Worte, und der größte Teil jener Mehrdeutigkeit, die vermischte Outputs erzeugt, verschwindet.
Drei weitere Gewohnheiten:
Geben Sie jeder Referenz genau eine Aufgabe. Ein überladenes Foto mit einer Person, einem Produkt und einem Raum zwingt das Modell zum Raten, worauf es Ihnen ankam. Croppen Sie eng.
Wiederholen Sie die Identität in Worten. „Dieselben kurzen silbernen Haare, dieselbe runde Brille“ verstärkt das, was die Referenz zeigt. Billige Versicherung.
Schreiben Sie den Dialog aus. Google erzeugt Ton nativ und ohne Ausschalter in ihrer API, Klang passiert also ohnehin — Sprache, Effekte, Atmo. Zitieren Sie die Zeile, und sie landet auf den richtigen Frames.
Google unterstützt Englisch vollständig und hat für dieses Modell nichts anderes evaluiert, halten Sie den Anweisungstext also englisch — die zitierte Dialogzeile darf in der Sprache stehen, die die Szene braucht.
Zwei Tage zum Herunterladen. Googles Aufbewahrung für generiertes Video beträgt zwei Tage — „Sie müssen Ihr Video innerhalb von 2 Tagen nach der Generierung herunterladen.“ Bei einer Kampagne aus zwanzig Clips, die über eine Woche entsteht, ist das eine Architekturentscheidung und keine Fußnote. Kopieren Sie outputs[0].url in Ihren eigenen Speicher, sobald ein Job fertig ist.
SynthID auf jedem Output. Googles unmerkliches Watermark wird auf jedes Veo-Video angewendet und ist über ihre Plattform verifizierbar. Kein Anbieter kann es abschalten.
Personengenerierung ist regional begrenzt. In der EU, dem UK, der Schweiz und der MENA-Region ist personGeneration auf allow_adult beschränkt.
Versionieren Sie Ihr Referenz-Set. Konsistenz hängt daran, jedes Mal bytegleiche Referenzen zu schicken. Ein neu exportiertes Porträt, das mitten im Batch ausgetauscht wird, sieht man.
Wir rechnen $0.01 pro Sekunde Output ab, ×1.5 mit Ton. Dieser Endpoint steht fest auf 8 Sekunden, ein 720p-Clip mit Ton kostet also $0.12. Höhere Auflösungen tragen ihren eigenen Multiplikator — prüfen Sie die aktuelle Modellseite, bevor Sie einen 1080p-Batch planen.
Höchstens drei. Googles Dokumentation sagt, dass Sie bis zu drei Referenzbilder verwenden dürfen, um den Inhalt zu steuern, und ihr Schema beschreibt sie als Stil- und Inhaltsreferenzen. Weniger ist in Ordnung; zwei sind üblich.
Google verlangt 8 Sekunden, sobald Referenzbilder im Spiel sind — dieselbe Regel, die auch für 1080p und 4k gilt. Sie brauchen 4 oder 6 Sekunden? Nehmen Sie stattdessen den image-to-video- oder den text-to-video-Endpoint: dasselbe Modell, derselbe Preis pro Sekunde.
Image-to-video macht ein Bild zum buchstäblichen Eröffnungsframe. Reference-to-video nimmt bis zu drei Bilder als Orientierung für Identität, Garderobe, Stil oder Ort und generiert daraus ein Eröffnungsframe, das dazu passt. Nehmen Sie Referenzen, wenn Konsistenz über mehrere Clips wichtiger ist als ein bestimmtes erstes Frame.
Ja. Google erzeugt Dialog, Soundeffekte und Atmo nativ, ohne jede Möglichkeit, das in ihrer eigenen API abzuschalten. Wir stellen has_sound mit dem Default true bereit, und diese Einstellung wendet den ×1.5-Preismultiplikator an.
Jeder Veo-Output trägt SynthID, Googles unmerklichen Marker für KI-generierte Inhalte, verifizierbar auf ihrer Plattform. Kein Anbieter — wir eingeschlossen — kann ihn abschalten.
Wir kalkulieren rund vier Minuten. Google nennt ein Minimum von 11 Sekunden und zu Spitzenzeiten ein Maximum von 6 Minuten — nutzen Sie für ein komplettes Clip-Set also eine webhookUrl, statt Polling-Schleifen offen zu halten.