Loading...
Loading...
Schnellere, günstigere Veo-3.1-Stufe für Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und Übergänge zwischen Start- und Endbild.
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/image-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.
Geben Sie diesem Endpoint ein Standbild und es wird zum ersten Frame einer bewegten, vertonten Einstellung. Wir betreiben Googles Veo 3.1 Fast als google/veo-3.1-fast/image-to-video und wir rechnen pro Sekunde Output ab: $0.01 pro Sekunde, ×1.5 bei aktiver Tonspur. Ein 8-Sekunden-Clip in 720p mit Ton kostet also $0.12 — ein Bild plus ein Prompt, ohne Referenz-Jonglage.
Kein Startbild zur Hand? Dann ist Veo 3.1 Fast text-to-video Ihr Endpoint — dasselbe Modell, derselbe Preis, nur ein Prompt, und Sie dürfen auf 4 oder 6 Sekunden heruntergehen. Haben Sie dagegen mehrere Bilder und geht es darum, eine Figur über mehrere Shots hinweg konsistent zu halten, gehen Sie zu Veo 3.1 Fast reference-to-video.
Niemand verkauft dieses Modell pro Video. Google, fal.ai, Replicate und wir messen den Output Sekunde für Sekunde, ein fairer Vergleich muss die Konfiguration also festnageln. Hier sind 8 Sekunden, 720p, Ton an, zuletzt geprüft am 26. August 2026:
| API-Anbieter | Abrechnung | Rate (720p, Ton an) | 8-Sekunden-Clip | vs. uns |
|---|---|---|---|---|
| E2X (aktuell) | pro Sekunde | $0.01/s ×1.5 Ton | $0.12 | — |
| Google Gemini API | pro Sekunde | $0.10/s | $0.80 | 6.7× unser Preis |
| fal.ai | pro Sekunde | $0.15/s | $1.20 | 10× unser Preis |
| Replicate | pro Sekunde | $0.15/s | $1.20 | 10× unser Preis |
| E2X Listenpreis (vor Rabatt) | pro Sekunde | $0.10/s ×1.5 | $1.20 | unsere Rate ohne Rabatt |
Bleiben Sie kurz bei der untersten Zeile. Unser nicht rabattierter Listenpreis liegt bei $1.20 für einen 8-Sekunden-Clip — exakt die Zahl, die fal.ai und Replicate verlangen. Die $0.12, die Sie heute zahlen, sind ein Zehntel davon, und immer noch 6.7× unter Googles eigener API.
Die Auflösung schlägt je nach Einkaufsort unterschiedlich auf die Rechnung durch. Der Schritt von 720p auf 1080p kostet bei fal.ai und Replicate nichts extra; Google verlangt eine höhere Rate pro Sekunde. Auch wir behandeln die Auflösung als Multiplikator — lesen Sie den aktuellen Wert deshalb aus der llms.txt dieses Modells, bevor Sie einen 1080p-Lauf planen.
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Ihr Bild verankert Frame eins. Alles danach wird generiert — halten Sie dieses Bild im Kopf, denn es erklärt sowohl die Stärke als auch den Fehlermodus.
Die Stärke: Bildaufbau, Farbpalette, Garderobe und Set sind bereits entschieden. Sie wetten nicht darauf, dass Prosa ein Produktbild reproduziert, das der Kunde längst abgenommen hat. Standbild rein, Bewegung beschreiben, Clip raus, der exakt dort beginnt, wo das Standbild stand.
Der Fehlermodus: Je weiter sich der Clip von diesem Frame entfernt, desto mehr improvisiert er. Verlangen Sie einen 180°-Orbit in acht Sekunden, und die abgewandte Seite des Motivs ist frei erfunden. Verlangen Sie eine langsame Push-in-Fahrt und eine Kopfdrehung, und es hält.
Der Ton kommt einfach mit. Google erzeugt ihn nativ und ihre API hat keinen Schalter, um ihn abzuschalten — Dialog in Sync, Schritte auf dem Auftritt, Raumton darunter. Ein Foto geht hinein; etwas mit Soundtrack kommt heraus.
Googles Vorgaben für das Quellbild, im Klartext:
image_url ab, wenn der Job läuft, nicht wenn Sie ihn einreichen.Der letzte Punkt verursacht mehr Fehlschläge als alle übrigen zusammen: kurzlebige signierte Links laufen mitten in der Warteschlange ab.
Zwei Pflichtfelder hier: prompt und image_url.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/image-to-video",
"input": {
"prompt": "Der Barista schiebt die Tasse nach vorn und Dampf kräuselt sich hoch. Langsame Push-in-Fahrt auf die Crema. Zischen der Espressomaschine, leises Café-Gemurmel im Hintergrund.",
"image_url": "https://example.com/counter-shot.jpg",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
Sie bekommen eine Job-ID zurück. Pollen Sie sie, oder geben Sie uns einen Webhook:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/image-to-video",
input: {
prompt:
"Sie schiebt die Sonnenbrille herunter und blickt nach links aus dem Bild. Der Saum hebt sich im Wind. Feststehende Kamera, Möwen und Brandung darunter.",
image_url: "https://example.com/lookbook-03.jpg",
aspect_ratio: "9:16",
resolution: "720p",
duration: "8",
has_sound: "true",
seed: 88117,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Animation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Jobs bewegen sich pending → processing → completed, oder bleiben bei failed / cancelled stehen. Schicken Sie eine webhookUrl, wenn Sie lieber nicht pollen. Wir planen mit ungefähr vier Minuten; Googles veröffentlichte Spanne reicht von 11 Sekunden im besten Fall bis 6 Minuten zu Spitzenzeiten.
Achten Sie auf die Typen: duration, resolution und has_sound sind Strings. "true", nicht true.
Drei Türen zu identischen Weights, zu identischem Sekundenpreis. Ihr Input entscheidet, welche:
| Endpoint | 8s-Clip, 720p + Ton | Nehmen Sie ihn, wenn |
|---|---|---|
| Veo 3.1 Fast image-to-video | $0.12 | Ein abgenommenes Standbild zu Frame eins werden soll |
| Veo 3.1 Fast text-to-video | $0.12 | Noch nichts existiert — und Sie eine 4s- oder 6s-Option wollen |
| Veo 3.1 Fast reference-to-video | $0.12 | Bis zu drei Bilder ein wiederkehrendes Gesicht, Produkt oder einen Ort definieren müssen |
Die ehrliche Trennlinie: Nehmen Sie diesen Endpoint, wenn das Standbild das Eröffnungsframe ist. Nehmen Sie reference-to-video, wenn Ihre Bilder stattdessen Orientierung geben — derselbe Darsteller über fünf Szenen — und akzeptieren Sie, dass Sie damit auf 8 Sekunden festgenagelt sind. Nur am Ausprobieren? Laden Sie gar nichts hoch: text-to-video mit 4 Sekunden kostet $0.06 und frisst sich schnell durch ein Storyboard. Den Rest finden Sie in der Kategorie image-to-video oder im gesamten Modellkatalog.
Der häufigste Fehler ist, das gerade hochgeladene Bild noch einmal zu beschreiben. Das Modell sieht es. Jedes Wort, das für „eine Frau im roten Mantel auf einem Steg“ draufgeht, fehlt bei dem, was als Nächstes passiert — und es lädt dazu ein, ein Frame neu zu interpretieren, das Sie bereits festgezurrt hatten.
Schreiben Sie stattdessen die Veränderung. Drei Gewohnheiten tragen den größten Teil der Qualität:
Geben Sie eine primäre Bewegung vor. Eine Kopfdrehung, eine Kamerafahrt nach vorn, eine sich öffnende Tür. Stapeln Sie vier Aktionen in acht Sekunden, und keine davon liest sich.
Sagen Sie, wo die Kamera steht und ob sie sich bewegt. „Feststehend“, „langsame Dolly-Fahrt hinein“, „Handheld-Drift nach rechts“. Schweigen an dieser Stelle erzeugt zielloses Schweben.
Vertonen Sie laut mit. Benennen Sie die Atmo und jede Dialogzeile in Anführungszeichen. Der Ton wird erzeugt, ob Sie ihn planen oder nicht — also planen Sie ihn.
Prompts auf Englisch werden vollständig unterstützt. Google hat für dieses Modell keine anderen Sprachen evaluiert, halten Sie die Anweisungen also auf Englisch, selbst wenn die gesprochene Zeile in einer anderen Sprache steht.
Zwei Tage. Das ist Ihr Download-Fenster. Google bewahrt das generierte Video zwei Tage auf — im Wortlaut: Sie müssen Ihr Video innerhalb von 2 Tagen nach der Generierung herunterladen. Ziehen Sie outputs[0].url in Ihren eigenen Speicher, im selben Codepfad, der die URL liest. Der zurückgegebene Link ist temporär.
SynthID liegt auf jedem Frame. Google versieht jeden Veo-Output mit seinem unmerklichen Herkunftsmarker, der über ihre Plattform verifizierbar ist. Kein Anbieter kann ihn abschalten, wir eingeschlossen.
Personen in regulierten Regionen. In der EU, dem UK, der Schweiz und der MENA-Region ist personGeneration auf allow_adult gedeckelt.
Passen Sie das Aspect Ratio an die Quelle an. Ein 16:9-Standbild mit angefordertem 9:16 zwingt das Modell dazu, die Ränder zu erfinden.
Wir berechnen $0.01 pro Sekunde generiertem Video, multipliziert mit 1.5, wenn Ton an ist. Damit kostet ein 8-Sekunden-Clip in 720p mit Ton $0.12. Höhere Auflösungen bringen ihren eigenen Multiplikator mit — prüfen Sie also die aktuelle Modellseite, bevor Sie einen 1080p- oder 4k-Batch budgetieren.
Unter 8 MB, mindestens 720p, und entweder 16:9 oder 9:16. Wir holen es von der image_url, die Sie angeben, der Link muss also noch auflösen, wenn der Job läuft — ablaufende signierte URLs sind hier der häufigste Fehlschlag.
Nicht an diesem Endpoint — er nimmt genau eine image_url. Sollen mehrere Bilder eine Generierung steuern, nutzen Sie reference-to-video, das ein Array von bis zu drei Bildern akzeptiert.
Ja, und das ist ein Hauptgrund, zu diesem Modell zu greifen. Google erzeugt synchronisierten Dialog, Effekte und Atmo nativ, ohne Ausschalter in ihrer eigenen API. Unser Schema stellt has_sound bereit, per Default true, und trägt damit den ×1.5-Multiplikator.
Bis zu 8 Sekunden. Dieser Endpoint akzeptiert 4, 6 oder 8, aber Output in 1080p und 4k verlangt die vollen 8. Nichts in der Veo 3.1 Fast Familie geht in einem einzelnen Call über 8 Sekunden hinaus.
Jedes Veo-Video trägt SynthID, Googles unmerkliches Watermark für KI-Herkunft, und es lässt sich auf ihrer Verifizierungsplattform prüfen. Niemand bietet eine Möglichkeit, es abzuschalten.
Planen Sie mit etwa vier Minuten pro Job. Googles offizielle Zahlen setzen den Boden bei 11 Sekunden und die Obergrenze zu Spitzenzeiten bei 6 Minuten — ein Webhook schlägt also eine Polling-Schleife, sobald Sie echtes Volumen fahren.