Loading...
Loading...
Schnellere, günstigere Veo-3.1-Stufe für Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und Übergänge zwischen Start- und Endbild.
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.
Veo 3.1 Fast ist Googles auf Tempo getrimmtes Veo 3.1: dieselben Auflösungen, dieselben 4/6/8-Sekunden-Längen, derselbe immer aktive native Ton — nur schneller geliefert und günstiger bepreist. Wir stellen es als google/veo-3.1-fast/text-to-video bereit und wir rechnen pro Sekunde Output ab — $0.01 pro Sekunde, ×1.5 wenn die Tonspur an ist. Ein 8-Sekunden-Clip in 720p mit Ton kommt damit auf $0.12. Nichts hochzuladen. Ein Prompt ist der gesamte Input.
Sie haben stattdessen ein Standbild, das sich bewegen soll? Dann wollen Sie Veo 3.1 Fast image-to-video — dasselbe Modell, ein einzelnes Startframe. Sollen dasselbe Gesicht und dieselbe Jacke eine ganze Serie von Shots überleben? Das ist Veo 3.1 Fast reference-to-video.
Jeder ernsthafte Anbieter dieses Modells rechnet sekundenweise ab, wir eingeschlossen. Der einzige ehrliche Vergleich ist deshalb eine feste Konfiguration — hier bei 720p mit aktivem Ton, geprüft am 26. August 2026:
| API-Anbieter | Abrechnung | Rate (720p, Ton an) | 8-Sekunden-Clip | vs. uns |
|---|---|---|---|---|
| E2X (aktuell) | pro Sekunde | $0.01/s ×1.5 Ton | $0.12 | — |
| Google Gemini API | pro Sekunde | $0.10/s | $0.80 | 6.7× unser Preis |
| fal.ai | pro Sekunde | $0.15/s | $1.20 | 10× unser Preis |
| Replicate | pro Sekunde | $0.15/s | $1.20 | 10× unser Preis |
| E2X Listenpreis (vor Rabatt) | pro Sekunde | $0.10/s ×1.5 | $1.20 | unsere Rate ohne Rabatt |
Lesen Sie die letzte Zeile gegen fal.ai und Replicate. Unser Listenpreis für einen 8-Sekunden-Clip liegt bei $1.20 — exakt das, was die beiden verlangen. Was Sie heute zahlen, ist ein Zehntel davon, und liegt für denselben Request immer noch 6.7× unter Googles eigener API.
Kalkulieren Sie eine Feinheit ein: Der Schritt von 720p auf 1080p ist bei fal.ai und Replicate kostenlos, während Google dafür mehr pro Sekunde berechnet. Auch bei uns ist die Auflösung ein Multiplikator — holen Sie sich den aktuellen Wert aus der llms.txt dieses Modells, bevor Sie sich auf eine 1080p-Pipeline festlegen.
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Die meisten Text-to-Video-Modelle geben Ihnen ein stummes MP4 und überlassen den Ton Ihnen. Veo 3.1 Fast nicht. Googles API erzeugt den Ton nativ und dort lässt er sich nicht abschalten — synchronisierte Dialoge, Foley und Raumton, gemeinsam mit dem Bild erzeugt und auf die Frames verriegelt. Googles eigenes dokumentiertes Beispiel-Prompt enthält gesprochene Zeilen.
Das verändert, was ein einzelner Call wert ist. Schreiben Sie „ein Fischhändler knallt eine Kiste hin und ruft frisch rein, vor fünf Minuten“ und Sie bekommen den Knall und den Ruf auf den richtigen Frames — keine Pantomime, die Sie hinterher vertonen müssen. Für Social Cuts und Animatics fällt ein kompletter Post-Schritt weg.
Was Sie tatsächlich wählen dürfen:
has_sound, per Default true, treibt den ×1.5-Multiplikator.Acht Sekunden sind die Obergrenze für einen Clip. Sequenzen sind mehrere Calls.
Legen Sie im Dashboard einen Key an, halten Sie ihn serverseitig, schicken Sie den Job ab. Erforderlich ist nur prompt.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/text-to-video",
"input": {
"prompt": "Handheld-Aufnahme durch eine regennasse Gasse in Osaka bei Nacht. Ein Ramen-Verkäufer hebt den Noren, Dampf quillt heraus, und er ruft einem vorbeifahrenden Radfahrer zu: \"Letzte Schale für heute Nacht!\" Neonreflexe zittern in den Pfützen.",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
Wir geben eine Job-ID zurück. Pollen Sie sie — oder eben nicht:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/text-to-video",
input: {
prompt:
"Langsame Push-in-Fahrt auf eine Leuchtturmwärterin, die ins Logbuch schreibt. Wind rüttelt an den Scheiben. Sie murmelt: \"Dritte Nacht, immer noch kein Signal.\" Der Lampenstrahl streicht alle vier Sekunden über ihr Gesicht.",
aspect_ratio: "9:16",
resolution: "720p",
duration: "6",
has_sound: "true",
seed: 41205,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Die Status laufen pending → processing → completed, oder landen auf failed / cancelled. Schicken Sie stattdessen eine webhookUrl und wir melden uns bei Ihnen. Kalkulieren Sie rund vier Minuten pro Job; Google nennt einen Boden von 11 Sekunden und zu Spitzenzeiten eine Obergrenze von 6 Minuten — bauen Sie für die Obergrenze.
Eine Schema-Falle: duration und resolution sind Strings. "8", nicht 8.
Dieselben Weights, derselbe Sekundenpreis, drei verschiedene Eingänge. Der Input, den Sie ohnehin schon haben, entscheidet:
| Endpoint | 8s-Clip, 720p + Ton | Nehmen Sie ihn, wenn |
|---|---|---|
| Veo 3.1 Fast text-to-video | $0.12 | Sie Worte haben und sonst nichts — und 4s oder 6s wollen |
| Veo 3.1 Fast image-to-video | $0.12 | Ein Standbild existiert und soll das erste Frame werden |
| Veo 3.1 Fast reference-to-video | $0.12 | Eine Person, ein Produkt oder ein Ort über mehrere Shots identisch bleiben muss |
Der Preis entscheidet nichts, also folgen Sie dem Briefing. Hat ein Kunde ein Key Visual bereits abgenommen, schlägt es jede Neubeschreibung in Prosa, wenn Sie es als Startframe schicken. Sollen sechs Clips wie eine Kampagne aussehen, laden Sie bis zu drei Referenzen — nur wissen Sie: reference-to-video erzwingt 8 Sekunden, ausnahmslos. Dieser Endpoint behält die kürzeren Längen und ist damit der günstigste Weg, ein Storyboard mit grober Bewegung zu füllen. Der Rest unseres Angebots liegt in der Kategorie text-to-video und im vollständigen Modellkatalog.
Behandeln Sie den Prompt als Shot List mit angehängter Tonmischung. Vier Dinge bewegen mehr als jedes Adjektiv:
Benennen Sie die Kamerabewegung. „Locked-off wide“, „langsame Dolly-Fahrt hinein“, „Handheld-Follow“ — das Modell respektiert das. Vage Bildgestaltung liefert driftende, unentschlossene Bewegung.
Schreiben Sie Dialoge in Anführungszeichen. Kurze Zeilen, eine oder zwei pro Clip. Acht Sekunden sind nicht lang. Paraphrasierte Absicht („er sagt etwas Aufmunterndes“) erzeugt genuscheltes Füllmaterial.
Fordern Sie die Atmo ein. Regen auf Blech, ein brummender Kühlschrank, ferner Verkehr. Das Modell erfindet ein Klangbett, wenn Sie keines nennen, und es muss nicht zu Ihrem Schnitt passen.
Sagen Sie, was das Licht tut. Bedeckter Mittag, Natriumdampflaterne, eine einzelne Praktikable. Das Licht entscheidet, ob ein Clip aus der Fast-Klasse absichtsvoll wirkt oder nach Render aussieht.
Englisch wird vollständig unterstützt; andere Sprachen hat Google hier nicht evaluiert. Schreiben Sie den Dialog in der Sprache, die gesprochen werden soll, und rechnen Sie außerhalb des Englischen mit mehr Streuung.
Laden Sie innerhalb von 48 Stunden herunter. Google hält die Datei zwei Tage vor — im Wortlaut: Sie müssen Ihr Video innerhalb von 2 Tagen nach der Generierung herunterladen. Kopieren Sie jeden Output in Ihren eigenen Bucket, im selben Job, der outputs[0].url liest. Ein CDN-Link ist kein Archiv.
Jedes Frame trägt SynthID. Googles unmerkliches Watermark liegt auf jedem Veo-Output und lässt sich auf ihrer Verifizierungsplattform prüfen. Niemand kann es abschalten, wir eingeschlossen.
Regionale Regeln für Personen. In der EU, dem UK, der Schweiz und der MENA-Region ist personGeneration auf allow_adult beschränkt.
Wir rechnen pro Sekunde ab: $0.01 pro Sekunde Output, multipliziert mit 1.5, wenn Ton aktiviert ist. Ein 8-Sekunden-Clip in 720p mit Ton kostet $0.12, einer mit 6 Sekunden $0.09, und 4 Sekunden kosten $0.06. Auflösungen oberhalb von 720p bringen ihren eigenen Multiplikator mit.
In der Konfiguration und zu dem Datum, die wir geprüft haben — 8 Sekunden, 720p, Ton an, 26. August 2026 — ja: $0.12 bei uns gegen $1.20 dort. Unser eigener, nicht rabattierter Listenpreis liegt bei genau diesen $1.20. Die Lücke ist ein Rabatt, kein anderes Produkt.
Unser Schema stellt has_sound bereit und wir setzen es per Default auf true. Googles eigene Gemini API bietet überhaupt keinen Ausschalter, deshalb betrachten Sie den Ton am besten als Teil dessen, was dieses Modell ist — dasselbe gilt an unserem image-to-video Endpoint. Er ist auch der Grund für den ×1.5-Preismultiplikator.
Acht Sekunden, in einem einzigen Call. An diesem Endpoint können Sie 4 oder 6 anfordern, aber 1080p und 4k verlangen die vollen 8. Längere Sequenzen bedeuten, dass Sie mehrere Jobs selbst aneinanderhängen — oder einen Look mit reference-to-video stabil halten.
Nur 16:9 und 9:16, bei 24fps, in 720p, 1080p oder 4k. Unser Default ist 16:9 und 720p. Eine quadratische oder 4:5-Option gibt es nicht — croppen Sie also in der Post, wenn Sie eine brauchen.
Ja — jeder Veo-Output ist mit SynthID markiert, Googles unmerklichem Herkunftsmarker, und lässt sich über ihre Plattform verifizieren. Kein Anbieter stellt einen Parameter bereit, um das abzuschalten.
Wir kalkulieren rund vier Minuten pro Job. Google nennt ein Minimum von 11 Sekunden und zu Spitzenzeiten ein Maximum von 6 Minuten — nutzen Sie für Massenläufe also einen Webhook statt einer engen Polling-Schleife.