Zurück zu Modellen

Veo 3.1 Fast

Schnellere, günstigere Veo-3.1-Stufe für Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und Übergänge zwischen Start- und Endbild.

Preiseab $0.01/Anfrage
Latenz~240 Sekunden im Durchschnitt
Auflösung720P/1080P/4K
Am besten geeignet fürvideo, google, high-fidelity

Parameter

Geschätzte Kosten

Du sparst 90% bei diesem Modell
Grundkosten pro second$0.10
Rabatt-90%
Deine Gesamtsumme$0.01
Sie sparen $0.09 pro Anfrage

Anmelden, um Modelle auszuführen

Output Preview

Ready

No output yet

Run the model to see generated results.

API-Beispiel— Aktuelle Parameter

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/veo-3.1-fast/image-to-video',
  'input': {}
}
)

Auftrag abrufen— Auf Ergebnis warten

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Preisaufschlüsselung

Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.

Dauer
720P
1080P
4K
4
$0.40
$0.40
$0.60
6
$0.60
$0.60
$0.90
8
$0.80
$0.80
$1.20
Alternativen entdecken

Ähnliche Modelle

Weitere KI-Modelle für Bild zu Video entdecken

Alle Modelle ansehen

Veo 3.1 Fast Image-to-Video API auf E2X

Geben Sie diesem Endpoint ein Standbild und es wird zum ersten Frame einer bewegten, vertonten Einstellung. Wir betreiben Googles Veo 3.1 Fast als google/veo-3.1-fast/image-to-video und wir rechnen pro Sekunde Output ab: $0.01 pro Sekunde, ×1.5 bei aktiver Tonspur. Ein 8-Sekunden-Clip in 720p mit Ton kostet also $0.12 — ein Bild plus ein Prompt, ohne Referenz-Jonglage.

Kein Startbild zur Hand? Dann ist Veo 3.1 Fast text-to-video Ihr Endpoint — dasselbe Modell, derselbe Preis, nur ein Prompt, und Sie dürfen auf 4 oder 6 Sekunden heruntergehen. Haben Sie dagegen mehrere Bilder und geht es darum, eine Figur über mehrere Shots hinweg konsistent zu halten, gehen Sie zu Veo 3.1 Fast reference-to-video.

Sekundenweise Abrechnung, und was das auf der Rechnung heißt

Niemand verkauft dieses Modell pro Video. Google, fal.ai, Replicate und wir messen den Output Sekunde für Sekunde, ein fairer Vergleich muss die Konfiguration also festnageln. Hier sind 8 Sekunden, 720p, Ton an, zuletzt geprüft am 26. August 2026:

API-AnbieterAbrechnungRate (720p, Ton an)8-Sekunden-Clipvs. uns
E2X (aktuell)pro Sekunde$0.01/s ×1.5 Ton$0.12—
Google Gemini APIpro Sekunde$0.10/s$0.806.7× unser Preis
fal.aipro Sekunde$0.15/s$1.2010× unser Preis
Replicatepro Sekunde$0.15/s$1.2010× unser Preis
E2X Listenpreis (vor Rabatt)pro Sekunde$0.10/s ×1.5$1.20unsere Rate ohne Rabatt

Bleiben Sie kurz bei der untersten Zeile. Unser nicht rabattierter Listenpreis liegt bei $1.20 für einen 8-Sekunden-Clip — exakt die Zahl, die fal.ai und Replicate verlangen. Die $0.12, die Sie heute zahlen, sind ein Zehntel davon, und immer noch 6.7× unter Googles eigener API.

Die Auflösung schlägt je nach Einkaufsort unterschiedlich auf die Rechnung durch. Der Schritt von 720p auf 1080p kostet bei fal.ai und Replicate nichts extra; Google verlangt eine höhere Rate pro Sekunde. Auch wir behandeln die Auflösung als Multiplikator — lesen Sie den aktuellen Wert deshalb aus der llms.txt dieses Modells, bevor Sie einen 1080p-Lauf planen.

Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.

Was das Modell mit Ihrem Frame anstellt

Ihr Bild verankert Frame eins. Alles danach wird generiert — halten Sie dieses Bild im Kopf, denn es erklärt sowohl die Stärke als auch den Fehlermodus.

Die Stärke: Bildaufbau, Farbpalette, Garderobe und Set sind bereits entschieden. Sie wetten nicht darauf, dass Prosa ein Produktbild reproduziert, das der Kunde längst abgenommen hat. Standbild rein, Bewegung beschreiben, Clip raus, der exakt dort beginnt, wo das Standbild stand.

Der Fehlermodus: Je weiter sich der Clip von diesem Frame entfernt, desto mehr improvisiert er. Verlangen Sie einen 180°-Orbit in acht Sekunden, und die abgewandte Seite des Motivs ist frei erfunden. Verlangen Sie eine langsame Push-in-Fahrt und eine Kopfdrehung, und es hält.

Der Ton kommt einfach mit. Google erzeugt ihn nativ und ihre API hat keinen Schalter, um ihn abzuschalten — Dialog in Sync, Schritte auf dem Auftritt, Raumton darunter. Ein Foto geht hinein; etwas mit Soundtrack kommt heraus.

Anforderungen an den Input, die wir durchsetzen

Googles Vorgaben für das Quellbild, im Klartext:

  • Unter 8 MB. Größere Dateien werden abgewiesen, bevor die Generierung überhaupt startet.
  • 720p oder höher. Skalieren Sie ein kleines Asset vorher hoch, nicht hinterher.
  • 16:9 oder 9:16. Quadratisch und 4:5 gehen nicht — vorher neu croppen.
  • Über HTTPS erreichbar. Wir holen image_url ab, wenn der Job läuft, nicht wenn Sie ihn einreichen.

Der letzte Punkt verursacht mehr Fehlschläge als alle übrigen zusammen: kurzlebige signierte Links laufen mitten in der Warteschlange ab.

API-Request: ein Bild, ein Prompt

Zwei Pflichtfelder hier: prompt und image_url.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/veo-3.1-fast/image-to-video",
    "input": {
      "prompt": "Der Barista schiebt die Tasse nach vorn und Dampf kräuselt sich hoch. Langsame Push-in-Fahrt auf die Crema. Zischen der Espressomaschine, leises Café-Gemurmel im Hintergrund.",
      "image_url": "https://example.com/counter-shot.jpg",
      "aspect_ratio": "16:9",
      "resolution": "720p",
      "duration": "8",
      "has_sound": "true"
    }
  }'

Sie bekommen eine Job-ID zurück. Pollen Sie sie, oder geben Sie uns einen Webhook:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/veo-3.1-fast/image-to-video",
    input: {
      prompt:
        "Sie schiebt die Sonnenbrille herunter und blickt nach links aus dem Bild. Der Saum hebt sich im Wind. Feststehende Kamera, Möwen und Brandung darunter.",
      image_url: "https://example.com/lookbook-03.jpg",
      aspect_ratio: "9:16",
      resolution: "720p",
      duration: "8",
      has_sound: "true",
      seed: 88117,
    },
  }),
}).then((r) => r.json());

const jobId = submitted.data.jobId;

while (true) {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") {
    console.log(job.data.outputs[0].url);
    break;
  }
  if (job.data.status === "failed") {
    throw new Error(job.data.error?.message || "Animation failed");
  }
  await new Promise((r) => setTimeout(r, 5000));
}

Jobs bewegen sich pending → processing → completed, oder bleiben bei failed / cancelled stehen. Schicken Sie eine webhookUrl, wenn Sie lieber nicht pollen. Wir planen mit ungefähr vier Minuten; Googles veröffentlichte Spanne reicht von 11 Sekunden im besten Fall bis 6 Minuten zu Spitzenzeiten.

Achten Sie auf die Typen: duration, resolution und has_sound sind Strings. "true", nicht true.

Den richtigen Veo 3.1 Fast Endpoint wählen

Drei Türen zu identischen Weights, zu identischem Sekundenpreis. Ihr Input entscheidet, welche:

Endpoint8s-Clip, 720p + TonNehmen Sie ihn, wenn
Veo 3.1 Fast image-to-video$0.12Ein abgenommenes Standbild zu Frame eins werden soll
Veo 3.1 Fast text-to-video$0.12Noch nichts existiert — und Sie eine 4s- oder 6s-Option wollen
Veo 3.1 Fast reference-to-video$0.12Bis zu drei Bilder ein wiederkehrendes Gesicht, Produkt oder einen Ort definieren müssen

Die ehrliche Trennlinie: Nehmen Sie diesen Endpoint, wenn das Standbild das Eröffnungsframe ist. Nehmen Sie reference-to-video, wenn Ihre Bilder stattdessen Orientierung geben — derselbe Darsteller über fünf Szenen — und akzeptieren Sie, dass Sie damit auf 8 Sekunden festgenagelt sind. Nur am Ausprobieren? Laden Sie gar nichts hoch: text-to-video mit 4 Sekunden kostet $0.06 und frisst sich schnell durch ein Storyboard. Den Rest finden Sie in der Kategorie image-to-video oder im gesamten Modellkatalog.

Beschreiben Sie die Bewegung, nicht das Bild

Der häufigste Fehler ist, das gerade hochgeladene Bild noch einmal zu beschreiben. Das Modell sieht es. Jedes Wort, das für „eine Frau im roten Mantel auf einem Steg“ draufgeht, fehlt bei dem, was als Nächstes passiert — und es lädt dazu ein, ein Frame neu zu interpretieren, das Sie bereits festgezurrt hatten.

Schreiben Sie stattdessen die Veränderung. Drei Gewohnheiten tragen den größten Teil der Qualität:

Geben Sie eine primäre Bewegung vor. Eine Kopfdrehung, eine Kamerafahrt nach vorn, eine sich öffnende Tür. Stapeln Sie vier Aktionen in acht Sekunden, und keine davon liest sich.

Sagen Sie, wo die Kamera steht und ob sie sich bewegt. „Feststehend“, „langsame Dolly-Fahrt hinein“, „Handheld-Drift nach rechts“. Schweigen an dieser Stelle erzeugt zielloses Schweben.

Vertonen Sie laut mit. Benennen Sie die Atmo und jede Dialogzeile in Anführungszeichen. Der Ton wird erzeugt, ob Sie ihn planen oder nicht — also planen Sie ihn.

Prompts auf Englisch werden vollständig unterstützt. Google hat für dieses Modell keine anderen Sprachen evaluiert, halten Sie die Anweisungen also auf Englisch, selbst wenn die gesprochene Zeile in einer anderen Sprache steht.

Bevor Sie ausliefern

Zwei Tage. Das ist Ihr Download-Fenster. Google bewahrt das generierte Video zwei Tage auf — im Wortlaut: Sie müssen Ihr Video innerhalb von 2 Tagen nach der Generierung herunterladen. Ziehen Sie outputs[0].url in Ihren eigenen Speicher, im selben Codepfad, der die URL liest. Der zurückgegebene Link ist temporär.

SynthID liegt auf jedem Frame. Google versieht jeden Veo-Output mit seinem unmerklichen Herkunftsmarker, der über ihre Plattform verifizierbar ist. Kein Anbieter kann ihn abschalten, wir eingeschlossen.

Personen in regulierten Regionen. In der EU, dem UK, der Schweiz und der MENA-Region ist personGeneration auf allow_adult gedeckelt.

Passen Sie das Aspect Ratio an die Quelle an. Ein 16:9-Standbild mit angefordertem 9:16 zwingt das Modell dazu, die Ränder zu erfinden.

Fragen, die uns gestellt werden

Was kostet Veo 3.1 Fast image-to-video auf E2X?

Wir berechnen $0.01 pro Sekunde generiertem Video, multipliziert mit 1.5, wenn Ton an ist. Damit kostet ein 8-Sekunden-Clip in 720p mit Ton $0.12. Höhere Auflösungen bringen ihren eigenen Multiplikator mit — prüfen Sie also die aktuelle Modellseite, bevor Sie einen 1080p- oder 4k-Batch budgetieren.

Welche Anforderungen gelten für das Eingabebild?

Unter 8 MB, mindestens 720p, und entweder 16:9 oder 9:16. Wir holen es von der image_url, die Sie angeben, der Link muss also noch auflösen, wenn der Job läuft — ablaufende signierte URLs sind hier der häufigste Fehlschlag.

Kann ich in einem einzigen Call mehr als ein Bild animieren?

Nicht an diesem Endpoint — er nimmt genau eine image_url. Sollen mehrere Bilder eine Generierung steuern, nutzen Sie reference-to-video, das ein Array von bis zu drei Bildern akzeptiert.

Enthält das generierte Video Ton?

Ja, und das ist ein Hauptgrund, zu diesem Modell zu greifen. Google erzeugt synchronisierten Dialog, Effekte und Atmo nativ, ohne Ausschalter in ihrer eigenen API. Unser Schema stellt has_sound bereit, per Default true, und trägt damit den ×1.5-Multiplikator.

Wie lang ist der generierte Clip?

Bis zu 8 Sekunden. Dieser Endpoint akzeptiert 4, 6 oder 8, aber Output in 1080p und 4k verlangt die vollen 8. Nichts in der Veo 3.1 Fast Familie geht in einem einzelnen Call über 8 Sekunden hinaus.

Liegt ein Watermark auf dem Output?

Jedes Veo-Video trägt SynthID, Googles unmerkliches Watermark für KI-Herkunft, und es lässt sich auf ihrer Verifizierungsplattform prüfen. Niemand bietet eine Möglichkeit, es abzuschalten.

Wie schnell läuft eine Generierung?

Planen Sie mit etwa vier Minuten pro Job. Googles offizielle Zahlen setzen den Boden bei 11 Sekunden und die Obergrenze zu Spitzenzeiten bei 6 Minuten — ein Webhook schlägt also eine Polling-Schleife, sobald Sie echtes Volumen fahren.