Loading...
Loading...
Googles Videomodellfamilie, die Clips aus Text-Prompts oder Referenzbildern erzeugt – ausgelegt auf schnelle Ergebnisse.
0/7 Elemente
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.
Omni Flash ist Googles gemini-omni-flash-preview — ein Videomodell aus der Gemini-Familie, kein Veo — und DeepMinds eigener Pitch dafür ist ein einziger Satz: „Stellen Sie sich Gemini Omni wie Nano Banana vor, nur für Video.“ Wir betreiben seine Reference-to-Video-Capability als google/omni-flash/reference-to-video und berechnen $0.10 für jede Sekunde fertiges 720p-Video. Der voreingestellte Clip von 8 Sekunden kostet damit $0.80, Audio inklusive.
Achten Sie auf die Einheit. Hier verkauft niemand einen Clip zum Pauschalpreis, jede Zahl, die Sie vergleichen, muss also mit der Länge multipliziert werden, die Sie rendern wollen.
Sie haben ein Skript, aber keine Bilder, die in die Aufnahme mitgenommen werden sollen? Dann ist Veo 3.1 Fast text-to-video der Endpoint, den Sie wollen — er startet allein aus dem Prompt, und auf unserer Plattform kostet er dramatisch weniger. Wir kommen weiter unten darauf zurück, ehrlich.
Unsere Position gegenüber den anderen Stellen, an denen Sie dieses Modell aufrufen können, geprüft am 26. August 2026:
| API-Anbieter | Pro Sekunde (720p) | Clip von 8 Sekunden | vs. E2X |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | wir sind 23 % günstiger |
| Atlas Cloud | $0.135 | $1.08 | wir sind 26 % günstiger |
| Runware | $0.10 | $0.80 | gleichauf |
| Google Gemini API | $0.10 | $0.80 | gleichauf |
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Wir schönen das nicht: Bei diesem Modell ziehen wir mit Googles Preis gleich, statt ihn zu unterbieten, und die Ersparnis ist nur gegenüber fal.ai und Atlas real. Referenzbilder fallen kaum ins Gewicht — Google zählt ein Bild mit 2.040 Tokens, drei davon kosten also rund einen Cent. duration ist das Feld, das Ihre Rechnung bewegt.
Der Sinn dieses Endpoints ist Kontinuität. Geben Sie dem Modell ein Motiv — eine Person, ein Produkt, ein Set, einen Look —, beschreiben Sie eine Szene, in der es nie fotografiert wurde, und das Motiv übersteht die Reise.
Sie können mehrere Referenzen anhängen, nicht nur eine. Googles veröffentlichte Beispiele gehen bis sechs; ein offizielles Maximum ist nirgends dokumentiert, und die Zahlen von Dritten widersprechen einander, deshalb drucken wir keine. Bauen Sie für eine Handvoll und testen Sie Ihre eigene Obergrenze.
Audio wird mit dem Bild erzeugt, nicht nachträglich angeschraubt. Es sitzt synchron auf der Handlung, und Sie steuern es aus demselben Prompt — bitten Sie um Regen auf einem Blechdach und einen tiefen Raumton, und genau das kommt zurück. Es gibt keine separate Audiospur, die man hinterher bearbeiten könnte.
Zehn Sekunden sind die Decke. Unser duration-Enum bietet 4, 6, 8 und 10; Googles Modell läuft von 3 bis 10 Sekunden, und bei 10 ist Schluss. Kein Extension-Endpoint, keine Interpolation. Alles Längere ist ein Schnittjob in Ihrem eigenen Editor — und die Kontinuität zwischen den Schnitten wird Ihr Problem.
720p, 24 fps, und das ist die ganze Liste. Unser resolution-Feld führt die Werte 1080p und 4k, und Google kündigt höhere Auflösungen als demnächst verfügbar an, aber heute liefert das Modell 720p. Lassen Sie es auf dem Default. Eine Anbieterseite, die hier 1080p bewirbt, ist Googles eigener Dokumentation voraus.
Rechnen Sie mit rund 45 Sekunden Verarbeitung für einen Standardclip — ein gemessener p50 von eachlabs, keine offizielle Zahl, planen Sie also damit, statt sie zu versprechen.
Zwei Felder sind Pflicht: image_urls und prompt. Erzeugen Sie einen Key in Ihrem Dashboard, halten Sie ihn auf einem Server, den Sie kontrollieren, und schicken Sie dann den Job ab.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "Der Sneaker aus Bild 1 steht auf nassem Asphalt, während hinter ihm ein Bus losfährt. Langsame Fahrt nach vorn. Umgebungsverkehr und leichter Regen, keine Musik.",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
Die Response enthält eine Job-ID. Video braucht Minuten, pollen Sie also langsam — oder lassen Sie das Polling ganz weg und übergeben Sie eine webhookUrl im Submit-Body:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"Die Frau aus der Referenz geht über einen Nachtmarkt, Neonschilder spiegeln sich auf ihrer Jacke. Handkamera. Stimmengemurmel und entferntes Brutzeln.",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
Die Status laufen pending → processing → completed oder landen auf failed oder cancelled. Das aktuelle Schema und der aktuelle Preis stehen in der maschinenlesbaren Spezifikation, falls Sie sie lieber programmatisch lesen.
Der Vergleich, auf den es ankommt, und er schmeichelt dieser Seite nicht:
| Modell | Unser Preis (8 s, 720p, Audio) | Nehmen Sie es, wenn |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | Mehrere Referenzen konsistent bleiben müssen oder Sie einen Clip von 10 Sekunden brauchen |
| Veo 3.1 Fast reference-to-video | $0.12 | Bis zu drei Referenzen, 8 Sekunden, und Sie wollen die günstigere Rechnung |
| Veo 3.1 Fast image-to-video | $0.12 | Ein Standbild, das Sie animieren wollen |
| Veo 3.1 Fast text-to-video | $0.12 | Überhaupt kein Ausgangsmaterial |
Veo 3.1 Fast kostet auf unserer Plattform einen Bruchteil von Omni Flash, und es erreicht 1080p und 4K, was Omni Flash derzeit nicht kann. Zu Googles eigenem Listenpreis liegen beide bei denselben $0.10 pro Sekunde für 720p — erst unser Rabatt reißt die Lücke auf. Fangen Sie also mit Veo Fast an. Kommen Sie hierher zurück, wenn seine Grenze von drei Referenzen Sie blockiert, wenn Sie diese zwei zusätzlichen Sekunden brauchen oder wenn Sie das Videobearbeitungsverhalten hinter dem Etikett „Nano Banana für Video“ wollen. Weitere Optionen stehen in der Kategorie reference-to-video, und der komplette Modellkatalog passt auf eine Seite.
Public Preview heißt, dass die rauen Kanten dokumentiert statt versteckt sind. Lesen Sie das, bevor Sie bauen:
Schreiben Sie die Einstellung, nicht die Geschichte. Ein Motiv, eine Kamerabewegung, eine Lichtsituation — und dann sagen Sie, wie es klingt, denn das Audio kommt aus demselben Prompt, und Stille ist eine Entscheidung, die Sie laut treffen müssen.
Kennzeichnen Sie Ihre Anhänge, wenn mehr als einer hineingeht: „Bild 1 ist die Flasche, Bild 2 die Nahaufnahme des Etiketts.“ Nichts anderes sagt dem Modell, welche Referenz die Hauptrolle spielt. Halten Sie die Kamerasprache schlicht — „langsame Fahrt nach vorn“, „starre Einstellung“, „Handkamera folgt“ schlagen einen Absatz Kameratheorie.
Jeder Clip trägt ein SynthID-Watermark — für Zuschauer unsichtbar, programmatisch nachweisbar — und C2PA Content Credentials werden standardmäßig angehängt. Kein Anbieter, der dieses Modell betreibt, kann das abschalten, wir eingeschlossen. Wenn ein Kundenvertrag gekennzeichnete KI-Assets verbietet, klären Sie das, bevor Sie integrieren.
Legen Sie Ihre Ergebnisse im Completion-Handler auf Ihren eigenen Speicher um. Ergebnis-URLs sind keine dauerhaften Adressen, und ein Video, das Sie nicht mehr abrufen können, ist ein Video, das Sie zweimal bezahlen.
Es ist Googles gemini-omni-flash-preview, ein Modell zur Videogenerierung und -bearbeitung aus der Gemini-Familie statt aus der Veo-Familie. DeepMind beschreibt es als „Nano Banana, aber für Video“ — der Schwerpunkt liegt darauf, Referenzen konsistent mitzuführen und vorhandenes Material zu bearbeiten, während Veo auf kinematische Generierung von Grund auf zielt. Es befindet sich in der Public Preview.
$0.80. Wir berechnen $0.10 pro Sekunde 720p-Ausgabe, die Länge treibt also die Rechnung — ein Clip von 4 Sekunden kostet $0.40, das Maximum von 10 Sekunden $1.00. Das war unser Preis bei der Prüfung am 26. August 2026.
Mehr als eines, und Googles dokumentierte Beispiele gehen bis sechs — aber ein offizielles Maximum ist nicht veröffentlicht. Quellen außerhalb von Google nennen unterschiedliche Obergrenzen und widersprechen einander, deshalb wiederholen wir keine Zahl, die wir nicht überprüfen können. Testen Sie Ihre eigenen Payloads, bevor Sie um eine bestimmte Anzahl herum entwerfen.
Heute nicht. Es gibt 720p bei 24 fps aus, und Google kündigt höhere Auflösungen als demnächst verfügbar an. Wenn Sie jetzt 1080p oder 4K brauchen, erreicht Veo 3.1 Fast beides.
Veo 3.1 Fast, für die meisten Aufgaben. Ein Clip von 8 Sekunden mit Audio kostet auf unserer Plattform dort $0.12 gegenüber $0.80 hier, und es geht bis 4K. Nehmen Sie Omni Flash, wenn Sie mehr als drei Referenzbilder, eine Dauer von 10 Sekunden oder sein Videobearbeitungsverhalten brauchen.
Ja, nativ und synchron zur Handlung auf dem Bild. Sie führen ihn aus demselben Prompt — nennen Sie die Atmo, die Effekte, oder bitten Sie um Musik. Audio lässt sich über die API nachträglich nicht bearbeiten, eine Änderung bedeutet also ein neues Rendering.
Ja. Jede Ausgabe trägt ein SynthID-Watermark, das Zuschauer nicht sehen, Erkennungswerkzeuge aber auslesen können, plus C2PA Content Credentials, die standardmäßig aktiv sind. Kein Anbieter stellt einen Parameter bereit, um eines von beiden abzuschalten.
Nur außerhalb des EWR, der Schweiz und des Vereinigten Königreichs — Google schränkt das Bearbeiten hochgeladener Videos in diesen Regionen ein. Die Reference-to-Video-Generierung selbst ist davon nicht betroffen. Beachten Sie außerdem, dass Video-Referenzen vom Schema zwar akzeptiert, aber nicht korrekt verarbeitet werden — senden Sie also Bilder.