Loading...
Loading...
Gemini Omni 1.1 Flash generates video from a text prompt, a single image, a start and end frame, or up to seven reference images. Clips run 4 to 10 seconds at resolutions from 360p to 4K.
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.
Gemini Omni 1.1 Flash ist bei Google am 27. August 2026 allgemein verfügbar geworden — ein Modell aus der Gemini-Familie, kein Veo. Wir betreiben seine Prompt-only-Capability als google/omni-1.1-flash/text-to-video und rechnen pro Sekunde Ausgabe ab: $0.09 bei 720p, ausgehend von einem Listenpreis von $0.15 nach dauerhaften 40 % Rabatt. Die voreingestellten acht Sekunden kosten $0.72. Ein prompt ist die gesamte Payload.
Eine Zahl ist hier gestiegen. Der Vorgänger, Gemini Omni Flash Text-to-Video, rechnet auf dieser Plattform $0.0825 pro Sekunde ab; diese Seite rechnet $0.09 ab. Neun Prozent mehr, und Sie sollten das hier lesen statt es aus einer Rechnung abzuleiten. Die neun Prozent kaufen keine bessere Sekunde Video. Sie kaufen eine Entwurfsstufe zu $0.0297, für die das ältere Modell gar kein Auflösungs-Enum hat, Clips bis zehn Sekunden und zwei Capabilities, die der Vorgänger auf E2X nie ausgeliefert hat. Unsere Notizen zum 1.1-Release gehen den Rest durch.
Jetzt der Satz, der gegen unsere eigene Rechnung spricht. Veo 3.1 Fast text-to-video liegt auf dieser Plattform bei $0.01 pro Sekunde — ein Neuntel des Preises dieser Seite. Ein einzelner Clip, aus einem Satz, und nichts hängt davon ab? Dann gehen Sie dorthin. Der Aufpreis hier kauft zehn Sekunden, 4K, einen billigen Draft-Modus und Aufnahmen, die zusammengehören. Kaufen Sie nichts davon, haben Sie nichts gekauft.
Anderes Material, anderer Endpoint: Ein Standbild, das Bild eins wird, gehört zu image-to-video, zwei Enden mit einer Lücke dazwischen zu start-end-frame-to-video, ein wiederkehrendes Gesicht zu reference-to-video.
Jede Zahl unten wurde am 28. August 2026 auf der Version-1.1-Seite des jeweiligen Anbieters gelesen:
| Wo Sie es aufrufen | 720p, pro Sekunde | Acht Sekunden | Gegenüber unserem Satz |
|---|---|---|---|
| E2X | $0.09 | $0.72 | — |
| fal.ai | $0.10 | $0.80 | wir sind 10 % günstiger |
| Runware | $0.10 | $0.80 | wir sind 10 % günstiger |
| Google Gemini API | $0.1014 | $0.81 | wir sind 11 % günstiger |
| Wavespeed AI | $0.13 | $1.04 | wir sind 31 % günstiger |
Googles Zeile ist seine eigene Rechenaufgabe, veröffentlicht auf seiner eigenen Preisseite: $17.50 pro einer Million Output-Tokens, 5.792 Tokens in einer Sekunde 720p, $0.1014 — weshalb die dortige Fußnote bei „ungefähr $0.10 pro Sekunde“ landet. Jede Zeile schließt Ton ein, der Vergleich ist also gleich zu gleich. Dieses Modell hat überhaupt keinen Audio-Schalter: Dialoge und Raumton entstehen zusammen mit dem Bild, und niemand auf dieser Liste berechnet sie separat. Google veröffentlicht denselben Satz für jede Auflösung als Tokenzahl: 1.931 Tokens pro Sekunde bei 360p, 5.792 bei 720p, 8.688 bei 1080p, 17.376 bei 4K — Ton in allen vier inbegriffen. Die Staffel unten vergleicht also durchgehend Gleiches mit Gleichem.
Prüfen Sie uns nach, aber lesen Sie zuerst den Versionsstring. fal.ai führt zwei Listings: eine versionslose Seite google/gemini-omni-flash, die die älteren Preview-Weights bei knapp $0.125 pro Sekunde ansetzt, und eine v1.1-Seite zu $0.10. Unsere ist v1.1. Bei Wavespeed gilt die umgekehrte Vorsicht — $0.13 ist allein für die Text-to-Video-Variante bestätigt, seine übrigen Zahlen bleiben deshalb draußen.
Der 720p-Satz ist nicht die interessante Hälfte. Diese hier ist es:
| Auflösung | E2X | fal.ai | Runware | Wavespeed | |
|---|---|---|---|---|---|
| 360p | $0.0297 | $0.0338 | $0.03 | $0.036 | $0.039 |
| 720p | $0.09 | $0.1014 | $0.10 | $0.10 | $0.13 |
| 1080p | $0.135 | $0.1520 | $0.15 | $0.16 | $0.195 |
| 4K | $0.18 | $0.3041 | $0.30 | $0.32 | $0.39 |
Unser Multiplikator von 720p auf 4K ist 2×. Googles ist exakt 3× — seine eigenen Tokenzahlen gehen von 5.792 auf 17.376 —, und die Reseller folgen Google. Unten haben beide Staffeln dieselbe Form — auf beiden Seiten 0,33× hinunter zu 360p — und nach oben laufen sie auseinander: Bei 4K hat Google seinen 720p-Satz verdreifacht, wir den unseren verdoppelt. Deshalb liegen wir auf allen vier Stufen unter Google: zwölf Prozent bei 360p, elf Prozent bei 720p und bei 1080p und einundvierzig Prozent bei 4K. Auch Runware lohnt einen Blick: bei 720p gleichauf mit Google, dann $0.16 bei 1080p und $0.32 bei 4K — in beiden Fällen über Googles eigenem Satz. Ein Hinweis, falls Sie nachprüfen: Googles Ankündigungstabelle rundet diese Werte auf $0.03, $0.10, $0.15 und $0.30. Die Zahlen oben stammen aus seinen eigenen Tokenzahlen je Auflösung — und danach wird die Rechnung gestellt.
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Nicht die einzelne Generierung leert das Konto, sondern die Wiederholung: Versuch sieben kostet genau das, was Versuch eins gekostet hat.
Vier Sekunden bei 360p kosten $0.1188, dieselben vier bei 720p $0.36. Sechs billige Drafts plus ein Render in der Voreinstellung kommen auf $1.07, gegenüber $2.52 für sieben Durchläufe zum vollen Preis. Google gibt außerdem an, dass 360p bis zu 60 % schneller zurückkommt.
| Dauer | 360p-Draft | 720p-Treffer |
|---|---|---|
| 4 s | $0.1188 | $0.36 |
| 6 s | $0.1782 | $0.54 |
| 8 s (Standard) | $0.2376 | $0.72 |
| 10 s | $0.297 | $0.90 |
Zehn Sekunden 4K kosten bei $0.18 pro Sekunde $1.80 — die höchste Einzelrechnung auf dieser Seite.
Erzeugen Sie einen Key, halten Sie ihn serverseitig, schicken Sie den Job ab. Pflicht ist nur prompt.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/text-to-video",
"input": {
"prompt": "Eine Schweißerin klappt ihre Maske herunter, Funken werfen blaues Licht über gestapelten Stahl. Langsame Fahrt nach links. Knistern des Lichtbogens, ein Ventilator außerhalb des Bildes.",
"resolution": "360p",
"duration": "6",
"seed": 20260828
}
}'
Das ist ein Draft-Durchlauf: sechs Sekunden bei 360p, $0.1782. Stellen Sie resolution auf 720p und derselbe Clip kostet $0.54.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/text-to-video",
input: { prompt: "Regen hämmert nachts auf ein Bushäuschen.", duration: "4" },
}),
}).then((r) => r.json());
for (let attempt = 0; attempt < 360; attempt++) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
const { status } = job.data;
if (status === "completed") { await archive(job.data.outputs[0].url); break; }
if (status === "failed" || status === "cancelled") throw new Error(status);
await new Promise((r) => setTimeout(r, 5000));
}
Rechnen Sie mit vier Minuten pro Job, oder übergeben Sie stattdessen eine webhookUrl. Zwei Fallen: duration und resolution reisen als Strings, "10" und nicht 10; und die zurückgegebene URL läuft ab, kopieren Sie die Datei also beim Auslesen an einen dauerhaften Ort. Jedes Feld steht in der maschinenlesbaren Spezifikation.
Das Günstigste zuerst:
| Modell | 8 s bei 720p | Nehmen Sie es, wenn |
|---|---|---|
| Veo 3.1 Fast text-to-video | $0.08 | Ein Clip, der für sich allein steht |
| Omni 1.1 Flash text-to-video | $0.72 | Zehn Sekunden, 4K oder eine 360p-Draft-Schleife |
| Omni 1.1 Flash start-end-frame | $0.72 | Beide Enden existieren bereits |
| Omni 1.1 Flash reference-to-video | $0.72 | Ein Motiv wiederholt sich über mehrere Clips |
| Omni Flash text-to-video | $0.66 | Nie; Google stellt es am 30. September 2026 ein |
Lesen Sie Zeile eins gegen Zeile zwei. Der neunfache Preis ist viel für einen Clip, den niemand gegen irgendetwas schneiden wird; Kontinuität ist das, was der Aufpreis kauft. Alles Übrige, was aus einem Prompt Filmmaterial macht, steht unter text-to-video, und jedes Modell, das wir betreiben passt auf eine Seite.
Die Ausgabe liegt fest: 24 fps, drei bis zehn Sekunden, 16:9 oder 9:16. Diese Zehn zählt, denn Veo hört bei acht auf. Die Model Card nennt drei Fehlermodi:
„Vollständige Konsistenz über alle Bearbeitungen hinweg zu wahren, Szenen mit komplexer Bewegung zu erzeugen oder Text perfekt akkurat wiederzugeben, bleibt eine Herausforderung.“
Text im Bild erwischt viele: Bitten Sie um ein Ladenschild und rechnen Sie mit Buchstabenformen, die bei genauem Hinsehen zerfallen. Menschenmengen, Wasser und Hände sind die Bewegungsfälle.
SynthID markiert jedes Einzelbild unsichtbar, und niemand bekommt es wieder heraus. Englisch ist die einzige Promptsprache, die Google evaluiert hat; Vertex AI hat Google am 22. April 2026 in die Gemini Enterprise Agent Platform überführt, und dort ist das Modell für Unternehmenskunden gelistet.
Das Modell hat Ihre Worte und einen Seed; was Sie ungesagt lassen, wird zu seiner Entscheidung. Beschreiben Sie eine Einstellung, nie eine Sequenz — drei Beats in acht Sekunden bringen Ihnen einen schlechten Schnitt oder Matsch.
Legen Sie die Kamera fest. „Starre Totale“, „langsame Fahrt nach links“, „Handkamera folgt“. Eine ungenannte Kamera driftet.
Legen Sie das Licht fest. Natriumdampflampe, bedeckter Nachmittag, eine einzelne Praktikable. Licht trennt ein bewusst gesetztes Bild vom bloßen Render.
Legen Sie den Ton fest. Sie bezahlen das Audio, ob Sie es eingeplant haben oder nicht, nennen Sie also die Atmo und jede gesprochene Zeile — sonst erfindet das Modell ein Klangbett, das gegen Ihren Schnitt arbeitet.
Halten Sie dann den Seed fest und ändern Sie jeweils nur einen Satzteil. Unser Gemini-Omni-Prompting-Guide geht weiter ins Detail.
$0.09 pro Sekunde 720p-Ausgabe — $0.72 für die voreingestellten acht Sekunden, $0.90 an der Obergrenze von zehn Sekunden. Das sind 40 % Rabatt auf einen Listenpreis von $0.15, geprüft am 28. August 2026. Weitere Stufen: $0.0297 bei 360p, $0.135 bei 1080p, $0.18 bei 4K, Audio inklusive.
Auf allen vier Stufen. Google rechnet Video in Output-Tokens ab — $17.50 pro einer Million, bei 1.931 Tokens pro Sekunde für 360p, 5.792 für 720p, 8.688 für 1080p und 17.376 für 4K —, was $0.0338, $0.1014, $0.1520 und $0.3041 pro Sekunde ergibt, Ton inbegriffen. Die Ankündigungstabelle rundet das auf $0.03, $0.10, $0.15 und $0.30; abgerechnet wird nach den ungerundeten Werten. Dagegen sind wir bei 360p rund zwölf Prozent günstiger, bei 720p und 1080p elf Prozent und bei 4K einundvierzig Prozent günstiger. Beide Staffeln nehmen denselben 0,33×-Schritt hinunter zu 360p; der Unterschied liegt oben, wo Google seinen 720p-Satz verdreifacht und wir unseren verdoppeln.
Nein — es kostet mehr. Omni Flash Text-to-Video läuft hier für $0.0825 pro Sekunde gegen $0.09 auf dieser Seite, acht Sekunden kosten dort also $0.66 und hier $0.72. Neun Prozent Unterschied. Das ältere Modell hat keine 360p-Stufe und hat auf E2X weder Image-to-Video noch Start-End-Frame-to-Video ausgeliefert; dorthin geht die Differenz. Der direkte Aufruf bei Google ist eine eigene Frage: Sein veröffentlichter Satz ergibt $0.1014 pro Sekunde bei 720p, also liegen diese Seite und die ältere beide darunter. Der Abstand kommt nicht daher, dass das Produkt teurer wäre: Alle drei stehen auf derselben Liste von $0.15, verschieden ist nur der dauerhafte Rabatt — 40 % hier gegen 45 % und 50 % auf den älteren Seiten.
Veo 3.1 Fast, fast immer — $0.01 pro Sekunde über dieselbe API, acht Sekunden kosten dort also $0.08 statt $0.72. Kommen Sie zurück, wenn der Clip zehn Sekunden erreichen muss, 4K braucht oder zu anderem Material passen soll.
Fürs Iterieren. Vier Sekunden bei 360p kosten $0.1188 gegenüber $0.36 bei 720p, Entwürfe kosten also einen Bruchteil der Treffer, und Sie können es sich leisten, öfter danebenzuliegen. Google berichtet außerdem, dass 360p bis zu 60 % schneller läuft.
Drei bis zehn Sekunden, bei 24 fps. Das duration-Enum bietet 4, 6, 8 und 10, jeweils als String. Längere Stücke entstehen aus mehreren Aufrufen — genau dafür gibt es die Kontinuitätsfunktionen von 1.1.
Ja, in jeder Zeile jedes Vergleichs auf dieser Seite. Es gibt überhaupt keinen Audio-Schalter — Dialoge und Atmosphäre entstehen zusammen mit dem Bild, und kein Anbieter auf dieser Liste bepreist sie separat.
Meistens, weil es ein anderes Modell ist. Das versionslose Listing google/gemini-omni-flash bei fal.ai bepreist die abgekündigten Preview-Weights mit knapp $0.125 pro Sekunde; die v1.1-Seite nennt $0.10, und unsere Tabelle nutzt v1.1. Prüfen Sie zuerst Version und Datum.