Loading...
Loading...
Animate a still image into video with Gemini Omni 1.1 Flash. The source image becomes the first frame and drives the generated motion.
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/image-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.
Gemini Omni 1.1 Flash ist bei Google am 27. August 2026 allgemein verfügbar geworden. Es gehört zur Gemini-Familie, nicht zu Veo, und wir stellen seine Image-to-Video-Capability als google/omni-1.1-flash/image-to-video bereit. Wir rechnen pro Sekunde fertiges Video ab — $0.09 pro Sekunde bei 720p, gegenüber einem Listenpreis von $0.15, denn ein dauerhafter Rabatt von 40 % gilt für alle vier Capabilities. Der voreingestellte Clip von acht Sekunden kostet $0.72. Pflichtfelder: prompt und image_url.
Machen Sie sich vor dem ersten Aufruf klar, was das Standbild ist. Es ist ein Vertrag. Es setzt Bild eins fest und damit den Bildausschnitt, die Brennweite, die Farbwelt, das Motiv und jeden Fehler, der schon drinsteckt. Ihr Prompt bekommt die nächsten paar Sekunden, nichts davor.
Fast jedes langweilige Ergebnis geht hier auf denselben Fehler zurück: einen Prompt, der die Fotografie beschreibt statt die Veränderung. Benennen Sie, was sich bewegt. Benennen Sie, wohin die Kamera geht.
| Cliplänge | Preis bei 720p |
|---|---|
| 4 s | $0.36 |
| 6 s | $0.54 |
| 8 s (Standard) | $0.72 |
| 10 s | $0.90 |
Die Auflösung skaliert diesen Satz: 360p sind 0,4× ($0.0297 pro Sekunde), 1080p 1,5× ($0.135), 4K 2× ($0.18). Ein Durchlauf von vier Sekunden bei 360p kostet $0.1188 — der billigste Weg herauszufinden, ob sich Ihr Standbild überhaupt bewegen lässt.
Zwei Bilder und die Mitte dem Modell überlassen? Omni 1.1 Flash start-end-frame-to-video. Ein Motiv aus mehreren Winkeln, stabil über eine ganze Shotlist? Omni 1.1 Flash reference-to-video. Überhaupt kein Ausgangsmaterial? Omni 1.1 Flash text-to-video führt die vollständige Preisargumentation.
Behandeln Sie den Job als Fortsetzung, nicht als Interpretation. Das Modell nimmt Ihr Standbild als Bild eins an und erfindet danach vierundzwanzig plausible Bilder pro Sekunde, alle verankert in dem, was Sie übergeben haben. Diese Verankerung ist der Wert: Ein freigegebenes Key Visual bleibt markenkonform, weil es niemand neu gewürfelt hat.
Sie ist zugleich die Einschränkung. Ein überladenes Bild gibt dem Modell mehr Objekte, die es kohärent halten muss, während sich alles verschiebt, und Kohärenz ist die Schwachstelle dieser Generation. Googles Model Card sagt es selbst: „Vollständige Konsistenz über alle Bearbeitungen hinweg zu wahren, Szenen mit komplexer Bewegung zu erzeugen oder Text perfekt akkurat wiederzugeben, bleibt eine Herausforderung.“ Schilder verschmieren. In Menschenmengen kochen die Gesichter. Ein Motiv vor sauberem Hintergrund übersteht zehn Sekunden besser als Unordnung vier.
Beschneiden Sie selbst auf das Zielformat. Die Ausgabe kommt in 16:9 oder 9:16 — kein Quadrat, kein 4:5, kein Ultrawide. Schieben Sie ein Hochformat in 4:5 in einen 16:9-Job, gibt irgendetwas nach: Das Modell füllt die Seiten mit Material, das nie jemand fotografiert hat, oder die Komposition verrutscht, bis sie passt. Bezahlen tun Sie so oder so $0.09 pro Sekunde. Schneiden Sie zuerst zu, solange die Entscheidung nichts kostet.
Skalieren Sie sich nicht nach 4K hinauf. Die Auflösung der Quelle begrenzt, wie viel die Ausgabe ehrlich tragen kann. Ein 640 Pixel breites Thumbnail, in 1080p gerendert, ist eine größere Datei mit demselben Detail, zum 1,5-fachen Satz.
Lassen Sie der Bewegung Platz. Luft über dem Kopf des Motivs, Straße vor dem Auto. Schneiden Sie eng zu, und nichts kann sich bewegen, ohne aus dem Bild geschoben zu werden — ein häufiger Grund, warum ein Clip wie eine wackelnde Fotografie wirkt.
Erzeugen Sie einen Key im Dashboard und halten Sie ihn serverseitig. Unsere Pipeline holt image_url selbst ab, die Adresse muss also über das öffentliche Internet erreichbar sein — eine HTTPS-Adresse auf Ihrem CDN oder Object Store, niemals ein lokaler Pfad, localhost oder eine URL hinter einem Login. Signierte URLs gehen in Ordnung, solange das Zeitfenster großzügig ist: Ein Job läuft rund vier Minuten, ein Link mit sechzig Sekunden Gültigkeit stirbt vorher.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/image-to-video",
"input": {
"prompt": "Dampf beginnt aus der Kesseltülle zu kräuseln und zieht nach rechts. Die Kamera fährt langsam auf den Griff zu. Küchensummen, ein Kessel, der zu ticken beginnt. Nichts anderes im Bild bewegt sich.",
"image_url": "https://cdn.example.com/stills/copper-kettle-16x9.jpg",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8"
}
}'
Zurück kommt eine Job-ID. Pollen Sie sie entweder, oder übergeben Sie uns eine webhookUrl und sparen Sie sich die Schleife:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const start = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/image-to-video",
input: {
prompt:
"Sie dreht sich zur Kamera und der Schal hebt sich im Wind. Starre Einstellung. Möwen, ferne Brandung.",
image_url: "https://cdn.example.com/stills/portrait-9x16.png",
aspect_ratio: "9:16",
resolution: "360p",
duration: "10",
},
}),
}).then((r) => r.json());
const { jobId } = start.data;
for (let tick = 0; tick < 360; tick++) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
await archive(job.data.outputs[0].url); // an einen dauerhaften Ort kopieren
break;
}
if (["failed", "cancelled"].includes(job.data.status)) {
throw new Error(job.data.error?.message ?? job.data.status);
}
await new Promise((r) => setTimeout(r, 5000));
}
Ein Job meldet pending, dann processing, dann completed, failed oder cancelled. Zwei Schema-Details beißen regelmäßig: duration und resolution sind Strings, senden Sie also "10" statt 10; und einen Audio-Schalter gibt es nicht, weil der Ton zusammen mit dem Bild erzeugt und aus Ihrem Prompt gesteuert wird. Die Felddefinitionen bleiben in der maschinenlesbaren Spezifikation aktuell.
Schreiben Sie nur, was sich ändert. Motiv, Licht und Komposition kamen mit der Datei; sie zu wiederholen verbraucht Aufmerksamkeit, die das Modell in Bewegung stecken könnte. Nennen Sie keine Bewegung, bekommen Sie ein beinahe stehendes Bild mit leichtem Drift, zum vollen Satz.
Eine Bewegung, benannt. Dampf steigt auf. Eine Tür schwingt nach innen. Haare heben sich. Wählen Sie die Aktion, auf die es ankommt, und lassen Sie den Rest stillstehen — das laut zu sagen hilft mehr, als es klingt.
Eine Kameraanweisung. „Langsame Fahrt heran“, „starre Einstellung“, „Handkamera driftet nach links“. Schlichte Grammatik schlägt einen Absatz Kameratheorie, und eine ungenannte Kamera wird zur Entscheidung des Modells.
Der Ton darunter. Raumton, Verkehr, ein konkreter Effekt. Stille ist nicht der Standard; eine unbestimmte Mischung wird für Sie erfunden. Prompts dürfen 50.000 Zeichen lang sein, die Länge ist also nie die Grenze — die Präzision ist es. Unser Gemini-Omni-Prompting-Guide geht bei der Formulierung tiefer.
Hören Sie es lieber von uns als von einer Rechnung. Veo 3.1 Fast image-to-video läuft auf derselben Plattform für $0.01 pro Sekunde — neunmal unter dem Endpoint auf dieser Seite.
| Endpoint | Clip von 8 Sekunden | Greifen Sie zu, wenn |
|---|---|---|
| Veo 3.1 Fast image-to-video | $0.08 | Ein Standbild, ein Clip, und nichts hängt davon ab |
| Omni 1.1 Flash image-to-video | $0.72 | Sie zehn Sekunden brauchen, einen 360p-Draft-Durchlauf, oder diese Aufnahme neben anderen stehen soll |
| Veo 3.1 Fast text-to-video | $0.08 | Das Standbild keine $0.64 an Arbeit leistet |
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Nehmen Sie das ernst. Eine Fotografie, einmal animiert, gehört zu Veo. Der Aufpreis hier zahlt sich in drei Fällen aus: Ihr Schnitt braucht zehn Sekunden und Veo hört bei acht auf; Sie wollen zu $0.0297 pro Sekunde entwerfen; oder dieser Clip muss zu einem Set gehören. Weitere Wege, ein Standbild zu animieren, stehen in der Kategorie image-to-video, daneben unser Modellkatalog.
Die Ausgabe läuft mit 24 fps, drei bis zehn Sekunden pro Generierung, mit einem SynthID-Watermark in jedem Einzelbild, das niemand in der Kette abschalten kann. Ergebnis-URLs sind vorübergehend — archivieren Sie die Datei in Ihrem Completion-Handler. Ein Link, den Sie morgen nicht mehr abrufen können, ist ein Render, den Sie zweimal bezahlen.
Eine Regel gilt speziell, weil Sie eine Fotografie hochladen: Im EWR, in der Schweiz und im Vereinigten Königreich blockiert Google Ausgangsbilder, die Minderjährige zeigen, und teils auch erkennbare Personen. Englisch ist außerdem die einzige Promptsprache, die Google evaluiert hat. Unsere Release Notes zu Gemini Omni 1.1 Flash beschreiben, was sich sonst noch gegenüber dem Vorgänger geändert hat, den wir weiter betreiben und der upstream am 30. September 2026 abgekündigt wird.
Neun Cent kaufen eine Sekunde bei 720p. Der voreingestellte Clip läuft acht Sekunden, macht $0.72; zehn Sekunden, die Obergrenze, kommen auf $0.90. Dieser Satz sind 40 % Rabatt auf einen Listenpreis von $0.15, am 28. August 2026 aus unserem Live-Katalog gelesen. Die Auflösung verschiebt den Multiplikator — 0,4× bei 360p, 1,5× bei 1080p, 2× bei 4K.
Veo, für die meisten Einzelbilder — $0.01 pro Sekunde gegen $0.09, oder $0.08 gegen $0.72 auf acht Sekunden. Kommen Sie zurück, wenn Sie zehn Sekunden brauchen, wenn ein 360p-Draft-Durchlauf unterm Strich Geld spart, oder wenn der Clip zu anderen aus demselben Motiv passen muss.
Nur 16:9 und 9:16. Schneiden Sie Ihre Quelle vor dem Absenden auf das Zielverhältnis zu; sonst löst das Modell den Widerspruch selbst auf, und Sie verlieren womöglich einen Teil der Komposition, die Sie freigegeben haben.
Überall dort, wo unsere Pipeline es über öffentliches HTTPS erreicht — ein CDN, ein S3- oder GCS-Bucket, Ihr eigener Webserver. Lokale Pfade, localhost und alles hinter einer Authentifizierung scheitern. Signierte URLs funktionieren, wenn ihre Gültigkeit die vier Minuten eines Jobs bequem überdauert.
Meistens, weil der Prompt das Bild noch einmal beschreibt, statt es zu inszenieren. Das Standbild hat Motiv und Bildausschnitt bereits festgelegt; ohne genannte Bewegung und ohne Kamerafahrt hat das Modell nichts, woran es ansetzen kann. Schreiben Sie ihn um: eine Bewegung plus eine Kameraanweisung.
Ja, nativ zusammen mit dem Bild erzeugt und darauf synchronisiert. Es gibt kein has_sound-Feld und keinen stummen Modus, beschreiben Sie die Atmo also im Prompt. Audio lässt sich nachträglich nicht bearbeiten — eine Änderung bedeutet eine neue Generierung.
Ja. Google blockiert Ausgangsbilder, die Minderjährige zeigen, sowie bestimmte erkennbare Personen, für Nutzer im EWR, in der Schweiz und im Vereinigten Königreich — Googles Richtlinie, durchgesetzt bei jedem Anbieter. Ausgaben tragen zudem ein unsichtbares SynthID-Watermark, planen Sie also mit gekennzeichneten KI-Assets.