Loading...
Loading...
Generate video from up to seven reference images with Gemini Omni 1.1 Flash. The reference images carry character and style consistency into the result.
0/7 Elemente
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.
Eine Kampagne ist nie ein einzelner Clip. Sie ist eine Shotlist — elf Zeilen, in jeder Zeile dieselbe Kuriertasche, und kein Budget für den Nachmittag, an dem die Tasche ab Zeile sechs grau wird. Reference-to-Video sorgt dafür, dass die Tasche dieselbe Tasche bleibt. Wir betreiben es als google/omni-1.1-flash/reference-to-video und berechnen $0.09 pro Sekunde 720p-Ausgabe, der voreingestellte Clip von acht Sekunden kostet also $0.72, Audio inklusive.
Das Feld, das die Arbeit macht, ist image_urls — ein Array, in unserem Schema mit minItems: 1 und maxItems: 7. Diese Obergrenze ist der Grund, warum es diese Seite gibt. Sieben Plätze zeigen ein Motiv aus so vielen Winkeln, dass das Modell aufhört, die vorenthaltenen zu erfinden.
Anderes Material, andere Tür: Ein einzelnes Standbild geht zu Omni 1.1 Flash image-to-video, beide Enden einer Einstellung mit einer Lücke dazwischen zu start-end-frame-to-video, und ein Briefing ganz ohne Assets zu Omni 1.1 Flash text-to-video, wo die vollständige Preistabelle steht.
Unser Satz, am 28. August 2026 aus dem Live-Katalog gelesen:
| Cliplänge | Preis bei 720p |
|---|---|
| 4 Sekunden | $0.36 |
| 6 Sekunden | $0.54 |
| 8 Sekunden (Standard) | $0.72 |
| 10 Sekunden | $0.90 |
Der Listenpreis liegt bei $0.15 pro Sekunde; ein dauerhafter Rabatt von 40 % bringt ihn auf $0.09. Die Auflösung skaliert von dort — $0.0297 bei 360p, $0.18 bei 4K, ein Rendering von zehn Sekunden in 4K kostet also $1.80. Und dann die Zahl, die entscheidet, wie Sie bauen: Ob Sie eine Referenz anhängen oder sieben, an allem oben ändert sich nichts. duration und resolution sind die ganze Formel. Referenzen sind Freigepäck.
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Die API holt jede URL im Array ab, sie müssen also dort liegen, wo unsere Worker sie über schlichtes HTTPS erreichen — ein öffentlicher Bucket, ein noch gültiger signierter Link, nichts hinter einem Login.
Sieben ist ein validiertes Maximum, keine Zeile auf einer Doku-Seite. Schicken Sie ein achtes Bild, und der Request wird abgelehnt, bevor eine GPU angefasst wird. Das klingt nach einer Grenze; behandeln Sie es als Budget. Ein Set, das alle sieben verdient, bringt Dreiviertelansicht, Profil, Rückseite, ein markentragendes Detail, eines in der Entfernung, in der der Clip es zeigen wird, und eines unter neutralem Licht. Doppelte Heldenwinkel verschwenden einen Platz. Winkel, die Sie vorenthalten, werden geraten.
Das ist die Verschiebung gegenüber der vorigen Generation. Unser Gemini Omni Flash Reference-to-Video-Endpoint fährt dieselbe Idee für $0.075 pro Sekunde, ganz ohne dokumentierte Obergrenze — Google hat nie eine veröffentlicht, also haben wir darauf verzichtet, eine Zahl zu drucken, für die wir nicht geradestehen können. Er ist der günstigere Endpoint, um zwanzig Prozent, und der Grund dafür ist sichtbar: kein validiertes Maximum von sieben Slots und keine 360p-Stufe, auf der sich ein Referenzsatz proben lässt, bevor Geld fließt. Google stellt dieses Modell am 30. September 2026 ein. Zeigt eine Pipeline noch dorthin, ist die Migration ein Slug-Tausch, kostet ein Fünftel mehr pro Sekunde und landet hier.
Bauen Sie das Array einmal. Legen Sie die sieben URLs neben Ihrer Shotlist ab und schicken Sie mit jedem Job genau dieses Array. Das Set ist die feste Größe, der Prompt die Variable.
Diese Umkehrung ist der Workflow. Weil die Referenzen das Motiv tragen, hört jeder Prompt auf zu beschreiben, wie das Ding aussieht, und beginnt zu beschreiben, was mit ihm geschieht — Kamera, was sich bewegt, das Licht, der Ton. Die Prompts werden kürzer und die Clips konsistenter, was nicht der Kompromiss ist, den die meisten erwarten. Pinnen Sie einen seed, wenn Sie zwei Formulierungen derselben Einstellung vergleichen, damit Sie erkennen, ob die Überarbeitung geholfen hat oder der Würfel.
Rechnen Sie mit 240 Sekunden pro Job und fächern Sie die Liste nebenläufig auf. Bleiben Sie dann kalibriert an dem, was Googles Model Card einräumt:
Vollständige Konsistenz über alle Bearbeitungen hinweg zu wahren, Szenen mit komplexer Bewegung zu erzeugen oder Text perfekt akkurat wiederzugeben, bleibt eine Herausforderung.
Sieben Referenzen verengen die Drift. Sie schaffen sie nicht ab.
Zwei Felder sind Pflicht: prompt und image_urls. Halten Sie Ihren Key serverseitig und schicken Sie den Job ab.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/reference-to-video",
"input": {
"prompt": "Bild 1 ist das gefaltete Fahrrad, Bild 2 das Scharnier, Bild 3 die Fahrerin. Kopfsteinpflaster-Innenhof bei Sonnenaufgang. Die Fahrerin klappt es auseinander und lässt den Rahmen einrasten. Starre Totale. Vogelgezwitscher, eine ferne Straßenbahn.",
"image_urls": [
"https://example.com/bike-folded.jpg",
"https://example.com/bike-hinge.jpg",
"https://example.com/rider.jpg"
],
"duration": "8",
"aspect_ratio": "16:9"
}
}'
Zurück kommt data.jobId. Renderings dauern Minuten, pollen Sie also langsam — oder übergeben Sie eine webhookUrl und lassen Sie das Polling weg.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
// Ein Array, von jedem Prompt wiederverwendet.
const image_urls = [
"https://example.com/fox-puppet-front.jpg",
"https://example.com/fox-puppet-muzzle.jpg",
"https://example.com/fox-puppet-profile.jpg",
];
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/reference-to-video",
input: {
prompt:
"Bild 1 ist die Fuchspuppe. Sie lehnt sich von links ins Bild und legt den Kopf schief. Langsame Fahrt heran. Papierrascheln, weicher Raumton.",
image_urls,
duration: "10",
aspect_ratio: "9:16",
resolution: "1080p",
seed: 70413,
},
}),
}).then((r) => r.json());
const { jobId } = submitted.data;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") { console.log(job.data.outputs[0].url); break; }
if (job.data.status === "failed") throw new Error(job.data.error?.message);
await new Promise((r) => setTimeout(r, 5000));
}
Die Status laufen pending → processing → completed oder landen auf failed / cancelled. Eine Falle: duration und resolution sind Strings. "10", niemals 10. Schema und Preis stehen in der maschinenlesbaren Spezifikation.
Veo 3.1 Fast reference-to-video kostet auf derselben Plattform $0.01 pro Sekunde. Neunmal weniger. Acht Sekunden kosten dort $0.08 gegen $0.72 hier, und wir werden das nicht unter einer Tabelle begraben.
Die Standardantwort lautet also Veo. Wenn eine Shotlist drei Referenzen, acht Sekunden und 720p braucht, ist jeder andere Aufruf Geld für nichts.
Vier Dinge drehen das um. Sie brauchen mehr Referenzen, als Veo annimmt, das bei drei aufhört gegen unsere sieben — der Unterschied zwischen ein Motiv abdecken und es stichprobenartig erfassen. Sie brauchen zehn Sekunden, die Veo Ihnen nicht gibt. Sie brauchen 4K. Oder Sie wollen die 360p-Stufe, auf der zwanzig Entwürfe weniger kosten als ein fertiger Clip und der Sieger aus demselben Array und Seed neu gerendert wird. Außerhalb dieser vier: nehmen Sie das Günstige. Mehr steht in der Kategorie reference-to-video, der Rest im Modellkatalog.
Ihre Referenzen sind Uploads echter Dinge und manchmal echter Menschen. Google blockiert Bild-Uploads, die Minderjährige oder bestimmte erkennbare Personen zeigen, für Nutzer im Vereinigten Königreich, in der Schweiz und im Europäischen Wirtschaftsraum. Hier ist das eine Casting-Vorgabe und keine Fußnote. Schreiben Sie es ins Briefing, nicht in einen gescheiterten Job um zwei Uhr nachts.
Jedes Einzelbild trägt SynthID. Googles unsichtbares Watermark liegt auf jeder Ausgabe, und kein Anbieter kann es abschalten, wir eingeschlossen. Klären Sie jeden Vertrag, der gekennzeichnete KI-Assets verbietet, bevor Sie integrieren.
Der Ton kommt aus Worten. Audio wird mit dem Bild erzeugt und aus demselben Prompt gesteuert — kein has_sound-Schalter, kein Upload einer Audioreferenz.
Ergebnis-URLs laufen ab. Kopieren Sie jede Ausgabe in dem Handler auf Ihren eigenen Speicher, der outputs[0].url ausliest. Eine Kampagne, die Sie neu rendern, ist eine, die Sie zweimal bezahlt haben.
Englisch ist die einzige vollständig unterstützte Promptsprache, und es ist in der Gemini Enterprise Agent Platform gelistet, dem Nachfolger, den Google im April 2026 an die Stelle von Vertex AI gesetzt hat. Die Hintergründe stehen in unserem Release-Text.
Sieben Bilder anzuhängen sagt dem Modell, was existiert. Es sagt nicht, welches die Hauptrolle spielt. Das tun Sie in Prosa: Bild 1 ist der Wasserkessel, Bild 2 der Emaildeckel, Bild 3 die Küche. Nummeriert, in der ersten Zeile, vor jeder Regieanweisung.
Hören Sie dann auf, das Motiv zu beschreiben. Ein Prompt, der Farbe und Form von etwas neu festlegt, das Sie bereits angehängt haben, streitet mit Ihren eigenen Referenzen, und das Modell teilt die Differenz. Investieren Sie die Worte in das, was das Array nicht halten kann: Kamera, eine Bewegung, das Licht, die Atmo. Halten Sie jeden Prompt auf einer durchgehenden Einstellung — verlangen Sie eine Erzählung in drei Szenen, und Sie bekommen Matsch. Unser Gemini-Omni-Prompting-Guide geht beim Einstellungsvokabular tiefer.
Sieben, und die Grenze ist veröffentlicht statt geraten: image_urls wird mit minItems: 1 und maxItems: 7 validiert, ein achter Eintrag scheitert also beim Absenden. Der Vorgänger hatte keine dokumentierte Obergrenze. Das ist der größte praktische Unterschied.
Nein. Wir rechnen pro Sekunde fertiges Video ab, skaliert nach Auflösung; die Zahl der Referenzen steht nicht in dieser Rechnung. Ob eine Referenz oder sieben, ein Clip von acht Sekunden bei 720p kostet $0.72. Länge und Auflösung sind die einzigen Hebel.
Nummerieren Sie sie im Prompt — welches Bild das Produkt enthält, welches das Detail, welches die Umgebung — und beschreiben Sie dann die Handlung. image_urls ist eine nackte Liste, bis Ihre Prosa die Rollen verteilt.
Genau so ist es gedacht. Legen Sie das Array einmal ab und schicken Sie es unverändert mit jedem Prompt, variieren Sie nur die Regie. Ein gepinnter seed hält das Licht stabil genug, damit die Clips zusammenschneidbar bleiben.
Fast immer, bei $0.01 pro Sekunde — Veo 3.1 Fast ist für einen gleichwertigen Request neunmal günstiger. Wechseln Sie hierher, wenn drei Referenzen keine ausreichende Abdeckung sind, wenn der Schnitt zehn Sekunden braucht, wenn das Ergebnis 4K sein muss oder für die 360p-Draft-Schleife.
360p, 720p, 1080p oder 4K, in 16:9 oder 9:16, mit 4, 6, 8 oder 10 Sekunden, immer bei 24 fps. Die oberen beiden Auflösungen sind hochskaliert statt nativ gerendert, beurteilen Sie die Schärfe also an Ihrem eigenen Material.
Google kündigt gemini-omni-flash-preview zu diesem Datum ab, und jeder Anbieter, der diese Weights betreibt, stellt am selben Tag ein. Richten Sie Ihre Jobs hierher: gleiche Request-Form, dokumentierte Referenz-Obergrenze. Die ältere Reference-to-Video-Seite bleibt als Migrationsreferenz online.