Zurück zu Modellen

Omni Flash

Googles Videomodellfamilie, die Clips aus Text-Prompts oder Referenzbildern erzeugt – ausgelegt auf schnelle Ergebnisse.

Referenz zu Videoab$0.075Text zu Videoab$0.075
Preiseab $0.075/Anfrage
Latenz~240 Sekunden im Durchschnitt
Auflösung4K/720P/1080P
Am besten geeignet fürvideo, google, high-fidelity

Parameter

0/7 Elemente

Geschätzte Kosten

Du sparst 50% bei diesem Modell
Grundkosten pro second$0.15
Rabatt-50%
Deine Gesamtsumme$0.075
Sie sparen $0.075 pro Anfrage

Anmelden, um Modelle auszuführen

Output Preview

Ready

No output yet

Run the model to see generated results.

Beispielausgabe

API-Beispiel— Aktuelle Parameter

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/omni-flash/reference-to-video',
  'input': {}
}
)

Auftrag abrufen— Auf Ergebnis warten

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Preisaufschlüsselung

Geschätzte Kosten pro Generierung nach Dauer und Auflösung. Sie zahlen nur für das, was Sie ausführen.

Dauer
4K
720P
1080P
4
$1.20
$0.60
$0.90
6
$1.80
$0.90
$1.35
8
$2.40
$1.20
$1.80
10
$3.00
$1.50
$2.25
Alternativen entdecken

Ähnliche Modelle

Weitere KI-Modelle für Referenz zu Video entdecken

Alle Modelle ansehen

Gemini Omni Flash Reference-to-Video API auf E2X

Omni Flash ist Googles gemini-omni-flash-preview — ein Videomodell aus der Gemini-Familie, kein Veo — und DeepMinds eigener Pitch dafür ist ein einziger Satz: „Stellen Sie sich Gemini Omni wie Nano Banana vor, nur für Video.“ Wir betreiben seine Reference-to-Video-Capability als google/omni-flash/reference-to-video und berechnen $0.10 für jede Sekunde fertiges 720p-Video. Der voreingestellte Clip von 8 Sekunden kostet damit $0.80, Audio inklusive.

Achten Sie auf die Einheit. Hier verkauft niemand einen Clip zum Pauschalpreis, jede Zahl, die Sie vergleichen, muss also mit der Länge multipliziert werden, die Sie rendern wollen.

Sie haben ein Skript, aber keine Bilder, die in die Aufnahme mitgenommen werden sollen? Dann ist Veo 3.1 Fast text-to-video der Endpoint, den Sie wollen — er startet allein aus dem Prompt, und auf unserer Plattform kostet er dramatisch weniger. Wir kommen weiter unten darauf zurück, ehrlich.

Unsere Position gegenüber den anderen Stellen, an denen Sie dieses Modell aufrufen können, geprüft am 26. August 2026:

API-AnbieterPro Sekunde (720p)Clip von 8 Sekundenvs. E2X
E2X$0.10$0.80—
fal.ai$0.13$1.04wir sind 23 % günstiger
Atlas Cloud$0.135$1.08wir sind 26 % günstiger
Runware$0.10$0.80gleichauf
Google Gemini API$0.10$0.80gleichauf

Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.

Wir schönen das nicht: Bei diesem Modell ziehen wir mit Googles Preis gleich, statt ihn zu unterbieten, und die Ersparnis ist nur gegenüber fal.ai und Atlas real. Referenzbilder fallen kaum ins Gewicht — Google zählt ein Bild mit 2.040 Tokens, drei davon kosten also rund einen Cent. duration ist das Feld, das Ihre Rechnung bewegt.

Was die Referenzbilder tatsächlich einbringen

Der Sinn dieses Endpoints ist Kontinuität. Geben Sie dem Modell ein Motiv — eine Person, ein Produkt, ein Set, einen Look —, beschreiben Sie eine Szene, in der es nie fotografiert wurde, und das Motiv übersteht die Reise.

Sie können mehrere Referenzen anhängen, nicht nur eine. Googles veröffentlichte Beispiele gehen bis sechs; ein offizielles Maximum ist nirgends dokumentiert, und die Zahlen von Dritten widersprechen einander, deshalb drucken wir keine. Bauen Sie für eine Handvoll und testen Sie Ihre eigene Obergrenze.

Audio wird mit dem Bild erzeugt, nicht nachträglich angeschraubt. Es sitzt synchron auf der Handlung, und Sie steuern es aus demselben Prompt — bitten Sie um Regen auf einem Blechdach und einen tiefen Raumton, und genau das kommt zurück. Es gibt keine separate Audiospur, die man hinterher bearbeiten könnte.

Zehn Sekunden sind die Decke. Unser duration-Enum bietet 4, 6, 8 und 10; Googles Modell läuft von 3 bis 10 Sekunden, und bei 10 ist Schluss. Kein Extension-Endpoint, keine Interpolation. Alles Längere ist ein Schnittjob in Ihrem eigenen Editor — und die Kontinuität zwischen den Schnitten wird Ihr Problem.

720p, 24 fps, und das ist die ganze Liste. Unser resolution-Feld führt die Werte 1080p und 4k, und Google kündigt höhere Auflösungen als demnächst verfügbar an, aber heute liefert das Modell 720p. Lassen Sie es auf dem Default. Eine Anbieterseite, die hier 1080p bewirbt, ist Googles eigener Dokumentation voraus.

Rechnen Sie mit rund 45 Sekunden Verarbeitung für einen Standardclip — ein gemessener p50 von eachlabs, keine offizielle Zahl, planen Sie also damit, statt sie zu versprechen.

API-Request: Referenzen rein, Clip raus

Zwei Felder sind Pflicht: image_urls und prompt. Erzeugen Sie einen Key in Ihrem Dashboard, halten Sie ihn auf einem Server, den Sie kontrollieren, und schicken Sie dann den Job ab.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/omni-flash/reference-to-video",
    "input": {
      "prompt": "Der Sneaker aus Bild 1 steht auf nassem Asphalt, während hinter ihm ein Bus losfährt. Langsame Fahrt nach vorn. Umgebungsverkehr und leichter Regen, keine Musik.",
      "image_urls": [
        "https://example.com/sneaker-front.jpg",
        "https://example.com/sneaker-side.jpg"
      ],
      "duration": "8",
      "aspect_ratio": "16:9",
      "resolution": "720p"
    }
  }'

Die Response enthält eine Job-ID. Video braucht Minuten, pollen Sie also langsam — oder lassen Sie das Polling ganz weg und übergeben Sie eine webhookUrl im Submit-Body:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/omni-flash/reference-to-video",
    input: {
      prompt:
        "Die Frau aus der Referenz geht über einen Nachtmarkt, Neonschilder spiegeln sich auf ihrer Jacke. Handkamera. Stimmengemurmel und entferntes Brutzeln.",
      image_urls: ["https://example.com/talent.jpg"],
      duration: "10",
      aspect_ratio: "9:16",
    },
  }),
}).then((r) => r.json());

const poll = async (id, attempt = 0) => {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") return job.data.outputs[0].url;
  if (job.data.status === "failed") throw new Error(job.data.error?.message);
  if (attempt > 90) throw new Error("Timed out waiting for the render");

  await new Promise((r) => setTimeout(r, 5000));
  return poll(id, attempt + 1);
};

const videoUrl = await poll(data.jobId);

Die Status laufen pending → processing → completed oder landen auf failed oder cancelled. Das aktuelle Schema und der aktuelle Preis stehen in der maschinenlesbaren Spezifikation, falls Sie sie lieber programmatisch lesen.

Die Wahl zwischen unseren Videomodellen

Der Vergleich, auf den es ankommt, und er schmeichelt dieser Seite nicht:

ModellUnser Preis (8 s, 720p, Audio)Nehmen Sie es, wenn
Omni Flash reference-to-video$0.80Mehrere Referenzen konsistent bleiben müssen oder Sie einen Clip von 10 Sekunden brauchen
Veo 3.1 Fast reference-to-video$0.12Bis zu drei Referenzen, 8 Sekunden, und Sie wollen die günstigere Rechnung
Veo 3.1 Fast image-to-video$0.12Ein Standbild, das Sie animieren wollen
Veo 3.1 Fast text-to-video$0.12Überhaupt kein Ausgangsmaterial

Veo 3.1 Fast kostet auf unserer Plattform einen Bruchteil von Omni Flash, und es erreicht 1080p und 4K, was Omni Flash derzeit nicht kann. Zu Googles eigenem Listenpreis liegen beide bei denselben $0.10 pro Sekunde für 720p — erst unser Rabatt reißt die Lücke auf. Fangen Sie also mit Veo Fast an. Kommen Sie hierher zurück, wenn seine Grenze von drei Referenzen Sie blockiert, wenn Sie diese zwei zusätzlichen Sekunden brauchen oder wenn Sie das Videobearbeitungsverhalten hinter dem Etikett „Nano Banana für Video“ wollen. Weitere Optionen stehen in der Kategorie reference-to-video, und der komplette Modellkatalog passt auf eine Seite.

Die Einschränkungen, die Google veröffentlicht

Public Preview heißt, dass die rauen Kanten dokumentiert statt versteckt sind. Lesen Sie das, bevor Sie bauen:

  • Videoreferenzen von bis zu drei Sekunden akzeptiert das API-Schema zwar, doch in Googles eigenen Worten „werden sie vom Modell nicht korrekt verarbeitet“. Behandeln Sie Videoreferenzen als nicht funktionsfähig und senden Sie Standbilder — und beachten Sie, dass Referenzieren oder Schlussfolgern über mehrere Videos hinweg überhaupt nicht unterstützt wird.
  • Das Bearbeiten eines hochgeladenen Videos ist im EWR, in der Schweiz und im Vereinigten Königreich nicht verfügbar. Wenn Ihre Nutzer oder Ihre Infrastruktur dort sitzen, fällt diese Hälfte des Modellnutzens weg.
  • Vollständig unterstützt wird nur Englisch. Andere Promptsprachen sind nicht evaluiert worden.
  • Eine lange, mehrszenige Erzählung in einer einzigen Generierung scheitert. Dieses Modell rendert eine durchgehende Einstellung; verlangen Sie drei hintereinander, bekommen Sie Matsch.

Bild und Ton zusammen prompten

Schreiben Sie die Einstellung, nicht die Geschichte. Ein Motiv, eine Kamerabewegung, eine Lichtsituation — und dann sagen Sie, wie es klingt, denn das Audio kommt aus demselben Prompt, und Stille ist eine Entscheidung, die Sie laut treffen müssen.

Kennzeichnen Sie Ihre Anhänge, wenn mehr als einer hineingeht: „Bild 1 ist die Flasche, Bild 2 die Nahaufnahme des Etiketts.“ Nichts anderes sagt dem Modell, welche Referenz die Hauptrolle spielt. Halten Sie die Kamerasprache schlicht — „langsame Fahrt nach vorn“, „starre Einstellung“, „Handkamera folgt“ schlagen einen Absatz Kameratheorie.

Bevor Sie ausliefern

Jeder Clip trägt ein SynthID-Watermark — für Zuschauer unsichtbar, programmatisch nachweisbar — und C2PA Content Credentials werden standardmäßig angehängt. Kein Anbieter, der dieses Modell betreibt, kann das abschalten, wir eingeschlossen. Wenn ein Kundenvertrag gekennzeichnete KI-Assets verbietet, klären Sie das, bevor Sie integrieren.

Legen Sie Ihre Ergebnisse im Completion-Handler auf Ihren eigenen Speicher um. Ergebnis-URLs sind keine dauerhaften Adressen, und ein Video, das Sie nicht mehr abrufen können, ist ein Video, das Sie zweimal bezahlen.

Häufig gestellte Fragen

Was ist Gemini Omni Flash?

Es ist Googles gemini-omni-flash-preview, ein Modell zur Videogenerierung und -bearbeitung aus der Gemini-Familie statt aus der Veo-Familie. DeepMind beschreibt es als „Nano Banana, aber für Video“ — der Schwerpunkt liegt darauf, Referenzen konsistent mitzuführen und vorhandenes Material zu bearbeiten, während Veo auf kinematische Generierung von Grund auf zielt. Es befindet sich in der Public Preview.

Was kostet ein Omni-Flash-Video von 8 Sekunden auf E2X?

$0.80. Wir berechnen $0.10 pro Sekunde 720p-Ausgabe, die Länge treibt also die Rechnung — ein Clip von 4 Sekunden kostet $0.40, das Maximum von 10 Sekunden $1.00. Das war unser Preis bei der Prüfung am 26. August 2026.

Wie viele Referenzbilder akzeptiert Omni Flash?

Mehr als eines, und Googles dokumentierte Beispiele gehen bis sechs — aber ein offizielles Maximum ist nicht veröffentlicht. Quellen außerhalb von Google nennen unterschiedliche Obergrenzen und widersprechen einander, deshalb wiederholen wir keine Zahl, die wir nicht überprüfen können. Testen Sie Ihre eigenen Payloads, bevor Sie um eine bestimmte Anzahl herum entwerfen.

Kann Omni Flash Video in 1080p oder 4K erzeugen?

Heute nicht. Es gibt 720p bei 24 fps aus, und Google kündigt höhere Auflösungen als demnächst verfügbar an. Wenn Sie jetzt 1080p oder 4K brauchen, erreicht Veo 3.1 Fast beides.

Sollte ich Omni Flash oder Veo 3.1 Fast nehmen?

Veo 3.1 Fast, für die meisten Aufgaben. Ein Clip von 8 Sekunden mit Audio kostet auf unserer Plattform dort $0.12 gegenüber $0.80 hier, und es geht bis 4K. Nehmen Sie Omni Flash, wenn Sie mehr als drei Referenzbilder, eine Dauer von 10 Sekunden oder sein Videobearbeitungsverhalten brauchen.

Hat das generierte Video Ton?

Ja, nativ und synchron zur Handlung auf dem Bild. Sie führen ihn aus demselben Prompt — nennen Sie die Atmo, die Effekte, oder bitten Sie um Musik. Audio lässt sich über die API nachträglich nicht bearbeiten, eine Änderung bedeutet also ein neues Rendering.

Sind Omni-Flash-Videos mit einem Watermark versehen?

Ja. Jede Ausgabe trägt ein SynthID-Watermark, das Zuschauer nicht sehen, Erkennungswerkzeuge aber auslesen können, plus C2PA Content Credentials, die standardmäßig aktiv sind. Kein Anbieter stellt einen Parameter bereit, um eines von beiden abzuschalten.

Kann ich mit diesem Modell ein hochgeladenes Video bearbeiten?

Nur außerhalb des EWR, der Schweiz und des Vereinigten Königreichs — Google schränkt das Bearbeiten hochgeladener Videos in diesen Regionen ein. Die Reference-to-Video-Generierung selbst ist davon nicht betroffen. Beachten Sie außerdem, dass Video-Referenzen vom Schema zwar akzeptiert, aber nicht korrekt verarbeitet werden — senden Sie also Bilder.