Die 40-Sekunden-Szenen von Gemini Omni 1.1 Flash sind vier getrennte Rechnungen
Die Zahl in jeder Schlagzeile dieser Woche lautet vierzig. Vierzigsekündige Szenen aus Googles neuem Videomodell — das klingt, als tippten Sie einen Prompt und bekämen vierzig Sekunden zurück.
Bekommen Sie nicht. Ein einzelner Aufruf von gemini-omni-1.1-flash liefert drei bis zehn Sekunden. Vierzig ist das, was Sie erreichen, indem Sie diesen Clip noch dreimal erweitern — insgesamt vier Jobs, jeder einzeln abgerechnet. Niemand hat gelogen: Googles eigene Ankündigung beschreibt die Fortsetzungen unmissverständlich. Aber die Zahl ist weit von diesem Satz weggereist und bei vielen als Wert pro Generierung angekommen.
Das hier ist das Briefing, das wir uns wünschen würden, bevor wir eine Karte hinlegen: was vierzig Sekunden kosten, wofür die 360p-Stufe da ist, und welche Einschränkungen in der Dokumentation vergraben sind — eine davon sperrt europäische Entwickler vollständig vom Hauptfeature aus.

Vierzig Sekunden sind vier Jobs und vier Rechnungen
Videomodelle rechnen pro Sekunde Output ab, und eine Erweiterung bringt keinen Rabatt — eine Fortsetzung kostet, was eine frische Generierung kostet. Vierzig Sekunden kalkulieren sich also wie vier Zehnsekundenclips. Auf jeder Stufe:
| Auflösung | Auf E2X | Direkt bei Google |
|---|---|---|
| 360p | $1.19 | $1.35 |
| 720p | $3.60 | $4.06 |
| 1080p | $5.40 | $6.08 |
| 4K | $7.20 | $12.16 |
Viermal zehn Sekunden zum jeweiligen Sekundenpreis. Unsere Zahlen stammen aus dem Live-Katalog; die Modellseiten führen den aktuellen Wert, falls dieser Text altert.
Die Google-Spalte verdient eine Anmerkung, denn die Preise sind überraschend schwer zu finden. Zwei offizielle Seiten führen die vollständige Staffel, und eine Textsuche erwischt keine von beiden. In der Ankündigung zum Launch stecken die Preise in einem Bild — für Menschen lesbar, für Strg-F unsichtbar. Auf der Cloud-Preisseite erscheinen sie als Tokens pro Sekunde gegen einen Zähler von $17.50 pro Million, sehen also erst nach dem Multiplizieren wie Preise aus. Die Seite, die Sie zuerst öffnen würden — die API-Preisdokumentation — liefert eine von vier Stufen: „ein effektiver Preis von ungefähr $0.10 pro Sekunde“ bei 720p.
Beide stimmen überein, mit einer Rundungsfalte: Die Ankündigung zeigt saubere $0.03 / $0.10 / $0.15 / $0.30, die Tokenrechnung landet jeweils ein wenig darüber. Abgerechnet wird nach Tokens, also folgt die Spalte oben ebenfalls den Tokens; der Launch-Beitrag enthält die Rechnung Stufe für Stufe.
Fünf Dollar vierzig für vierzig Sekunden 1080p, gut sechs bei Google. Das ist der Listenpreis vor dem ersten alternativen Take — und Sie werden welche nehmen, denn die letzte Erweiterung ist die Stelle, an der die Drift auftaucht. Kalkulieren Sie den Schnitt, den Sie behalten, plus die beiden, die Sie verwerfen, und eine fertige Vierzig-Sekunden-Sequenz kostet sechzehn Dollar, nicht fünf.
Die 360p-Zeile war früher die, in der wir verloren, und bis vor Kurzem stand das hier auch so. Das hat sich verschoben: Unsere Draft-Stufe liegt jetzt bei $0.0297 pro Sekunde gegen Googles $0.0338, zwölf Prozent darunter. Lesen Sie nicht zu viel hinein. fal liegt bei $0.03 — ein Prozent Abstand, statistisches Rauschen im Gewand eines Sieges, und genau die Art Vorsprung, die kippt, sobald jemand einen Multiplikator anfasst. Der Draft-Workflow weiter unten gilt, bei wem auch immer Sie kaufen; er hat nie davon abgehangen, dass der Preis unserer ist.
Das eigentliche Upgrade von 1.1 ist Gedächtnis, nicht Länge
Länge war vorher schon ungefähr erreichbar. Brauchbar wird sie durch das, was das Modell sieht, wenn es fortsetzt.
Die Juni-Preview las die letzte Sekunde des Clips, den sie erweiterte. Eine Sekunde sagt Ihnen, was im Bild ist, und fast nichts darüber, was gerade geschah — also drifteten die Erweiterungen. Die Kamerafahrt hörte auf zu fahren. Eine Jacke verschob sich um eine Nuance. Das Licht baute sich an jeder Naht neu auf.
Gemini Omni 1.1 Flash liest bis zu zehn Sekunden vorheriges Material. Zehn Sekunden reichen aus, um zu wissen, dass der Dolly noch in Bewegung war, von welcher Seite das Führungslicht kam und welche Farbe der Mantel ungefähr hatte — deshalb hält eine vierteilige Sequenz überhaupt zusammen. Wenn Ihnen jemand sagt, das Hauptfeature von 1.1 sei die Länge, hat er es andersherum. Länge war Arithmetik. Gedächtnis ist das Modell.
1080p und 4K sind Hochskalierungen, keine Renderings
Eine einzige Klammer in Googles Dokumentation ändert, wofür Sie zahlen sollten. Aus der Modellreferenz, wörtlich: „1080p output (upscaled)“ und „4K output (upscaled)“. Das Modell rendert unterhalb dieser Auflösungen und skaliert hoch. Das obere Ende der Staffel ist nicht mehr Detail — es ist eine größere Datei, die dieselbe Information trägt.
Das färbt die 4K-Zeile oben um. Gut zwölf Dollar, bei Google, für vierzig Sekunden hochskalierten Output. Wenn eine Kundenspezifikation 4K-Maße verlangt, zahlen Sie das. Wenn Sie 4K gewählt haben in der Annahme, es sähe besser aus, zahlen Sie exakt das Dreifache von Googles 720p-Rate für eine Größenänderung, die Sie in ffmpeg laufen lassen könnten.
In 360p entwerfen, in 720p fertigstellen
Das ist der Teil, der Geld spart, und niemand hat ihn in eine Schlagzeile gesetzt.
360p kostet hier $0.0297 pro Sekunde — ein Vier-Sekunden-Draft sind zwölf Cent, gegen $0.36 bei 720p und $0.54 bei 1080p. Google behauptet außerdem, 360p laufe bis zu 60 % schneller — eine Herstellerangabe und kein von uns gemessener Wert, auch wenn die Richtung offensichtlich stimmt.
Nun die Arithmetik. Nehmen wir an, eine Einstellung braucht zehn Versuche, bis die Bewegung sitzt — realistisch für alles mit einer bestimmten Kamerabewegung.
- Zehn Durchgänge direkt in 1080p → $5.40
- Zehn Durchgänge in 360p → $1.19, dann ein Gewinner neu gerendert in 1080p → $1.73
Achtundsechzig Prozent weniger, für eine zusätzliche Generierung am Ende. Seien Sie ehrlich darüber, was ein 360p-Durchgang Ihnen sagen kann: Bildaufbau, Kamerabewegung, ob das Modell Schnitte eingefügt hat, um die Sie nie gebeten haben. Feine Textur kann er nicht beurteilen — dafür fehlt schlicht die Auflösung.
Hier derselbe Prompt auf beiden Stufen, gleicher Seed, jeweils vier Sekunden. Zuerst der Draft:
Dann das 720p-Rendering desselben Prompts und Seeds:
Beide zeigen eine Messing-Stoppuhr auf dunklem Schiefer, die Kamera fährt von links heran, ein warmes Führungslicht streift über das Metall. Der Prompt für beide, wörtlich:
Editorial slow-motion macro shot of a brass mechanical stopwatch resting on a dark slate table, its second hand sweeping forward in a single continuous shot with no scene cuts. Camera performs a slow dolly in from the left, shallow depth of field, one warm amber key light raking across the metal, cool blue rim light behind. Fine dust drifts through the beam. Clean dark background, no text, no logos, no people. Sound design: a soft mechanical tick and low room tone, nothing else.
(Der Prompt bleibt auf Englisch: Das Modell wurde nur für Englisch evaluiert, und Sie sollen ihn kopieren und dasselbe Ergebnis erzeugen können.)
Zwölf Cent gegen sechsunddreißig. Der Draft sagte uns, dass der Dolly liest und das Modell eine Einstellung durchhält — alles, was wir wissen mussten, bevor wir uns festlegten. Lassen Sie Ihre Schleife dort unten laufen.
Erweiterung läuft nur vorwärts
Szenenerweiterung hängt hinten an, und die Form dieser Grenze entscheidet, wie Sie eine Sequenz planen. Sie können nichts in die Mitte eines Clips einfügen. Sie können nicht rückwärts erweitern, um einen Vorlauf zu bauen. Es gibt kein „behalte das Ende, baue die ersten vier Sekunden neu“ — die Funktion läuft nur in eine Richtung. Ist Einstellung drei falsch, wandert alles danach mit ihr in den Papierkorb.
Verlagern Sie den Aufwand also nach vorn. Die erste Generierung legt Kamerasprache, Palette und Licht für alles Folgende fest, und sie ist das einzige Segment, das Sie günstig überarbeiten können. Bei der dritten Erweiterung sind Sie vier Jobs tief und haben keine Möglichkeit mehr, zurückzugreifen.
Eines wird die Erweiterung außerdem nicht tun. Geben Sie ihr ein Video einer sprechenden Person und verlangen Sie neue Dialoge, dann lehnt sie ab — Google beschränkt die Veränderung von Sprache. Die Launch-Berichterstattung liest das als bewusste Zurückhaltung im Sinne eines verantwortungsvollen Release und nicht als fehlendes Feature; diese Einordnung stammt vom Berichtenden, die Einschränkung aber steht in der Dokumentation. Bauen Sie kein Synchronisationsprodukt auf diesem Modell.
Europäische Entwickler, lesen Sie diese Zeile zweimal
In der Dokumentation als einzelner Satz vergraben: Im EWR, in der Schweiz und im Vereinigten Königreich ist das Bearbeiten und Erweitern eines hochgeladenen Videos nicht verfügbar.
Das ist keine weiche Einschränkung. Das Hauptfeature — Material nehmen, fortsetzen — funktioniert in weiten Teilen Europas nicht. Text-to-Video und Image-to-Video laufen weiterhin. Aber wenn der Plan ein Werkzeug war, das von Ihren Nutzern hochgeladene Clips verlängert, und diese Nutzer in Berlin oder Manchester sitzen, ist der Plan tot — und die Ankündigung erwähnt es mit keinem Wort.
Prüfen Sie das gegen Ihre Deployment-Region, bevor Sie eine Zeile Integrationscode schreiben. Es ist der Punkt hier, dessen späte Entdeckung am teuersten wird.
Die Regler, die es nicht gibt
Wer von einem Textmodell kommt, greift nach Parametern, die hier nicht existieren. Googles Dokumentation markiert die gesamte Sampling-Oberfläche als nicht unterstützt: kein temperature, kein top_p, keine Systemanweisungen, keine Stoppsequenzen, kein negativer Prompt. Nichts davon.
Ihre einzige Steuerfläche ist der Prompt selbst, und Dokumentation von Dritten setzt die Obergrenze bei 40.000 Zeichen — viel Spielraum, wobei wir diese Zahl in Googles eigener Referenz nicht gefunden haben. Alles, was Sie sonst über einen Sampling-Parameter erledigen würden, muss stattdessen ins Englische geschrieben werden. Wie man dieses Englisch gut schreibt, haben wir in einem eigenen Beitrag zur Prompt-Syntax behandelt, samt Tag-Struktur und dem Problem mit den Szenenschnitten; es hier zu wiederholen bringt nichts.
Eine Warnung noch. Schema-Dokumentation von Dritten führt für dieses Modell temperature und top_p als akzeptierte Felder, während Googles Referenz sie als nicht unterstützt bezeichnet. Wir sagen Ihnen nicht, welche Quelle recht hat — wir sagen Ihnen, dass die beiden sich widersprechen. Bauen Sie nicht auf der Grundlage eines Schema-Eintrags um diese Parameter herum; testen Sie erst, ob sie überhaupt etwas verändern.
Ton, den Sie nicht abschalten können, Englisch, das Sie nicht verlassen können
Audio wird zu jedem Clip nativ erzeugt, und es gibt keinen Ausschalter. Kein Parameter, kein Flag, kein stiller Modus. Sie können ihn steuern — ein Sound design:-Satz leistet echte Arbeit — aber Sie können ihn nicht ablehnen. Für eine Einbettung im Blog heißt das: im Player stummschalten, genau das tun beide Clips oben.
Sie können außerdem kein Audio als Referenz mitgeben, erzeugtes Audio nicht nachträglich bearbeiten und den Ton eines Videos, das Sie zur Erweiterung hochladen, nicht erhalten. Alle drei sind vernünftige Erwartungen. Keine davon wird unterstützt.
Die Sprachunterstützung ist enger, als das Marketing nahelegt: Englisch ist die einzige vollständig unterstützte Sprache. Japanisch und andere sind als nicht evaluiert dokumentiert — eine vorsichtige Art zu sagen, dass die Ergebnisse unvorhersehbar sind. Wenn Ihre Prompts oder Dialoge nicht auf Englisch sind, kalkulieren Sie Überraschungen ein.
Kennen Sie die Referenzgrenzen, bevor Sie eine Eingabepipeline entwerfen. Videoreferenzen: bis zu drei Clips à drei Sekunden, und Google warnt, dass mehrere gleichzeitig die Ergebnisse verschlechtern können — behandeln Sie drei als Obergrenze, nicht als Zielwert. Seitenverhältnisse sind 16:9 oder 9:16, ebenfalls von Google. Zwei Zahlen, die daneben zitiert werden, sind es nicht: Die Bildrate von 24 fps und die Spanne von eins bis sieben Bildern für Reference-to-Video stammen beide aus Schema-Dokumentation von Dritten. Jedes Bild trägt ein SynthID-Wasserzeichen, und wir haben keinen Anbieter gefunden, der dafür einen Schalter anbietet.
Bevor Sie irgendetwas ausgeben, tun Sie das hier
Vier Prüfungen, in dieser Reihenfolge. Die erste killt mehr Integrationen als die übrigen zusammen.
- Bestätigen Sie Ihre Region. Wenn Sie im EWR, in der Schweiz oder im Vereinigten Königreich sitzen und Ihr Produkt hochgeladene Videos erweitert, hören Sie hier auf. Dieses Modell kann diese Aufgabe für Sie nicht erledigen.
- Kalkulieren Sie die Sequenz, nicht den Clip. Multiplizieren Sie mit den Erweiterungen, dann mit den Takes, die Sie tatsächlich fahren werden. Vierzig Sekunden 1080p sind hier bestenfalls $5.40, realistisch das Dreifache, sobald Sie die Wiederholungen mitzählen.
- Fragen Sie, ob Sie Omni überhaupt brauchen. Eine Sekunde Veo 3.1 Fast kostet hier einen Cent, gegen neun bei Omni in 720p. Eine Einstellung, keine Fortsetzung, keine Frame-Interpolation, niemand, der zwei Clips später noch gleich aussehen muss — dann ist dieses Vielfache verbranntes Geld.
- Bauen Sie Ihre Schleife auf der Draft-Stufe. Iterieren Sie in 360p, befördern Sie den Gewinner. Achtundsechzig Prozent sind kein Rundungsfehler.
Omni verdient das Vielfache genau dort, wohin die 1.1-Features zeigen: eine Einstellung fortsetzen, zwischen einem ersten und letzten Frame interpolieren, ein Standbild animieren oder ein Motiv über Schnitte hinweg tragen. Außerhalb davon ist es ein teurer Weg, einen einzelnen Clip zu kaufen.
Die anderen Blickwinkel liegen nebenan: was am Launch-Tag tatsächlich erschienen ist, was die Leaderboards sagen und was nicht — die diese Woche kursierenden Arena-Rankings gehören zum Vorgängermodell — und eine Preisaufschlüsselung Plattform für Plattform. Schemata und Live-Preise stehen im Katalog.
Preise und Produktbedingungen ändern sich. Prüfen Sie die aktuelle Preisgestaltung jedes Anbieters, bevor Sie eine Kaufentscheidung treffen.
Häufig gestellte Fragen
Kann Gemini Omni 1.1 Flash wirklich 40-sekündige Videos erzeugen?
Ja, aber nicht in einem Aufruf. Eine einzelne Generierung liefert 3 bis 10 Sekunden. Vierzig Sekunden sind die kumulierte Gesamtlänge, die Sie erreichen, indem Sie einen bestehenden Clip noch dreimal erweitern — vier Jobs — und jede Erweiterung wird zum selben Sekundenpreis wie eine frische Generierung separat abgerechnet. Auf E2X kostet eine 40-Sekunden-Sequenz in 1080p $5.40, gegen $6.08 bei einem direkten Aufruf von Google.
Wie viel kostet eine 40-sekündige Gemini-Omni-Sequenz?
Multiplizieren Sie 40 Sekunden mit dem Sekundenpreis Ihrer Auflösung; Erweiterungen bringen keinen Rabatt. Auf E2X sind das $1.19 in 360p, $3.60 in 720p, $5.40 in 1080p und $7.20 in 4K. Direkt bei Google, gerechnet aus den veröffentlichten Tokenraten pro Sekunde, kosten dieselben Längen $1.35, $4.06, $6.08 und $12.16. Rechnen Sie verworfene Takes hinzu und erwarten Sie das Zwei- bis Dreifache des Schlagzeilenwerts.
Ist der 4K-Output von Gemini Omni 1.1 Flash echtes 4K?
Nein. Googles Dokumentation kennzeichnet sowohl die 1080p- als auch die 4K-Stufe als „upscaled“ — das Modell rendert niedriger und skaliert das Ergebnis hoch. Die Datei hat 4K-Maße; das Bild trägt keine 4K-Details. Solange keine Lieferspezifikation diese Maße verlangt, kauft der Preis der obersten Stufe eine Größenänderung statt mehr Information.
Kann ich Gemini Omni 1.1 Flash in der EU nutzen?
Teilweise. Text-to-Video und Image-to-Video funktionieren, aber das Bearbeiten oder Erweitern eines hochgeladenen Videos ist im EWR, in der Schweiz und im Vereinigten Königreich nicht verfügbar. Da die Erweiterung die zentrale Fähigkeit ist, blockiert das jedes europäische Produkt, das auf dem Fortsetzen nutzergelieferten Materials aufbaut. Prüfen Sie es vor der Integration gegen Ihre Deployment-Region.
Unterstützt Gemini Omni 1.1 Flash temperature oder negative Prompts?
Googles Referenz markiert die Sampling-Oberfläche als nicht unterstützt — kein temperature, top_p, keine Systemanweisungen, Stoppsequenzen oder negativen Prompts. Der Prompt-Text ist Ihre einzige Steuerung, wobei Schema-Dokumentation von Dritten die Obergrenze bei 40.000 Zeichen ansetzt. Dieselben Drittquellen führen temperature und top_p als akzeptierte Felder und widersprechen damit Google — testen Sie sie also, bevor Sie sich darauf verlassen.
Kann ich den Ton im Output von Gemini Omni abschalten?
Nein. Das Modell baut standardmäßig in jeden Clip eine Tonspur ein, und kein Parameter schaltet sie ab. Eine Sound-Design-Anweisung im Prompt steuert, was Sie bekommen, aber Sie können sie nicht ablehnen, keine Audioreferenz mitgeben, das Ergebnis nicht bearbeiten und den Ton eines zur Erweiterung hochgeladenen Videos nicht erhalten. Für stumme Wiedergabe schalten Sie im Player stumm.
Kann Gemini Omni ein Video rückwärts erweitern oder die Mitte einer Szene bearbeiten?
Nein. Die Erweiterung hängt ausschließlich hinten an — keine Rückwärtserweiterung für einen Vorlauf, kein Einfügen in die Mitte einer Sequenz. Planen Sie entsprechend: Die erste Generierung legt Kamera- und Lichtsprache für alles Nachfolgende fest, und ein früher Fehler entwertet jede darauf aufgebaute Erweiterung.
Lohnt sich Gemini Omni 1.1 Flash gegenüber Veo 3.1 Fast?
Nur wenn Sie brauchen, was Omni hinzufügt. Veo 3.1 Fast läuft auf E2X für $0.01 pro Sekunde gegen Omnis $0.09 in 720p. Für einen einzelnen Clip ohne Erweiterung, ohne Steuerung von erstem und letztem Frame und ohne Kontinuität über mehrere Einstellungen gewinnt Veo deutlich. Omni verdient seinen Aufpreis bei mehrteiligen Sequenzen und referenzgetriebener Kontinuitätsarbeit.