Kamerabegriffe, auf die Gemini Omni 1.1 Flash reagiert — und die, die es ignoriert
Wer Googles Material zum Video-Prompting lange genug liest, stößt auf zwei Sätze, die ein paar Absätze auseinanderliegen. Der eine veröffentlicht eine Liste von Kamerabewegungen — Dolly, Truck, Pedestal, Kran, Whip Pan, Arc —, als bestellten Sie von einer Speisekarte. Der andere warnt, dass „Some advanced camera angles are not officially supported. The results and reliability may vary depending on the overall prompt and your specific use case.“
Beides stimmt, und in der Lücke dazwischen entstehen die meisten enttäuschenden Clips. Eine benannte Bewegung ist eine Bitte, der das Modell wahrscheinlich nachkommt, kein Parameter, den es ausführen muss. Es gibt kein Feld für die Kameraposition auf gemini-omni-1.1-flash — kein Rig, kein Objektiv, nur Wörter, die mit Ihren anderen Wörtern konkurrieren. Dieser Beitrag handelt davon, welche dieser Wörter ihren Platz verdienen, erarbeitet aus dem, was Google dokumentiert, was Runway berichtet und was das Schema offenlegt.

Die Wörter, die sofort herausfallen
Fangen Sie mit dem Streichen an, das kostet nichts und schafft Platz im Prompt. Runways Referenz zum Kamera-Prompting ist unmissverständlich, was die beiden häufigsten Wörter in KI-Video-Prompts angeht: „'Cinematic' and '4k' come out because they're doing no work. Neither one changes what the camera does, and the prompt space they occupy is better spent on the move.“
Das ist eine Aussage über deren Werkzeuge, nicht über Googles, aber die Begründung trägt. „Cinematic“ beschreibt einen Eindruck, keinen Blickpunkt: Es sagt nicht, wo man stehen soll, wie weit entfernt, was scharf bleibt oder in welche Richtung es geht. Dasselbe gilt für den nachgezogenen Ballast — masterpiece, award-winning, 8k, ultra detailed —, geerbt aus der Prompt-Kultur der Bildmodelle, wo diese Tokens als Qualitätsbeschwörungen gegen eine ganz andere Trainingsverteilung funktionierten.
Die positive Form ist genauso schlicht: Benennen Sie eine bestimmte Bewegung, statt um „dynamische, cinematische Kamera“ zu bitten, denn diese Modelle behandeln „camera instructions as spatial direction, not decoration.“ Nichts daran sagt, dass „cinematic“ schadet. Es sagt, das Wort verdrängt etwas Besseres, und in einem Prompt aus ein paar Dutzend Wörtern ist Verdrängung das ganze Spiel.
Googles Liste und wie weit man ihr trauen kann
Das dokumentierte Vokabular schlägt alles, was in Prompt-Threads kursiert:
| Kategorie | Was Google benennt |
|---|---|
| Bewegung | static · pan · tilt · dolly (in, out) · truck (left, right) · pedestal (up, down) · zoom · crane · aerial oder drone · handheld · whip pan · arc |
| Winkel und Größe | eye-level · low · high · bird's-eye · Dutch · point-of-view · over-the-shoulder · extreme close-up · close-up · medium · full · wide oder establishing |
| Optik | wide-angle · telephoto · deep und shallow depth of field · lens flare · rack focus · fisheye · dolly zoom |
Zwei Details lohnen die Aufmerksamkeit. Google trennt Zoom und Dolly bewusst, weil Modelle sie vermischen: Ein Zoom ist eine Änderung der Brennweite, und „This is different from a dolly, as the camera itself doesn't move.“ Sie wollen, dass der Hintergrund relativ zu Ihrem Motiv anschwillt? Bitten Sie um einen Dolly. Sie wollen, dass sich der Bildausschnitt bei unveränderter Geometrie verengt? Bitten Sie um einen Zoom. Schreiben Sie „zoom in slowly as the camera pushes forward“, haben Sie beides bestellt — einen Dolly-Zoom, und der ist fast nie gemeint.
Zweitens: Begriffe, die Google weithin zugeschrieben werden, stehen gar nicht auf seinen Seiten. Oner, push in und natural smartphone zoom tauchen in Guides auf, die sich auf Googles Dokumentation berufen; wir konnten sie dort nicht finden. Undokumentiert heißt nicht verboten, aber sie haben nicht mehr Autorität als eine Formulierung, die Sie selbst erfinden. Die vollständige dokumentierte Syntax steht in unserem Prompting-Guide.
Eine Bewegung pro Clip
Der schärfste Befund in Runways Referenz ist nicht, welche Verben funktionieren, sondern wie viele.
„Stacked verbs (unreliable): 'Orbit the subject and crane up and push in.' Phased description (reliable): 'The camera arcs around the seated figure, then rises above the table to reveal the empty chairs surrounding her.'“
Der Rat, der darauf folgt, lautet: Beschreiben Sie, was den Bildausschnitt in jeder Phase füllt, statt Verben zu stapeln — und wenn die zusammengesetzte Bewegung immer noch scheitert, „cut back to one move and generate the second beat as its own clip.“
Omni gibt dem eine mechanische Schärfe, aus Googles eigener Dokumentation: Das Modell erzeugt standardmäßig mehrere Einstellungen, sofern nichts anderes gesagt wird. Bitten Sie um drei gleichzeitige Bewegungen, und Sie haben ihm einen Ausweg gegeben — den Schnitt. Zwei Sekunden Arc, Schnitt, zwei Sekunden Kran, Schnitt, den Rest Push-in. Jede Anweisung erfüllt, nichts von dem, was Sie wollten. Der Ein-Satz-Fix, „In a single continuous shot“ oder „No scene cuts“, hindert das Modell daran, Ihre Mehrdeutigkeit mit einem Schnitt aufzulösen.
Eine Szene, zweimal erzeugt, verändert wurde nur der Kamerasatz:
Vier Sekunden pro Seite in 720p, sechsunddreißig Cent das Stück. Motiv, Raum, Licht und Tonspur sind identisch; nur der erste Satz unterscheidet sich, eine feststehende Einstellung gegen einen langsamen Dolly-in. Der Kamerasatz ist der wirkungsvollste Satz im Prompt und der, den die meisten zuletzt schreiben.
Brennweite ist Regieanweisung, nicht Optik
Es gibt kein Objektiv. Das gehört klar gesagt, weil das mentale Modell zählt. Schreiben Sie „85mm“, berechnet das Modell keinen Bildwinkel; es greift nach allem, was in den Trainingsdaten so beschriftet ist, und Fotos tragen dieses Label millionenfach. Zurück kommt der Look, der an der Zahl hängt: komprimierter Hintergrund, Motiv aus einem weichen Feld herausgeschnitten, verflachte Distanz. Bei kurzer Brennweite: gedehnte Perspektive, mehr Raum im Bild, gebogene Ränder.
Das macht die Brennweite zu einem der effizientesten verfügbaren Wörter, weil sie Bildausschnitt und Anmutung in vier Zeichen zugleich bewegt. Die kursierenden Empfehlungen sind konsistent — grob 24mm für weiten Kontext, 35mm für eine dokumentarische Anmutung, 50mm für neutrales Erzählen, 85mm für komprimierte, intime Arbeit —, gelesen als visuelle Anweisung, nicht als Versprechen buchstäblicher Optik.

Daraus folgen zwei Gewohnheiten. Geben Sie der Zahl eine Aufgabe, statt sie als Adjektiv stehen zu lassen: „35mm“ allein ist ein Token, während „35mm, the workshop visible behind her throughout“ sagt, wofür das Weitwinkel da ist — und dieser Teilsatz überlebt, selbst wenn die Zahl ignoriert wird. Googles dokumentierte optische Begriffe — shallow depth of field, deep focus, rack focus, telephoto — leisten dieselbe Arbeit in einfachen Worten. Und kombinieren Sie eine Brennweite nie mit einer widersprüchlichen Anweisung: „85mm wide establishing shot of the valley“ verlangt Kompression und Weite zugleich.
Der Bildausschnitt ist das Verlässlichste, das Sie angeben können
Sortiert man Kamerasprache danach, wie zuverlässig sie ankommt, zeigt sich ein Muster: statische Eigenschaften schlagen zeitliche.
Die Einstellungsgröße — von extreme close-up bis wide establishing — ist eine Eigenschaft eines einzelnen Frames. Das gilt auch für den Winkel und für die Geometrie eines Two-Shots oder einer Over-the-Shoulder. Das Modell kann jede davon im ersten gerenderten Frame erfüllen und dann halten.
Ein Dolly-in ist eine Behauptung über Frame eins gegenüber Frame sechsundneunzig, und sie muss jeden Frame dazwischen überstehen, in einem Prozess ohne explizite Repräsentation der Kameraposition. Genau diese Lücke soll die Forschungsliteratur schließen: CameraCtrl, die Referenzarbeit zur Kamerasteuerung in Video-Diffusion, beginnt mit der Feststellung, dass bestehenden Modellen „lack control of camera pose that serves as a cinematic language to express deeper narrative nuances“, und ergänzt dann ein Modul zur Posen-Konditionierung, weil Text allein nicht reichte. Keine uns bekannte produktive Video-API legt diesen Kanal offen.
Daraus folgt eine Hierarchie, die man sich merken sollte. Bildausschnitt und Winkel: frei angeben, Befolgung erwarten. Eine benannte Bewegung: meistens erwartbar. Zwei Bewegungen oder eine Bewegung mit angegebener Geschwindigkeit und Endpunkt: mehrere Takes einplanen oder den Beat aufteilen.

Vorher und nachher
Ein Prompt, geschrieben so, wie die meisten Kamera-Prompts geschrieben werden. Jedes Wort darin haben wir selbst schon verwendet.
Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.
Zählen Sie, was davon umsetzbar ist. Drei gestapelte Verben, die unmöglich alle in einem Take halten. Keine Einstellungsgröße, keine Brennweite, keine Anweisung zur Zahl der Einstellungen — der dokumentierte Multi-Shot-Default darf also feuern, und bei drei konkurrierenden Bewegungen auf dem Tisch ist der Schnitt der Weg des geringsten Widerstands.
Dieselbe Einstellung, umgeschrieben auf das, worauf das Modell reagieren kann:
In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.
Vier Änderungen, nach Gewicht geordnet. Der Teilsatz zur Zahl der Einstellungen steht zuerst, damit Mehrdeutigkeit nicht mit einem Schnitt beantwortet werden kann. Drei Bewegungen fallen auf eine zusammen, Anfangs- und Endausschnitt benannt — die phasenweise Beschreibung, die Runway empfiehlt, geschrieben als eine einzige Fahrt. Die Brennweite kommt mit einer Konsequenz verknüpft. Und der Ton bekommt eigene Sätze, gemäß Googles Empfehlung, Audio getrennt zu beschreiben, mit Negationen als kurzen nachgestellten Teilsätzen. Die Neufassung ist schlichter und langweiliger zu lesen, was meist das Zeichen dafür ist, dass ein Prompt aufgehört hat, eine Stimmung zu beschreiben, und angefangen hat, eine Einstellung zu beschreiben.
Wo die Kamera im Prompt steht
Bei der Reihenfolge hatten wir keine Antwort erwartet. Es gibt eine, aus Googles Veo-Anleitung statt von der Omni-Seite: Die Formel dort lautet cinematography, subject, action, context, style and ambiance — Kamera zuerst, bevor Sie benennen, wer im Bild ist —, weil dieses Element „is the most powerful tool for conveying tone and emotion.“ Omnis eigene Dokumentation listet die Elemente anders auf, Kamera in der Mitte, Google veröffentlicht also zwei Reihenfolgen, und wir haben keinen kontrollierten Vergleich gefahren.
Mit der Kamera zu beginnen übersteht den Kontakt mit Omnis übrigem dokumentiertem Verhalten, denn die Anweisung zur Zahl der Einstellungen muss ankommen, bevor das Modell mit dem Bau einer Erzählung beginnt. Es macht einen Prompt außerdem prüfbar: Beschreibt der erste Satz keinen Blickpunkt, haben Sie keine Einstellung inszeniert.
Was das Schema Ihnen nicht gibt
Zwei strukturelle Grenzen, keine davon durch bessere Formulierung behebbar.
Die erste ist Wiederholbarkeit. Googles API-Dokumentation stellt fest, dass „System instructions, temperature, top_p, stop sequences, and negative prompts are not supported“, und rät, Negationen stattdessen in den Prompt zu schreiben. Es gibt keinen Sampler zum Nachziehen. Übrig bleibt seed, ein optionaler Integer in unserem Schema für dieses Modell, und das ist die gesamte Steuerungsfläche.
Für Kameraarbeit zählt das mehr als für alles andere in einem Prompt. Licht, das leicht anders zurückkommt, ist eine andere Abstufung derselben Einstellung; ein Dolly, der als Schwenk zurückkommt, ist eine andere Einstellung. Eine Bewegung über mehrere Takes stabil zu halten heißt daher, den Seed festzuhalten und sonst nichts zu ändern — und ein geändertes Wort bedeutet, neu zu samplen. Behandeln Sie einen funktionierenden Seed als Vermögenswert und schreiben Sie ihn neben den Prompt.
Die zweite Grenze: Für die Geschwindigkeit der Kamera gibt es kein Vokabular. „Slow dolly in“ ist die Steuerungsfläche: keine Einheit, keine Dauer, keine Möglichkeit zu sagen, die Fahrt solle in der fünften Sekunde enden und dann halten. Timecode-Syntax hilft ein wenig — Omni nimmt Bereiche in eckigen Klammern —, ein Prompt kann die Kamera also bitten, sich bei vier Sekunden zu setzen. Ob sie das tut, ist eine andere Frage.
Verschlusswinkel und Bewegungsunschärfe stehen in derselben Spalte: Beide tauchen in Googles dokumentiertem Vokabular nicht auf. Die Bildrate ist knapp daneben — 24 fps erscheint auf der Omni-Seite nur innerhalb eines durchgerechneten Timing-Beispiels, „12 frames at 24fps“, nicht als Prompt-Hebel. Nützlich zum Nachdenken über Timecodes; nichts, das man hineinschreibt und davon Steuerung erwartet.
Was Kameraexperimente kosten, auf der Stufe, die zählt
Kameraarbeit ist der Teil des Promptings, den man nicht in einem Durchgang hinbekommt: Sie verlangen Verhalten über die Zeit, ohne Parameter, der es einschränkt — also generieren, ansehen, anpassen, erneut generieren. Die Zahl, die zählt, ist der Preis eines Takes.
In 4K kostet ein Acht-Sekunden-Take hier $1.44 gegen $2.43 beim direkten Aufruf von Google. Sechs Takes, um eine Bewegung zu landen — bescheiden für alles mit einer bestimmten Fahrt —, sind $8.64 gegen $14.60. Dieser Abstand beträgt 41 %, mit weitem Vorsprung der größte der vier Auflösungen und der Grund, warum die 4K-Zeile die einzige ist, über die sich zu streiten lohnt. Anderswo kostet eine 4K-Sekunde $0.30 bei fal, $0.32 bei Runware und $0.39 bei WaveSpeed, gegen $0.18 hier; Replicate listet das Modell ganz ohne Sekundenpreis.
Weniger ausgeben heißt allerdings nicht, eine günstigere 4K-Sekunde zu finden, sondern aufzuhören, Kamerabewegungen in 4K zu testen. Zehn Acht-Sekunden-Entwürfe auf der 360p-Stufe kosten $2.38, und 360p reicht, um zu sehen, ob die Kamera getan hat, worum Sie gebeten haben — eine Bewegung ist in jeder Auflösung lesbar, und genau das macht sie billig zu testen. Zehn Entwürfe plus ein 4K-Keeper sind $3.82, gegen $14.40 für zehn 4K-Takes.
Die obersten zwei Sprossen sind Upscales, keine nativen Renderings — Googles Modellreferenz bezeichnet sie als „1080p output (upscaled)“ und „4K output (upscaled)“ —, ein 4K-Take kauft also Ausliefermaße, nicht mehr Detail in der Einstellung, die Sie prüfen. Unser Beitrag über Vierzig-Sekunden-Szenen behandelt, wo sich das trotzdem lohnt.
Preise und Produktbedingungen können sich ändern. Prüfen Sie die aktuellen Preise jedes Anbieters, bevor Sie eine Kaufentscheidung treffen.
Die kürzere Fassung
Nennen Sie zuerst die Zahl der Einstellungen, dann eine Bewegung, dann den Bildausschnitt, mit dem sie beginnt und endet. Geben Sie einer Brennweite einen Grund, dort zu stehen. Setzen Sie Audio in eigene Sätze. Streichen Sie jedes Wort, das beschreibt, wie das Video jemanden fühlen lassen soll, und geben Sie den Platz dafür aus, wo die Kamera steht.
Was in 1.1 ausgeliefert wurde, steht im Launch-Bericht, und das Preis-Audit der Anbieter erklärt, warum identische Gewichte je nach Seite unterschiedlich viel kosten. Parameter und aktuelle Tarife stehen auf der text-to-video-Modellseite. Für eine einzelne Bewegung, an der nichts hängt, kalkulieren Sie zuerst Veo 3.1 Fast mit einem Cent pro Sekunde — das Kameravokabular stammt aus dem Guide, den Google für beide veröffentlicht, die Praxis überträgt sich also.
Häufige Fragen
Welche Begriffe für Kamerabewegungen versteht Gemini Omni 1.1 Flash?
Google benennt ein Bewegungsvokabular — static, pan und tilt, die Paare dolly, truck und pedestal, zoom, crane, drone oder aerial, handheld, whip pan, arc — plus Begriffe für Winkel, Einstellungsgröße und Optik. Es warnt zugleich, dass einige fortgeschrittene Kamerawinkel nicht offiziell unterstützt werden und die Zuverlässigkeit vom Prompt abhängt: Lesen Sie eine benannte Bewegung als Bitte, nicht als Parameter.
Bewirkt das Wort „cinematic“ in einem Video-Prompt irgendetwas?
Allein nicht viel. Runways Referenz zum Kamera-Prompting streicht sowohl „cinematic“ als auch „4k“ mit der Begründung, dass keines von beiden verändert, was die Kamera tut, und der Platz besser für die Benennung einer Bewegung genutzt wird. Das Wort beschreibt einen Eindruck statt eines Blickpunkts und gibt dem Modell daher nichts, worauf es reagieren könnte — wie „masterpiece“, „8k“ und der restliche Ballast aus dem Bild-Prompting.
Verändern Brennweitenangaben wie 35mm oder 85mm die Ausgabe?
Sie verschieben den Look, weil Fotos in den Trainingsdaten die Brennweite in ihren Metadaten tragen und die Zahl als Stilhinweis gelesen wird. Ein langes Objektiv neigt dazu, den Hintergrund zu komprimieren und das Motiv freizustellen; ein kurzes dehnt die Perspektive und lässt mehr vom Raum zu. Behandeln Sie das als visuelle Anweisung statt als buchstäbliche Optik und knüpfen Sie es an eine Konsequenz.
Wo sollte die Kameraanweisung in einem Omni-Prompt stehen?
Googles Veo-Prompting-Guide stellt die Kameraarbeit an den Anfang, vor Motiv, Handlung, Kontext und Stil, und nennt sie das wirkungsvollste Element zur Vermittlung von Tonfall. Omnis eigene Dokumentation platziert Kamerabegriffe in der Mitte. Beides ist Google. Mit der Kamera zu beginnen hat einen praktischen Vorteil: Die Anweisung zur Zahl der Einstellungen ist eine Kameraentscheidung und muss ankommen, bevor das Modell eine Erzählung baut.
Bekommt man dieselbe Kamerabewegung zweimal aus Gemini Omni 1.1 Flash?
Nur über die Wiederverwendung eines Seeds. Googles Dokumentation sagt, dass temperature, top_p, System-Anweisungen, Stoppsequenzen und negative Prompts nicht unterstützt werden, womit seed — ein optionaler Integer in unserem Schema — die gesamte Kontrolle über Reproduzierbarkeit ist. Ändern Sie ein Wort des Prompts, samplen Sie neu; halten Sie den Seed, der eine gute Bewegung erzeugt hat, in dem Moment fest, in dem sie funktioniert hat.
Warum schneidet die Kamera mitten in der Einstellung, obwohl ich eine Bewegung wollte?
Weil mehrere Einstellungen der Default sind. Google dokumentiert, dass Omni mehrere Einstellungen versucht und eine Erzählung baut, sofern nichts anderes gesagt wird — ein Prompt mit zwei oder drei gestapelten Bewegungen liefert also den Vorwand, jede in einem eigenen Schnitt zu erfüllen. Die dokumentierte Abhilfe ist ein Teilsatz, der eine ununterbrochene Szene verlangt, und die Rückkehr zu einer einzigen benannten Bewegung nimmt den Anreiz.
Kann man Verschlusszeit oder Bildrate in einem Gemini-Omni-Prompt angeben?
Nichts in Googles dokumentiertem Kameravokabular deckt Verschlusswinkel oder Bewegungsunschärfe ab, und wir würden nicht behaupten, dass diese Begriffe befolgt werden. Auch die Bildrate ist kein Prompt-Hebel: 24 fps erscheint auf Googles Omni-Seite in einem Timing-Beispiel — „12 frames at 24fps“ — und nicht als einstellbare Spezifikation. Regeln Sie die Bildrate in der Postproduktion.
Was kostet es, Kamera-Prompts in 4K zu testen?
Ein Acht-Sekunden-Take in 4K kostet $1.44 auf E2X gegen $2.43 beim direkten Aufruf von Google, sechs Takes kommen also auf $8.64 statt $14.60 — ein Abstand von 41 %, der größte der vier Auflösungen. In 4K zu testen ist allerdings meist verschwendet: Eine Bewegung ist in 360p lesbar, wo zehn Acht-Sekunden-Entwürfe zusammen $2.38 kosten, und ein 4K-Keeper bringt den Durchgang auf $3.82.