Fotorealistische Menschen auf Gemini Omni 1.1 Flash: Streichen Sie das Wort „schön“
Der schnellste Weg, einen generierten Menschen falsch aussehen zu lassen, ist, um einen attraktiven zu bitten.
Schreiben Sie beautiful woman, perfect skin, flawless, stunning, und das Modell gehorcht — es greift in die Region seiner Trainingsdaten, in der diese Bildunterschriften leben, und das ist retuschierte Werbefotografie. Poren weg, Asymmetrie weg, und die kleinen Spannungen, die ein Gesicht als von jemandem bewohnt lesbar machen, gleich mit. Nichts an der Ausgabe ist falsch. Der Prompt hat um eine Kosmetikanzeige gebeten und eine bekommen.
Googles eigene Prompt-Anleitung weist in einem Satz in die andere Richtung — „Be extremely detailed in your descriptions of characters and environments.“ Detailliert, nicht schmeichelhaft. Das sind verschiedene Anweisungen und sie erzeugen verschiedene Gesichter. Es folgt der Unterschied: Gesichter, Hände, das Audio, das Sie nicht abschalten können, und wo Google entschieden hat, dass Sie nicht hindürfen.

Ein Gesicht ist eine Liste von Fakten, keine Liste von Komplimenten
Jedes Adjektiv ist eine Stimme für ein Caption-Cluster, und gorgeous stimmt für Stockfotografie. 8k, hyperrealistic, masterpiece stammen aus der Folklore der Bildmodelle, wo sie als Qualitätstokens dienten; auf einem Videomodell ohne Sampling-Parameter konkurrieren sie nur mit den Wörtern, die Ihre Einstellung beschreiben. Die Ersatzformulierungen sind konkret und langweilig, und genau das ist der Punkt:
Alter als Zahl oder Jahrzehnt. „Eine Frau Ende vierzig“ ist eine Einschränkung; „eine junge Frau“ ist ein Lottoschein.
Eine benannte Unvollkommenheit. Eine erhabene Narbe, ein abgesplitterter Schneidezahn, eine einmal gebrochene und leicht schief verheilte Nase. Eine reicht; drei liest sich wie ein Charakterbogen.
Haut als Oberfläche. Sichtbare Poren über Nase und Wangen, Glanz auf der Stirn, geplatzte Äderchen am Nasenflügel. Die ertragreichste Ersetzung im Prompt: „perfect skin“ und „visible pores across the nose“ liegen an entgegengesetzten Enden des Caption-Raums.
Blick mit Richtung und Wechsel. Nicht „looking at the camera“, sondern „reads something off frame to the right, then her eyes flick to the lens for about a second and away again“. Ununterbrochener Blickkontakt über einen ganzen Clip ist etwas, das fast kein Mensch tut, und eine unbestimmte Blickachse lässt das Modell also genau bei dem raten, was ein Betrachter zuerst liest.
Eine Mikro-Expression, getimt. „The corner of her mouth tightens once.“ Ein inszeniertes Ereignis schlägt „emotional“, weil das Modell ein Ereignis inszenieren kann und eine Abstraktion nicht.
Abnutzung an allem, was nicht Haut ist. Ein zweihundertmal gewaschener Kragen, ein weiches Uhrenarmband, ein Kaffeering auf den Papieren. Garderobe verkauft eine Person zuverlässiger als ein Gesicht.
Der Tausch, konkret gemacht. Zuerst die Version, die aussieht wie ein Stockfoto, das blinzeln gelernt hat:
A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.
Die meisten dieser Wörter beschreiben eine Fotografie; keines beschreibt einen Menschen. Die Neufassung behält die Einstellung und tauscht jedes Kompliment gegen einen Fakt:
In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.
Nichts in der zweiten Fassung bittet um Qualität. Sie liefert eine Textur zum Rendern, einen Grund für die Blickachse und ein getimtes Ereignis — drei Dinge, auf die das Modell reagieren kann, wo „stunning“ drei Dinge sind, auf die es nicht reagieren kann. Beachten Sie auch den Teilsatz zur Zahl der Einstellungen ganz vorn: Omni baut standardmäßig mehrere Einstellungen, wie wir im Prompting-Guide behandelt haben, und ein Porträt, das in sechs Sekunden zweimal schneidet, kann kein Gesicht halten.

Eine Warnung zu den Augen: „wet eyes“ und „glossy tear film“ sind Qualitätswörter im technischen Kostüm, sie benennen ein Glanzlicht statt einer Ursache. Geben Sie dem Auge etwas zu tun und lassen Sie den Glanzpunkt aus dem Licht folgen, das Sie ohnehin angegeben haben.
Hände: geben Sie ihnen eine Aufgabe
Hände sind die traditionelle Peinlichkeit generativer Videos und immer noch das, was einen Take am ehesten beendet. Die Modellkarte von DeepMind hebt sie nicht eigens hervor, benennt aber ihre Kategorie: „maintaining complete consistency throughout edits, generating scenes with complex motion, or rendering perfectly accurate text remains a challenge.“ Finger sind komplexe Bewegung auf kleiner Bildfläche, vielfach gelenkig und ständig selbstverdeckend.
Die Abhilfe ist kontraintuitiv. Beschreiben Sie die Hände nicht — geben Sie ihnen eine Aufgabe. Eine Hand, die ein bestimmtes Objekt mit angegebenem Griff hält, hat eine Form und einen Kontaktpunkt zum Verankern. „Beautiful, elegant hands“ liefert keines von beidem und überlässt die Fingerzahl der Erfindung des Modells.
Vergleichen Sie:
- Schwach: her hands rest naturally at her sides
- Besser: she holds a chipped enamel mug in both hands, thumbs overlapping on the near side
- Schwach: he gestures while speaking
- Besser: he turns a pen over in his right hand twice, then sets it down on the papers
Die zweite Form jedes Paares legt die Fingerzahl implizit fest, gibt der Bewegung Anfang und Ende und erzeugt einen Beat, auf den Sie schneiden können.
Ein Vorbehalt, der für jede Drittangabe in diesem Beitrag gilt. Die beiden veröffentlichten Praxisberichte, die wir finden konnten — der von invideo und der Multi-Turn-Test des JXP-Teams, datiert auf den 21. Mai 2026 — nennen das getestete Modell beide Gemini Omni Flash, ohne 1.1-Suffix an irgendeiner Stelle. Keiner misst das Modell, um das es hier geht; lesen Sie sie als Evidenz über die Familie. JXP berichtet, dass beim fünften Bearbeitungsschritt einer Geigen-Einstellung „Her left hand drifted slightly off the fingerboard.“ Die Hände gingen zuerst, während alles andere noch hielt.
Zwei weitere Regeln, die nichts kosten. Halten Sie Hände in einer Schärfeebene — eine Hand, die einem Weitwinkel entgegengestreckt wird, ist das Schwierigste, worum Sie bitten können. Und halten Sie Hände vom Gesicht fern, weil Verdeckung zwischen zwei schwierigen Strukturen den Fehler potenziert statt ihn zu mitteln.

Sie inszenieren eine Stimme, ob Sie wollen oder nicht
Audio ist hier nativ: im selben Durchgang wie das Bild erzeugt, durch keinen Parameter abschaltbar, von keinem uns bekannten Anbieter getrennt abgerechnet. Ein Prompt, der nichts über Ton sagt, ist daher keine Bitte um Stille — er ist ein unbeaufsichtigtes Briefing, und das Modell wird es füllen.
Schreiben Sie das Audio also bewusst, in eigenen Sätzen. Googles dokumentierte Dialogform ist ein Doppelpunkt ohne Anführungszeichen — the man says: We lost it —, und die viel wiederholte Behauptung, Anführungszeichen lösten einen Lippensynchronisationsmodus aus, steht in keinem Google-Dokument.
Vier Dinge entscheiden, ob eine Sprecheinstellung funktioniert:
Zeilenlänge. invideo berichtet in einem Review, das das getestete Modell als Gemini Omni Flash benennt, dass „For a single person talking, the lip sync holds up until about 6 to 7 seconds before it begins to drop off.“ Eher eine Richtung als eine Spezifikation, aber sie zeigt eindeutig hin: Eine Zeile aus vier bis zwölf Wörtern, früh platziert, dann Stille und eine Reaktion, schlägt einen Satz, der über die ganze Länge des Takes läuft.
Eine sprechende Person im Bild. Dasselbe Review ist unumwunden: „Two speakers in one frame remain a weak spot, since Omni often drops sync or misattributes dialogue, so single-speaker shots are the safe bet today.“ Machen Sie die zweite Person zu einer Schulter am Bildrand, unscharf, und drehen Sie ihre Zeile als eigene Generierung.
Stimmführung in Prosa. Es gibt keinen Stimmparameter, also gehen Akzent, Alter, Register und Tempo als gewöhnliches Englisch hinein: tired, quiet, American accent, no rise at the end.
Ausdrückliche Stille. Schreiben Sie No dialogue. oder No music.
Vorher und nachher für eine Dialogeinstellung. Die schwache Fassung begeht jeden der obigen Fehler auf einmal — zwei Sprechende im Bild, Anführungszeichen, je eine Zeile, Adjektive statt Regie:
A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.
Die Neufassung nimmt eine sprechende Person aus dem Bild, kürzt die Zeile auf vier Wörter und beschreibt die Stimme, statt sie zu loben:
In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.
Ihre Antwort gehört in eine zweite Generierung, auf sie gerahmt — zwei Clips statt einem, und immer noch günstiger, als ein Zwiegespräch achtmal neu zu würfeln in der Hoffnung, dass die Lippensynchronität auf beiden Gesichtern zugleich sitzt.
Eine dokumentierte Grenze: Sie können ein hochgeladenes Video einer sprechenden Person nicht mit neuem Dialog fortsetzen. Das ist vorenthalten, nicht fehlend, und die Modellkarte sagt es klar — „As part of editing videos, Gemini Omni Flash is capable of changing people's speech. For now, we are restricting this capability and working to better understand how to safely and responsibly bring it to our users.“ Das Modell kann eine Person neu vertonen; Google hat entschieden, dass Sie das nicht dürfen. Synchronisation ist hier kein Produkt, das Sie bauen können.
Menschenmengen, Hintergrundfiguren und wo man nicht investiert
Hintergrundpersonen bekommen die Aufmerksamkeit, die übrig bleibt, und eine belebte Straße voller Passanten ist eine Reihe von Gesichtern, die die Pausetaste nicht überstehen. Geben Sie eine Zahl an — „four people at scattered tables“ schlägt „a crowded café“, weil vage Mengen Näherungen einladen. Halten Sie sie außerhalb der Schärfeebene, denn Figuren, die von einem offenen 50mm weichgezeichnet werden, sind glaubwürdig, wo dieselben Figuren scharf bei f/11 eine Galerie von Beinahe-Treffern sind. Und geben Sie ihnen je eine Handlung, abgewandt: Hinterköpfe sind gratis. Wenn ein bestimmtes Hintergrundgesicht wichtig ist, befördern Sie es in eine eigene Einstellung.
Was die Takes kosten und warum 4K die Zahl ist, die zählt
An Gesichtern verbrennen Sie Generierungen — Sie würfeln neu für die Blickachse, dann für die Hand, dann weil die Stimme zwanzig Jahre zu jung klang. Diese Arbeit ehrlich zu bepreisen heißt, Takes zu bepreisen, nicht Clips. Und der Anbieterabstand ist an der Spitze der Leiter am größten. Zehn Sekunden 4K, Stand 29. August 2026:
| Wo Sie es aufrufen | 10 s in 4K |
|---|---|
| E2X | $1.80 |
| fal | $3.00 |
| Google, direkt | $3.04 |
| Runware | $3.20 |
| WaveSpeed | $3.90 |
Googles Wert leitet sich aus der veröffentlichten Token-pro-Sekunde-Rate ab statt aus einem Listenpreis, und fals Wert ist eine Durchreichung von Googles Liste statt einer eigenständigen Einschätzung der Rechenkosten. Die Spanne ist strukturell: Von der 720p-Basis aus verlangt Google für 4K das Dreifache, wo wir das Doppelte verlangen. 41 % weniger in 4K ist der größte unserer vier Stufen, und ein Acht-Sekunden-Take kostet hier $1.44 gegen $2.43 direkt. Das Audit Anbieter für Anbieter hat den Rest.
Die andere Hälfte der Rechnung ist, wo Sie iterieren. Zehn Suchdurchgänge in 360p plus ein Finish in 1080p kosten $1.73 gegen $5.40 für zehn direkte 1080p-Durchgänge — achtundsechzig Prozent weniger für eine zusätzliche Generierung. Ein Entwurfsdurchgang trägt genug Auflösung für Blickachse, Anordnung und die Frage, ob die Hand den Becher gefunden hat; nicht genug für Hauttextur oder Lippensynchronität, planen Sie also zwei Takes in voller Auflösung ein, nachdem die Schleife geschlossen ist. Und fragen Sie, ob die Einstellung dieses Modell braucht: Veo 3.1 Fast läuft hier für einen Cent pro Sekunde, und für ein einzelnes Porträt ohne Fortsetzung kauft der neunfache Aufpreis sehr wenig.
Die Grenzen, klar benannt
Kein Haftungsausschluss-Abschnitt. Jeder Punkt darunter hat schon jemandem den Projektplan verändert.
SynthID steckt in jedem Frame, und es gibt keinen Schalter. Googles Wortlaut: „All generated videos include SynthID watermarking, which is invisible to viewers but can be detected programmatically for provenance verification.“ Kein Anbieter legt einen Umschalter offen, und weil die Markierung so gebaut ist, dass sie Neukodierung, Beschnitt und Farbänderungen übersteht, ist „wir entfernen das in der Post“ kein Plan. Wenn ein Liefervertrag Assets mit Wasserzeichen verbietet, klären Sie das, bevor Sie rendern.
Das Bearbeiten hochgeladener Videos ist im EWR, in der Schweiz und im Vereinigten Königreich nicht verfügbar. Googles Zeile, samt der Klammer, die entscheidet, wie schlimm das für Sie ist: „Editing or extending uploaded videos is not currently available for users in the European Economic Area (EEA), Switzerland, and the United Kingdom (editing or extending videos generated by the model is supported).“ Ein europäisches Team kann weiterhin eine Einstellung erzeugen und die eigene Ausgabe erweitern; was es nicht kann, ist Material fortsetzen, das ein Nutzer hochgeladen hat. Die Folgen haben wir im Beitrag zu Vierzig-Sekunden-Szenen behandelt — der teuerste Punkt hier, wenn man ihn spät entdeckt.
Uploads mit bestimmten Personen werden abgelehnt. Zwei weitere Zeilen aus demselben Abschnitt zu Einschränkungen, beide auf diese Regionen bezogen: „Uploading and editing images containing minors is not supported in European Economic Area, Switzerland, and the United Kingdom“ und „Uploading and editing images containing certain recognizable people is not supported in European Economic Area, Switzerland, and the United Kingdom.“ Die Ablehnungsfläche wirkt breiter als dieser Wortlaut: JXP berichtet im selben Review aus der Vorgängerzeit, ein Prompt mit einem echten Markennamen „was blocked at submission with a generic policy message“, und eine Anfrage, „age a generic adult character ten years“, sei ebenfalls blockiert worden. Bauen Sie keine Pipeline, die darauf angewiesen ist, dass Ablehnungen ausbleiben.
Reale Personen sind zuerst eine rechtliche und erst dann eine technische Frage. Ein erkennbares Abbild einer tatsächlichen Person, ohne deren Einverständnis erzeugt, trifft auf Persönlichkeits- und Verwertungsrechte, die je nach Rechtsordnung variieren und nicht deshalb entfallen, weil die Ausgabe synthetisch ist. Davon getrennt gelten Transparenzpflichten nach Artikel 50 der EU-KI-Verordnung ab dem 2. August 2026: Betreiber müssen offenlegen, dass Inhalte künstlich erzeugt oder manipuliert wurden, klar und bei der ersten Konfrontation. SynthID beantwortet eine Anforderung an maschinenlesbare Kennzeichnung; es beantwortet nicht die Pflicht, es der zuschauenden Person zu sagen. Das ist eine Kennzeichnungsentscheidung, die mit Rechtsberatung fällt und nicht als Flag im API-Aufruf.
Ein generiertes Gesicht ist keine Person, aber es kann nah genug an einer liegen, dass jemand zu Schaden kommt. Einwilligung, Offenlegung und die Bereitschaft, eine Einstellung nicht zu machen, gehören zu diesem Handwerk so wie die Brennweite.
Häufige Fragen
Wie bekommt man realistische Haut in Gemini Omni 1.1 Flash?
Beschreiben Sie die Oberfläche, statt sie zu loben. „Perfect skin“, „flawless“ und „beautiful“ selektieren auf retuschierte Werbebilder und flachen die Textur ab. Tauschen Sie sie gegen beobachtbare Fakten — sichtbare Poren über Nase und Wangen, Glanz auf der Stirn, eine kleine Narbe — und nennen Sie ein Alter. Google bittet um äußerst detaillierte Figurenbeschreibung, was nicht dasselbe ist wie die Bitte um eine attraktive Figur.
Warum sehen Hände in KI-Videos falsch aus und wie behebt man das im Prompt?
Finger sind komplexe Bewegung in einer kleinen, selbstverdeckenden Region, und Googles Modellkarte benennt komplexe Bewegung als etwas, das „remains a challenge.“ Geben Sie Händen eine Aufgabe, statt sie zu beschreiben: ein bestimmtes Objekt mit angegebenem Griff oder eine Handlung mit Anfang und Ende. Halten Sie sie in einer Schärfeebene, weg vom Gesicht.
Kann man Audio in Gemini Omni 1.1 Flash abschalten?
Nein. Audio wird nativ zusammen mit dem Bild erzeugt, kein Parameter deaktiviert es, und es wird nicht getrennt vom Sekundenpreis abgerechnet. Sie können es mit einem „Sound design:“-Satz und ausdrücklichen „No dialogue.“- oder „No music.“-Teilsätzen steuern, aber nicht ablehnen. Für stumme Wiedergabe schalten Sie den Player stumm.
Wie sollte Dialog in einem Omni-Prompt geschrieben werden?
Verwenden Sie Googles dokumentierte Form: Sprecher, Doppelpunkt, Zeile, keine Anführungszeichen. Die Stimmführung folgt in einfacher Prosa, denn einen Stimmparameter gibt es nicht — Akzent, Alter, Register und Tempo kommen alle als Englisch an. Halten Sie Zeilen kurz, platzieren Sie sie früh, beschreiben Sie den Tonfall, statt um „emotionale“ Darbietung zu bitten.
Wie lange hält Gemini Omni die Lippensynchronität?
invideo berichtet in einem Review, das das getestete Modell als Gemini Omni Flash und nicht als 1.1 benennt, dass die Lippensynchronität bei einer einzelnen sprechenden Person etwa sechs bis sieben Sekunden hält, bevor sie abfällt, und nennt zwei Sprechende in einem Bild eine Schwachstelle, an der das Modell die Synchronität verliert oder Dialog falsch zuordnet. Der Befund eines Testers zu einem früheren Modell, keine Google-Spezifikation, aber er spricht für eine sprechende Person pro Generierung und kurze, früh platzierte Zeilen.
Kann Gemini Omni 1.1 Flash das Abbild einer realen Person erzeugen?
Nicht zuverlässig, und denken Sie gründlich nach, bevor Sie es versuchen. Googles Dokumentation sagt, dass das Hochladen und Bearbeiten von Bildern mit bestimmten erkennbaren Personen im EWR, in der Schweiz und im Vereinigten Königreich nicht unterstützt wird, und Tester berichten von Ablehnungen bei echten Markennamen und gewöhnlichen Figurenänderungen. Jenseits des Filters variieren Rechte am eigenen Bild je nach Rechtsordnung und entfallen nicht, weil das Material synthetisch ist.
Erscheint das SynthID-Wasserzeichen in jedem Frame und kann es entfernt werden?
Jedes erzeugte Video trägt SynthID, bei der Generierung eingebettet, für Betrachter unsichtbar und programmatisch nachweisbar. Kein Anbieter legt einen Schalter offen, und die Markierung übersteht Kompression, Beschnitt und Farbänderungen, Entfernung ist also kein Workflow, mit dem Sie planen können. Wenn eine Lieferspezifikation Material mit Wasserzeichen untersagt, klären Sie das vor dem Rendern.
Ist es günstiger, an Gesichtern in niedriger Auflösung zu iterieren?
Ja, deutlich. Zehn Suchdurchgänge in 360p plus ein Finish in 1080p kosten $1.73 auf E2X gegen $5.40 für zehn Durchgänge in 1080p — achtundsechzig Prozent weniger für eine zusätzliche Generierung. Entwurfsdurchgänge tragen genug Auflösung für Blickachse und Anordnung, aber nicht für Hauttextur oder Lippensynchronität, planen Sie also zwei Takes in voller Auflösung ein, nachdem die Entwurfsschleife geschlossen ist.
Preise und Produktbedingungen ändern sich. Prüfen Sie die aktuellen Preise jedes Anbieters, bevor Sie eine Kaufentscheidung treffen.
Schemata und aktuelle Tarife für alle vier Capabilities stehen auf der Modellseite. Nebenan: die dokumentierte Prompt-Syntax, was Vierzig-Sekunden-Sequenzen tatsächlich kosten und wo dieselben Gewichte teurer verkauft werden.