Retour au blog

Des humains photoréalistes sur Gemini Omni 1.1 Flash : supprimez le mot « belle »

E2X Team··19 min de lecture
gemini-omniprompt-engineeringphotorealismtext-to-videogoogle

Le moyen le plus rapide de rendre un humain généré artificiel est d'en demander un séduisant.

Écrivez beautiful woman, perfect skin, flawless, stunning et le modèle obéit — il puise dans la région de ses données d'entraînement où vivent ces légendes, c'est-à-dire la photographie commerciale retouchée. Pores disparus, asymétrie disparue, et avec eux les petites tensions qui font lire un visage comme habité par quelqu'un. Rien dans le résultat n'est faux. Le prompt a demandé une publicité de cosmétique et en a obtenu une.

Les propres consignes de prompt de Google pointent dans l'autre direction en une phrase : « Be extremely detailed in your descriptions of characters and environments. » Détaillé, pas flatteur. Ce sont deux instructions différentes et elles produisent des visages différents. Ce qui suit, c'est cette différence : les visages, les mains, l'audio que vous ne pouvez pas couper, et les endroits où Google a décidé que vous n'iriez pas.

Portrait en très gros plan d'un homme d'une soixantaine d'années près d'une fenêtre exposée au nord, remplissant le cadre du sourcil au menton, une lumière du jour douce et directionnelle détaillant la texture des pores et la barbe grise de quelques jours

Un visage est une liste de faits, pas une liste de compliments

Chaque adjectif est un vote pour un groupe de légendes, et gorgeous vote pour la banque d'images. 8k, hyperrealistic, masterpiece viennent du folklore des modèles d'image, où ils servaient de tokens de qualité ; sur un modèle vidéo sans paramètres d'échantillonnage, ils ne font que concurrencer les mots qui décrivent votre plan. Les remplacements sont précis et ennuyeux, et c'est tout l'intérêt :

L'âge en nombre ou en décennie. « Une femme d'une petite cinquantaine » est une contrainte ; « une jeune femme » est un billet de loterie.

Une imperfection nommée. Une cicatrice en relief, une incisive ébréchée, un nez cassé une fois et remis légèrement de travers. Une suffit ; trois se lisent comme une fiche de personnage.

La peau comme surface. Des pores visibles sur le nez et les joues, de la brillance sur le front, des capillaires éclatés à l'aile du nez. La substitution la plus rentable du prompt : « perfect skin » et « visible pores across the nose » sont aux extrémités opposées de l'espace des légendes.

Un regard avec une direction et un changement. Pas « looking at the camera » mais « reads something off frame to the right, then her eyes flick to the lens for about a second and away again ». Un contact visuel ininterrompu sur tout un clip est une chose que presque aucun humain ne fait : une ligne de regard non spécifiée laisse donc le modèle deviner ce qu'un spectateur lit en premier.

Une micro-expression, minutée. « The corner of her mouth tightens once. » Un événement mis en scène bat « emotional », parce que le modèle sait mettre en scène un événement et ne sait pas mettre en scène une abstraction.

De l'usure sur tout ce qui n'est pas de la peau. Un col lavé deux cents fois, un bracelet de montre assoupli, une trace de tasse sur les papiers. Le costume vend une personne plus sûrement qu'un visage.

L'échange, rendu concret. D'abord la version qui ressemble à une photo de banque d'images ayant appris à cligner des yeux :

A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.

La plupart de ces mots décrivent une photographie ; aucun ne décrit une personne. La réécriture garde le plan et remplace chaque compliment par un fait :

In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.

Rien dans la seconde version ne demande de la qualité. Elle fournit une texture à rendre, une raison à la ligne de regard et un événement minuté — trois choses sur lesquelles le modèle peut agir, là où « stunning » en est trois sur lesquelles il ne peut pas. Notez aussi la proposition sur le nombre de plans en tête : Omni construit plusieurs plans par défaut, comme nous l'avons vu dans le guide de prompting, et un portrait qui coupe deux fois en six secondes ne peut pas tenir un visage.

Macro extrême d'une joue et d'une tempe humaines éclairées par une lumière rasante dure venue de l'extrême gauche, une moitié du cadre lumineuse et texturée, l'autre s'enfonçant dans l'ombre

Une précaution sur les yeux : « wet eyes » et « glossy tear film » sont des mots de qualité en costume technique, ils nomment un reflet plutôt qu'une cause. Donnez quelque chose à faire à l'œil et laissez le spéculaire découler de la lumière que vous avez déjà spécifiée.

Les mains : donnez-leur un travail

Les mains sont l'embarras traditionnel de la vidéo générative et restent ce qui fait le plus souvent échouer une prise. La fiche modèle de DeepMind ne les isole pas, mais elle nomme leur catégorie : « maintaining complete consistency throughout edits, generating scenes with complex motion, or rendering perfectly accurate text remains a challenge. » Les doigts sont du mouvement complexe sur une petite portion d'image, articulés de multiples façons et constamment auto-occultants.

Le correctif est contre-intuitif. Ne décrivez pas les mains — assignez-leur une tâche. Une main qui tient un objet précis avec une prise décrite possède une forme et un point de contact où s'ancrer. « Beautiful, elegant hands » ne fournit ni l'un ni l'autre et laisse le nombre de doigts à l'invention du modèle.

Comparez :

  • Faible : her hands rest naturally at her sides
  • Mieux : she holds a chipped enamel mug in both hands, thumbs overlapping on the near side
  • Faible : he gestures while speaking
  • Mieux : he turns a pen over in his right hand twice, then sets it down on the papers

La seconde forme de chaque paire fixe implicitement le nombre de doigts, donne un début et une fin au mouvement, et produit un temps sur lequel vous pouvez couper.

Une réserve qui vaut pour tous les chiffres tiers de ce billet. Les deux tests publiés que nous avons pu trouver — celui d'invideo et le test multi-tours de l'équipe JXP, daté du 21 mai 2026 — nomment tous deux le modèle testé Gemini Omni Flash, sans aucun suffixe 1.1. Ni l'un ni l'autre ne mesure le modèle dont parle ce billet ; lisez-les comme des indices sur la famille. JXP rapporte qu'au cinquième tour d'édition d'un plan de violon, « Her left hand drifted slightly off the fingerboard. » Les mains ont lâché en premier, alors que tout le reste tenait encore.

Deux règles supplémentaires qui ne coûtent rien. Gardez les mains dans un seul plan de netteté — une main tendue vers un grand angle est la chose la plus difficile que vous puissiez demander. Et éloignez les mains du visage, parce que l'occultation entre deux structures difficiles aggrave l'échec au lieu de le moyenner.

Photographie macro des deux mains mouillées d'un potier se refermant sur un cylindre d'argile en rotation, la barbotine coulant entre les doigts, tendons et plis des phalanges soulignés par la lumière

Vous dirigez une voix, que vous l'ayez voulu ou non

L'audio est ici natif : produit dans la même passe que l'image, désactivable par aucun paramètre, facturé séparément par aucun fournisseur que nous ayons vérifié. Un prompt qui ne dit rien du son n'est donc pas une demande de silence — c'est un brief laissé sans surveillance, et le modèle le remplira.

Écrivez donc l'audio délibérément, dans ses propres phrases. La forme de dialogue documentée par Google est un deux-points sans guillemets — the man says: We lost it — et l'affirmation très répétée selon laquelle les guillemets déclencheraient un mode lip-sync n'apparaît dans aucun document Google.

Quatre choses décident si un plan parlé fonctionne :

La longueur de la réplique. invideo, dans un test qui nomme le modèle testé Gemini Omni Flash, rapporte que « For a single person talking, the lip sync holds up until about 6 to 7 seconds before it begins to drop off. » Une direction plutôt qu'une spécification, mais elle pointe d'un seul côté : une réplique de quatre à douze mots placée tôt, puis du silence et une réaction, vaut mieux qu'une phrase qui court sur toute la durée de la prise.

Un seul locuteur dans le cadre. Le même test est catégorique : « Two speakers in one frame remain a weak spot, since Omni often drops sync or misattributes dialogue, so single-speaker shots are the safe bet today. » Faites de la seconde personne une épaule en bord de cadre, hors netteté, et tournez sa réplique dans une génération séparée.

La direction de voix en prose. Aucun paramètre de voix n'existe : accent, âge, registre et débit entrent donc comme de l'anglais ordinaire — tired, quiet, American accent, no rise at the end.

Le silence explicite. Écrivez No dialogue. ou No music.

Avant et après pour un plan de dialogue. La version faible commet toutes les erreurs ci-dessus à la fois — deux locuteurs dans le cadre, des guillemets, une réplique chacun, des adjectifs à la place de la direction :

A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.

La réécriture sort un locuteur du cadre, réduit la réplique à quatre mots et décrit la voix au lieu de la vanter :

In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.

Sa réponse appartient à une seconde génération, cadrée sur elle — deux clips au lieu d'un, et toujours moins cher que de relancer huit fois un champ-contrechamp en espérant que la synchronisation tombe juste sur les deux visages à la fois.

Une limite documentée : vous ne pouvez pas prendre une vidéo téléversée d'une personne qui parle et la prolonger avec un nouveau dialogue. C'est retenu, pas absent, et la fiche modèle le dit clairement — « As part of editing videos, Gemini Omni Flash is capable of changing people's speech. For now, we are restricting this capability and working to better understand how to safely and responsibly bring it to our users. » Le modèle sait revoicer une personne ; Google a décidé que vous n'en aviez pas le droit. Le doublage n'est pas un produit que vous pouvez bâtir ici.

Foules, figurants et là où il ne faut pas dépenser

Les personnes d'arrière-plan reçoivent l'attention qui reste, et une rue passante de piétons est une rangée de visages qui ne survivra pas à une pause. Donnez un nombre — « four people at scattered tables » vaut mieux que « a crowded café », parce qu'une quantité vague invite aux approximations. Gardez-les hors du plan de netteté, puisque des silhouettes adoucies par un 50mm ouvert sont crédibles là où les mêmes silhouettes nettes à f/11 forment une galerie de quasi-ratés. Et donnez-leur une action chacune, de dos : les nuques sont gratuites. Si un visage d'arrière-plan précis compte, promouvez-le en plan à part entière.

Ce que coûtent les prises, et pourquoi la 4K est le chiffre qui compte

Les visages sont l'endroit où vous brûlez des générations — vous relancez pour la ligne de regard, puis pour la main, puis parce que la voix est sortie avec vingt ans de trop peu. Chiffrer honnêtement ce travail, c'est chiffrer des prises, pas des clips. Et l'écart entre fournisseurs est le plus large en haut de l'échelle. Dix secondes de 4K, au 29 août 2026 :

Où vous l'appelez10 s en 4K
E2X$1.80
fal$3.00
Google, en direct$3.04
Runware$3.20
WaveSpeed$3.90

Le chiffre de Google dérive de son tarif publié en tokens par seconde plutôt que d'un prix affiché, et celui de fal est une répercussion de la liste de Google plutôt qu'une lecture indépendante du calcul. L'écart est structurel : depuis la base 720p, Google triple pour la 4K là où nous doublons. 41 % de moins en 4K est le plus grand de nos quatre paliers, et une prise de huit secondes coûte $1.44 ici contre $2.43 en direct. L'audit fournisseur par fournisseur contient le reste.

L'autre moitié du calcul est le lieu où vous itérez. Dix passes de recherche en 360p plus une finition en 1080p reviennent à $1.73 contre $5.40 pour dix passes directes en 1080p — soixante-huit pour cent d'économie pour une génération supplémentaire. Une passe de brouillon porte assez de résolution pour la ligne de regard, le placement et la question de savoir si la main a trouvé la tasse ; pas assez pour la texture de peau ou la synchronisation labiale, prévoyez donc deux prises en pleine résolution une fois la boucle refermée. Et demandez-vous si le plan a besoin de ce modèle : Veo 3.1 Fast tourne à un cent la seconde ici, et pour un simple portrait sans continuation, la prime neuf fois supérieure achète très peu.

Les limites, énoncées franchement

Ce n'est pas une section d'avertissement. Chacun des points ci-dessous a déjà modifié le plan de projet de quelqu'un.

SynthID est dans chaque image, et il n'y a pas d'interrupteur. Les mots de Google : « All generated videos include SynthID watermarking, which is invisible to viewers but can be detected programmatically for provenance verification. » Aucun fournisseur n'expose de bascule, et parce que la marque est conçue pour survivre au réencodage, au recadrage et aux changements de couleur, « on l'enlèvera en post » n'est pas un plan. Si un contrat de livraison interdit les assets tatoués, réglez la question avant de rendre.

L'édition de vidéos téléversées est indisponible dans l'EEE, en Suisse et au Royaume-Uni. La ligne de Google, y compris la parenthèse qui décide de la gravité du problème pour vous : « Editing or extending uploaded videos is not currently available for users in the European Economic Area (EEA), Switzerland, and the United Kingdom (editing or extending videos generated by the model is supported). » Une équipe européenne peut encore générer un plan et prolonger sa propre sortie ; ce qu'elle ne peut pas faire, c'est prolonger des images téléversées par un utilisateur. Nous en avons traité les conséquences dans le billet sur les scènes de quarante secondes — l'élément le plus coûteux à découvrir tardivement.

Les téléversements contenant certaines personnes sont refusés. Deux autres lignes de la même section de limitations, toutes deux cantonnées à ces régions : « Uploading and editing images containing minors is not supported in European Economic Area, Switzerland, and the United Kingdom », et « Uploading and editing images containing certain recognizable people is not supported in European Economic Area, Switzerland, and the United Kingdom. » La surface de refus paraît plus large que cette formulation : JXP, dans le même test de l'époque du prédécesseur, rapporte qu'un prompt nommant une marque réelle « was blocked at submission with a generic policy message », et qu'une demande de « age a generic adult character ten years » a été bloquée aussi. Ne construisez pas un pipeline qui dépend de l'absence de refus.

Les personnes réelles sont une question juridique avant d'être technique. Une ressemblance reconnaissable d'une personne réelle, produite sans son accord, se heurte à des droits de la personnalité et à l'image qui varient selon les juridictions et ne disparaissent pas parce que le résultat est synthétique. Séparément, les obligations de transparence de l'article 50 du règlement européen sur l'IA s'appliquent à partir du 2 août 2026 : les déployeurs doivent indiquer que le contenu est généré ou manipulé artificiellement, clairement et dès la première exposition. SynthID répond à une exigence de marquage lisible par machine ; il ne répond pas au devoir d'informer la personne qui regarde. C'est une décision d'étiquetage à prendre avec un conseil juridique, pas un drapeau dans un appel d'API.

Un visage généré n'est pas une personne, mais il peut s'en approcher assez pour que quelqu'un en soit lésé. Le consentement, la divulgation et la volonté de renoncer à un plan appartiennent à ce métier au même titre que la focale.

Questions fréquentes

Comment obtenir une peau réaliste avec Gemini Omni 1.1 Flash ?

Décrivez la surface au lieu d'en faire l'éloge. « Perfect skin », « flawless » et « beautiful » sélectionnent l'imagerie commerciale retouchée et aplatissent la texture. Remplacez-les par des faits observables — pores visibles sur le nez et les joues, brillance sur le front, une petite cicatrice — et indiquez un âge. Google demande une description de personnage extrêmement détaillée, ce qui n'est pas la même chose que de demander un personnage séduisant.

Pourquoi les mains sont-elles ratées en vidéo IA, et comment corriger cela dans un prompt ?

Les doigts sont du mouvement complexe dans une petite région auto-occultante, et la fiche modèle de Google nomme le mouvement complexe comme une chose qui « remains a challenge. » Donnez un travail aux mains plutôt que de les décrire : un objet précis avec une prise décrite, ou une action avec un début et une fin. Gardez-les dans un seul plan de netteté, loin du visage.

Peut-on couper l'audio dans Gemini Omni 1.1 Flash ?

Non. L'audio est généré nativement avec l'image, aucun paramètre ne le désactive, et il n'est pas facturé séparément du tarif à la seconde. Vous pouvez l'orienter avec une phrase « Sound design: » et des propositions explicites « No dialogue. » ou « No music. », mais pas le refuser. Pour une lecture silencieuse, coupez le son du lecteur.

Comment écrire un dialogue dans un prompt Omni ?

Utilisez la forme documentée par Google : locuteur, deux-points, réplique, sans guillemets. La direction de voix suit en prose simple, puisqu'aucun paramètre de voix n'existe — accent, âge, registre et débit arrivent tous en anglais. Gardez les répliques courtes, placez-les tôt, décrivez le ton au lieu de demander un jeu « emotional ».

Combien de temps Gemini Omni tient-il la synchronisation labiale ?

invideo, dans un test qui nomme le modèle testé Gemini Omni Flash plutôt que 1.1, rapporte qu'avec une seule personne qui parle, la synchronisation tient environ six à sept secondes avant de décrocher, et qualifie deux locuteurs dans un même cadre de point faible où le modèle perd la synchronisation ou attribue mal le dialogue. Un constat de testeur sur un modèle antérieur, pas une spécification Google, mais il plaide pour un locuteur par génération et des répliques courtes placées tôt.

Gemini Omni 1.1 Flash peut-il générer la ressemblance d'une personne réelle ?

Pas de façon fiable, et réfléchissez bien avant d'essayer. La documentation de Google indique que le téléversement et l'édition d'images contenant certaines personnes reconnaissables ne sont pas pris en charge dans l'EEE, en Suisse et au Royaume-Uni, et les testeurs rapportent des refus pour des marques réelles et des modifications de personnage ordinaires. Au-delà du filtre, les droits à l'image varient selon les juridictions et ne disparaissent pas parce que les images sont synthétiques.

Le filigrane SynthID apparaît-il sur chaque image, et peut-on le retirer ?

Chaque vidéo générée porte SynthID, intégré au moment de la génération, invisible pour les spectateurs et détectable par programme. Aucun fournisseur n'expose d'interrupteur, et la marque survit à la compression, au recadrage et aux changements de couleur : le retrait n'est donc pas un flux de travail sur lequel compter. Si un cahier des charges de livraison interdit le matériel tatoué, réglez ce point avant de rendre.

Est-il moins cher d'itérer sur les visages en basse résolution ?

Oui, nettement. Dix passes de recherche en 360p plus une finition en 1080p coûtent $1.73 sur E2X contre $5.40 pour dix passes en 1080p — soixante-huit pour cent d'économie pour une génération supplémentaire. Les passes de brouillon portent assez de résolution pour la ligne de regard et le placement, mais pas pour la texture de peau ni la synchronisation labiale : prévoyez deux prises en pleine résolution une fois la boucle de brouillon refermée.

Les prix et les conditions produit changent. Vérifiez les tarifs en vigueur de chaque fournisseur avant toute décision d'achat.

Les schémas et les tarifs en vigueur des quatre capacités sont sur la page du modèle. À côté : la syntaxe de prompt documentée, ce que coûtent réellement les séquences de quarante secondes, et où les mêmes poids se vendent plus cher.