Retour au blog

Les mots de caméra que Gemini Omni 1.1 Flash applique, et ceux qu'il ignore

E2X Team··18 min de lecture
gemini-omniprompt-engineeringcinematographytext-to-videovideo-generation

Lisez assez longtemps la documentation de prompting vidéo de Google et vous tombez sur deux phrases séparées de quelques paragraphes. L'une publie une liste de mouvements de caméra — dolly, truck, pedestal, grue, whip pan, arc — comme si vous commandiez à la carte. L'autre prévient que « Some advanced camera angles are not officially supported. The results and reliability may vary depending on the overall prompt and your specific use case. »

Les deux sont vraies, et c'est dans l'écart entre elles que naissent la plupart des clips décevants. Un mouvement nommé est une demande que le modèle honorera probablement, pas un paramètre qu'il doit exécuter. Il n'existe aucun champ de position de caméra sur gemini-omni-1.1-flash — pas de machinerie, pas d'optique, seulement des mots en concurrence avec vos autres mots. Ce billet porte sur ceux de ces mots qui méritent leur place, à partir de ce que Google documente, de ce que Runway rapporte et de ce que le schéma expose.

Cinq objectifs à focale fixe de cinéma anciens dressés sur du velours noir dans un loueur mal éclairé, rangés du plus court au plus long, leurs bagues de mise au point en laiton accrochant une unique lumière latérale dure venue de la gauche

Les mots qui sautent d'emblée

Commencez par la soustraction : elle ne coûte rien et libère de la place dans le prompt. La référence de Runway sur le prompting de caméra est catégorique sur les deux mots les plus fréquents des prompts vidéo générés par IA : « 'Cinematic' and '4k' come out because they're doing no work. Neither one changes what the camera does, and the prompt space they occupy is better spent on the move. »

C'est une affirmation sur leurs outils, pas sur ceux de Google, mais le raisonnement se transfère. « Cinematic » décrit une impression, pas un point de vue : cela ne dit pas où se placer, à quelle distance, ce qui doit rester net, ni dans quelle direction se déplacer. Même chose pour le reste du chargement — masterpiece, award-winning, 8k, ultra detailed — hérité de la culture de prompt des modèles d'image, où ces tokens fonctionnaient comme des incantations de qualité face à une distribution d'entraînement très différente.

La forme positive est tout aussi simple : nommez un mouvement précis plutôt que de demander une « caméra cinématique dynamique », parce que ces modèles traitent les « camera instructions as spatial direction, not decoration. » Rien là-dedans ne dit que « cinematic » nuit. Cela dit que le mot déplace quelque chose de meilleur, et dans un prompt de quelques dizaines de mots, le déplacement fait tout le jeu.

La liste de Google, et jusqu'où lui faire confiance

Le vocabulaire documenté vaut mieux que tout ce qui circule dans les fils de discussion sur les prompts :

CatégorieCe que Google nomme
Mouvementstatic · pan · tilt · dolly (in, out) · truck (left, right) · pedestal (up, down) · zoom · crane · aerial ou drone · handheld · whip pan · arc
Angle et échelleeye-level · low · high · bird's-eye · Dutch · point-of-view · over-the-shoulder · extreme close-up · close-up · medium · full · wide ou establishing
Optiquewide-angle · telephoto · deep et shallow depth of field · lens flare · rack focus · fisheye · dolly zoom

Deux détails méritent l'attention. Google sépare délibérément le zoom du dolly, parce que les modèles les confondent : un zoom est un changement de focale, et « This is different from a dolly, as the camera itself doesn't move. » Vous voulez que l'arrière-plan gonfle par rapport à votre sujet ? Demandez un dolly. Vous voulez que le cadre se resserre sans changement de géométrie ? Demandez un zoom. Écrivez « zoom in slowly as the camera pushes forward » et vous avez commandé les deux — un dolly zoom, qui n'est presque jamais l'intention.

Ensuite, des termes largement attribués à Google ne figurent pas sur ses pages. Oner, push in et natural smartphone zoom apparaissent dans des guides qui citent la documentation Google ; nous ne les y avons pas trouvés. Non documenté ne veut pas dire interdit, mais ils n'ont pas plus d'autorité qu'une formule que vous inventeriez. La syntaxe documentée complète est dans notre guide de prompting.

Un mouvement par clip

Le constat le plus tranchant de la référence Runway ne porte pas sur les verbes qui marchent, mais sur leur nombre.

« Verbes empilés (peu fiable) : "Orbit the subject and crane up and push in." Description par phases (fiable) : "The camera arcs around the seated figure, then rises above the table to reveal the empty chairs surrounding her." »

Le conseil qui suit est de décrire ce qui remplit le cadre à chaque étape plutôt que d'empiler des verbes, et si le mouvement composé échoue encore, de « cut back to one move and generate the second beat as its own clip. »

Omni ajoute à cela un tranchant mécanique, tiré de la documentation de Google : le modèle produit plusieurs plans par défaut sauf indication contraire. Demandez trois mouvements simultanés et vous lui avez donné une échappatoire — la coupe. Deux secondes d'arc, coupe, deux de grue, coupe, un push in pour le reste. Chaque instruction honorée, rien de ce que vous vouliez. Le correctif en une proposition, « In a single continuous shot » ou « No scene cuts », empêche le modèle de résoudre votre ambiguïté par un montage.

Une même scène, générée deux fois, en ne changeant que la phrase de caméra :

Quatre secondes de chaque côté en 720p, trente-six cents pièce. Sujet, pièce, lumière et bande son sont identiques ; seule la première phrase diffère, un cadre fixe contre un dolly in lent. La phrase de caméra est la plus déterminante du prompt, et celle que la plupart des gens écrivent en dernier.

La focale est une direction, pas de l'optique

Il n'y a pas d'objectif. Cela vaut d'être dit franchement, parce que le modèle mental compte. Écrivez « 85mm » et le modèle ne calcule pas un angle de champ ; il puise dans tout ce que ses données d'entraînement portent comme étiquette, et les photographies portent cette étiquette par millions. Ce qui revient, c'est le look attaché au nombre : arrière-plan comprimé, sujet découpé sur un champ flou, distances aplaties. Sur une courte focale, perspective étirée, plus de place dans le cadre, bords qui se courbent.

Ce qui fait de la focale l'un des mots les plus efficaces disponibles, déplaçant cadrage et sensation ensemble en quatre caractères. Les recommandations qui circulent sont cohérentes — environ 24mm pour un contexte large, 35mm pour une sensation documentaire, 50mm pour une narration neutre, 85mm pour un travail intime et comprimé — à lire comme une direction visuelle, pas comme une promesse d'optique littérale.

Cinq tubes télescopiques en laiton poli, de longueur croissante, dressés en rangée sur un sol de béton brut, le plus court à gauche

Deux habitudes en découlent. Donnez un travail au nombre plutôt que de le laisser en adjectif : « 35mm » seul est un token, alors que « 35mm, the workshop visible behind her throughout » dit à quoi sert le grand angle, et cette proposition survit même si le nombre est ignoré. Les termes optiques documentés par Google — shallow depth of field, deep focus, rack focus, telephoto — font le même travail en mots simples. Et n'associez jamais une focale à une instruction contradictoire : « 85mm wide establishing shot of the valley » demande compression et ampleur à la fois.

Le cadrage est ce que vous pouvez spécifier de plus fiable

Triez le langage de caméra selon la fiabilité avec laquelle il aboutit et un motif apparaît : les propriétés statiques battent les propriétés temporelles.

L'échelle de plan — de l'extreme close-up au wide establishing — est une propriété d'une seule image. L'angle aussi, de même que la géométrie d'un plan à deux ou d'une amorce d'épaule. Le modèle peut satisfaire n'importe laquelle dès la première image qu'il rend, puis la tenir.

Un dolly in est une affirmation sur l'image un par rapport à l'image quatre-vingt-seize, et elle doit survivre à toutes les images intermédiaires, dans un processus sans représentation explicite de la position de la caméra. C'est précisément l'écart que la littérature de recherche existe pour combler : CameraCtrl, le travail de référence sur le contrôle de caméra en diffusion vidéo, s'ouvre en notant que les modèles existants « lack control of camera pose that serves as a cinematic language to express deeper narrative nuances », puis ajoute un module de conditionnement par la pose parce que le texte seul ne suffisait pas. Aucune API vidéo de production que nous connaissions n'expose ce canal.

D'où une hiérarchie à retenir. Cadrage et angle : spécifiez librement, attendez-vous à être suivi. Un mouvement nommé : attendez-vous à l'obtenir la plupart du temps. Deux mouvements, ou un mouvement avec vitesse et point d'arrêt déclarés : prévoyez plusieurs prises, ou découpez le temps.

Une main tenant à bout de bras un cadre de visée en carton noir devant un paysage côtier flou au crépuscule

Avant et après

Un prompt écrit comme la plupart des prompts de caméra le sont. Chaque mot qu'il contient, nous l'avons utilisé.

Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.

Comptez ce qui est actionnable. Trois verbes empilés qui ne peuvent pas tous tenir dans une seule prise. Pas d'échelle de plan, pas de focale, aucune instruction sur le nombre de plans — le comportement multi-plan documenté par défaut est donc libre de se déclencher, et avec trois mouvements concurrents sur la table, couper est la voie de moindre résistance.

Le même plan, réécrit pour ne dire que ce sur quoi le modèle peut agir :

In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.

Quatre changements, par ordre de poids. La proposition sur le nombre de plans vient en premier, pour que l'ambiguïté ne puisse pas être résolue par un montage. Trois mouvements se réduisent à un, avec cadrage d'ouverture et de fermeture nommés — la description par phases que Runway recommande, écrite comme un seul déplacement. La focale arrive attachée à une conséquence. Et le son obtient ses propres phrases, conformément à la consigne de Google de décrire l'audio séparément, avec les négations en courtes propositions finales. La réécriture est plus plate et plus ennuyeuse à lire, ce qui est en général le signe qu'un prompt a cessé de décrire une ambiance et commencé à décrire un plan.

Où placer la caméra dans le prompt

L'ordre est la question pour laquelle nous n'attendions aucune réponse. Il y en a une, issue des consignes Veo de Google plutôt que de la page Omni : la formule y est cinematography, subject, action, context, style and ambiance — la caméra d'abord, avant de nommer qui est dans le plan — parce que cet élément « is the most powerful tool for conveying tone and emotion. » La documentation propre à Omni liste les éléments autrement, caméra en milieu de liste : Google publie donc deux ordres et nous n'avons mené aucune comparaison contrôlée.

Commencer par la caméra résiste au contact avec les autres comportements documentés d'Omni, puisque l'instruction sur le nombre de plans doit arriver avant que le modèle commence à construire un récit. Cela rend aussi un prompt auditable : si la première phrase ne décrit pas un point de vue, vous n'avez pas dirigé un plan.

Ce que le schéma ne vous donnera pas

Deux limites structurelles, aucune corrigeable par une meilleure formulation.

La première est la répétabilité. La documentation de l'API de Google indique que « System instructions, temperature, top_p, stop sequences, and negative prompts are not supported », et vous invite à écrire les négations dans le prompt. Il n'y a aucun échantillonneur à resserrer. Il reste seed, un entier optionnel dans notre schéma pour ce modèle, et c'est toute la surface de contrôle.

Cela compte davantage pour le travail de caméra que pour toute autre partie d'un prompt. Une lumière qui revient légèrement différente est un autre étalonnage du même plan ; un dolly qui revient en panoramique est un autre plan. Tenir un mouvement stable d'une prise à l'autre suppose donc de fixer le seed et de ne rien changer d'autre — et modifier un seul mot signifie rééchantillonner. Traitez un seed qui fonctionne comme un actif et notez-le à côté du prompt.

La seconde limite est que la vitesse de caméra n'a aucun vocabulaire. « Slow dolly in » est la surface de contrôle : pas d'unité, pas de durée, aucun moyen de dire que le mouvement doit s'achever à la cinquième seconde puis tenir. La syntaxe de timecode aide un peu — Omni accepte des plages entre crochets — donc un prompt peut demander à la caméra de se poser à quatre secondes. Qu'elle le fasse est une autre affaire.

L'angle d'obturation et le flou de mouvement sont dans la même colonne : ni l'un ni l'autre n'apparaît dans le vocabulaire documenté par Google. La fréquence d'images passe tout près — 24 fps figure sur la page Omni uniquement à l'intérieur d'un exemple de minutage, « 12 frames at 24fps », et non comme levier de prompt. Utile pour raisonner sur les timecodes ; pas quelque chose à écrire en espérant piloter.

Ce que coûtent les expérimentations de caméra, au palier qui compte

Le travail de caméra est la partie du prompting qu'on ne réussit pas en une passe : vous demandez un comportement dans la durée sans paramètre pour le contraindre, donc vous générez, regardez, ajustez, régénérez. Le chiffre qui compte est le prix d'une prise.

En 4K, une prise de huit secondes coûte $1.44 ici contre $2.43 en appelant Google directement. Six prises pour obtenir un mouvement — modeste pour tout ce qui comporte un déplacement précis — font $8.64 contre $14.60. Cet écart est de 41 %, de loin le plus grand des quatre résolutions et la raison pour laquelle la ligne 4K est la seule qui mérite discussion. Ailleurs, une seconde de 4K vaut $0.30 chez fal, $0.32 chez Runware et $0.39 chez WaveSpeed, contre $0.18 ici ; Replicate liste le modèle sans aucun tarif à la seconde.

La façon de dépenser moins n'est cependant pas de trouver une seconde de 4K moins chère, mais d'arrêter de tester les mouvements de caméra en 4K. Dix brouillons de huit secondes au palier 360p coûtent $2.38, et le 360p suffit à voir si la caméra a fait ce que vous demandiez — un mouvement est lisible à n'importe quelle résolution, et c'est ce qui le rend peu coûteux à tester. Dix brouillons plus un keeper en 4K font $3.82, contre $14.40 pour dix prises en 4K.

Les deux barreaux du haut sont des upscales, pas des rendus natifs — la référence modèle de Google les qualifie de « 1080p output (upscaled) » et « 4K output (upscaled) » — donc une prise en 4K achète des dimensions de livraison, pas du détail supplémentaire dans le plan que vous évaluez. Notre billet sur les scènes de quarante secondes explique où cela vaut malgré tout le coût.

Les prix et les conditions produit peuvent changer. Vérifiez les tarifs en vigueur de chaque fournisseur avant toute décision d'achat.

La version courte

Dites d'abord le nombre de plans, puis un mouvement, puis le cadrage sur lequel il commence et finit. Donnez à une focale une raison d'être là. Mettez l'audio dans ses propres phrases. Supprimez chaque mot décrivant ce que la vidéo doit faire ressentir, et dépensez la place ainsi libérée pour dire où est la caméra.

Ce qui a été livré dans la 1.1 est dans le compte rendu de lancement, et l'audit tarifaire des fournisseurs explique pourquoi des poids identiques coûtent des montants différents selon la page. Les paramètres et les tarifs en vigueur sont sur la page du modèle text-to-video. Pour un mouvement isolé dont rien ne dépend, chiffrez d'abord Veo 3.1 Fast à un cent la seconde — le vocabulaire de caméra vient du guide que Google publie pour les deux, la pratique se transfère donc.

Questions fréquentes

Quels termes de mouvement de caméra Gemini Omni 1.1 Flash comprend-il ?

Google nomme un vocabulaire de mouvement — static, pan et tilt, les paires dolly, truck et pedestal, zoom, crane, drone ou aerial, handheld, whip pan, arc — plus des termes d'angle, d'échelle de plan et d'optique. Il prévient aussi que certains angles avancés ne sont pas officiellement pris en charge et que la fiabilité varie selon le prompt : lisez un mouvement nommé comme une demande plutôt que comme un paramètre.

Écrire « cinematic » dans un prompt vidéo sert-il à quelque chose ?

Pas à grand-chose, seul. La référence de Runway sur le prompting de caméra retire « cinematic » et « 4k », au motif qu'aucun des deux ne change ce que fait la caméra et que la place est mieux employée à nommer un mouvement. Le mot décrit une impression plutôt qu'un point de vue : il ne donne donc rien au modèle sur quoi agir — comme « masterpiece », « 8k » et le reste du chargement hérité du prompting d'image.

Les focales comme 35mm ou 85mm changent-elles le résultat ?

Elles déplacent le look, parce que les photographies des données d'entraînement portent la focale dans leurs métadonnées et que le nombre se lit comme un indice de style. Une longue focale tend à comprimer l'arrière-plan et à détacher le sujet ; une courte étire la perspective et laisse entrer plus de la pièce. Traitez cela comme une direction visuelle plutôt que comme de l'optique littérale, et attachez-y une conséquence.

Où placer la direction de caméra dans un prompt Omni ?

Le guide de prompting Veo de Google place la cinématographie en premier, avant le sujet, l'action, le contexte et le style, en la qualifiant d'élément le plus puissant pour transmettre le ton. La documentation propre à Omni place les termes de caméra en milieu de liste. Les deux viennent de Google. Commencer par la caméra a un avantage pratique : l'instruction sur le nombre de plans est une décision de caméra et doit être enregistrée avant que le modèle construise un récit.

Peut-on obtenir deux fois le même mouvement de caméra avec Gemini Omni 1.1 Flash ?

Seulement en réutilisant un seed. La documentation de Google indique que temperature, top_p, les instructions système, les séquences d'arrêt et les prompts négatifs ne sont pas pris en charge, ce qui laisse seed — un entier optionnel dans notre schéma — comme unique contrôle de reproductibilité. Changez un mot du prompt et vous rééchantillonnez : notez donc le seed qui a produit un mouvement réussi au moment même où il a fonctionné.

Pourquoi la caméra coupe-t-elle en plein plan alors que j'ai demandé un seul mouvement ?

Parce que le multi-plan est le comportement par défaut. Google documente qu'Omni tentera plusieurs plans et construira un récit sauf indication contraire : un prompt empilant deux ou trois mouvements lui donne donc un prétexte pour satisfaire chacun dans une coupe distincte. Le correctif documenté est une proposition demandant une scène ininterrompue, et revenir à un seul mouvement nommé supprime l'incitation.

Peut-on spécifier la vitesse d'obturation ou la fréquence d'images dans un prompt Gemini Omni ?

Rien dans le vocabulaire de caméra documenté par Google ne couvre l'angle d'obturation ni le flou de mouvement, et nous n'affirmerions pas que ces termes sont honorés. La fréquence d'images n'est pas non plus un levier de prompt : 24 fps apparaît sur la page Omni de Google à l'intérieur d'un exemple de minutage — « 12 frames at 24fps » — et non comme une spécification réglable. Gérez la fréquence d'images en post-production.

Combien coûte le test de prompts de caméra en 4K ?

Une prise de huit secondes en 4K vaut $1.44 sur E2X contre $2.43 en appelant Google directement, donc six prises reviennent à $8.64 plutôt qu'à $14.60 — un écart de 41 %, le plus large des quatre résolutions. Tester en 4K est pourtant généralement du gaspillage : un mouvement est lisible en 360p, où dix brouillons de huit secondes totalisent $2.38, et un keeper en 4K porte la série à $3.82.