Les scènes de 40 secondes de Gemini Omni 1.1 Flash sont quatre factures distinctes
Le chiffre de tous les titres cette semaine, c'est quarante. Des scènes de quarante secondes avec le nouveau modèle vidéo de Google — ce qui laisse entendre qu'on écrit un prompt et qu'on récupère quarante secondes.
Non. Un seul appel à gemini-omni-1.1-flash renvoie trois à dix secondes. On atteint quarante en prolongeant ce clip trois fois de plus — quatre jobs au total, facturés séparément. Personne n'a menti : l'annonce de Google décrit ces continuations noir sur blanc. Mais le chiffre a fait beaucoup de chemin depuis cette phrase, et il est arrivé chez beaucoup de gens comme une valeur par génération.
Voici le briefing qu'on aimerait avoir avant de sortir la carte bleue : ce que coûtent quarante secondes, à quoi sert le palier 360p, et les contraintes enfouies dans la documentation — dont l'une prive purement et simplement les développeurs européens de la fonctionnalité vedette.

Quarante secondes, c'est quatre jobs et quatre factures
Les modèles vidéo facturent à la seconde produite, et l'extension ne donne droit à aucune remise — une continuation coûte ce que coûte une génération neuve, donc quarante secondes se chiffrent comme quatre clips de dix secondes. À chaque palier :
| Résolution | Sur E2X | En direct chez Google |
|---|---|---|
| 360p | $1.19 | $1.35 |
| 720p | $3.60 | $4.06 |
| 1080p | $5.40 | $6.08 |
| 4K | $7.20 | $12.16 |
Quatre fois dix secondes, au tarif par seconde de chacun. Les nôtres viennent du catalogue en direct ; les pages modèle portent le chiffre courant si celui-ci vieillit.
Cette colonne Google mérite un mot, parce que ces tarifs sont étonnamment difficiles à trouver. Deux pages officielles portent l'échelle complète et une recherche textuelle n'en attrape aucune. Dans l'annonce de lancement, les prix sont à l'intérieur d'une image — lisibles pour un humain, invisibles au Ctrl-F. Sur la page Cloud pricing, ils apparaissent en tokens par seconde face à un compteur à $17.50 le million, donc ils ne ressemblent pas à des prix tant qu'on n'a pas multiplié. La page qu'on ouvrirait en premier, la documentation tarifaire de l'API, n'en donne qu'un barreau sur quatre : « un prix effectif d'environ $0.10 par seconde » en 720p.
Les deux concordent, avec un pli d'arrondi — l'annonce affiche un joli $0.03 / $0.10 / $0.15 / $0.30, le calcul en tokens atterrit légèrement au-dessus de chacun. La facturation suit les tokens, donc la colonne ci-dessus aussi ; le post de lancement détaille le calcul palier par palier.
Cinq dollars quarante pour quarante secondes de 1080p, six et des poussières chez Google. C'est le prix affiché avant la moindre prise alternative — et vous en ferez, parce que c'est sur la dernière extension que la dérive se voit. Budgétez le montage que vous gardez plus les deux que vous jetez, et une séquence de quarante secondes terminée revient à seize dollars, pas cinq.
La ligne 360p était celle qu'on perdait, et on l'écrivait ici jusqu'à récemment. Ça a bougé : notre palier brouillon est désormais à $0.0297 la seconde contre $0.0338 chez Google, douze pour cent en dessous. N'en tirez pas grand-chose. fal est à $0.03 — un écart d'un pour cent, du bruit statistique déguisé en victoire, et le genre de chose qui s'inverse dès que quelqu'un modifie un multiplicateur. Le workflow brouillon ci-dessous tient quel que soit votre fournisseur ; il n'a jamais dépendu du fait que le prix soit le nôtre.
La vraie nouveauté de la 1.1, c'est la mémoire, pas la longueur
La longueur était déjà à peu près atteignable. Ce qui la rend exploitable, c'est ce que le modèle voit quand il prolonge.
La preview de juin lisait la dernière seconde du clip qu'elle prolongeait. Une seconde vous dit ce qu'il y a dans le cadre et presque rien de ce qui était en train de se passer, donc les extensions dérivaient. Le travelling cessait de travelinguer. Une veste changeait de nuance. La lumière se reconstruisait à chaque raccord.
Gemini Omni 1.1 Flash lit jusqu'à dix secondes de séquence antérieure. Dix secondes, c'est assez pour savoir que le chariot était encore en mouvement, de quel côté venait la lumière principale et à peu près de quelle couleur était le manteau — et c'est pour ça qu'une séquence en quatre morceaux tient enfin debout. Si quelqu'un vous dit que la fonctionnalité vedette de la 1.1 est la longueur, il a pris le problème à l'envers. La longueur était de l'arithmétique. La mémoire, c'est le modèle.
Le 1080p et le 4K sont des upscales, pas des rendus
Une parenthèse dans la documentation de Google change ce pour quoi vous devriez payer. Depuis la référence du modèle, mot pour mot : « sortie 1080p (upscalée) » et « sortie 4K (upscalée) ». Le modèle effectue son rendu en dessous de ces résolutions puis agrandit. Le haut de l'échelle, ce n'est pas plus de détail — c'est un fichier plus gros portant la même information.
Ce qui recolore la ligne 4K ci-dessus. Douze dollars et des poussières, chez Google, pour quarante secondes de sortie upscalée. Si un cahier des charges client exige des dimensions 4K, payez. Si vous avez choisi le 4K en supposant que c'est plus beau, vous payez exactement trois fois le tarif 720p de Google pour un redimensionnement que vous pourriez faire dans ffmpeg.
Brouillonnez en 360p, finissez en 720p
C'est la partie qui fait économiser, et personne ne l'a mise dans un titre.
Le 360p coûte $0.0297 la seconde ici — un brouillon de quatre secondes revient à douze cents, contre $0.36 en 720p et $0.54 en 1080p. Google affirme aussi que le 360p tourne jusqu'à 60 % plus vite, un chiffre fournisseur plutôt qu'une mesure de notre part, même si la direction est évidemment la bonne.
Passons au calcul. Disons qu'un plan demande dix tentatives avant que le mouvement soit juste — réaliste pour tout ce qui comporte un mouvement de caméra précis.
- Dix passes directement en 1080p → $5.40
- Dix passes en 360p → $1.19, puis un gagnant relancé en 1080p → $1.73
Soixante-huit pour cent d'économie, pour une génération supplémentaire à la fin. Soyez honnête sur ce qu'une passe en 360p peut vous dire : le cadre, le mouvement de caméra, si le modèle a inséré des coupes que vous n'avez jamais demandées. La texture fine, il ne peut pas la juger — pas assez de résolution pour la porter.
Voici le même prompt aux deux paliers, même seed, quatre secondes chacun. Le brouillon d'abord :
Puis le rendu 720p du prompt et du seed identiques :
Les deux montrent un chronomètre en laiton sur de l'ardoise sombre, la caméra avançant en travelling depuis la gauche, une lumière principale chaude effleurant le métal. Le prompt des deux, mot pour mot :
Editorial slow-motion macro shot of a brass mechanical stopwatch resting on a dark slate table, its second hand sweeping forward in a single continuous shot with no scene cuts. Camera performs a slow dolly in from the left, shallow depth of field, one warm amber key light raking across the metal, cool blue rim light behind. Fine dust drifts through the beam. Clean dark background, no text, no logos, no people. Sound design: a soft mechanical tick and low room tone, nothing else.
(Le prompt est laissé en anglais : le modèle n'a été évalué que pour l'anglais, et vous devez pouvoir reproduire le résultat tel quel.)
Douze cents contre trente-six. Le brouillon nous a dit que le travelling passait et que le modèle tenait un seul plan — tout ce qu'il fallait savoir avant de s'engager. Faites tourner votre boucle là-dessous.
L'extension ne va que vers l'avant
L'extension de scène ajoute à la suite, et la forme de cette limite détermine comment vous planifiez une séquence. Vous ne pouvez pas insérer au milieu d'un clip. Vous ne pouvez pas prolonger vers l'arrière pour construire une amorce. Il n'existe pas de « garde la fin, refais les quatre premières secondes » — la capacité ne fonctionne que dans un sens. Si le troisième plan est raté, tout ce qui vient après part à la poubelle avec lui.
Alors chargez l'effort à l'avant. La première génération fixe le langage de caméra, la palette et l'éclairage de tout ce qui suit, et c'est le seul segment que vous pouvez réviser à bon compte. À la troisième extension, vous êtes à quatre jobs de profondeur sans possibilité de revenir en arrière.
L'extension refuse encore une chose. Donnez-lui la vidéo de quelqu'un qui parle, demandez un nouveau dialogue, et elle décline — Google restreint la modification de la parole. La presse spécialisée y lit une retenue volontaire liée à une publication responsable plutôt qu'une fonctionnalité manquante ; cette lecture est celle du journaliste, mais la restriction, elle, est dans la documentation. Ne construisez pas un produit de doublage sur ce modèle.
Développeurs européens, lisez cette ligne deux fois
Enfouie dans la documentation en une seule phrase : dans l'EEE, en Suisse et au Royaume-Uni, l'édition et l'extension d'une vidéo téléversée ne sont pas disponibles.
Ce n'est pas une restriction molle. La fonctionnalité vedette — prendre des rushes, les prolonger — ne fonctionne pas dans la majeure partie de l'Europe. Le text-to-video et l'image-to-video tournent toujours. Mais si le plan était un outil qui prolonge les clips téléversés par vos utilisateurs, et que ces utilisateurs sont à Berlin ou à Manchester, le plan est mort et l'annonce n'en dit pas un mot.
Vérifiez-le pour votre région de déploiement avant d'écrire une ligne de code d'intégration. C'est l'élément le plus coûteux de ce texte à découvrir trop tard.
Les molettes qui n'existent pas
En venant d'un modèle de texte, vous chercherez des paramètres qui ne sont pas là. La documentation de Google marque toute la surface d'échantillonnage comme non prise en charge : pas de temperature, pas de top_p, pas d'instructions système, pas de séquences d'arrêt, pas de prompt négatif. Rien.
Votre seule surface de contrôle est le prompt lui-même, et la documentation tierce fixe le plafond à 40 000 caractères — beaucoup de corde, même si ce chiffre n'est pas de ceux que nous avons trouvés dans la référence de Google. Tout ce que vous feriez normalement avec un paramètre d'échantillonnage doit s'écrire en anglais à la place. Si vous voulez savoir comment bien écrire cet anglais, nous avons traité la syntaxe des prompts dans un post dédié, y compris la structure des balises et le problème des coupes, et il n'y a aucune raison de le répéter ici.
Une mise en garde. La documentation de schéma tierce pour ce modèle liste temperature et top_p comme champs acceptés, alors que la référence de Google les dit non pris en charge. Nous ne vous dirons pas qui a raison — nous vous disons que les deux se contredisent. Ne concevez rien autour de ces paramètres sur la foi d'un schéma ; testez d'abord s'ils changent quoi que ce soit.
Un son qu'on ne coupe pas, un anglais qu'on ne quitte pas
L'audio est généré nativement avec chaque clip et il n'y a pas d'interrupteur. Pas de paramètre, pas de flag, pas de mode silencieux. Vous pouvez l'orienter — une phrase Sound design: fait un vrai travail — mais vous ne pouvez pas le refuser. Pour une intégration sur un blog, cela veut dire couper le son dans le lecteur, ce que font les deux clips ci-dessus.
Vous ne pouvez pas non plus fournir de l'audio en référence, éditer l'audio généré après coup, ni conserver le son d'une vidéo que vous téléversez pour extension. Les trois sont des attentes raisonnables. Aucune n'est prise en charge.
La prise en charge linguistique est plus étroite que le marketing ne le suggère : l'anglais est la seule langue pleinement prise en charge. Le japonais et les autres sont documentés comme non évalués — une façon prudente de dire que les résultats sont imprévisibles. Si vos prompts ou vos dialogues ne sont pas en anglais, budgétez des surprises.
Connaissez les plafonds de référence avant de concevoir un pipeline d'entrée. Références vidéo : jusqu'à trois clips, trois secondes chacun, et Google prévient qu'en fournir plusieurs à la fois peut dégrader les résultats — voyez trois comme un plafond, pas une cible. Les formats sont 16:9 ou 9:16, également chez Google. Deux chiffres cités à côté ne le sont pas : la cadence de 24 fps et la fourchette de une à sept images pour reference-to-video viennent tous deux de documentations de schéma tierces. Chaque image porte un filigrane SynthID, et nous n'avons trouvé aucun fournisseur qui expose un interrupteur pour le désactiver.
Avant de dépenser quoi que ce soit, faites ceci
Quatre vérifications, dans l'ordre. La première tue plus d'intégrations que toutes les autres réunies.
- Confirmez votre région. Si vous êtes dans l'EEE, en Suisse ou au Royaume-Uni et que votre produit prolonge des vidéos téléversées, arrêtez-vous là. Ce modèle ne peut pas faire ce travail pour vous.
- Chiffrez la séquence, pas le clip. Multipliez par les extensions, puis par les prises que vous allez réellement faire. Quarante secondes de 1080p, c'est $5.40 ici dans le meilleur des cas, et réalistement le triple une fois les reprises comptées.
- Demandez-vous si vous avez besoin d'Omni. Une seconde de Veo 3.1 Fast coûte un cent ici, contre neuf sur Omni en 720p. Un plan, pas de continuation, pas d'interpolation d'images, personne qui doive avoir la même tête deux clips plus loin — alors ce multiple, c'est de l'argent brûlé.
- Construisez votre boucle sur le palier brouillon. Itérez en 360p, promouvez le gagnant. Soixante-huit pour cent, ce n'est pas une erreur d'arrondi.
Omni justifie ce multiple exactement là où pointent les fonctionnalités de la 1.1 : prolonger un plan, interpoler entre une première et une dernière image, animer une image fixe, ou porter un sujet d'un plan à l'autre. En dehors de ça, c'est une façon coûteuse d'acheter un seul clip.
Les autres angles sont juste à côté : ce qui est réellement sorti le jour du lancement, ce que disent et ne disent pas les classements — les places d'arène qui circulent cette semaine appartiennent au modèle précédent — et un comparatif de prix plateforme par plateforme. Les schémas et les prix en direct sont dans le catalogue.
Les prix et les conditions commerciales changent. Vérifiez la tarification en vigueur de chaque fournisseur avant toute décision d'achat.
Questions fréquentes
Gemini Omni 1.1 Flash peut-il vraiment faire des vidéos de 40 secondes ?
Oui, mais pas en un seul appel. Une génération renvoie 3 à 10 secondes. Quarante secondes, c'est le total cumulé qu'on atteint en prolongeant un clip existant trois fois de plus — quatre jobs — et chaque extension est facturée séparément au même tarif par seconde qu'une génération neuve. Sur E2X, une séquence de 40 secondes en 1080p coûte $5.40, contre $6.08 en appelant Google directement.
Combien coûte une séquence Gemini Omni de 40 secondes ?
Multipliez 40 secondes par le tarif à la seconde de votre résolution ; les extensions ne donnent droit à aucune remise. Sur E2X, cela fait $1.19 en 360p, $3.60 en 720p, $5.40 en 1080p et $7.20 en 4K. En direct chez Google, à partir de ses tarifs publiés en tokens par seconde, les mêmes durées coûtent $1.35, $4.06, $6.08 et $12.16. Ajoutez les prises jetées et comptez deux à trois fois le chiffre affiché.
La sortie 4K de Gemini Omni 1.1 Flash est-elle du vrai 4K ?
Non. La documentation de Google qualifie les paliers 1080p et 4K d'« upscalés » — le modèle effectue son rendu plus bas et agrandit le résultat. Le fichier a les dimensions du 4K ; l'image ne porte pas le détail du 4K. À moins qu'un cahier des charges n'exige ces dimensions, le tarif du palier supérieur achète un redimensionnement plutôt que de l'information supplémentaire.
Puis-je utiliser Gemini Omni 1.1 Flash dans l'UE ?
En partie. Le text-to-video et l'image-to-video fonctionnent, mais l'édition ou l'extension d'une vidéo téléversée est indisponible dans l'EEE, en Suisse et au Royaume-Uni. Comme l'extension est la capacité vedette, cela bloque tout produit européen construit autour de la continuation de séquences fournies par les utilisateurs. Vérifiez-le pour votre région de déploiement avant d'intégrer.
Gemini Omni 1.1 Flash prend-il en charge temperature ou les prompts négatifs ?
La référence de Google marque la surface d'échantillonnage comme non prise en charge — pas de temperature, top_p, instructions système, séquences d'arrêt ni prompt négatif. Le texte du prompt est votre seul contrôle, la documentation de schéma tierce fixant le plafond à 40 000 caractères. Ces mêmes documentations tierces listent temperature et top_p comme champs acceptés, ce qui contredit Google : testez-les avant d'en dépendre.
Peut-on couper le son dans les sorties de Gemini Omni ?
Non. Le modèle intègre une bande-son à chaque clip par défaut, et aucun paramètre ne la désactive. Une instruction de sound design dans le prompt oriente ce que vous obtenez, mais vous ne pouvez pas la refuser, fournir une référence audio, éditer le résultat, ni conserver le son d'une vidéo que vous téléversez pour extension. Pour une lecture silencieuse, coupez le son dans le lecteur.
Gemini Omni peut-il prolonger une vidéo vers l'arrière ou éditer le milieu d'une scène ?
Non. L'extension n'ajoute qu'à la fin d'un clip — pas d'extension vers l'arrière pour construire une amorce, pas d'insertion au milieu d'une séquence. Planifiez en conséquence : la première génération fixe le langage de caméra et d'éclairage de tout ce qui suit, et une erreur en amont invalide chaque extension bâtie dessus.
Gemini Omni 1.1 Flash vaut-il le coup face à Veo 3.1 Fast ?
Seulement si vous avez besoin de ce qu'Omni apporte. Veo 3.1 Fast est à $0.01 la seconde sur E2X contre $0.09 pour Omni en 720p. Pour un clip isolé sans extension, sans contrôle première/dernière image et sans continuité d'un plan à l'autre, Veo gagne largement. Omni justifie sa prime sur les séquences multi-plans et le travail de continuité piloté par références.