Gemini Omni 1.1 Flash est sorti aujourd'hui. La nouveauté, c'est l'édition, pas la génération
Google a rendu gemini-omni-1.1-flash généralement disponible aujourd'hui. Lisez la liste des fonctionnalités et une chose ressort : presque rien là-dedans ne concerne la fabrication d'un meilleur clip de huit secondes.
Une extension de scène qui lit dix secondes de contexte au lieu d'une. La possibilité de donner au modèle une première image et une dernière image et de le laisser construire le milieu. Des clips de référence qui portent un personnage d'un plan à l'autre. Ce sont des fonctionnalités de continuité. Ce sont celles dont vous avez besoin quand un clip n'est pas le livrable mais un morceau du livrable, et les sortir ensemble est une déclaration de direction plus claire que ne l'aurait été n'importe quelle promesse de qualité.

Ce qui est réellement nouveau
Le prédécesseur ici, c'est Gemini Omni Flash — gemini-omni-flash-preview, en preview API depuis le 30 juin 2026. Notez le nommage, parce qu'internet se trompe déjà : il n'existe aucun produit appelé « Omni Flash 1.0 ». La chaîne officielle de Google est « Gemini Omni 1.1 Flash », et ce qu'il remplace s'appelle simplement Gemini Omni Flash.
| Capacité | Gemini Omni Flash (preview) | Gemini Omni 1.1 Flash |
|---|---|---|
| Contexte d'extension de scène | Dernière seconde du clip | Jusqu'à 10 secondes de séquence antérieure |
| Longueur étendue totale | — | 40 secondes, construites par continuations de 3–10 s |
| Première et dernière image | — | Fournissez les deux, le modèle génère l'entre-deux |
| Clips de référence | — | Jusqu'à 3 clips, 3 secondes chacun |
| Résolutions | 720p | 360p, 720p, 1080p et 4K (les deux dernières upscalées) |
| Durée par génération | 3–10 secondes | 3–10 secondes |
Le changement sur l'extension est celui qu'il faut lire deux fois. Un modèle qui ne voit que la dernière image de ce qu'il prolonge n'a aucune idée de ce que faisait la caméra, donc les extensions dérivent — la lumière se déplace, une veste change de couleur, le travelling qui partait vers la gauche s'arrête. Dix secondes de contexte suffisent à porter un mouvement de caméra et un parti d'éclairage de part et d'autre du raccord. Google décrit les continuations comme des segments de 3–10 secondes jusqu'à un total de 40 secondes, donc ce n'est pas une taille de bloc fixe ; vous assemblez des morceaux de longueur variable.
Il y a aussi un mode 360p, dont Google dit qu'il tourne jusqu'à 60 % plus vite pour un tiers du coût du 720p. Ce chiffre vient du blog d'annonce plutôt que de la référence API, donc traitez-le comme une affirmation du fournisseur plutôt que comme une mesure — mais la forme générale est manifestement juste, et un palier brouillon bon marché est exactement ce qui manquait au travail vidéo itératif.
Ce que ça coûte directement chez Google
La sortie vidéo est facturée $17.50 par million de tokens, et la note de bas de page tarifaire de Google fait la conversion pour vous : 5 792 tokens par seconde de vidéo 720p, « soit un prix effectif d'environ $0.10 par seconde ». L'entrée est à $1.50 par million. Il n'y a pas de palier gratuit pour la sortie vidéo.
Les autres résolutions sont publiées elles aussi, simplement pas à côté de cette note, ce qui explique que presque personne ne les cite. L'annonce de Google porte un tableau tarifaire sous forme d'image, et sa page Cloud pricing en donne la version exacte en une phrase : Omni facture 1 931 tokens par seconde en 360p, 5 792 en 720p, 8 688 en 1080p et 17 376 en 4K. À $17.50 le million, cela fait $0.0338, $0.1014, $0.1520 et $0.3041 la seconde. Regardez la forme plutôt que les chiffres — rapportés au 720p, ces comptes de tokens valent exactement un tiers, un, un et demi, et trois. L'échelle triple du 720p à la 4K, ce qu'il vaut la peine de garder en tête quand on est tenté de rendre un premier jet en pleine résolution.
Dix cents la seconde mérite qu'on s'y arrête un instant. Une séquence de quarante secondes, assemblée par extensions en 720p, représente environ quatre dollars de sortie avant même d'avoir généré une seule prise alternative. Le prix de la vidéo n'est pas le prix de l'image, et les habitudes d'itération qui fonctionnent à une fraction de centime par image vont vider un compte ici.
Où vous pouvez l'appeler aujourd'hui
- Gemini API (
generativelanguage.googleapis.com) — GA - Google AI Studio — GA
- Gemini Enterprise Agent Platform — pour l'accès API entreprise
- Google Flow — pour les abonnés AI Plus, Pro et Ultra
- Application Gemini — extension de scène pour Plus, Pro et Ultra
Pas Vertex AI. Ses notes de version ne mentionnent Omni nulle part, et l'annonce de Google renvoie les utilisateurs entreprise vers l'Agent Platform à la place. Si vous avez lu le contraire, cette page fait des suppositions.
Un élément daté se glisse sous tout ça : l'endpoint de preview gemini-omni-flash-preview doit être déprécié le 30 septembre 2026. Tout ce que vous avez construit sur la preview cet été a environ un mois de marge.

Les spécifications, en un seul endroit
La sortie par génération va de 3 à 10 secondes à 24 FPS, en 16:9 ou 9:16 — ce sont les deux seuls aspect ratios, donc les cadrages carrés et cinéma vertical sont exclus. L'audio est généré nativement avec l'image, et vous ne pouvez pas téléverser de référence audio pour l'orienter. Toute vidéo que vous fournissez pour de l'édition ou de l'extension doit faire 10 secondes ou moins.
Chaque image porte SynthID, le filigrane de provenance invisible de Google. Il est indétectable pour le spectateur et ne peut être désactivé par aucun fournisseur, ce qui ne compte que si vous avez un contrat qui interdit les livrables filigranés.
Google est aussi franc dans la model card sur ce qui ne fonctionne pas encore :
« Maintenir une cohérence complète tout au long des éditions, générer des scènes à mouvement complexe ou rendre du texte parfaitement exact reste un défi. »
Lisez ça à côté de la liste des fonctionnalités et la tension devient utile. Les ajouts phares sont des fonctionnalités de cohérence ; la model card dit que la cohérence reste le point difficile. Les deux sont vrais, et un article de lancement qui ne citerait que le premier serait en train de vous vendre quelque chose.
Une capacité est délibérément retenue. Le modèle sait modifier la parole enregistrée, et Google a choisi de ne pas la livrer :
« Gemini Omni Flash est capable de modifier la parole des personnes. Pour l'instant, nous restreignons cette capacité et travaillons à mieux comprendre comment l'apporter à nos utilisateurs de façon sûre et responsable. »
Il y a aussi des limites régionales : dans l'EEE, en Suisse et au Royaume-Uni, vous ne pouvez ni téléverser ni éditer des images contenant des mineurs ou certaines personnes reconnaissables.
Ce que ça veut dire sur E2X
Nous avions dit que nous ne mettrions pas de date dessus. Elle est tombée le lendemain. Gemini Omni 1.1 Flash est passé en ligne sur E2X le 28 août 2026, ses quatre capacités appelables via la même forme d'endpoint que tout le reste du catalogue.
Un seul prix couvre les quatre : $0.09 la seconde en 720p pour text-to-video, image-to-video, start-end-frame-to-video et reference-to-video, vérifié le 28 août 2026. Durées de 4, 6, 8 et 10 secondes, en 360p, 720p, 1080p ou 4K — $0.0297 la seconde sur le palier brouillon, $0.18 en 4K. Les deux du milieu sont nouvelles ici : la génération précédente n'a jamais proposé que text-to-video et reference-to-video sur cette plateforme, animer une image fixe et interpoler entre une première et une dernière image sont donc deux premières pour cette famille.
Mettez ça en face des tarifs à la seconde de Google : la différence est en réalité une différence de multiplicateurs. Google demande $0.0338, $0.1014, $0.1520 et $0.3041 à mesure qu'on monte ; nous demandons $0.0297, $0.09, $0.135 et $0.18. Les deux échelles partent de la même forme — un tiers du tarif 720p en 360p, une fois et demie en 1080p — puis se séparent en haut : Google triple, nous doublons. Cela nous place sous Google à chaque palier : environ douze pour cent en 360p, onze en 720p et en 1080p, et quarante et un en 4K. Ce que le prix achète aussi, c'est une seule surface d'API et un seul jeu d'identifiants sur tous les modèles de notre catalogue, ce qui vaut quelque chose sans être une prétention à être le moins cher partout.
L'option réellement bon marché est juste à côté, et la plupart des lecteurs devraient la regarder en premier. Veo 3.1 Fast text-to-video est à $0.01 la seconde — un neuvième d'Omni 1.1 Flash. C'est aussi le seul chiffre de cette page qui ne se discute pas : le tableau de Google lui-même place Veo 3.1 Fast à $0.10 la seconde en 720p, si bien que le même modèle coûte ici un dixième de ce qu'il coûte là-bas. Pour un simple plan text-to-video sans édition, sans extension et sans continuité de personnage, la prime de neuf fois par rapport à lui vous achète très peu. Nous préférons que vous dépensiez un dollar plutôt que neuf et que vous reveniez.
Là où Omni justifie la différence, c'est exactement là où pointent les fonctionnalités de la 1.1 : la continuation, le contrôle première et dernière image, et le fait de porter un sujet d'un plan à l'autre. Si votre travail se fait un clip à la fois, Veo 3.1 Fast est le meilleur choix, et il couvre aussi les jobs image-to-video, reference-to-video et start-and-end-frame.
Les prix et les conditions produit peuvent changer. Vérifiez le tarif courant de chaque fournisseur avant toute décision d'achat. Il s'agit d'une comparaison délimitée, pas d'une affirmation qu'E2X est l'option la moins chère dans toutes les configurations.
Ce qu'il faut faire cette semaine
Si vous étiez sur l'endpoint de preview, mettez la date du 30 septembre au calendrier et bougez. Si vous choisissez un modèle vidéo pour la première fois, commencez sur Veo 3.1 Fast à un centime la seconde et ne montez que lorsqu'un job réclame vraiment de la continuité. Et si vous préférez comparer des schémas plutôt que lire de la prose, chaque modèle publie une spec lisible par machine — celle d'Omni 1.1 Flash liste chaque paramètre, chaque contrainte et le prix courant.
Parcourez le reste par job depuis text-to-video ou reference-to-video.
Questions fréquentes
Qu'est-ce que Gemini Omni 1.1 Flash ?
Gemini Omni 1.1 Flash est le modèle de génération et d'édition vidéo de Google, rendu généralement disponible le 27 août 2026 sous l'id d'API gemini-omni-1.1-flash. Il génère des clips de 3 à 10 secondes à 24 FPS avec audio natif, et ajoute des fonctionnalités d'édition qui manquaient à son prédécesseur : extension de scène jusqu'à 40 secondes, interpolation entre première et dernière image, et clips de référence pour la cohérence de personnage.
Quand Gemini Omni 1.1 Flash est-il sorti ?
Le 27 août 2026, en tant que modèle généralement disponible plutôt qu'en preview. Le changelog de l'API de Google l'enregistre comme « Gemini Omni Flash generally available (GA): Released gemini-omni-1.1-flash ». Le modèle de preview antérieur, gemini-omni-flash-preview, était disponible depuis le 30 juin 2026 et doit être déprécié le 30 septembre 2026.
Existe-t-il un Omni Flash 1.0 ?
Non. Google n'a jamais sorti de produit appelé Omni Flash 1.0. Le modèle qui précède Gemini Omni 1.1 Flash s'appelle Gemini Omni Flash, avec l'id d'API gemini-omni-flash-preview, et c'était une sortie en preview. Les pages qui décrivent un « Omni Flash 1.0 » inventent un numéro de version qui n'existe pas.
Combien coûte Gemini Omni 1.1 Flash ?
En appelant Google directement, la sortie vidéo est facturée $17.50 par million de tokens, avec l'entrée à $1.50 par million et aucun palier gratuit pour la vidéo. La page Cloud pricing de Google donne le coût en tokens d'une seconde à chaque résolution — 1 931 en 360p, 5 792 en 720p, 8 688 en 1080p et 17 376 en 4K — soit $0.0338, $0.1014, $0.1520 et $0.3041 la seconde. Sur E2X, ces mêmes paliers sont à $0.0297, $0.09, $0.135 et $0.18, ce qui place le clip de huit secondes en 720p par défaut à $0.72.
Quelle durée peut faire une vidéo Gemini Omni 1.1 Flash ?
Une génération unique produit 3 à 10 secondes. Avec l'extension de scène, vous pouvez construire jusqu'à 40 secondes au total, en ajoutant des continuations de 3 à 10 secondes à un clip existant. Toute vidéo que vous fournissez en entrée pour l'édition ou l'extension doit elle-même faire 10 secondes ou moins.
Puis-je utiliser Gemini Omni 1.1 Flash sur Vertex AI ?
Pas au 27 août 2026. Les notes de version de Vertex AI ne mentionnent nulle part la famille Omni. L'annonce de Google dirige les utilisateurs d'API entreprise vers la Gemini Enterprise Agent Platform, et le modèle est également disponible via la Gemini API, AI Studio, Flow et l'application Gemini.
Gemini Omni 1.1 Flash est-il disponible sur E2X ?
Oui, depuis le 28 août 2026, sur les quatre capacités : text-to-video, image-to-video, start-end-frame-to-video et reference-to-video. C'est $0.09 la seconde en 720p, avec $0.0297 en 360p, $0.135 en 1080p et $0.18 en 4K, pour des durées de 4, 6, 8 et 10 secondes. Cela passe sous le tarif à la seconde de Google à chaque palier : environ douze pour cent en 360p, onze pour cent en 720p et en 1080p, et quarante et un pour cent en 4K. L'audio est généré nativement et ne peut pas être désactivé. Pour des clips uniques sans besoin d'édition ni de continuité, Veo 3.1 Fast à $0.01 la seconde reste en général le meilleur rapport.