Gemini Omni 1.1 Flash se lanzó hoy. La noticia es la edición, no la generación
Google puso hoy gemini-omni-1.1-flash en disponibilidad general. Lea la lista de funciones y hay una cosa que destaca: casi nada de ella va de hacer un clip de ocho segundos mejor.
Extensión de escena que lee diez segundos de contexto en lugar de uno. La posibilidad de entregarle al modelo un primer fotograma y un último fotograma y que construya lo de en medio. Clips de referencia que llevan un personaje de un plano a otro. Son funciones de continuidad. Son las que hacen falta cuando un clip no es el entregable sino una pieza de uno, y lanzarlas juntas es una declaración de rumbo más clara de lo que habría sido cualquier afirmación sobre calidad.

Lo que es realmente nuevo
El predecesor aquí es Gemini Omni Flash —gemini-omni-flash-preview, en preview de API desde el 30 de junio de 2026—. Fíjese en la nomenclatura, porque internet ya la está entendiendo mal: no existe ningún producto llamado «Omni Flash 1.0». La cadena que usa Google es «Gemini Omni 1.1 Flash», y lo que sustituye es simplemente Gemini Omni Flash.
| Capacidad | Gemini Omni Flash (preview) | Gemini Omni 1.1 Flash |
|---|---|---|
| Contexto de extensión de escena | El último segundo del clip | Hasta 10 segundos de metraje previo |
| Longitud total extendida | — | 40 segundos, construidos en continuaciones de 3–10 s |
| Primer y último fotograma | — | Aporte los dos y el modelo genera lo que va entre ellos |
| Clips de referencia | — | Hasta 3 clips, de 3 segundos cada uno |
| Resoluciones | 720p | 360p, 720p, 1080p y 4K (las dos últimas por escalado) |
| Duración por generación | 3–10 segundos | 3–10 segundos |
El cambio en la extensión es el que conviene leer dos veces. Un modelo que solo ve el último fotograma de aquello que continúa no tiene ni idea de qué estaba haciendo la cámara, así que las extensiones derivan: la luz cambia, una chaqueta cambia de color, el travelling que iba hacia la izquierda se detiene. Diez segundos de contexto bastan para llevar un movimiento de cámara y un esquema de iluminación al otro lado de la unión. Google describe las continuaciones como segmentos de 3–10 segundos hasta un total de 40 segundos, así que el tamaño de bloque no es fijo: está cosiendo piezas de longitud variable.
Hay también un modo 360p que, según Google, funciona hasta un 60% más rápido a un tercio del coste de 720p. Esa cifra sale del blog del anuncio y no de la referencia de la API, así que trátela como una afirmación del proveedor y no como un número medido; pero la forma del asunto es evidentemente correcta, y un nivel barato para borradores es justo lo que le faltaba al trabajo iterativo con vídeo.
Lo que cuesta directamente en Google
La salida de vídeo se factura a $17.50 por millón de tokens, y la nota al pie de precios de Google le hace la conversión: 5.792 tokens por segundo de vídeo a 720p, «un precio efectivo de aproximadamente $0.10 por segundo». La entrada son $1.50 por millón. No hay nivel gratuito para la salida de vídeo.
Las demás resoluciones también están publicadas, solo que no cerca de esa nota, y por eso casi nadie las cita. El anuncio de Google lleva una tabla de precios como imagen, y su página de Cloud pricing lleva la versión exacta en una frase: Omni factura 1.931 tokens por segundo a 360p, 5.792 a 720p, 8.688 a 1080p y 17.376 a 4K. A $17.50 el millón, eso son $0.0338, $0.1014, $0.1520 y $0.3041 por segundo. Fíjese en la forma más que en las cifras: respecto a 720p, esos recuentos de tokens son exactamente un tercio, uno, uno y medio, y tres. La escala se triplica de 720p a 4K, algo que conviene recordar cuando le tiente renderizar una primera pasada a resolución completa.
Diez céntimos por segundo merece un momento de reflexión. Una secuencia de cuarenta segundos, montada a base de extensiones a 720p, son unos cuatro dólares de salida antes de haber generado una sola toma alternativa. El precio del vídeo no es el precio de la imagen, y los hábitos de iteración que funcionan a una fracción de céntimo por imagen aquí le van a vaciar la cuenta.
Dónde puede llamarlo hoy
- Gemini API (
generativelanguage.googleapis.com) — GA - Google AI Studio — GA
- Gemini Enterprise Agent Platform — para acceso de API empresarial
- Google Flow — para suscriptores de AI Plus, Pro y Ultra
- App de Gemini — extensión de escena para Plus, Pro y Ultra
En Vertex AI no. Sus notas de versión no mencionan Omni en absoluto, y el anuncio de Google dirige a los usuarios empresariales a la Agent Platform. Si ha leído lo contrario, esa página está adivinando.
Debajo de todo esto hay un elemento con fecha: el endpoint de preview gemini-omni-flash-preview tiene programada su retirada para el 30 de septiembre de 2026. Lo que construyera contra el preview durante el verano tiene alrededor de un mes de margen.

Las especificaciones, en un solo sitio
La salida por generación va de 3 a 10 segundos a 24 FPS, en 16:9 o 9:16 —esas son las dos únicas relaciones de aspecto, así que los encuadres cuadrados y de cine vertical quedan fuera—. El audio se genera de forma nativa junto con la imagen, y no puede subir una referencia de audio para dirigirlo. Cualquier vídeo que aporte para editar o extender tiene que durar 10 segundos o menos.
Cada fotograma lleva SynthID, la marca de agua invisible de procedencia de Google. Es indetectable para el espectador y ningún proveedor puede desactivarla, lo que solo importa si tiene un contrato que prohíbe los entregables con marca de agua.
Google también es franco en la model card sobre lo que todavía no funciona:
"Maintaining complete consistency throughout edits, generating scenes with complex motion, or rendering perfectly accurate text remains a challenge."
Léalo junto a la lista de funciones y sale una tensión útil. Las novedades del titular son funciones de consistencia; la model card dice que la consistencia sigue siendo la parte difícil. Las dos cosas son ciertas, y un post de lanzamiento que solo citara la primera le estaría vendiendo algo.
Hay una capacidad retenida a propósito. El modelo puede alterar el habla grabada, y Google ha optado por no lanzarlo:
"Gemini Omni Flash is capable of changing people's speech. For now, we are restricting this capability and working to better understand how to safely and responsibly bring it to our users."
También hay límites regionales: en el EEE, Suiza y el Reino Unido no puede subir ni editar imágenes que contengan menores o determinadas personas reconocibles.
Lo que esto significa en E2X
Dijimos que no le pondríamos fecha. Llegó al día siguiente. Gemini Omni 1.1 Flash entró en producción en E2X el 28 de agosto de 2026, con sus cuatro capacidades invocables a través de la misma forma de endpoint que todo lo demás del catálogo.
Un solo precio cubre las cuatro: $0.09 por segundo a 720p para text-to-video, image-to-video, start-end-frame-to-video y reference-to-video, comprobado el 28 de agosto de 2026. Duraciones de 4, 6, 8 y 10 segundos, a 360p, 720p, 1080p o 4K: $0.0297 por segundo en el nivel de borrador, $0.18 a 4K. Las dos del medio son nuevas aquí: la generación anterior solo llegó a ofrecer text-to-video y reference-to-video en esta plataforma, así que animar una imagen fija e interpolar entre un primer y un último fotograma son ambas primicias para esta familia.
Póngalo junto a las tarifas por segundo del propio Google y verá que la diferencia es en realidad una diferencia de multiplicadores. Google cobra $0.0338, $0.1014, $0.1520 y $0.3041 según se sube; nosotros cobramos $0.0297, $0.09, $0.135 y $0.18. Las dos escalas arrancan con la misma forma —un tercio de la tarifa de 720p en 360p, una vez y media en 1080p— y se separan arriba: Google triplica y nosotros duplicamos. Eso nos deja por debajo de Google en todos los escalones: alrededor de un doce por ciento a 360p, un once a 720p y 1080p, y un cuarenta y uno a 4K. Lo que el precio compra además es una única superficie de API y un solo juego de credenciales para todos los modelos de nuestro catálogo, lo cual vale algo sin ser una pretensión de ser el más barato en todas las configuraciones.
La opción genuinamente barata está justo al lado, y la mayoría de los lectores debería mirarla primero. Veo 3.1 Fast text-to-video cuesta $0.01 por segundo: una novena parte de Omni 1.1 Flash. Es además la única cifra de esta página que no está reñida: la propia tabla de Google pone Veo 3.1 Fast a $0.10 por segundo a 720p, así que el mismo modelo cuesta aquí la décima parte de lo que cuesta allí. Para un plano de texto a vídeo sin edición, sin extensión y sin continuidad de personaje, esa prima de nueve veces sobre él le compra muy poco. Preferimos que se gaste un dólar y no nueve y que vuelva.
Donde Omni justifica la diferencia es exactamente donde apuntan las funciones de la 1.1: continuación, control de primer y último fotograma, y llevar un sujeto de un plano a otro. Si su trabajo es de un clip cada vez, Veo 3.1 Fast es la mejor elección, y además cubre trabajos de image-to-video, reference-to-video y primer y último fotograma.
Los precios y las condiciones de producto pueden cambiar. Compruebe el precio vigente de cada proveedor antes de tomar una decisión de compra. Esta es una comparación acotada, no una afirmación de que E2X sea la opción más barata en todas las configuraciones.
Qué hacer esta semana
Si estaba en el endpoint de preview, apunte la fecha del 30 de septiembre en el calendario y muévase. Si está eligiendo modelo de vídeo por primera vez, empiece por Veo 3.1 Fast a un céntimo por segundo y suba de nivel solo cuando un trabajo necesite continuidad de verdad. Y si prefiere comparar esquemas antes que leer prosa, cada modelo publica una especificación legible por máquina: la de Omni 1.1 Flash lista todos los parámetros, restricciones y el precio actual.
Explore el resto por tipo de trabajo desde text-to-video o reference-to-video.
Preguntas frecuentes
¿Qué es Gemini Omni 1.1 Flash?
Gemini Omni 1.1 Flash es el modelo de generación y edición de vídeo de Google, puesto en disponibilidad general el 27 de agosto de 2026 bajo el id de API gemini-omni-1.1-flash. Genera clips de 3 a 10 segundos a 24 FPS con audio nativo, y añade funciones de edición que su predecesor no tenía: extensión de escena hasta 40 segundos, interpolación entre primer y último fotograma, y clips de referencia para la consistencia de personaje.
¿Cuándo se lanzó Gemini Omni 1.1 Flash?
El 27 de agosto de 2026, como modelo en disponibilidad general y no como preview. El changelog de la API de Google lo recoge como «Gemini Omni Flash generally available (GA): Released gemini-omni-1.1-flash». El modelo de preview anterior, gemini-omni-flash-preview, estaba disponible desde el 30 de junio de 2026 y tiene programada su retirada para el 30 de septiembre de 2026.
¿Existe un Omni Flash 1.0?
No. Google nunca ha lanzado un producto llamado Omni Flash 1.0. El modelo anterior a Gemini Omni 1.1 Flash se llama Gemini Omni Flash, con el id de API gemini-omni-flash-preview, y era una versión en preview. Las páginas que describen un «Omni Flash 1.0» se están inventando un número de versión que no existe.
¿Cuánto cuesta Gemini Omni 1.1 Flash?
Llamando a Google directamente, la salida de vídeo se factura a $17.50 por millón de tokens, con la entrada a $1.50 por millón y sin nivel gratuito para vídeo. La página de Cloud pricing de Google da el coste en tokens de un segundo en cada resolución —1.931 a 360p, 5.792 a 720p, 8.688 a 1080p y 17.376 a 4K—, lo que sale a $0.0338, $0.1014, $0.1520 y $0.3041 por segundo. En E2X esos mismos niveles cuestan $0.0297, $0.09, $0.135 y $0.18, lo que deja el clip de ocho segundos a 720p por defecto en $0.72.
¿Cuánto puede durar un vídeo de Gemini Omni 1.1 Flash?
Una sola generación produce de 3 a 10 segundos. Usando la extensión de escena puede construir hasta 40 segundos en total, añadiendo continuaciones de 3 a 10 segundos a un clip existente. Cualquier vídeo que aporte como entrada para editar o extender tiene que durar a su vez 10 segundos o menos.
¿Puedo usar Gemini Omni 1.1 Flash en Vertex AI?
No a fecha de 27 de agosto de 2026. Las notas de versión de Vertex AI no mencionan la familia Omni. El anuncio de Google dirige a los usuarios de API empresarial a la Gemini Enterprise Agent Platform, y el modelo también está disponible a través de la Gemini API, AI Studio, Flow y la app de Gemini.
¿Está disponible Gemini Omni 1.1 Flash en E2X?
Sí, desde el 28 de agosto de 2026, en las cuatro capacidades: text-to-video, image-to-video, start-end-frame-to-video y reference-to-video. Cuesta $0.09 por segundo a 720p, con $0.0297 a 360p, $0.135 a 1080p y $0.18 a 4K, y duraciones de 4, 6, 8 y 10 segundos. Eso queda por debajo de la tarifa por segundo del propio Google en todos los niveles: alrededor de un doce por ciento a 360p, un once por ciento a 720p y 1080p, y un cuarenta y uno por ciento a 4K. El audio se genera de forma nativa y no se puede desactivar. Para clips sueltos sin requisitos de edición ni de continuidad, Veo 3.1 Fast a $0.01 por segundo sigue siendo normalmente mejor relación de valor.