Las escenas de 40 segundos de Gemini Omni 1.1 Flash son cuatro facturas distintas
La cifra que aparece en todos los titulares esta semana es cuarenta. Escenas de cuarenta segundos con el nuevo modelo de vídeo de Google, lo que suena a escribir un prompt y recibir cuarenta segundos de vuelta.
Pues no. Una sola llamada a gemini-omni-1.1-flash devuelve entre tres y diez segundos. A cuarenta se llega prolongando ese clip tres veces más —cuatro trabajos en total, cada uno facturado por separado—. Nadie mintió: el propio anuncio de Google describe esas continuaciones con claridad. Pero la cifra recorrió un largo camino desde esa frase y llegó a mucha gente como un valor por generación.
Este es el informe que nos gustaría tener antes de poner la tarjeta: qué cuestan cuarenta segundos, para qué sirve el nivel de 360p y qué restricciones están enterradas en la documentación —una de ellas deja a los desarrolladores europeos completamente fuera de la función estrella—.

Cuarenta segundos son cuatro trabajos y cuatro facturas
Los modelos de vídeo facturan por segundo generado, y la extensión no lleva descuento: una continuación cuesta lo mismo que una generación nueva, así que cuarenta segundos salen como cuatro clips de diez. En cada nivel:
| Resolución | En E2X | Directo de Google |
|---|---|---|
| 360p | $1.19 | $1.35 |
| 720p | $3.60 | $4.06 |
| 1080p | $5.40 | $6.08 |
| 4K | $7.20 | $12.16 |
Cuatro por diez segundos, a la tarifa por segundo de cada uno. Las nuestras salen del catálogo en vivo; las páginas de modelo llevan la cifra actual si esta envejece.
Esa columna de Google merece una explicación, porque las tarifas cuestan sorprendentemente encontrarlas. Dos páginas oficiales llevan la escalera completa y una búsqueda de texto no atrapa ninguna. En el anuncio de lanzamiento los precios están dentro de una imagen: legibles para un humano, invisibles al Ctrl-F. En la página de Cloud pricing aparecen como tokens por segundo frente a un contador de $17.50 por millón, así que no parecen precios hasta que multiplicas. La página que abrirías primero, la documentación de precios de la API, da un peldaño de cuatro: «un precio efectivo de aproximadamente $0.10 por segundo» en 720p.
Ambas coinciden, con un matiz de redondeo: el anuncio muestra un pulcro $0.03 / $0.10 / $0.15 / $0.30, y la aritmética de tokens aterriza un poco por encima de cada uno. La facturación sigue a los tokens, así que la columna de arriba también; el post de lanzamiento tiene el cálculo nivel por nivel.
Cinco dólares cuarenta por cuarenta segundos de 1080p, seis y pico desde Google. Ese es el precio de etiqueta antes de una sola toma alternativa, y las harás, porque es en la última extensión donde aparece la deriva. Presupuesta el montaje que te quedas más los dos que tiras y una secuencia terminada de cuarenta segundos sale por dieciséis dólares, no por cinco.
La fila de 360p era la que perdíamos, y así lo escribíamos aquí hasta hace poco. Ha cambiado: nuestro nivel de borrador está ahora en $0.0297 el segundo frente a los $0.0338 de Google, un doce por ciento por debajo. No saques demasiadas conclusiones. fal está en $0.03 —una diferencia del uno por ciento, ruido estadístico disfrazado de victoria y de esas cosas que se dan la vuelta en cuanto alguien retoca un multiplicador—. El flujo de trabajo con borradores que viene abajo se sostiene compres donde compres; nunca ha dependido de que el precio fuera el nuestro.
La verdadera mejora de la 1.1 es la memoria, no la duración
La duración ya era más o menos alcanzable. Lo que la vuelve utilizable es lo que el modelo ve cuando continúa.
La preview de junio leía el último segundo del clip que estaba prolongando. Un segundo te dice qué hay en el encuadre y casi nada de lo que estaba ocurriendo, así que las extensiones derivaban. El travelling dejaba de moverse. Una chaqueta cambiaba de tono. La luz se reconstruía en cada empalme.
Gemini Omni 1.1 Flash lee hasta diez segundos de metraje previo. Diez segundos bastan para saber que el dolly seguía en marcha, de qué lado venía la luz principal y de qué color era más o menos el abrigo, y por eso una secuencia de cuatro partes por fin se sostiene. Si alguien te dice que la función estrella de la 1.1 es la duración, lo tiene al revés. La duración era aritmética. La memoria es el modelo.
El 1080p y el 4K son escalados, no renders
Un paréntesis en la documentación de Google cambia por qué deberías pagar. De la referencia del modelo, literal: «salida 1080p (escalada)» y «salida 4K (escalada)». El modelo renderiza por debajo de esas resoluciones y luego amplía. La parte alta de la escalera no es más detalle: es un archivo más grande con la misma información dentro.
Lo cual recolorea la fila de 4K de arriba. Doce dólares y pico, desde Google, por cuarenta segundos de salida escalada. Si un pliego de cliente exige dimensiones 4K, págalo. Si elegiste 4K suponiendo que se ve mejor, estás pagando exactamente el triple de la tarifa de 720p de Google por un redimensionado que podrías hacer en ffmpeg.
Borrador en 360p, acabado en 720p
Esta es la parte que ahorra dinero, y nadie la puso en un titular.
El 360p cuesta $0.0297 el segundo aquí: un borrador de cuatro segundos son doce centavos, frente a $0.36 en 720p y $0.54 en 1080p. Google también afirma que el 360p corre hasta un 60 % más rápido, una cifra del proveedor y no una medición nuestra, aunque la dirección es evidentemente correcta.
Vamos con la aritmética. Supón que un plano necesita diez intentos hasta que el movimiento queda bien, algo realista en cualquier cosa con un movimiento de cámara concreto.
- Diez pasadas directamente en 1080p → $5.40
- Diez pasadas en 360p → $1.19, y luego el ganador relanzado en 1080p → $1.73
Un sesenta y ocho por ciento menos, a cambio de una generación extra al final. Sé honesto sobre lo que una pasada en 360p puede decirte: composición, movimiento de cámara, si el modelo metió cortes que nunca pediste. La textura fina no la puede juzgar: no hay resolución suficiente para sostenerla.
Aquí está el mismo prompt en los dos niveles, con la misma seed, cuatro segundos cada uno. Primero el borrador:
Y luego el render en 720p del mismo prompt y la misma seed:
Ambos muestran un cronómetro de latón sobre pizarra oscura, con la cámara avanzando en travelling desde la izquierda y una luz principal cálida rozando el metal. El prompt de los dos, literal:
Editorial slow-motion macro shot of a brass mechanical stopwatch resting on a dark slate table, its second hand sweeping forward in a single continuous shot with no scene cuts. Camera performs a slow dolly in from the left, shallow depth of field, one warm amber key light raking across the metal, cool blue rim light behind. Fine dust drifts through the beam. Clean dark background, no text, no logos, no people. Sound design: a soft mechanical tick and low room tone, nothing else.
(El prompt se deja en inglés: el modelo solo se ha evaluado en inglés y conviene que puedas reproducir el resultado tal cual.)
Doce centavos frente a treinta y seis. El borrador nos dijo que el travelling funcionaba y que el modelo mantenía un solo plano, que era todo lo que necesitábamos antes de comprometernos. Haz tus iteraciones ahí abajo.
La extensión solo avanza hacia delante
La extensión de escena añade al final, y la forma de ese límite decide cómo planificas una secuencia. No puedes insertar en mitad de un clip. No puedes extender hacia atrás para construir una entrada. No existe un «quédate con el final y rehaz los primeros cuatro segundos»: la capacidad funciona en una sola dirección. Si el tercer plano está mal, todo lo que viene después se va a la basura con él.
Así que carga el esfuerzo al principio. La primera generación fija el lenguaje de cámara, la paleta y la iluminación de todo lo que sigue, y es el único segmento que puedes revisar barato. Para la tercera extensión llevas cuatro trabajos de profundidad y ninguna forma de volver atrás.
La extensión tampoco hará una cosa más. Dale el vídeo de alguien hablando, pídele un diálogo nuevo y se niega: Google restringe la modificación del habla. La prensa especializada lo interpreta como una contención deliberada por publicación responsable más que como una función ausente; esa lectura es del periodista, pero la restricción sí está en la documentación. No construyas un producto de doblaje sobre este modelo.
Desarrolladores europeos, leed esta línea dos veces
Enterrada en la documentación como una sola frase: en el EEE, Suiza y el Reino Unido, editar y extender un vídeo subido no está disponible.
No es una restricción blanda. La función estrella —coger metraje y continuarlo— no funciona en la mayor parte de Europa. El text-to-video y el image-to-video siguen corriendo. Pero si el plan era una herramienta que prolonga los clips que suben tus usuarios, y esos usuarios están en Berlín o en Mánchester, el plan está muerto y el anuncio no lo menciona ni una vez.
Compruébalo contra tu región de despliegue antes de escribir una línea de código de integración. Es lo más caro de este texto que se puede descubrir tarde.
Los mandos que no existen
Viniendo de un modelo de texto, buscarás parámetros que aquí no están. La documentación de Google marca toda la superficie de muestreo como no soportada: nada de temperature, nada de top_p, nada de instrucciones de sistema, ni secuencias de parada, ni prompt negativo. Nada.
Tu única superficie de control es el prompt en sí, y la documentación de terceros sitúa el techo en 40.000 caracteres —mucha cuerda, aunque esa cifra no es de las que encontramos en la referencia propia de Google—. Todo lo que normalmente harías con un parámetro de muestreo hay que escribirlo en inglés. Si quieres saber cómo escribir bien ese inglés, tratamos la sintaxis de prompts en un post aparte, incluida la estructura de etiquetas y el problema de los cortes, y no tiene sentido repetirlo aquí.
Una advertencia. La documentación de esquema de terceros para este modelo lista temperature y top_p como campos aceptados, mientras que la referencia de Google dice que no están soportados. No te vamos a decir cuál acierta: te decimos que se contradicen. No diseñes nada alrededor de esos parámetros fiándote de un esquema; prueba antes si cambian algo.
Un sonido que no se apaga, un inglés del que no se sale
El audio se genera de forma nativa con cada clip y no hay interruptor. Ni parámetro, ni flag, ni modo silencioso. Puedes orientarlo —una frase Sound design: hace trabajo de verdad— pero no puedes rechazarlo. Para un embed en un blog eso significa silenciarlo en el reproductor, que es lo que hacen los dos clips de arriba.
Tampoco puedes aportar audio como referencia, editar el audio generado después, ni conservar el sonido de un vídeo que subas para extenderlo. Las tres son expectativas razonables. Ninguna está soportada.
El soporte de idiomas es más estrecho de lo que sugiere el marketing: el inglés es el único idioma plenamente soportado. El japonés y los demás están documentados como no evaluados, una forma prudente de decir que los resultados son impredecibles. Si tus prompts o tus diálogos no están en inglés, presupuesta sorpresas.
Conoce los topes de referencia antes de diseñar un pipeline de entrada. Referencias de vídeo: hasta tres clips, de tres segundos cada uno, y Google advierte de que aportar varios a la vez puede degradar los resultados; trata el tres como techo, no como objetivo. Las relaciones de aspecto son 16:9 o 9:16, también de Google. Dos cifras que se citan al lado no lo son: los 24 fps y el rango de una a siete imágenes para reference-to-video vienen ambos de documentación de esquema de terceros. Cada fotograma lleva una marca de agua SynthID, y no hemos encontrado ningún proveedor que exponga un interruptor para quitarla.
Antes de gastar nada, haz esto
Cuatro comprobaciones, en orden. La primera mata más integraciones que todas las demás juntas.
- Confirma tu región. Si estás en el EEE, Suiza o el Reino Unido y tu producto extiende vídeo subido, párate aquí. Este modelo no puede hacer ese trabajo por ti.
- Presupuesta la secuencia, no el clip. Multiplica por las extensiones y luego por las tomas que vas a hacer de verdad. Cuarenta segundos de 1080p son $5.40 aquí en el mejor caso, y realistamente el triple contando repeticiones.
- Pregúntate si necesitas Omni siquiera. Un segundo de Veo 3.1 Fast cuesta un centavo aquí, frente a nueve en Omni a 720p. Un plano, sin continuación, sin interpolación de fotogramas, sin nadie que deba tener la misma cara dos clips después: entonces ese múltiplo es dinero quemado.
- Monta tu bucle sobre el nivel de borrador. Itera en 360p y promociona al ganador. Un sesenta y ocho por ciento no es un error de redondeo.
Omni se gana el múltiplo exactamente donde apuntan las funciones de la 1.1: continuar un plano, interpolar entre una primera y una última imagen, animar una imagen fija o llevar un sujeto de un plano a otro. Fuera de eso, es una forma cara de comprar un solo clip.
Los otros ángulos están al lado: qué salió realmente el día del lanzamiento, qué dicen y qué no dicen las clasificaciones —los puestos de arena que circulan esta semana pertenecen al modelo anterior— y un desglose de precios plataforma por plataforma. Los esquemas y los precios en vivo están en el catálogo.
Los precios y las condiciones comerciales cambian. Consulta la tarifa vigente de cada proveedor antes de tomar una decisión de compra.
Preguntas frecuentes
¿Gemini Omni 1.1 Flash puede hacer vídeos de 40 segundos de verdad?
Sí, pero no en una sola llamada. Una generación devuelve de 3 a 10 segundos. Cuarenta segundos es el total acumulado al que llegas prolongando un clip existente tres veces más —cuatro trabajos— y cada extensión se factura por separado a la misma tarifa por segundo que una generación nueva. En E2X una secuencia de 40 segundos en 1080p cuesta $5.40, frente a $6.08 llamando a Google directamente.
¿Cuánto cuesta una secuencia de 40 segundos con Gemini Omni?
Multiplica 40 segundos por la tarifa por segundo de tu resolución; las extensiones no llevan descuento. En E2X eso son $1.19 en 360p, $3.60 en 720p, $5.40 en 1080p y $7.20 en 4K. Directo de Google, partiendo de sus tarifas publicadas en tokens por segundo, las mismas duraciones cuestan $1.35, $4.06, $6.08 y $12.16. Suma las tomas descartadas y cuenta con dos o tres veces la cifra de titular.
¿La salida 4K de Gemini Omni 1.1 Flash es 4K real?
No. La documentación de Google etiqueta los niveles de 1080p y 4K como «escalados»: el modelo renderiza más bajo y amplía el resultado. El archivo tiene dimensiones 4K; la imagen no lleva detalle 4K. A menos que un pliego de entrega exija esas dimensiones, la tarifa del nivel superior compra un redimensionado y no más información.
¿Puedo usar Gemini Omni 1.1 Flash en la UE?
Parcialmente. El text-to-video y el image-to-video funcionan, pero editar o extender un vídeo subido no está disponible en el EEE, Suiza y el Reino Unido. Como la extensión es la capacidad estrella, esto bloquea cualquier producto europeo construido alrededor de continuar metraje aportado por usuarios. Verifícalo contra tu región de despliegue antes de integrar.
¿Gemini Omni 1.1 Flash admite temperature o prompts negativos?
La referencia de Google marca la superficie de muestreo como no soportada: nada de temperature, top_p, instrucciones de sistema, secuencias de parada ni prompt negativo. El texto del prompt es tu único control, y la documentación de esquema de terceros sitúa el techo en 40.000 caracteres. Esa misma documentación de terceros lista temperature y top_p como campos aceptados, contradiciendo a Google, así que pruébalos antes de depender de ellos.
¿Se puede quitar el audio en las salidas de Gemini Omni?
No. El modelo incorpora una banda sonora a cada clip por defecto y ningún parámetro la desactiva. Una instrucción de sound design en el prompt orienta lo que obtienes, pero no puedes rechazarla, aportar una referencia de audio, editar el resultado ni conservar el sonido de un vídeo que subas para extenderlo. Para reproducción en silencio, silencia en el reproductor.
¿Gemini Omni puede extender un vídeo hacia atrás o editar el medio de una escena?
No. La extensión solo añade al final de un clip: no hay extensión hacia atrás para construir una entrada ni inserción en mitad de una secuencia. Planifica en consecuencia: la primera generación fija el lenguaje de cámara e iluminación de todo lo que viene después, y un error temprano invalida cada extensión levantada encima.
¿Merece la pena Gemini Omni 1.1 Flash frente a Veo 3.1 Fast?
Solo si necesitas lo que Omni añade. Veo 3.1 Fast va a $0.01 el segundo en E2X frente a los $0.09 de Omni en 720p. Para un clip suelto sin extensión, sin control de primera y última imagen y sin continuidad entre planos, Veo gana por mucho. Omni se gana su prima en secuencias de varios planos y en trabajo de continuidad guiado por referencias.