El 4K de Gemini Omni 1.1 Flash es un escalado. Aun así cuesta aquí un 41 % menos
Salimos a hacer la prueba obvia y se vino abajo en el primer paso, que resultó ser el resultado más interesante.
El plan era de lo más corriente: un prompt, un seed fijo, dos resoluciones, y después los dos fotogramas abiertos a píxel real para ver qué añade el peldaño de arriba. Lo que volvió fueron dos películas distintas. Mismo texto de prompt, mismo seed, y la lupa de latón que en la toma de 720p queda abajo y a la izquierda del encuadre está a la derecha y más al fondo en la de 4K. Los cuencos de pigmento están dispuestos de otra manera y hay más: siete cuencos llenos en el encuadre a los cinco segundos y medio de la toma de 720p, frente a cinco en la de 4K. El lino pasa de ser un rollo plegado al fondo a extenderse a lo ancho por la derecha.
Conviene decirlo sin rodeos, porque los consejos de prompting dan por supuesto lo contrario: un seed reproduce un plano dentro de una misma resolución, no entre resoluciones distintas. Cambie de peldaño y habrá encargado una toma nueva, no una copia más grande de la que ya tenía. Quien piense hacer borradores baratos y acabar caro con un mismo seed debería leer eso dos veces.
Así que la comparación hubo que montarla sobre un único archivo entregado. Tome un fotograma 4K, redúzcalo a 1920 por 1080 y vuelva a ampliarlo a 3840 por 2160. Todo lo que un máster 1080p habría podido llevar sobrevive a ese viaje; nada más fino de lo que 1080p puede representar lo hace. Compare el round trip contra el nativo y la diferencia es lo que el peldaño de arriba entrega de verdad por encima de 1080p.
El control importa más que la medición, porque el grano de H.264 vive exactamente en la banda que se está midiendo. Así que la prueba corrió sobre dos tipos de región: zonas con textura donde podría haber detalle real, y zonas desenfocadas y sin textura que no pueden sostenerlo. Las regiones sin textura le dan el suelo de ruido.
| Parche de 512 por 512 | Qué es | Nativo frente a round trip, high-frequency energy |
|---|---|---|
| Con textura | trama del lino | 3.62x |
| Sin textura | mesa de trabajo desenfocada | 1.10x |
| Sin textura | fondo desenfocado | 1.15x |
El excedente de la zona con textura queda claramente por encima del suelo de ruido, así que el 4K entregado lleva estructura real por encima de lo que 1080p podía sostener, y no solo grano. Pero mire su tamaño: unas tres veces el suelo de ruido, frente a nueve veces los píxeles. Y como el ruido de compresión sesga la medición hacia encontrar detalle, trátelo como un techo, no como una estimación.
Tres parches colocados a mano son una base endeble para eso, así que además deslizamos la misma ventana de 512 píxeles por todo el fotograma en pasos de 128 píxeles y separamos los resultados según cuánta textura sostiene realmente cada parche. Los trece más planos quedan entre 1.08x y 1.35x; los once con más textura, entre 2.86x y 3.86x. La diferencia es una propiedad del fotograma, no de dónde pusimos las cajas.


La misma región de 512 píxeles del mismo fotograma —el fotograma 96, a los cuatro segundos, en el píxel (2944, 1152)—, así que la diferencia entre ellos es todo lo que el peldaño de arriba añade sobre un máster 1080p. El segundo es un round trip, no un render en 1080p, y no lo vamos a etiquetar como tal.
Y si a usted los dos le parecen casi idénticos, esa es la lectura correcta y no un fallo de la ilustración. Se diferencian como mucho en 9 valores de 255, en 0.82 de media, con 47.1 dB de PSNR. Tampoco es un ejemplo escogido con suavidad: ese parche es el cuadrado de 512 píxeles con más textura de todo el fotograma. Un ratio de 3.62x en la banda de alta frecuencia es un resultado real, pero es el triple de una cantidad que nunca fue grande: este material es blando de principio a fin. Lo que el peldaño de arriba añade aquí es algo que un espectro puede separar y un ojo, en su mayor parte, no.
Una nota metodológica para quien quiera repetirlo: la high-frequency energy es la fracción del power spectrum promediado radialmente que queda por encima del límite de Nyquist de 1080p, que para un parche de 512 píxeles de un fotograma 4K es el bin de radio 128. El round trip es ffmpeg -vf "scale=1920:1080,scale=3840:2160" con el bicúbico por defecto, aplicado al fotograma entero antes de recortar los parches.
La Laplacian variance, el atajo habitual para estimar nitidez, es el instrumento más romo: sitúa el parche con textura en 1.70x frente a 1.36x y 1.07x en los parches sin textura, donde la medida espectral da 3.62x frente a 1.10x y 1.15x. Sí que los separa, pero por un margen lo bastante pequeño como para discutirlo, porque cuenta el ruido de compresión junto con el detalle.
Dos comprobaciones de cordura sobre el archivo, porque un peldaño superior es fácil de falsificar. ffprobe informa de unos 3840 por 2160 reales, con un bitrate de archivo de 25 583 339 bit/s: 8.84 veces el de la toma de 720p del mismo prompt, frente a una proporción de píxeles de 9.00. Nadie le está entregando un flujo famélico dentro de un envoltorio UHD. Y mide 24 fps exactos, 192 fotogramas a lo largo de 8.000 segundos, una cifra que circula apoyada en documentación de esquema de terceros y no en nada que publique Google, confirmada aquí en nuestra propia salida.
Así que la respuesta honesta no es ninguna de las dos que se suelen oír. El peldaño de arriba no es un archivo 1080p reetiquetado, y tampoco es cuatro veces la imagen. Nueve veces los píxeles compran algo más cercano al triple de estructura, que es por lo que cuánto cuesta merece preguntarse con cuidado.

Qué hace la palabra «upscaled» dentro de ese paréntesis
La referencia de modelo de Google añade la palabra a los dos peldaños de arriba, literal: «1080p output (upscaled)» y «4K output (upscaled)», salida escalada. La generación ocurre en algún raster interno más bajo y el resultado se redimensiona a la salida, así que la estructura que lleve el peldaño de arriba la puso el redimensionado, no la resolvió el renderizador. Google no publica esa resolución interna, así que nadie que le cite un factor de ampliación la conoce tampoco.
Dos consecuencias. No puede recomprar una toma mala en la caja, porque el fallo está aguas arriba del redimensionado y un upscaler dispuesto a inventar textura plausible no va a inventar la correcta. Pero «ya la amplío yo en local» es más flojo de lo que suena: el redimensionado del modelo corre antes de la codificación de entrega, el suyo corre después, sobre un archivo con su cuantización ya cocida dentro.
Cinco trabajos donde las dimensiones son el entregable
Esto es lo que la divulgación honesta tiende a enterrar: el detalle es una razón para querer un raster grande, y no la más habitual en producción.
Un pliego de entrega que nombra un raster. Cadenas y agencias escriben los requisitos como dimensiones, y el control de calidad automatizado lee la cabecera. Un archivo de 1920 por 1080 contra un pliego UHD suspende antes de que lo vea una persona. Nadie ahí está midiendo la función de transferencia de modulación: están midiendo el archivo.
Un máster de archivo. Guarde la versión más grande que llegara a generar: el modelo acabará depreciado y, como muestra el resultado del seed de arriba, no puede volver a ejecutar el prompt y recuperar ese clip. Los entregables se hacen bajando desde un máster, nunca subiendo.
Margen para reencuadrar y para cerrar el plano. El argumento práctico más fuerte, y es aritmética. Omni ofrece dos relaciones de aspecto y ninguna más, 16:9 y 9:16, así que cualquier cosa cuadrada o en 4:5 es un recorte. Un recorte 9:16 centrado sobre un fotograma 1080p tiene 608 píxeles de ancho: una entrega vertical de 1080 de ancho obliga a ampliar otra vez un archivo comprimido. El mismo recorte sobre UHD tiene 1215 de ancho y está reduciendo hasta el pliego. Los cierres de plano, igual: un reencuadre de 1.5× sobre UHD todavía le deja unos 1920 por 1080 nativos, donde una fuente 1080p deja 1280 por 720.
Pantalla de gran formato. En un muro LED o en un panel DOOH el pitch de píxel fija el archivo que entrega, y una fuente 1080p estirada para llenarlo se ve blanda de un modo que nunca se ve en un vídeo incrustado en un navegador.
Placas de composición y VFX. Los trackers y los keyers trabajan sobre píxeles, y cuatro veces más asientan una resolución de tracking planar aunque vengan de una ampliación y no de un sensor. Además se acaba en el pliego de entrega, así que la placa tiene que estar ya ahí.
Ninguno de los cinco va de que la imagen se vea mejor. Los cinco van de que el archivo tenga el tamaño correcto para lo que viene después.

Y tres donde está pagando un redimensionado
Vertical para redes. Todas las plataformas grandes recodifican al subir y la mayoría topan el lado largo muy por debajo de UHD: está pagando la tarifa del peldaño de arriba por píxeles que se tiran en la ingesta, antes de que un espectador vea la publicación.
Vídeo incrustado en web. Un clip en la columna de un artículo se reproduce a unos 800 píxeles de ancho. Una fuente UHD le cuesta dinero al generar y Largest Contentful Paint al entregar, una rara pérdida doble.
Pasadas de revisión interna. Aprobar un movimiento de cámara es un juicio de forma y de movimiento, que se toma dos peldaños más abajo por una fracción del dinero.
La sección de precios, que es el argumento de verdad
El peldaño de arriba en todos los proveedores que publican una tarifa por segundo invocable, consultado el 29 de agosto de 2026.
| Dónde lo llama | 4K, por segundo | Clip de diez segundos |
|---|---|---|
| E2X | $0.18 | $1.80 |
| fal.ai | $0.30 | $3.00 |
| Google, directo | $0.3041 | $3.04 |
| Runware | $0.32 | $3.20 |
| WaveSpeed | $0.39 | $3.90 |
Contra la tarifa del propio Google eso es un cuarenta y uno por ciento por debajo, con mucho la mayor diferencia de los cuatro peldaños. Un peldaño más abajo, en 1080p, la horquilla se estrecha a un once por ciento, $0.135 frente a $0.1520, y más abajo todavía el grupo va tan junto que no merece un párrafo.
Replicate falta por una razón que conviene decir en lugar de tapar: lleva el modelo y no publica ninguna tarifa por segundo a ninguna resolución. Buscamos una cifra de 4K y no hay nada que citar.
Que la diferencia se ensanche arriba no es comportamiento de margen sino la forma de la escalera, y las dos formas son públicas. Normalice cada proveedor contra su propio segundo de 720p y las dos coinciden en tres peldaños: un tercio en el nivel de borrador, uno entero en el medio, la mitad más en 1080p. El cuarto es donde se separan: Google cobra el triple de su segundo de 720p, nosotros cobramos el doble del nuestro. Cada dólar del cuarenta y uno por ciento sale de ese único escalón.

Extiéndalo a las duraciones que encargaría:
| Trabajo | E2X 4K | Google 4K |
|---|---|---|
| Plano de recurso de 4 segundos | $0.72 | — |
| Plano principal de 8 segundos | $1.44 | $2.43 |
| Generación única de 10 segundos, el máximo | $1.80 | $3.04 |
| Secuencia de 40 segundos (una generación, tres extensiones) | $7.20 | $12.16 |
Retenga esa última fila si está presupuestando una campaña. Una secuencia UHD de cuarenta segundos son cuatro trabajos facturados por separado use el proveedor que use, y las columnas se diferencian en casi cinco dólares en una sola secuencia, antes de las tomas que descarte, cada una multiplicando la brecha.
Las dos columnas compran los mismos pesos, el mismo audio nativo, la misma marca de agua SynthID en cada fotograma. Nada del cuarenta y uno por ciento es una renuncia de calidad, y nada de ello afirma que esta sea la forma más barata de hacer vídeo en general, cosa que normalmente no lo es.
Qué cambia en el prompt cuando pasa a 4K
Casi nada, y el casi es la parte interesante.
La resolución es un parámetro de API, y escribir «4K» dentro del texto no selecciona el peldaño. Los adjetivos de detalle van dirigidos a la etapa equivocada: la ampliación corre después de la generación y no lee nunca su prompt. Va a inventar muestras, como enseña la medición de arriba, solo que no en ninguna dirección que dirijan sus palabras.
Lo que sí llega al renderizador es la óptica y la luz, y resulta que la luz hace doble trabajo. Una fuente rasante construye bordes de alto contraste, y los bordes de alto contraste son lo que sobrevive a una ampliación, tanto si el upscaler los preserva como si los reconstruye. Iluminar buscando textura es lo más parecido que hay a hacerle prompting al peldaño.
Aquí está el mismo encargo escrito de dos maneras. Primero, como escribe la gente cuando va detrás de la resolución:
4K ultra detailed cinematic shot of a museum conservation bench, 8K,
hyper realistic, insanely sharp, maximum detail, best quality, intricate
textures, razor sharp focus, highly detailed surfaces, photorealistic
masterpiece, professional cinematography, award winning, unreal engine
render, ray tracing, ultra HD, crisp edges, no blur, extreme detail on
every surface, cinematic lighting, beautiful composition, trending.
Lea qué instruye eso. No prohíbe en ningún momento los cortes de escena, así que el modelo tiene vía libre para construir una pequeña narrativa, su comportamiento documentado por defecto. No coloca ninguna luz, no nombra ninguna óptica, no fija ninguna velocidad de cámara, y «unreal engine» apunta a un render de videojuego y no a una fotografía. Veintidós adjetivos, ninguno de ellos una instrucción sobre la que un renderizador pueda actuar.
Y el prompt que ejecutamos de verdad, el que produjo el clip de abajo, los recortes de arriba y todas las cifras de este post:
Slow lateral pan, 50mm lens on a motorized slider, moving right to left
at a steady crawl across a museum conservation bench. The frame passes
over an unrolled length of raw linen, a brass magnifier resting on its
side, and a scatter of dry pigment powder in small glass dishes - ochre,
ultramarine, deep charcoal - then settles on the corner of an oil
painting where fine craquelure spiders across the varnish. Hard
low-angle tungsten light from the left rakes over every surface so the
linen weave, the dust and the cracked glaze all read as texture. Focus
stays locked on the bench plane throughout and nothing moves except the
camera. Sound: the faint whir of the slider motor and a room's worth of
quiet.
Ocho segundos en 4K, o sea $1.44. Fíjese en dónde se hace el trabajo: una única fuente dura y baja rasando la mesa para que la trama, el polvo y el craquelado se lean todos como textura. Esa frase hizo más que veintidós adjetivos, y es la razón de que el round trip tuviera algo que encontrar.
Una nota de producción. Este prompt fue rechazado en el primer envío con It seems there was an issue with the input you provided, y pasó en el reintento tras cambiar dos palabras: se cayó un término de jerga de cámara y se renombró un pigmento. En prompts largos una sola palabra puede tumbar la petición, y el error no le va a decir cuál.
Dónde el peldaño de arriba sigue sin poder ayudarle
Hay cuatro límites que rodean específicamente el trabajo en 4K. La relación de aspecto sigue siendo 16:9 o 9:16, así que los entregables cuadrados y en 4:5 salen de un recorte pague el peldaño que pague. Cada fotograma lleva una marca de agua SynthID sin ningún interruptor en ninguna parte. No hay ningún modo 4K nativo al que escalar ni control alguno sobre el upscaler. Y una generación sigue topando en diez segundos, así que un máster UHD más largo es una cadena de extensiones donde cada eslabón fallido cuesta ahora $1.80 en lugar de $1.35.
Y la advertencia con la que se cierra todo el post: nada de esto convierte a Omni en el modelo correcto para un clip suelto en 4K. Veo 3.1 Fast va a un centavo por segundo con la misma clave. Para un plano suelto del que no depende nada, un múltiplo de dieciocho veces es indefendible por bien que se vea la tarifa de 4K.
Haga borradores baratos, entregue en grande
Itere barato y ascienda a un ganador: diez pasadas a 360p más un acabado son $1.728 frente a $5.40 por diez a 1080p. El post de los 40 segundos lo desarrolla como es debido.
UHD añade una advertencia y no un paso más. Haga borradores a $0.0297 el segundo, por supuesto, pero el resultado del seed de arriba significa que el ganador es una guía y no una previsualización: la toma que entregue será otra distinta. Deje que el peldaño lo elija el pliego de entrega y no el peldaño en el que hizo los borradores.
Las cifras por capacidad están en la especificación legible por máquina; el modelo vive en text-to-video. Las tarifas se mueven: confirme la página de cada proveedor antes de comprometer gasto. Esto cubre a los proveedores que publicaban una tarifa por segundo de 4K invocable el 29 de agosto de 2026.
Preguntas frecuentes
¿Renderiza Gemini Omni 1.1 Flash en 4K nativo?
No. La referencia de modelo de Google lo lista como «4K output (upscaled)»: la generación ocurre en un raster interno más bajo y el fotograma se amplía antes de la entrega, y esa resolución interna no se publica. Medido contra un round trip a través de 1080p, eso sí, el archivo sostiene estructura real por encima de lo que 1080p podía llevar: unas tres veces el suelo de ruido en las regiones con textura, frente a nueve veces los píxeles. Un excedente real, pero nada parecido a nueve veces la imagen.
¿Cuánto cuesta el 4K en Gemini Omni 1.1 Flash?
En E2X, $0.18 por segundo: $0.72 por cuatro segundos, $1.44 por ocho, $1.80 por una generación de diez segundos, la longitud máxima. Llamar a Google directamente cuesta $0.3041 el segundo, desde sus recuentos de tokens publicados. fal.ai lista $0.30, Runware $0.32, WaveSpeed $0.39. Replicate no publica ninguna tarifa por segundo a ninguna resolución.
¿Por qué la diferencia de precio entre proveedores es mayor en 4K?
Porque lo que difiere es el multiplicador sobre el peldaño de arriba, no la tarifa base. Tomando 720p como 1×, la escalera de Google va 0.33, 1, 1.5 y 3; la nuestra va 0.33, 1, 1.5 y 2. Coinciden en los tres peldaños de abajo y se separan en el cuarto, donde Google triplica por el escalado y nosotros duplicamos. Ese único escalón es todo el cuarenta y uno por ciento.
¿Cuándo merece la pena pagar la tarifa de 4K?
Cuando el requisito son las dimensiones en sí: un pliego de entrega que nombra un raster UHD y que comprueba un control de calidad automatizado; un máster de archivo del que sacar entregables futuros; margen para reencuadrar, ya que Omni solo saca 16:9 y 9:16; pantalla de gran formato o DOOH, donde el pitch del panel fija la fuente; y placas de composición, que necesitan número de píxeles y tienen que acabar en el pliego.
¿Cuándo debería evitar renderizar en 4K?
En vertical para redes, donde las plataformas recodifican en la ingesta y topan el lado largo muy por debajo de UHD; en vídeos incrustados que se reproducen a unos pocos cientos de píxeles de ancho, donde el peso cuesta rendimiento de página además de dinero; y en las pasadas de aprobación interna, que son juicios de forma y de movimiento que puede hacer en el nivel de borrador por una fracción del coste.
¿Escribir «4K» o «ultra detailed» en el prompt mejora el resultado?
No. La resolución es un parámetro de API y el texto del prompt no la selecciona. Los adjetivos de detalle van dirigidos a la etapa equivocada: la ampliación corre después de la generación y no lee nunca el prompt. Sí añade estructura, la hemos medido, pero nada de lo que escriba dirige qué añade. La elección de óptica, la dirección de la luz y el movimiento de cámara sí cambian lo que se renderiza antes del redimensionado, y ahí es donde las palabras del prompt se ganan su sitio.
¿Se puede recortar a vertical un clip 4K de Omni sin perder calidad?
Normalmente sí, y es el argumento práctico más fuerte a favor del peldaño. Un recorte 9:16 centrado sobre UHD tiene 1215 píxeles de ancho, así que una entrega vertical de 1080 de ancho es una reducción. El mismo recorte sobre 1080p tiene 608 de ancho y hay que ampliarlo otra vez, desde un archivo ya comprimido. Los cierres de plano van igual: un reencuadre de 1.5× sobre UHD todavía deja unos 1920 por 1080 nativos.
¿El mismo seed da el mismo plano a otra resolución?
No, y esto nos sorprendió. Un prompt con un seed fijo, renderizado a 720p y otra vez a 4K, devolvió dos planos distintos: objetos en lados opuestos de la mesa, otro número de cuencos de pigmento dispuestos de otra manera, otra altura de cámara. Trate el determinismo del seed como válido únicamente dentro de una misma resolución, y no cuente con aprobar un plano barato y volver a renderizar después ese mismo plano en grande.