Cinco sitios venden Gemini Omni 1.1 Flash. El precio se mueve un 44 %
Nadie compara precios de pesos de modelo. Eliges un nombre de modelo, aterrizas en la página de proveedor que Google te puso delante y pagas lo que dice la página.
El 28 de agosto de 2026 salimos a buscar todos los sitios que publican un precio invocable para un solo modelo: gemini-omni-1.1-flash, lanzado por Google el día anterior. Lo hacen cinco. Los mismos pesos, el mismo audio nativo, la misma marca de agua SynthID en cada fotograma. La cifra del final de la página varía un cuarenta y cuatro por ciento.
Lo que sigue es esa auditoría, incluida la parte en la que te decimos que compres algo nueve veces más barato que el modelo del que trata este post.

Los cinco precios, leídos la misma tarde
Todo lo de abajo es 720p, por segundo de vídeo terminado, leído en la página en vivo de cada proveedor el 28 de agosto de 2026. El audio va incluido en todas partes: el modelo no tiene interruptor de sonido, así que el audio se genera con la imagen y nadie lo factura aparte.
| Dónde lo llamas | Por segundo, 720p | Clip de ocho segundos |
|---|---|---|
| E2X | $0.09 | $0.72 |
fal.ai v1.1/edit | $0.10 | $0.80 |
| Runware | $0.10 | $0.80 |
| Google, directo | $0.1014 efectivo | $0.81 |
| fal.ai base text-to-video | $0.125 | $1.00 |
| fal.ai base reference / image-to-video | $0.13 | $1.04 |
| WaveSpeed | $0.13 | $1.04 |
De abajo arriba, $0.09 frente a $0.13. Ese es el cuarenta y cuatro por ciento, y no compra nada: ni un segundo de vídeo mejor, ni un clip más largo, ni un techo más alto. El mismo archivo, el mismo centro de datos.
Tres de esas filas pertenecen a una sola empresa, que es la siguiente sección.
La fila de Google necesita una nota al pie, porque la página de precios de Google factura en tokens y no en segundos. La salida de vídeo va a $17.50 por millón de tokens, y el 720p consume 5.792 tokens por segundo; multiplica y sale $0.1014. Esa conversión es aritmética de Google, no nuestra: la página la imprime como «un precio efectivo de aproximadamente $0.10 por segundo».
Una empresa, una familia de modelos, dos lógicas de precio
El hallazgo más raro no es un competidor. Es fal.ai en desacuerdo consigo mismo.
Abre fal.ai/models/google/gemini-omni-flash/v1.1/edit y tienes $0.10 por segundo en una escalera idéntica a la lista redondeada de Google, peldaño a peldaño, sin margen ninguno. Eso no es un precio independiente sino una repercusión: trátalo como un segundo dato y estarás contando a Google dos veces. Abre las páginas base de gemini-omni-flash en el mismo dominio y el modelo se tarifa en tokens, a $21.875 por millón, unos $0.125 para text-to-video y $0.13 para trabajos de reference e image. La misma empresa, la misma familia, una ficha a precio de coste y otra con margen.
Ese margen es exactamente un veinticinco por ciento sobre la tarifa por token de Google. Nada que objetar: un agregador que gestiona reintentos y te da una sola superficie de autenticación tiene derecho a cobrar. Pero significa que «el precio de Omni 1.1 Flash» no tiene un referente único ni siquiera dentro de una misma tienda. Así que comprueba la cadena de versión en la página contra la que estás facturando: una página que pone gemini-omni-flash sin versión puede no estar vendiéndote ni la 1.1 ni su precio.

A un proveedor le falta la cifra por completo. Replicate lista el modelo y no publica ninguna tarifa por segundo para él: lo buscamos y no hay nada que citar. Eso es un hallazgo, no una omisión nuestra: un modelo de vídeo cuyo coste no puedes leer antes de ejecutarlo es un modelo que no puedes presupuestar.
La escalera de resoluciones de Google está publicada dos veces, en dos formas distintas
Todo lo anterior es un solo peldaño. Omni 1.1 Flash vende cuatro, y encontrar los otros tres costó mucho más de lo que debería.
Google la publica dos veces, en ninguno de los sitios donde mirarías. La nota al pie de Cloud pricing da recuentos de tokens por segundo, por nivel: la verdad de facturación, ya que la factura se emite sobre tokens. El anuncio de lanzamiento lleva una tabla en dólares redondeados, pero como imagen renderizada, así que los scrapers y los artículos construidos a partir de ellos pasan de largo. La página de precios de la API de Gemini, la parada obvia, solo tiene la celda de 720p.
Llegamos lo bastante lejos por ese camino como para concluir que la escalera de cuatro peldaños era un invento de revendedor, y llegamos a redactar una sección diciéndolo, antes de volver atrás y leer la imagen. Vale la pena admitirlo, porque es exactamente el modo de fallo del que trata este post: una cifra publicada, con fuente y correcta puede seguir siendo invisible para la forma en que la mayoría comprueba.
La escalera a partir de los recuentos de tokens, que es lo que pagas de verdad:
| Resolución | Tokens/s Google | $/s Google | E2X | Diferencia |
|---|---|---|---|---|
| 360p | 1.931 | $0.0338 | $0.0297 | E2X un 12 % más barato |
| 720p | 5.792 | $0.1014 | $0.09 | E2X un 11 % más barato |
| 1080p | 8.688 | $0.1520 | $0.135 | E2X un 11 % más barato |
| 4K | 17.376 | $0.3041 | $0.18 | E2X un 41 % más barato |
Lee la primera fila para lo que de verdad cambia tu forma de trabajar. Un segundo de 360p cuesta exactamente un tercio de un segundo de 720p en nuestra escalera —$0.0297 frente a $0.09—, así que tres borradores cuestan lo que una pasada a resolución completa. Ese es todo el argumento del nivel de borrador en una frase, y por eso el peldaño barato merece existir aunque la calidad sea obviamente peor.
Ahora la última fila, donde trabajar desde los recuentos de tokens compensa: el argumento de los multiplicadores deja de ser retórica y pasa a ser dato del propio Google. Toma el 720p como 1×. Los niveles de Google van 0,33 · 1 · 1,5 · 3. Los nuestros van 0,33 · 1 · 1,5 · 2. Idénticos abajo, idénticos en medio, y luego Google triplica hacia el 4K donde nosotros duplicamos, y por eso diez segundos de 4K son $3.04 llamando a Google y $1.80 llamándonos a nosotros.

Las cuatro capacidades facturan sobre esa misma escalera aquí: reference-to-video cuesta lo que cuesta start-end-frame-to-video, que es lo que cuestan image-to-video y el simple text-to-video. No es universal: en las páginas base de fal, los trabajos de reference e image cuestan más que los que solo llevan prompt.
El peldaño barato de Runware se apoya sobre uno caro
En 720p Runware iguala al grupo en $0.10. Sube un peldaño y cobra $0.16 en 1080p y $0.32 en 4K, frente a los $0.1520 y $0.3041 del propio Google. Es más caro que la fuente que revende exactamente en las dos resoluciones donde un segundo cuesta más. Solo un cinco por ciento por encima de Google; pero compara proveedores por la primera cifra que ves, elígelo para un trabajo en 4K y pagarás casi el doble de los $0.18 que cuesta ese peldaño aquí.
La lección vale más que la cifra: compara en el nivel al que realmente renderizas. Una tarifa de titular es casi siempre el peldaño útil más barato de un proveedor, y la proporción entre peldaños la fija el revendedor.
Lo que llamar a Google directamente no incluye
El instinto dice cortar la capa intermedia y comprar en la fuente. Aquí la fuente no es ni la opción más barata ni la menos restrictiva.
- Sin nivel gratuito para salida de vídeo. El texto y la imagen funcionan en el nivel gratuito de Gemini; el vídeo no. No hay nada contra lo que probar.
- Sin descuento por Batch. Otros modelos Gemini 3.x llevan alrededor de un cincuenta por ciento de descuento por envío en batch. El vídeo queda excluido, así que la palanca que parte por la mitad un trabajo grande desaparece.
- Tratamiento de datos. Incluso en el nivel de pago, los términos de Google marcan el contenido enviado a este modelo como utilizable para mejora de producto.
- Un precio que hay que cazar. La documentación muestra una celda de vídeo; la escalera es una imagen en un post de blog.
Nada de eso hace que llamar a Google esté mal. Hace que «compra directo, sáltate el margen» sea una heurística más débil de lo que suena: en este modelo apenas hay margen que saltarse, ya que el revendedor que refleja el precio de lista te lo pasa a coste.
El clip de abajo costó $0.72
Lo generamos con el propio Omni 1.1 Flash, ocho segundos en 720p, al precio del que discute este post. Ocho por nueve centavos.
Una aérea nocturna sobre Midtown Manhattan se adentra en Times Square hasta que un panel digital llena el encuadre: OMNI FLASH 1.1, luego AVAILABLE NOW ON E2X.AI, resolviendo en el logo de E2X sobre asfalto mojado.
El prompt, literal:
Cinematic 8-second commercial set in New York City at night. Opens on a wide aerial shot of Manhattan, then pushes rapidly into Times Square. Neon billboards, yellow taxis, pedestrians, wet asphalt reflecting colored light. The camera flies toward one massive digital billboard dominating the square. On the billboard, clearly readable text appears: "OMNI FLASH 1.1". Then: "THE LOWEST PRICE." The billboard transitions to: "AVAILABLE NOW ON E2X.AI". Final text: "START USING OMNI FLASH 1.1 TODAY". End with a clean bold E2X.AI logo filling the billboard. Fast energetic camera movement, realistic New York atmosphere, cinematic lighting, photorealistic detail, premium tech commercial look, high contrast, shallow depth of field, realistic reflections, subtle lens flares, smooth transitions. No narration, no one speaks. The message is carried entirely by the giant Times Square billboard. Sound design: city ambience, distant traffic, a rising synth swell, no voices, no speech.
(El prompt se deja en inglés: el modelo solo se ha evaluado en inglés.)
Ejecutado como text-to-video, ocho segundos, 720p, 16:9. Volvió en 94 segundos frente a la estimación de unos 240 de nuestro propio pipeline; esa estimación es nuestra, Google no publica cifras de latencia. Una muestra no es un benchmark, pero si venías presupuestando cuatro minutos por generación, presupuesta menos.
Ahora lee el prompt contra la imagen, porque esto acabó siendo una prueba accidental de la habilidad más floja del modelo. El prompt nombra el texto del panel cuatro veces, entre comillas, y el panel protagonista cumple: las dos líneas limpias, el logo bien puesto. Todos los demás paneles del encuadre, esos a los que el prompt aludía con «neon billboards», vuelven como galimatías convincente. Así que la regla no es «este modelo no sabe hacer texto» sino algo más estrecho: el texto que especificas tiende a renderizarse; el texto que el modelo se inventa para vestir el decorado, no. El renderizado de texto inestable se viene reportando en esta familia desde el lanzamiento —implicator.ai lo señaló, y no hemos podido encontrarlo formulado así en la ficha de modelo de Google—, así que toma el clip como prueba nuestra, no como una admisión del proveedor.
Antes de pagar nueve centavos, mira el de un centavo
Aquí es donde la auditoría argumenta contra su propio tema.
Veo 3.1 Fast cuesta $0.01 por segundo en la misma API, con la misma clave: un noveno de Omni 1.1 Flash. El clip de arriba habría costado ocho centavos en vez de setenta y dos y, para un plano suelto del que no depende nada, muy probablemente habría bastado. En la propia tabla de Google, Veo 3.1 Fast aparece a $0.10 por segundo, así que ahí estamos a una décima parte de la fuente en lugar de un once por ciento por debajo.
Así que la clasificación honesta no es «Omni es el más barato aquí». Es que la mayoría de quienes leen un post sobre la forma más barata de llamar a Omni deberían estar llamando a otra cosa. Tira de él cuando el trabajo necesite lo que solo él hace: una primera y una última imagen especificadas, un personaje que sobreviva de un plano a otro, extensión hasta cuarenta segundos. Un travelling no es uno de esos casos.
Una comparación sería deshonesta hecha al revés. Omni Flash, la preview de junio, factura $0.0825 por segundo en text-to-video y $0.075 en trabajos de reference aquí, así que la 1.1 es entre un nueve y un veinte por ciento más cara que el modelo al que sustituye, no más barata. Conviene ser preciso sobre de dónde sale eso: las tres parten de la misma tarifa de lista de $0.15 y solo se diferencian en el descuento que aplicamos, un 40 por ciento frente a un 45 y un 50. La subida es un descuento menor, no un producto más caro. Lo que compra es image-to-video y control de primera y última imagen, un peldaño de 360p que el enum antiguo no tiene, y un techo de diez segundos: un intercambio justo, pero una subida, y quien te diga que el modelo nuevo es más barato tiene la dirección invertida.
Cómo hacer tú mismo esta auditoría
Cinco hábitos que sobrevivirán a estas cifras concretas:
- Lee la cadena de versión, no el nombre del modelo. Dos páginas de un mismo dominio nos vendieron la misma familia a $0.10 y a $0.125 la misma tarde.
- Comprueba si la fuente es texto. La escalera en dólares de Google es una imagen y la real una nota al pie en tokens, así que los scrapers solo citan la cifra que está en la documentación como HTML.
- Tarifa el nivel al que renderizas, no el que el proveedor pone por delante. Runware va a la par en 720p y es la ficha más cara en 4K.
- Convierte tokens a segundos antes de comparar. $17.50 por millón no significa nada hasta que multiplicas por los tokens que quema tu nivel.
- Comprueba si siquiera existe un precio por segundo. Replicate lleva el modelo sin publicar ninguno.
Los precios y las condiciones comerciales pueden cambiar. Consulta la tarifa vigente de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a una petición de API estándar bajo demanda, porque la planificación, la disponibilidad y las condiciones de procesamiento difieren; por eso quedan excluidos aquí. Esta es una comparación acotada a los cinco proveedores que publican un precio invocable por segundo, no una afirmación de que E2X sea la opción más barata en todas las configuraciones. La forma más barata de hacer la mayoría de los clips no es este modelo en absoluto, como dice la sección de arriba.
Luego haz borradores en el peldaño más barato que puedas tolerar y renderiza el bueno en 720p. Los parámetros y las tarifas vigentes por capacidad están en la especificación legible por máquina; la gama está en nuestro catálogo. Cubrimos qué salió en la 1.1, qué midieron las clasificaciones, cómo hacerle prompting y por qué una escena de 40 segundos llega como cuatro facturas distintas por separado.
Preguntas frecuentes
¿Cuál es la forma más barata de llamar a Gemini Omni 1.1 Flash?
Entre los cinco proveedores que publicaban un precio invocable el 28 de agosto de 2026, E2X salió el más bajo en los cuatro peldaños: $0.0297 por un segundo en 360p, nueve centavos en 720p, $0.135 un nivel más arriba y $0.18 en 4K. El grupo de 720p va de $0.10 en la página v1.1 de fal.ai y en Runware, $0.1014 desde Google, hasta $0.13 en WaveSpeed y en los endpoints base de reference e image de fal. Nuestro margen es más fino en 360p, alrededor de un uno por ciento frente a fal, y más ancho en 4K.
¿Cuánto cuesta Gemini Omni 1.1 Flash si llamo a Google directamente?
Google factura en tokens, no en segundos: $17.50 por millón para salida de vídeo. Su nota al pie de Cloud pricing lista los tokens que quema cada resolución por segundo, y multiplicando sale algo más de tres centavos por un segundo en 360p, algo más de diez en 720p, quince y pico en 1080p y justo por encima de treinta en 4K. Una versión redondeada de la misma escalera aparece en el anuncio de lanzamiento, como imagen en lugar de texto. Sin nivel gratuito y sin descuento por Batch.
¿Por qué distintos proveedores cobran precios distintos por el mismo modelo?
Tarifan sobre bases distintas. Algunos reflejan la lista redondeada de Google, por eso la página v1.1 de fal.ai y Runware aterrizan ambos en $0.10. Otros tarifan en tokens con margen añadido: las páginas base de fal usan $21.875 por millón frente a los $17.50 de Google, un 25 % de recargo que llega a $0.125 y $0.13. WaveSpeed declara una tarifa plana de $0.13. Los pesos y la salida son idénticos en todos los casos.
¿Replicate publica un precio para Gemini Omni 1.1 Flash?
Replicate lista el modelo pero no publica ninguna tarifa por segundo para él, a 28 de agosto de 2026. Eso lo hace imposible de incluir en una comparación equivalente y difícil de presupuestar, ya que la facturación de vídeo escala con la duración y la resolución en lugar de con el número de peticiones.
¿Es Gemini Omni 1.1 Flash más barato que el modelo al que sustituye?
No. La preview anterior, Gemini Omni Flash, factura $0.0825 por segundo en text-to-video y $0.075 en reference-to-video en E2X, frente a $0.09 de Omni 1.1 Flash: entre un nueve y un veinte por ciento más. Las tres salen de la misma tarifa de lista de $0.15 y solo difieren en el descuento, así que la subida es un descuento menor y no un modelo más caro. Lo extra compra image-to-video, control de primera y última imagen, un peldaño de borrador en 360p y clips de diez segundos.
¿A qué resolución debería generar para mantener bajos los costes?
Haz borradores en 360p y renderiza solo el bueno en 720p. En E2X un segundo de 360p es exactamente un tercio de uno de 720p, así que cuatro segundos cuestan $0.1188 frente a $0.36: cinco borradores más un render completo suman $0.954, todavía por debajo de los $1.08 de tres intentos directos en 720p. El 4K rara vez se gana su sitio para entrega web: diez segundos son $1.80 aquí frente a $3.04 desde Google.
¿Hay algún modelo de vídeo más barato que Gemini Omni 1.1 Flash?
Sí, y para la mayoría del trabajo de clip suelto es la mejor opción. Veo 3.1 Fast va a un centavo por segundo en E2X —un noveno de Omni 1.1 Flash y una décima parte de los $0.10 que el propio Google lista para él— y cubre trabajos solo con prompt, imágenes fijas animadas, clips de referencia y trabajo de primera y última imagen. Omni se gana su prima solo en extensión de escena, generaciones de diez segundos, el nivel de 360p o consistencia por referencia entre planos.