Loading...
Loading...
Gemini Omni 1.1 Flash generates video from a text prompt, a single image, a start and end frame, or up to seven reference images. Clips run 4 to 10 seconds at resolutions from 360p to 4K.
Inicia sesión para ejecutar modelos
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Costo estimado por generación según duración y resolución. Solo pagas por lo que uses.
Omni 1.1 Flash pasó a disponibilidad general en Google el 27 de agosto de 2026: un modelo de la familia Gemini, no un Veo. Operamos su capability de solo prompt como google/omni-1.1-flash/text-to-video y la cobramos por segundo de salida: $0.09 en 720p, sobre una tarifa de lista de $0.15 y tras un descuento permanente del 40%. Los ocho segundos por defecto salen por $0.72. Un prompt es el payload entero.
Aquí hay una cifra que ha subido. El predecesor, Gemini Omni Flash text-to-video, cobra $0.0825 por segundo en esta plataforma; esta página cobra $0.09. Un nueve por ciento más, y es mejor leerlo aquí que deducirlo de una factura. Ese nueve por ciento no compra un segundo de vídeo mejor. Compra un nivel de borrador a $0.0297 para el que el modelo antiguo ni siquiera tiene enum de resolución, clips que llegan a diez segundos y dos capabilities que el predecesor nunca publicó en E2X. Nuestras notas sobre la versión 1.1 repasan el resto.
Y ahora la frase que juega en contra de nuestra propia factura. Veo 3.1 Fast text-to-video corre en esta misma plataforma a $0.01 por segundo: la novena parte de lo que cuesta esta página. ¿Un clip suelto, salido de una frase, sin nada que dependa de él después? Váyase allí. Lo que compra el sobreprecio de aquí son diez segundos, 4K, un modo borrador barato y planos que se pertenecen entre sí. Si no compra ninguna de esas cosas, no ha comprado nada.
Otro material, otro endpoint: una imagen fija que se convierte en el primer fotograma va a image-to-video, dos extremos con un hueco en medio a start-end-frame-to-video, una cara que se repite a reference-to-video.
Todas las cifras de abajo se leyeron el 28 de agosto de 2026 en la página de la versión 1.1 de cada proveedor:
| Dónde lo llama | 720p, por segundo | Ocho segundos | Frente a nuestra tarifa |
|---|---|---|---|
| E2X | $0.09 | $0.72 | — |
| fal.ai | $0.10 | $0.80 | somos un 10% más baratos |
| Runware | $0.10 | $0.80 | somos un 10% más baratos |
| Google Gemini API | $0.1014 | $0.81 | somos un 11% más baratos |
| Wavespeed AI | $0.13 | $1.04 | somos un 31% más baratos |
La fila de Google es aritmética suya, publicada en su propia página de precios: $17.50 por millón de tokens de salida, 5.792 tokens en un segundo de 720p, $0.1014, que es la razón por la que su nota al pie se queda en "aproximadamente $0.10 por segundo." Todas las filas incluyen sonido, así que la comparación es equivalente. Este modelo no tiene ningún interruptor de audio: el diálogo y el tono de sala se generan junto con la imagen, y nadie de esa lista los cobra aparte. Google publica la misma tarifa en cada resolución, como recuento de tokens: 1.931 tokens por segundo en 360p, 5.792 en 720p, 8.688 en 1080p, 17.376 en 4K, con sonido incluido en las cuatro. La escala de abajo compara, pues, lo comparable hasta arriba.
Compruébenos, pero lea antes la cadena de versión. fal.ai mantiene dos fichas: una página sin versión, google/gemini-omni-flash, que tarifa los pesos preview antiguos cerca de $0.125 por segundo, y una página v1.1 a $0.10. La nuestra es la v1.1. Wavespeed merece la precaución contraria: $0.13 está confirmado solo para su variante de text-to-video, así que sus demás cifras se quedan fuera.
La tarifa de 720p no es la mitad interesante. Esta sí:
| Resolución | E2X | fal.ai | Runware | Wavespeed | |
|---|---|---|---|---|---|
| 360p | $0.0297 | $0.0338 | $0.03 | $0.036 | $0.039 |
| 720p | $0.09 | $0.1014 | $0.10 | $0.10 | $0.13 |
| 1080p | $0.135 | $0.1520 | $0.15 | $0.16 | $0.195 |
| 4K | $0.18 | $0.3041 | $0.30 | $0.32 | $0.39 |
Nuestro multiplicador de 720p a 4K es 2×. El de Google es exactamente 3×: sus propios recuentos de tokens pasan de 5.792 a 17.376, y los revendedores siguen a Google. Abajo las dos escalas tienen la misma forma —0,33× hasta 360p en ambos lados— y se separan a medida que usted sube: al llegar a 4K, Google ha triplicado su tarifa de 720p y nosotros hemos duplicado la nuestra. Por eso quedamos por debajo de Google en los cuatro niveles: un doce por ciento en 360p, un once por ciento en 720p y en 1080p, y un cuarenta y uno por ciento en 4K. Runware también merece un vistazo: a la par con Google en 720p, luego $0.16 en 1080p y $0.32 en 4K, por encima de la propia tarifa de Google en ambos casos. Una nota por si nos comprueba: la tabla de anuncio de Google redondea estas cifras a $0.03, $0.10, $0.15 y $0.30. Las de arriba salen de sus propios recuentos de tokens por resolución, que es sobre lo que se calcula la factura.
Los precios y las condiciones de los productos pueden cambiar con el tiempo; consulte los precios vigentes de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a un request estándar de API bajo demanda, porque la programación, la disponibilidad y las condiciones de procesamiento son distintas; por eso quedan excluidos de esta comparación. Se trata de una comparación acotada, no de una afirmación de que E2X sea la opción más barata del mundo en cualquier configuración.
Lo que vacía la cuenta es la repetición, no ninguna generación concreta: el séptimo intento cuesta lo mismo que costó el primero.
Cuatro segundos en 360p son $0.1188; esos mismos cuatro en 720p, $0.36. Seis borradores baratos más un render en la duración por defecto suman $1.07, frente a los $2.52 de siete pasadas a precio completo. Google afirma además que 360p vuelve hasta un 60% más rápido: cifra suya, no nuestra.
| Duración | Borrador en 360p | Definitivo en 720p |
|---|---|---|
| 4 s | $0.1188 | $0.36 |
| 6 s | $0.1782 | $0.54 |
| 8 s (por defecto) | $0.2376 | $0.72 |
| 10 s | $0.297 | $0.90 |
Diez segundos de 4K, a $0.18 por segundo, son $1.80: la factura individual más alta de esta página.
Genere una key en el dashboard, manténgala fuera del cliente y envíe el job. prompt es el único campo obligatorio.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/text-to-video",
"input": {
"prompt": "Una soldadora se baja la careta y las chispas lanzan luz azul sobre el acero apilado. Dolly lento a la izquierda. Chisporroteo del arco, un ventilador fuera de plano.",
"resolution": "360p",
"duration": "6",
"seed": 20260828
}
}'
Eso es una pasada de borrador: seis segundos en 360p, $0.1782. Cambie resolution a 720p y cuesta $0.54.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/text-to-video",
input: { prompt: "La lluvia golpea una marquesina de autobús de noche.", duration: "4" },
}),
}).then((r) => r.json());
for (let attempt = 0; attempt < 360; attempt++) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
const { status } = job.data;
if (status === "completed") { await archive(job.data.outputs[0].url); break; }
if (status === "failed" || status === "cancelled") throw new Error(status);
await new Promise((r) => setTimeout(r, 5000));
}
Cuente con cuatro minutos por job, o pase un webhookUrl. Dos trampas: duration y resolution viajan como strings, "10" y no 10; y la URL devuelta caduca, así que copie el archivo a un sitio permanente en el mismo momento en que lo lea. Todos los campos están en la especificación legible por máquina.
Del más barato al más caro:
| Modelo | Llámelo cuando | 8 s en 720p |
|---|---|---|
| Veo 3.1 Fast text-to-video | Un clip suelto, que no se monta con nada | $0.08 |
| Omni 1.1 Flash text-to-video | Diez segundos, 4K, o un bucle de borradores en 360p | $0.72 |
| Omni 1.1 Flash start-end-frame | Los dos extremos ya existen | $0.72 |
| Omni 1.1 Flash reference-to-video | Un sujeto se repite de un clip a otro | $0.72 |
| Omni Flash text-to-video | Nunca; Google lo retira el 30 de septiembre de 2026 | $0.66 |
Lea la primera fila contra la segunda. Nueve veces el precio es mucho por un clip que nadie va a montar contra nada; lo que compra el sobreprecio es la continuidad. Todo lo demás que convierte un prompt en metraje está en text-to-video; todos los modelos que operamos caben en una sola página.
La salida es fija: 24 fps, de tres a diez segundos, 16:9 o 9:16. Ese diez importa, porque Veo se queda en ocho. La model card nombra tres modos de fallo:
"Mantener una consistencia completa a lo largo de las ediciones, generar escenas con movimiento complejo o renderizar texto perfectamente exacto sigue siendo un desafío."
El texto en pantalla es lo que pilla a la gente: pida el rótulo de una tienda y espere unas letras que se deshacen en cuanto se miran de cerca. Multitudes, agua y manos son los casos de movimiento.
SynthID marca cada fotograma de forma invisible y nadie puede quitarlo. El inglés es el único idioma de prompt que Google ha evaluado, y Google integró Vertex AI en la Gemini Enterprise Agent Platform el 22 de abril de 2026: ahí es donde este modelo aparece para compradores de empresa.
El modelo tiene sus palabras y un seed; todo lo que usted deje sin decir pasa a ser decisión suya. Describa un plano, nunca una secuencia: tres tiempos en ocho segundos le dan un corte malo o un borrón.
Fije la cámara. "Plano general fijo", "dolly lento a la izquierda", "seguimiento en cámara en mano". Una cámara sin especificar se va a la deriva.
Fije la luz. Farola de sodio, tarde nublada, una sola luz práctica. La iluminación es lo que separa un encuadre deliberado de un render.
Fije el sonido. El audio lo paga usted lo hubiera previsto o no, así que nombre el ambiente y cualquier línea de diálogo; si no, el modelo se inventa una base que pelea con su montaje.
Después mantenga el seed y cambie una cláusula cada vez. Nuestra guía de prompting de Gemini Omni llega más lejos.
$0.09 por segundo de salida en 720p: $0.72 por los ocho segundos por defecto y $0.90 en el techo de diez segundos. Un descuento del 40% sobre una tarifa de lista de $0.15, comprobado el 28 de agosto de 2026. Los otros niveles: $0.0297 en 360p, $0.135 en 1080p, $0.18 en 4K, audio incluido.
En los cuatro niveles. Google cobra el vídeo en tokens de salida —$17.50 por millón, a 1.931 tokens por segundo en 360p, 5.792 en 720p, 8.688 en 1080p y 17.376 en 4K—, lo que sale a $0.0338, $0.1014, $0.1520 y $0.3041 por segundo, con sonido incluido. Su tabla de anuncio los redondea a $0.03, $0.10, $0.15 y $0.30; la factura se calcula sobre las cifras sin redondear. Frente a eso somos alrededor de un doce por ciento más baratos en 360p, un once por ciento en 720p y 1080p, y un cuarenta y uno por ciento más baratos en 4K. Las dos escalas bajan a 360p con el mismo paso de 0,33×; la diferencia está arriba, donde Google triplica su tarifa de 720p y nosotros duplicamos la nuestra.
No: cuesta más. Omni Flash text-to-video funciona aquí a $0.0825 por segundo frente a los $0.09 de esta página, así que ocho segundos salen por $0.66 allí y $0.72 aquí. Un nueve por ciento de diferencia. El modelo antiguo no tiene nivel de 360p y nunca publicó ni image-to-video ni start-end-frame-to-video en E2X; ahí se va la diferencia. Llamar a Google directamente es otra cuestión: su tarifa publicada sale a $0.1014 por segundo en 720p, así que tanto esta página como la anterior quedan por debajo. La diferencia no es que el producto salga más caro: los tres parten de la misma tarifa de lista de $0.15, y lo que cambia es el descuento permanente: un 40% aquí frente a un 45% y un 50% en las páginas antiguas.
Veo 3.1 Fast, casi siempre: $0.01 por segundo en la misma API, así que ocho segundos cuestan $0.08 en lugar de $0.72. Vuelva aquí cuando el clip tenga que llegar a diez segundos, necesite 4K o tenga que casar con otro metraje.
Para iterar. Cuatro segundos en 360p son $0.1188 frente a $0.36 en 720p, así que las tomas que tira cuestan una fracción de la que se queda.
De tres a diez segundos, a 24 fps. El enum de duration expone 4, 6, 8 y 10, como strings. Las piezas más largas salen de varias llamadas: exactamente lo que las funciones de continuidad de la 1.1 existen para hacer llevadero.
Sí, en todas las filas de todas las comparaciones de esta página. No hay ningún interruptor de audio: el diálogo y el ambiente se generan junto con la imagen, y ningún proveedor de esa lista los cobra por separado.
Normalmente porque es otro modelo. La ficha sin versión de fal.ai, google/gemini-omni-flash, tarifa los pesos preview ya obsoletos cerca de $0.125 por segundo; su página v1.1 marca $0.10, y nuestra tabla usa la v1.1. Compruebe primero la versión y la fecha.