Loading...
Loading...
Familia de generación de vídeo de Google que crea clips a partir de prompts de texto o imágenes de referencia, optimizada para resultados rápidos.
0/7 elementos
Inicia sesión para ejecutar modelos
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Costo estimado por generación según duración y resolución. Solo pagas por lo que uses.
Omni Flash es el gemini-omni-flash-preview de Google —un modelo de vídeo de la familia Gemini, no un Veo— y el propio argumento de DeepMind para venderlo cabe en una frase: "Piense en Gemini Omni como en Nano Banana, pero para vídeo". Operamos su capability de reference-to-video como google/omni-flash/reference-to-video y cobramos $0.10 por cada segundo de vídeo terminado en 720p. El clip por defecto, de 8 segundos, cuesta por tanto $0.80, audio incluido.
Fíjese en la unidad. Aquí nadie vende un clip por una tarifa plana, así que cualquier cifra que compare hay que multiplicarla por la duración que piense renderizar.
¿Tiene guion pero ninguna imagen que llevar al plano? Entonces el endpoint que quiere es Veo 3.1 Fast text-to-video: parte solo del prompt y, en nuestra plataforma, cuesta muchísimo menos. Volvemos sobre eso más abajo, con honestidad.
Nuestra posición frente a los demás sitios desde los que puede llamar a este modelo, comprobada el 26 de agosto de 2026:
| Proveedor de API | Por segundo (720p) | Clip de 8 segundos | vs. E2X |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | somos un 23% más baratos |
| Atlas Cloud | $0.135 | $1.08 | somos un 26% más baratos |
| Runware | $0.10 | $0.80 | empatados |
| Google Gemini API | $0.10 | $0.80 | empatados |
Los precios y las condiciones de los productos pueden cambiar con el tiempo; consulte los precios vigentes de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a un request estándar de API bajo demanda, porque la programación, la disponibilidad y las condiciones de procesamiento son distintas; por eso quedan excluidos de esta comparación. Se trata de una comparación acotada, no de una afirmación de que E2X sea la opción más barata del mundo en cualquier configuración.
No lo vamos a maquillar: en este modelo igualamos la tarifa de Google en lugar de bajarla, y el ahorro solo es real frente a fal.ai y Atlas. Las imágenes de referencia apenas se notan en la factura: Google cuenta una imagen como 2.040 tokens, así que tres de ellas cuestan alrededor de un céntimo. duration es el campo que mueve su factura.
El sentido de este endpoint es la continuidad. Entregue al modelo un sujeto —una persona, un producto, un decorado, un look—, describa una escena en la que nunca fue fotografiado, y el sujeto sobrevive al viaje.
Puede adjuntar varias referencias, no una. Los ejemplos publicados por Google llegan hasta seis; no hay ningún máximo oficial documentado, y las cifras de terceros se contradicen entre sí, así que no vamos a imprimir una. Diseñe para un puñado y pruebe usted mismo dónde está su techo.
El audio se genera con la imagen, no se pega después. Se sincroniza con la acción y usted lo dirige desde el mismo prompt: pida lluvia sobre un tejado de chapa y un tono de sala grave, y eso es lo que vuelve. No hay una pista de audio separada que editar después.
Diez segundos es el techo. Nuestro enum de duration expone 4, 6, 8 y 10; el modelo de Google va de 3 a 10 segundos, y 10 es un límite duro. Sin endpoint de extensión, sin interpolación. Cualquier cosa más larga es un trabajo de montaje en su propio editor, y la continuidad entre cortes pasa a ser problema suyo.
720p, 24 fps, y ahí acaba la lista. Nuestro campo resolution incluye los valores 1080p y 4k, y Google anuncia resoluciones mayores como próximamente, pero hoy el modelo devuelve 720p. Déjelo en el valor por defecto. Una página de proveedor que anuncie 1080p aquí va por delante de la documentación del propio Google.
Espere unos 45 segundos de procesamiento para un clip estándar: un p50 medido por eachlabs, no una cifra oficial, así que planifique con ella en vez de prometerla.
Dos campos son obligatorios: image_urls y prompt. Genere una key desde su dashboard, manténgala en un servidor que usted controle y envíe el job.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "La zapatilla de la imagen 1 está sobre el asfalto mojado mientras un autobús arranca detrás de ella. Push-in lento. Tráfico ambiente y lluvia ligera, sin música.",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
La response lleva un job ID. El vídeo tarda minutos, así que haga polling despacio, o sáltese el polling y pase un webhookUrl en el body del submit:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"La mujer de la referencia camina por un mercado nocturno, con los carteles de neón reflejándose en su chaqueta. Cámara en mano. Murmullo de gente y frituras a lo lejos.",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
Los status se mueven pending → processing → completed, o acaban en failed o cancelled. El schema en vivo y el precio están en la especificación legible por máquina si prefiere leerlos de forma programática.
La comparación que importa, y no deja bien a esta página:
| Modelo | Nuestro precio (8s, 720p, audio) | Elíjalo cuando |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | Varias referencias deben mantenerse consistentes, o necesita un clip de 10 segundos |
| Veo 3.1 Fast reference-to-video | $0.12 | Hasta tres referencias, 8 segundos, y quiere la factura más barata |
| Veo 3.1 Fast image-to-video | $0.12 | Una imagen fija que quiere animar |
| Veo 3.1 Fast text-to-video | $0.12 | No hay ningún material de partida |
Veo 3.1 Fast cuesta una fracción de Omni Flash en nuestra plataforma, y llega a 1080p y 4K, algo que Omni Flash hoy no puede. Al precio de lista del propio Google, ambos están en los mismos $0.10 por segundo para 720p: es nuestro descuento lo que abre la brecha. Así que empiece por Veo Fast. Vuelva aquí cuando lo que le bloquee sea su tope de tres referencias, cuando necesite esos dos segundos extra, o cuando quiera el comportamiento de edición de vídeo que hay detrás del enfoque "Nano Banana para vídeo". Hay más opciones en la categoría reference-to-video, y el catálogo de modelos entero cabe en una página.
Public Preview significa que las asperezas están documentadas en vez de escondidas. Lea esto antes de construir:
Escriba el plano, no la historia. Un sujeto, un movimiento de cámara, una condición de luz, y después diga a qué suena, porque el audio sale del mismo prompt y el silencio es una decisión que hay que tomar en voz alta.
Etiquete sus adjuntos cuando entre más de uno: "la imagen 1 es la botella, la imagen 2 es el primer plano de la etiqueta". Nada más le dice al modelo cuál es la referencia protagonista. Mantenga un lenguaje de cámara llano: "push-in lento", "cámara fija", "seguimiento en cámara en mano" ganan a un párrafo de cinematografía.
Cada clip lleva un watermark SynthID —invisible para quien lo ve, detectable de forma programática— y las credenciales de contenido C2PA se adjuntan por defecto. Ningún proveedor que opere este modelo puede desactivarlas, nosotros incluidos. Si el contrato de un cliente prohíbe assets de IA etiquetados, resuelva eso antes de integrar.
Vuelva a alojar sus salidas en su propio almacenamiento dentro del handler de finalización. Las URLs de resultado no son direcciones permanentes, y un vídeo que no puede recuperar es un vídeo que paga dos veces.
Es el gemini-omni-flash-preview de Google, un modelo de generación y edición de vídeo de la familia Gemini y no de la familia Veo. DeepMind lo describe como "Nano Banana, pero para vídeo": el énfasis cae en arrastrar referencias de forma consistente y en editar metraje existente, mientras que Veo apunta a la generación cinematográfica desde cero. Está en Public Preview.
$0.80. Cobramos $0.10 por segundo de salida en 720p, así que la duración manda en la factura: un clip de 4 segundos son $0.40 y el máximo de 10 segundos, $1.00. Esa era nuestra tarifa en la comprobación del 26 de agosto de 2026.
Más de una, y los ejemplos documentados por Google llegan hasta seis, pero no hay ningún máximo oficial publicado. Las fuentes ajenas a Google citan techos distintos y se contradicen entre sí, así que no vamos a repetir un número que no podemos verificar. Pruebe sus propios payloads antes de diseñar en torno a una cifra concreta.
Hoy no. Entrega 720p a 24 fps, y Google anuncia resoluciones mayores como próximamente. Si necesita 1080p o 4K ahora, Veo 3.1 Fast llega a ambas.
Veo 3.1 Fast, para la mayoría de los trabajos. Cuesta $0.12 por un clip de 8 segundos con audio en nuestra plataforma frente a los $0.80 de aquí, y llega a 4K. Elija Omni Flash cuando necesite más de tres imágenes de referencia, una duración de 10 segundos, o su comportamiento de edición de vídeo.
Sí, de forma nativa y sincronizado con la acción en pantalla. Usted lo dirige desde el mismo prompt: nombre el ambiente, los efectos, o pida música. El audio no se puede editar después a través de la API, así que un cambio significa volver a renderizar.
Sí. Cada salida lleva un watermark SynthID que quien la ve no puede percibir pero las herramientas de detección sí leen, además de credenciales de contenido C2PA activadas por defecto. Ningún proveedor expone un parámetro para desactivar ninguno de los dos.
Solo fuera del EEE, Suiza y el Reino Unido: Google restringe la edición de vídeo subido en esas regiones. La generación reference-to-video en sí no se ve afectada. Tenga en cuenta además que las referencias de vídeo son aceptadas por el schema pero no se procesan correctamente, así que envíe imágenes.