Volver a Modelos

Omni Flash

Familia de generación de vídeo de Google que crea clips a partir de prompts de texto o imágenes de referencia, optimizada para resultados rápidos.

Referencia a Videodesde$0.075Texto a Videodesde$0.075
Preciosdesde $0.075/solicitud
Latencia~240 segundos en promedio
Resolución4K/720P/1080P
Ideal paravideo, google, high-fidelity

Parámetros

0/7 elementos

Costo Estimado

Ahorras 50% en este modelo
Costo base por second$0.15
Descuento-50%
Tu Total$0.075
Ahorras $0.075 por solicitud

Inicia sesión para ejecutar modelos

Output Preview

Ready

No output yet

Run the model to see generated results.

Ejemplo de salida

Ejemplo de API— Parámetros Actuales

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/omni-flash/reference-to-video',
  'input': {}
}
)

Obtener trabajo— Consultar resultado

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Desglose de precios

Costo estimado por generación según duración y resolución. Solo pagas por lo que uses.

Duración
4K
720P
1080P
4
$1.20
$0.60
$0.90
6
$1.80
$0.90
$1.35
8
$2.40
$1.20
$1.80
10
$3.00
$1.50
$2.25
Explorar alternativas

Modelos relacionados

Descubre más modelos de IA para Referencia a Video

Ver todos los modelos

API de Gemini Omni Flash Reference-to-Video en E2X

Omni Flash es el gemini-omni-flash-preview de Google —un modelo de vídeo de la familia Gemini, no un Veo— y el propio argumento de DeepMind para venderlo cabe en una frase: "Piense en Gemini Omni como en Nano Banana, pero para vídeo". Operamos su capability de reference-to-video como google/omni-flash/reference-to-video y cobramos $0.10 por cada segundo de vídeo terminado en 720p. El clip por defecto, de 8 segundos, cuesta por tanto $0.80, audio incluido.

Fíjese en la unidad. Aquí nadie vende un clip por una tarifa plana, así que cualquier cifra que compare hay que multiplicarla por la duración que piense renderizar.

¿Tiene guion pero ninguna imagen que llevar al plano? Entonces el endpoint que quiere es Veo 3.1 Fast text-to-video: parte solo del prompt y, en nuestra plataforma, cuesta muchísimo menos. Volvemos sobre eso más abajo, con honestidad.

Nuestra posición frente a los demás sitios desde los que puede llamar a este modelo, comprobada el 26 de agosto de 2026:

Proveedor de APIPor segundo (720p)Clip de 8 segundosvs. E2X
E2X$0.10$0.80—
fal.ai$0.13$1.04somos un 23% más baratos
Atlas Cloud$0.135$1.08somos un 26% más baratos
Runware$0.10$0.80empatados
Google Gemini API$0.10$0.80empatados

Los precios y las condiciones de los productos pueden cambiar con el tiempo; consulte los precios vigentes de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a un request estándar de API bajo demanda, porque la programación, la disponibilidad y las condiciones de procesamiento son distintas; por eso quedan excluidos de esta comparación. Se trata de una comparación acotada, no de una afirmación de que E2X sea la opción más barata del mundo en cualquier configuración.

No lo vamos a maquillar: en este modelo igualamos la tarifa de Google en lugar de bajarla, y el ahorro solo es real frente a fal.ai y Atlas. Las imágenes de referencia apenas se notan en la factura: Google cuenta una imagen como 2.040 tokens, así que tres de ellas cuestan alrededor de un céntimo. duration es el campo que mueve su factura.

Qué compran realmente las imágenes de referencia

El sentido de este endpoint es la continuidad. Entregue al modelo un sujeto —una persona, un producto, un decorado, un look—, describa una escena en la que nunca fue fotografiado, y el sujeto sobrevive al viaje.

Puede adjuntar varias referencias, no una. Los ejemplos publicados por Google llegan hasta seis; no hay ningún máximo oficial documentado, y las cifras de terceros se contradicen entre sí, así que no vamos a imprimir una. Diseñe para un puñado y pruebe usted mismo dónde está su techo.

El audio se genera con la imagen, no se pega después. Se sincroniza con la acción y usted lo dirige desde el mismo prompt: pida lluvia sobre un tejado de chapa y un tono de sala grave, y eso es lo que vuelve. No hay una pista de audio separada que editar después.

Diez segundos es el techo. Nuestro enum de duration expone 4, 6, 8 y 10; el modelo de Google va de 3 a 10 segundos, y 10 es un límite duro. Sin endpoint de extensión, sin interpolación. Cualquier cosa más larga es un trabajo de montaje en su propio editor, y la continuidad entre cortes pasa a ser problema suyo.

720p, 24 fps, y ahí acaba la lista. Nuestro campo resolution incluye los valores 1080p y 4k, y Google anuncia resoluciones mayores como próximamente, pero hoy el modelo devuelve 720p. Déjelo en el valor por defecto. Una página de proveedor que anuncie 1080p aquí va por delante de la documentación del propio Google.

Espere unos 45 segundos de procesamiento para un clip estándar: un p50 medido por eachlabs, no una cifra oficial, así que planifique con ella en vez de prometerla.

Request de API: entran referencias, sale el clip

Dos campos son obligatorios: image_urls y prompt. Genere una key desde su dashboard, manténgala en un servidor que usted controle y envíe el job.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/omni-flash/reference-to-video",
    "input": {
      "prompt": "La zapatilla de la imagen 1 está sobre el asfalto mojado mientras un autobús arranca detrás de ella. Push-in lento. Tráfico ambiente y lluvia ligera, sin música.",
      "image_urls": [
        "https://example.com/sneaker-front.jpg",
        "https://example.com/sneaker-side.jpg"
      ],
      "duration": "8",
      "aspect_ratio": "16:9",
      "resolution": "720p"
    }
  }'

La response lleva un job ID. El vídeo tarda minutos, así que haga polling despacio, o sáltese el polling y pase un webhookUrl en el body del submit:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/omni-flash/reference-to-video",
    input: {
      prompt:
        "La mujer de la referencia camina por un mercado nocturno, con los carteles de neón reflejándose en su chaqueta. Cámara en mano. Murmullo de gente y frituras a lo lejos.",
      image_urls: ["https://example.com/talent.jpg"],
      duration: "10",
      aspect_ratio: "9:16",
    },
  }),
}).then((r) => r.json());

const poll = async (id, attempt = 0) => {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") return job.data.outputs[0].url;
  if (job.data.status === "failed") throw new Error(job.data.error?.message);
  if (attempt > 90) throw new Error("Timed out waiting for the render");

  await new Promise((r) => setTimeout(r, 5000));
  return poll(id, attempt + 1);
};

const videoUrl = await poll(data.jobId);

Los status se mueven pending → processing → completed, o acaban en failed o cancelled. El schema en vivo y el precio están en la especificación legible por máquina si prefiere leerlos de forma programática.

Cómo elegir entre nuestros modelos de vídeo

La comparación que importa, y no deja bien a esta página:

ModeloNuestro precio (8s, 720p, audio)Elíjalo cuando
Omni Flash reference-to-video$0.80Varias referencias deben mantenerse consistentes, o necesita un clip de 10 segundos
Veo 3.1 Fast reference-to-video$0.12Hasta tres referencias, 8 segundos, y quiere la factura más barata
Veo 3.1 Fast image-to-video$0.12Una imagen fija que quiere animar
Veo 3.1 Fast text-to-video$0.12No hay ningún material de partida

Veo 3.1 Fast cuesta una fracción de Omni Flash en nuestra plataforma, y llega a 1080p y 4K, algo que Omni Flash hoy no puede. Al precio de lista del propio Google, ambos están en los mismos $0.10 por segundo para 720p: es nuestro descuento lo que abre la brecha. Así que empiece por Veo Fast. Vuelva aquí cuando lo que le bloquee sea su tope de tres referencias, cuando necesite esos dos segundos extra, o cuando quiera el comportamiento de edición de vídeo que hay detrás del enfoque "Nano Banana para vídeo". Hay más opciones en la categoría reference-to-video, y el catálogo de modelos entero cabe en una página.

Las restricciones que Google publica

Public Preview significa que las asperezas están documentadas en vez de escondidas. Lea esto antes de construir:

  • Las referencias de vídeo de hasta tres segundos son aceptadas por el schema de la API pero, en palabras del propio Google, "no son procesadas correctamente por el modelo". Trate la referencia por vídeo como no funcional y envíe imágenes fijas; y tenga en cuenta que referenciar o razonar sobre varios vídeos no está soportado en absoluto.
  • Editar un vídeo subido no está disponible en el EEE, Suiza y el Reino Unido. Si sus usuarios o su infraestructura están ahí, esa mitad del atractivo del modelo queda descartada.
  • Solo el inglés está totalmente soportado. Otros idiomas de prompt no han sido evaluados.
  • Una narrativa larga y multiescena en una sola generación falla. Este modelo renderiza un plano continuo; pida tres en secuencia y obtendrá un desastre.

Cómo escribir el prompt de imagen y sonido a la vez

Escriba el plano, no la historia. Un sujeto, un movimiento de cámara, una condición de luz, y después diga a qué suena, porque el audio sale del mismo prompt y el silencio es una decisión que hay que tomar en voz alta.

Etiquete sus adjuntos cuando entre más de uno: "la imagen 1 es la botella, la imagen 2 es el primer plano de la etiqueta". Nada más le dice al modelo cuál es la referencia protagonista. Mantenga un lenguaje de cámara llano: "push-in lento", "cámara fija", "seguimiento en cámara en mano" ganan a un párrafo de cinematografía.

Antes de publicar

Cada clip lleva un watermark SynthID —invisible para quien lo ve, detectable de forma programática— y las credenciales de contenido C2PA se adjuntan por defecto. Ningún proveedor que opere este modelo puede desactivarlas, nosotros incluidos. Si el contrato de un cliente prohíbe assets de IA etiquetados, resuelva eso antes de integrar.

Vuelva a alojar sus salidas en su propio almacenamiento dentro del handler de finalización. Las URLs de resultado no son direcciones permanentes, y un vídeo que no puede recuperar es un vídeo que paga dos veces.

Preguntas frecuentes

¿Qué es Gemini Omni Flash?

Es el gemini-omni-flash-preview de Google, un modelo de generación y edición de vídeo de la familia Gemini y no de la familia Veo. DeepMind lo describe como "Nano Banana, pero para vídeo": el énfasis cae en arrastrar referencias de forma consistente y en editar metraje existente, mientras que Veo apunta a la generación cinematográfica desde cero. Está en Public Preview.

¿Cuánto cuesta un vídeo de 8 segundos de Omni Flash en E2X?

$0.80. Cobramos $0.10 por segundo de salida en 720p, así que la duración manda en la factura: un clip de 4 segundos son $0.40 y el máximo de 10 segundos, $1.00. Esa era nuestra tarifa en la comprobación del 26 de agosto de 2026.

¿Cuántas imágenes de referencia acepta Omni Flash?

Más de una, y los ejemplos documentados por Google llegan hasta seis, pero no hay ningún máximo oficial publicado. Las fuentes ajenas a Google citan techos distintos y se contradicen entre sí, así que no vamos a repetir un número que no podemos verificar. Pruebe sus propios payloads antes de diseñar en torno a una cifra concreta.

¿Puede Omni Flash producir vídeo en 1080p o 4K?

Hoy no. Entrega 720p a 24 fps, y Google anuncia resoluciones mayores como próximamente. Si necesita 1080p o 4K ahora, Veo 3.1 Fast llega a ambas.

¿Debería usar Omni Flash o Veo 3.1 Fast?

Veo 3.1 Fast, para la mayoría de los trabajos. Cuesta $0.12 por un clip de 8 segundos con audio en nuestra plataforma frente a los $0.80 de aquí, y llega a 4K. Elija Omni Flash cuando necesite más de tres imágenes de referencia, una duración de 10 segundos, o su comportamiento de edición de vídeo.

¿El vídeo generado tiene sonido?

Sí, de forma nativa y sincronizado con la acción en pantalla. Usted lo dirige desde el mismo prompt: nombre el ambiente, los efectos, o pida música. El audio no se puede editar después a través de la API, así que un cambio significa volver a renderizar.

¿Los vídeos de Omni Flash llevan watermark?

Sí. Cada salida lleva un watermark SynthID que quien la ve no puede percibir pero las herramientas de detección sí leen, además de credenciales de contenido C2PA activadas por defecto. Ningún proveedor expone un parámetro para desactivar ninguno de los dos.

¿Puedo editar un vídeo subido con este modelo?

Solo fuera del EEE, Suiza y el Reino Unido: Google restringe la edición de vídeo subido en esas regiones. La generación reference-to-video en sí no se ve afectada. Tenga en cuenta además que las referencias de vídeo son aceptadas por el schema pero no se procesan correctamente, así que envíe imágenes.