Retour aux modèles

Omni Flash

Famille de génération vidéo de Google produisant des clips à partir de prompts textuels ou d'images de référence, optimisée pour la rapidité.

Référence vers vidéoà partir de$0.075Texte en vidéoà partir de$0.075
Tarificationà partir de $0.075/requête
Latence~240 secondes en moyenne
Résolution4K/720P/1080P
Idéal pourvideo, google, high-fidelity

Paramètres

0/7 éléments

Coût estimé

Vous économisez 50 % sur ce modèle
Coût de base par second$0.15
Remise-50%
Votre total$0.075
Vous économisez $0.075 par requête

Connectez-vous pour exécuter des modèles

Output Preview

Ready

No output yet

Run the model to see generated results.

Exemple de résultat

Exemple d'API— Paramètres actuels

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/omni-flash/reference-to-video',
  'input': {}
}
)

Obtenir la tâche— Interroger le résultat

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Détail des tarifs

Coût estimé par génération selon la durée et la résolution. Vous ne payez que ce que vous utilisez.

Durée
4K
720P
1080P
4
$1.20
$0.60
$0.90
6
$1.80
$0.90
$1.35
8
$2.40
$1.20
$1.80
10
$3.00
$1.50
$2.25
Explorer les alternatives

Modèles similaires

Découvrez d'autres modèles d'IA pour Référence vers vidéo

Voir tous les modèles

API Gemini Omni Flash Reference-to-Video sur E2X

Omni Flash, c'est le gemini-omni-flash-preview de Google — un modèle vidéo de la famille Gemini, pas un Veo — et l'argumentaire de DeepMind tient en une phrase : « Voyez Gemini Omni comme Nano Banana, mais pour la vidéo. » Nous opérons sa capability reference-to-video sous google/omni-flash/reference-to-video, et nous facturons $0.10 pour chaque seconde de vidéo 720p finie. Le clip de 8 secondes par défaut coûte donc $0.80, audio compris.

Notez l'unité. Personne ne vend ici un clip au forfait : tout chiffre que vous comparez doit être multiplié par la durée que vous comptez rendre.

Vous avez un script mais aucune image à embarquer dans le plan ? Alors Veo 3.1 Fast text-to-video est l'endpoint qu'il vous faut — il part du seul prompt, et sur notre plateforme il coûte radicalement moins cher. Nous y revenons plus bas, honnêtement.

Notre position face aux autres endroits où appeler ce modèle, vérifiée le 26 août 2026 :

Provider APIÀ la seconde (720p)Clip de 8 secondesvs. E2X
E2X$0.10$0.80—
fal.ai$0.13$1.04nous sommes 23 % moins cher
Atlas Cloud$0.135$1.08nous sommes 26 % moins cher
Runware$0.10$0.80à égalité
Google Gemini API$0.10$0.80à égalité

Les prix et les conditions produit peuvent changer. Vérifiez les tarifs en vigueur de chaque provider avant toute décision d'achat. La tarification Google Batch ou Flex n'est pas directement équivalente à une requête API on-demand standard, car les conditions de planification, de disponibilité et de traitement diffèrent ; elle est donc exclue de cette comparaison. Il s'agit d'une comparaison délimitée, et non d'une affirmation selon laquelle E2X serait l'option la moins chère au monde dans toutes les configurations.

Nous n'allons pas l'enjoliver : sur ce modèle nous nous alignons sur le tarif de Google plutôt que de passer en dessous, et l'économie n'est réelle que face à fal.ai et Atlas. Les images de référence se remarquent à peine — Google compte une image à 2 040 tokens, donc trois d'entre elles coûtent environ un cent. C'est duration qui fait bouger votre facture.

Ce que les images de référence achètent vraiment

Le but de cet endpoint, c'est la continuité. Donnez un sujet au modèle — une personne, un produit, un décor, un look —, décrivez une scène dans laquelle il n'a jamais été photographié, et le sujet survit au voyage.

Vous pouvez attacher plusieurs références, pas une seule. Les exemples publiés par Google vont jusqu'à six ; aucun maximum officiel n'est documenté, et les chiffres tiers se contredisent : nous n'en imprimerons donc pas. Construisez pour une poignée, testez votre propre plafond.

L'audio est généré avec l'image, pas rajouté par-dessus. Il se synchronise sur l'action, et vous le pilotez depuis le même prompt — demandez de la pluie sur un toit de tôle et une ambiance de pièce sourde, et c'est ce qui revient. Il n'y a pas de piste audio séparée à monter ensuite.

Dix secondes, c'est le toit. Notre enum duration expose 4, 6, 8 et 10 ; le modèle de Google tourne de 3 à 10 secondes, et 10 est une limite dure. Pas d'endpoint d'extension, pas d'interpolation. Tout ce qui est plus long est un travail de montage dans votre propre éditeur — et la continuité entre les coupes devient votre problème.

720p, 24 fps, et c'est toute la liste. Notre champ resolution porte des valeurs 1080p et 4k et Google annonce des résolutions supérieures comme à venir, mais aujourd'hui le modèle renvoie du 720p. Laissez-le sur la valeur par défaut. Une page de provider qui annonce ici de la 1080p est en avance sur la documentation de Google elle-même.

Comptez environ 45 secondes de traitement pour un clip standard — un p50 mesuré par eachlabs, pas un chiffre officiel : planifiez avec, ne le promettez pas.

Requête API : références en entrée, clip en sortie

Deux champs sont obligatoires : image_urls et prompt. Générez une API key depuis votre dashboard, gardez-la sur un serveur que vous contrôlez, puis postez le job.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/omni-flash/reference-to-video",
    "input": {
      "prompt": "La basket visible en image 1 repose sur un asphalte mouillé, un bus démarre derrière elle. Lent travelling avant. Circulation ambiante et pluie fine, pas de musique.",
      "image_urls": [
        "https://example.com/sneaker-front.jpg",
        "https://example.com/sneaker-side.jpg"
      ],
      "duration": "8",
      "aspect_ratio": "16:9",
      "resolution": "720p"
    }
  }'

La réponse porte un job ID. La vidéo prend des minutes : faites du polling lentement — ou sautez le polling et passez un webhookUrl dans le body de soumission :

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/omni-flash/reference-to-video",
    input: {
      prompt:
        "La femme de la référence traverse un marché de nuit, les enseignes néon se reflètent sur sa veste. Caméra portée. Murmure de foule et friture au loin.",
      image_urls: ["https://example.com/talent.jpg"],
      duration: "10",
      aspect_ratio: "9:16",
    },
  }),
}).then((r) => r.json());

const poll = async (id, attempt = 0) => {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") return job.data.outputs[0].url;
  if (job.data.status === "failed") throw new Error(job.data.error?.message);
  if (attempt > 90) throw new Error("Timed out waiting for the render");

  await new Promise((r) => setTimeout(r, 5000));
  return poll(id, attempt + 1);
};

const videoUrl = await poll(data.jobId);

Les statuts passent pending → processing → completed, ou atterrissent sur failed ou cancelled. Le schema et le prix en vigueur se trouvent dans la spécification lisible par machine si vous préférez les lire par programme.

Choisir parmi nos modèles vidéo

La comparaison qui compte, et elle ne flatte pas cette page :

ModèleNotre prix (8 s, 720p, audio)À choisir quand
Omni Flash reference-to-video$0.80Plusieurs références doivent rester cohérentes, ou il vous faut un clip de 10 secondes
Veo 3.1 Fast reference-to-video$0.12Jusqu'à trois références, 8 secondes, et vous voulez la facture la plus basse
Veo 3.1 Fast image-to-video$0.12Une image fixe que vous voulez animer
Veo 3.1 Fast text-to-video$0.12Aucun matériau source

Veo 3.1 Fast coûte une fraction d'Omni Flash sur notre plateforme, et il atteint la 1080p et la 4K, ce qu'Omni Flash ne peut pas faire aujourd'hui. Au tarif public de Google, les deux sont au même $0.10 la seconde en 720p — c'est notre remise qui ouvre l'écart. Partez donc de Veo Fast. Revenez ici quand c'est son plafond de trois références qui vous bloque, quand il vous faut ces deux secondes supplémentaires, ou quand vous voulez le comportement de montage vidéo derrière la formule « Nano Banana pour la vidéo ». D'autres options se trouvent dans la catégorie reference-to-video, et tout le catalogue de modèles tient sur une page.

Les contraintes que Google publie

Public Preview signifie que les aspérités sont documentées plutôt que cachées. Lisez ceci avant de construire :

  • Les références vidéo jusqu'à trois secondes sont acceptées par le schema de l'API mais, selon les mots mêmes de Google, « ne sont pas traitées correctement par le modèle ». Considérez le référencement vidéo comme non fonctionnel et envoyez des images fixes — et notez que référencer ou raisonner à travers plusieurs vidéos n'est pas supporté du tout.
  • L'édition d'une vidéo uploadée est indisponible dans l'EEE, en Suisse et au Royaume-Uni. Si vos utilisateurs ou votre infrastructure y sont, cette moitié de l'attrait du modèle est hors de portée.
  • Seul l'anglais est pleinement supporté. Les autres langues de prompt n'ont pas été évaluées.
  • Un récit long et multi-scènes en une seule génération échoue. Ce modèle rend un plan continu ; demandez-en trois à la suite et vous obtenez une bouillie.

Prompter l'image et le son ensemble

Écrivez le plan, pas l'histoire. Un sujet, un mouvement de caméra, une condition de lumière — puis dites ce que ça donne à l'oreille, parce que l'audio sort du même prompt et que le silence est un choix qu'on fait à voix haute.

Étiquetez vos pièces jointes quand il y en a plus d'une : « image 1 est la bouteille, image 2 est le gros plan de l'étiquette ». Rien d'autre n'indique au modèle quelle référence est la vedette. Gardez un langage de caméra simple — « lent travelling avant », « caméra fixe », « caméra portée en suivi » battent un paragraphe de cinématographie.

Avant de mettre en production

Chaque clip porte un watermark SynthID — invisible pour les spectateurs, détectable par programme — et les content credentials C2PA sont attachés par défaut. Aucun provider opérant ce modèle ne peut les désactiver, nous compris. Si un contrat client interdit les assets IA étiquetés, réglez ce point avant d'intégrer.

Ré-hébergez vos sorties sur votre propre stockage à l'intérieur du handler de complétion. Les URL de résultat ne sont pas des adresses permanentes, et une vidéo que vous ne pouvez pas récupérer est une vidéo que vous payez deux fois.

Questions fréquentes

Qu'est-ce que Gemini Omni Flash ?

C'est le gemini-omni-flash-preview de Google, un modèle de génération et d'édition vidéo de la famille Gemini plutôt que de la famille Veo. DeepMind le décrit comme « Nano Banana, mais pour la vidéo » — l'accent est mis sur le fait de porter des références de façon cohérente et de monter des rushes existants, là où Veo vise la génération cinématographique à partir de zéro. Il est en Public Preview.

Combien coûte une vidéo Omni Flash de 8 secondes sur E2X ?

$0.80. Nous facturons $0.10 par seconde de sortie 720p : c'est donc la durée qui pilote la facture — un clip de 4 secondes coûte $0.40, le maximum de 10 secondes $1.00. C'était notre tarif lors de la vérification du 26 août 2026.

Combien d'images de référence Omni Flash accepte-t-il ?

Plus d'une, et les exemples documentés par Google vont jusqu'à six — mais aucun maximum officiel n'est publié. Les sources hors de Google citent des plafonds différents et se contredisent : nous ne répéterons donc pas un chiffre que nous ne pouvons pas vérifier. Testez vos propres payloads avant de concevoir autour d'un nombre précis.

Omni Flash peut-il produire de la vidéo en 1080p ou 4K ?

Pas aujourd'hui. Il sort du 720p en 24 fps, et Google annonce des résolutions supérieures comme à venir. S'il vous faut de la 1080p ou de la 4K maintenant, Veo 3.1 Fast atteint les deux.

Dois-je utiliser Omni Flash ou Veo 3.1 Fast ?

Veo 3.1 Fast, pour la plupart des travaux. Il coûte $0.12 pour un clip de 8 secondes avec audio sur notre plateforme, contre $0.80 ici, et il monte jusqu'en 4K. Choisissez Omni Flash quand il vous faut plus de trois images de référence, une durée de 10 secondes, ou son comportement de montage vidéo.

La vidéo générée a-t-elle du son ?

Oui, nativement et en synchronisation avec l'action à l'écran. Vous le dirigez depuis le même prompt — nommez l'ambiance, les effets, ou demandez de la musique. L'audio ne peut pas être retouché ensuite via l'API : un changement veut donc dire un nouveau rendu.

Les vidéos Omni Flash sont-elles watermarkées ?

Oui. Chaque sortie porte un watermark SynthID que les spectateurs ne voient pas mais que les outils de détection lisent, plus des content credentials C2PA activés par défaut. Aucun provider n'expose de paramètre pour désactiver l'un ou l'autre.

Puis-je éditer une vidéo uploadée avec ce modèle ?

Seulement hors de l'EEE, de la Suisse et du Royaume-Uni — Google restreint l'édition de vidéo uploadée dans ces régions. La génération reference-to-video elle-même n'est pas affectée. Notez aussi que les références vidéo sont acceptées par le schema mais ne sont pas traitées correctement : envoyez donc des images.