Loading...
Loading...
Famille de génération vidéo de Google produisant des clips à partir de prompts textuels ou d'images de référence, optimisée pour la rapidité.
0/7 éléments
Connectez-vous pour exécuter des modèles
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Coût estimé par génération selon la durée et la résolution. Vous ne payez que ce que vous utilisez.
Omni Flash, c'est le gemini-omni-flash-preview de Google — un modèle vidéo de la famille Gemini, pas un Veo — et l'argumentaire de DeepMind tient en une phrase : « Voyez Gemini Omni comme Nano Banana, mais pour la vidéo. » Nous opérons sa capability reference-to-video sous google/omni-flash/reference-to-video, et nous facturons $0.10 pour chaque seconde de vidéo 720p finie. Le clip de 8 secondes par défaut coûte donc $0.80, audio compris.
Notez l'unité. Personne ne vend ici un clip au forfait : tout chiffre que vous comparez doit être multiplié par la durée que vous comptez rendre.
Vous avez un script mais aucune image à embarquer dans le plan ? Alors Veo 3.1 Fast text-to-video est l'endpoint qu'il vous faut — il part du seul prompt, et sur notre plateforme il coûte radicalement moins cher. Nous y revenons plus bas, honnêtement.
Notre position face aux autres endroits où appeler ce modèle, vérifiée le 26 août 2026 :
| Provider API | À la seconde (720p) | Clip de 8 secondes | vs. E2X |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | nous sommes 23 % moins cher |
| Atlas Cloud | $0.135 | $1.08 | nous sommes 26 % moins cher |
| Runware | $0.10 | $0.80 | à égalité |
| Google Gemini API | $0.10 | $0.80 | à égalité |
Les prix et les conditions produit peuvent changer. Vérifiez les tarifs en vigueur de chaque provider avant toute décision d'achat. La tarification Google Batch ou Flex n'est pas directement équivalente à une requête API on-demand standard, car les conditions de planification, de disponibilité et de traitement diffèrent ; elle est donc exclue de cette comparaison. Il s'agit d'une comparaison délimitée, et non d'une affirmation selon laquelle E2X serait l'option la moins chère au monde dans toutes les configurations.
Nous n'allons pas l'enjoliver : sur ce modèle nous nous alignons sur le tarif de Google plutôt que de passer en dessous, et l'économie n'est réelle que face à fal.ai et Atlas. Les images de référence se remarquent à peine — Google compte une image à 2 040 tokens, donc trois d'entre elles coûtent environ un cent. C'est duration qui fait bouger votre facture.
Le but de cet endpoint, c'est la continuité. Donnez un sujet au modèle — une personne, un produit, un décor, un look —, décrivez une scène dans laquelle il n'a jamais été photographié, et le sujet survit au voyage.
Vous pouvez attacher plusieurs références, pas une seule. Les exemples publiés par Google vont jusqu'à six ; aucun maximum officiel n'est documenté, et les chiffres tiers se contredisent : nous n'en imprimerons donc pas. Construisez pour une poignée, testez votre propre plafond.
L'audio est généré avec l'image, pas rajouté par-dessus. Il se synchronise sur l'action, et vous le pilotez depuis le même prompt — demandez de la pluie sur un toit de tôle et une ambiance de pièce sourde, et c'est ce qui revient. Il n'y a pas de piste audio séparée à monter ensuite.
Dix secondes, c'est le toit. Notre enum duration expose 4, 6, 8 et 10 ; le modèle de Google tourne de 3 à 10 secondes, et 10 est une limite dure. Pas d'endpoint d'extension, pas d'interpolation. Tout ce qui est plus long est un travail de montage dans votre propre éditeur — et la continuité entre les coupes devient votre problème.
720p, 24 fps, et c'est toute la liste. Notre champ resolution porte des valeurs 1080p et 4k et Google annonce des résolutions supérieures comme à venir, mais aujourd'hui le modèle renvoie du 720p. Laissez-le sur la valeur par défaut. Une page de provider qui annonce ici de la 1080p est en avance sur la documentation de Google elle-même.
Comptez environ 45 secondes de traitement pour un clip standard — un p50 mesuré par eachlabs, pas un chiffre officiel : planifiez avec, ne le promettez pas.
Deux champs sont obligatoires : image_urls et prompt. Générez une API key depuis votre dashboard, gardez-la sur un serveur que vous contrôlez, puis postez le job.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "La basket visible en image 1 repose sur un asphalte mouillé, un bus démarre derrière elle. Lent travelling avant. Circulation ambiante et pluie fine, pas de musique.",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
La réponse porte un job ID. La vidéo prend des minutes : faites du polling lentement — ou sautez le polling et passez un webhookUrl dans le body de soumission :
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"La femme de la référence traverse un marché de nuit, les enseignes néon se reflètent sur sa veste. Caméra portée. Murmure de foule et friture au loin.",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
Les statuts passent pending → processing → completed, ou atterrissent sur failed ou cancelled. Le schema et le prix en vigueur se trouvent dans la spécification lisible par machine si vous préférez les lire par programme.
La comparaison qui compte, et elle ne flatte pas cette page :
| Modèle | Notre prix (8 s, 720p, audio) | À choisir quand |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | Plusieurs références doivent rester cohérentes, ou il vous faut un clip de 10 secondes |
| Veo 3.1 Fast reference-to-video | $0.12 | Jusqu'à trois références, 8 secondes, et vous voulez la facture la plus basse |
| Veo 3.1 Fast image-to-video | $0.12 | Une image fixe que vous voulez animer |
| Veo 3.1 Fast text-to-video | $0.12 | Aucun matériau source |
Veo 3.1 Fast coûte une fraction d'Omni Flash sur notre plateforme, et il atteint la 1080p et la 4K, ce qu'Omni Flash ne peut pas faire aujourd'hui. Au tarif public de Google, les deux sont au même $0.10 la seconde en 720p — c'est notre remise qui ouvre l'écart. Partez donc de Veo Fast. Revenez ici quand c'est son plafond de trois références qui vous bloque, quand il vous faut ces deux secondes supplémentaires, ou quand vous voulez le comportement de montage vidéo derrière la formule « Nano Banana pour la vidéo ». D'autres options se trouvent dans la catégorie reference-to-video, et tout le catalogue de modèles tient sur une page.
Public Preview signifie que les aspérités sont documentées plutôt que cachées. Lisez ceci avant de construire :
Écrivez le plan, pas l'histoire. Un sujet, un mouvement de caméra, une condition de lumière — puis dites ce que ça donne à l'oreille, parce que l'audio sort du même prompt et que le silence est un choix qu'on fait à voix haute.
Étiquetez vos pièces jointes quand il y en a plus d'une : « image 1 est la bouteille, image 2 est le gros plan de l'étiquette ». Rien d'autre n'indique au modèle quelle référence est la vedette. Gardez un langage de caméra simple — « lent travelling avant », « caméra fixe », « caméra portée en suivi » battent un paragraphe de cinématographie.
Chaque clip porte un watermark SynthID — invisible pour les spectateurs, détectable par programme — et les content credentials C2PA sont attachés par défaut. Aucun provider opérant ce modèle ne peut les désactiver, nous compris. Si un contrat client interdit les assets IA étiquetés, réglez ce point avant d'intégrer.
Ré-hébergez vos sorties sur votre propre stockage à l'intérieur du handler de complétion. Les URL de résultat ne sont pas des adresses permanentes, et une vidéo que vous ne pouvez pas récupérer est une vidéo que vous payez deux fois.
C'est le gemini-omni-flash-preview de Google, un modèle de génération et d'édition vidéo de la famille Gemini plutôt que de la famille Veo. DeepMind le décrit comme « Nano Banana, mais pour la vidéo » — l'accent est mis sur le fait de porter des références de façon cohérente et de monter des rushes existants, là où Veo vise la génération cinématographique à partir de zéro. Il est en Public Preview.
$0.80. Nous facturons $0.10 par seconde de sortie 720p : c'est donc la durée qui pilote la facture — un clip de 4 secondes coûte $0.40, le maximum de 10 secondes $1.00. C'était notre tarif lors de la vérification du 26 août 2026.
Plus d'une, et les exemples documentés par Google vont jusqu'à six — mais aucun maximum officiel n'est publié. Les sources hors de Google citent des plafonds différents et se contredisent : nous ne répéterons donc pas un chiffre que nous ne pouvons pas vérifier. Testez vos propres payloads avant de concevoir autour d'un nombre précis.
Pas aujourd'hui. Il sort du 720p en 24 fps, et Google annonce des résolutions supérieures comme à venir. S'il vous faut de la 1080p ou de la 4K maintenant, Veo 3.1 Fast atteint les deux.
Veo 3.1 Fast, pour la plupart des travaux. Il coûte $0.12 pour un clip de 8 secondes avec audio sur notre plateforme, contre $0.80 ici, et il monte jusqu'en 4K. Choisissez Omni Flash quand il vous faut plus de trois images de référence, une durée de 10 secondes, ou son comportement de montage vidéo.
Oui, nativement et en synchronisation avec l'action à l'écran. Vous le dirigez depuis le même prompt — nommez l'ambiance, les effets, ou demandez de la musique. L'audio ne peut pas être retouché ensuite via l'API : un changement veut donc dire un nouveau rendu.
Oui. Chaque sortie porte un watermark SynthID que les spectateurs ne voient pas mais que les outils de détection lisent, plus des content credentials C2PA activés par défaut. Aucun provider n'expose de paramètre pour désactiver l'un ou l'autre.
Seulement hors de l'EEE, de la Suisse et du Royaume-Uni — Google restreint l'édition de vidéo uploadée dans ces régions. La génération reference-to-video elle-même n'est pas affectée. Notez aussi que les références vidéo sont acceptées par le schema mais ne sont pas traitées correctement : envoyez donc des images.