Loading...
Loading...
Gemini Omni 1.1 Flash generates video from a text prompt, a single image, a start and end frame, or up to seven reference images. Clips run 4 to 10 seconds at resolutions from 360p to 4K.
Connectez-vous pour exécuter des modèles
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Coût estimé par génération selon la durée et la résolution. Vous ne payez que ce que vous utilisez.
Omni 1.1 Flash est passé en disponibilité générale chez Google le 27 août 2026 — un modèle de la famille Gemini, pas un Veo. Nous opérons sa capability sur prompt seul sous google/omni-1.1-flash/text-to-video, facturée à la seconde de sortie : $0.09 en 720p, sur un tarif catalogue de $0.15 après une remise permanente de 40 %. Les huit secondes par défaut reviennent à $0.72. Un prompt tient lieu de payload complet.
Un chiffre a monté ici. Le prédécesseur, Gemini Omni Flash text-to-video, facture $0.0825 la seconde sur cette plateforme ; cette page facture $0.09. Neuf pour cent de plus, et mieux vaut le lire ici que le déduire d'une facture. Ces neuf pour cent n'achètent pas une meilleure seconde de vidéo. Ils achètent un palier de brouillon à $0.0297 dont l'ancien modèle n'a même pas l'enum de résolution, des clips qui vont jusqu'à dix secondes, et deux capabilities que le prédécesseur n'a jamais livrées sur E2X. Nos notes sur la sortie de la 1.1 détaillent le reste.
Maintenant la phrase qui plaide contre notre propre facture. Veo 3.1 Fast text-to-video tourne sur cette plateforme à $0.01 la seconde — un neuvième du prix de cette page. Un seul clip, tiré d'une phrase, sans rien en aval qui en dépende ? Allez-y. Le surcoût ici achète dix secondes, la 4K, un mode brouillon bon marché et des plans qui s'appartiennent les uns aux autres. N'achetez aucun des quatre et vous n'avez rien acheté.
Autre matériau, autre endpoint : une image fixe qui devient l'image un part vers image-to-video, deux extrémités séparées par un trou vers start-end-frame-to-video, un visage qui revient de plan en plan vers reference-to-video.
Chaque chiffre ci-dessous a été relevé le 28 août 2026 sur la page version 1.1 du provider lui-même :
| Où vous l'appelez | 720p, à la seconde | Huit secondes | Face à notre tarif |
|---|---|---|---|
| E2X | $0.09 | $0.72 | — |
| fal.ai | $0.10 | $0.80 | nous sommes 10 % moins cher |
| Runware | $0.10 | $0.80 | nous sommes 10 % moins cher |
| Google Gemini API | $0.1014 | $0.81 | nous sommes 11 % moins cher |
| Wavespeed AI | $0.13 | $1.04 | nous sommes 31 % moins cher |
La ligne de Google, c'est sa propre arithmétique, publiée sur sa propre page tarifaire : $17.50 par million de tokens de sortie, 5 792 tokens dans une seconde de 720p, $0.1014 — d'où la note de bas de page qui s'y range à « environ $0.10 la seconde ». Chaque ligne comprend le son, la comparaison est donc à périmètre égal. Ce modèle n'a aucun interrupteur audio : dialogues et ambiance de pièce sont générés avec l'image, et personne dans cette liste ne les facture à part. Google publie le même tarif à chaque résolution, sous forme de compte de tokens : 1 931 tokens par seconde en 360p, 5 792 en 720p, 8 688 en 1080p, 17 376 en 4K — son compris dans les quatre. Le barème ci-dessous compare donc le comparable jusqu'en haut.
Vérifiez-nous, mais lisez la chaîne de version. fal.ai maintient deux fiches : une page google/gemini-omni-flash sans version qui facture les anciens poids preview autour de $0.125 la seconde, et une page v1.1 à $0.10. La nôtre est la v1.1. Wavespeed appelle la prudence inverse — les $0.13 ne sont confirmés que pour sa variante text-to-video, donc ses autres chiffres restent dehors.
Le tarif 720p n'est pas la moitié intéressante. Celle-ci l'est :
| Résolution | E2X | fal.ai | Runware | Wavespeed | |
|---|---|---|---|---|---|
| 360p | $0.0297 | $0.0338 | $0.03 | $0.036 | $0.039 |
| 720p | $0.09 | $0.1014 | $0.10 | $0.10 | $0.13 |
| 1080p | $0.135 | $0.1520 | $0.15 | $0.16 | $0.195 |
| 4K | $0.18 | $0.3041 | $0.30 | $0.32 | $0.39 |
Notre multiplicateur du 720p à la 4K est de 2×. Celui de Google est exactement 3× — ses propres comptes de tokens passent de 5 792 à 17 376 — et les revendeurs suivent Google. En bas, les deux barèmes ont la même forme — 0,33× jusqu'au 360p des deux côtés — et ils divergent à mesure que vous montez : arrivé en 4K, Google a triplé son tarif 720p quand nous avons doublé le nôtre. C'est pourquoi nous passons sous Google sur les quatre paliers : douze pour cent en 360p, onze pour cent en 720p comme en 1080p, et quarante et un pour cent en 4K. Runware mérite aussi un coup d'œil : à égalité avec Google en 720p, puis $0.16 en 1080p et $0.32 en 4K — au-dessus du tarif de Google dans les deux cas. Une note si vous vérifiez : le tableau d'annonce de Google arrondit ces montants à $0.03, $0.10, $0.15 et $0.30. Les chiffres ci-dessus viennent de ses propres comptes de tokens par résolution, et c'est sur eux que la facture est calculée.
Les prix et les conditions produit peuvent changer. Vérifiez les tarifs en vigueur de chaque provider avant toute décision d'achat. La tarification Google Batch ou Flex n'est pas directement équivalente à une requête API on-demand standard, car les conditions de planification, de disponibilité et de traitement diffèrent ; elle est donc exclue de cette comparaison. Il s'agit d'une comparaison délimitée, et non d'une affirmation selon laquelle E2X serait l'option la moins chère au monde dans toutes les configurations.
C'est la répétition qui vide le compte, pas une génération en particulier : la septième tentative coûte ce que coûtait la première.
Quatre secondes en 360p, c'est $0.1188 ; les mêmes quatre en 720p, $0.36. Six brouillons bon marché plus un rendu à la durée par défaut font $1.07, contre $2.52 pour sept passes au prix fort. Google annonce en prime que le 360p revient jusqu'à 60 % plus vite.
| Durée | Brouillon 360p | Rendu 720p |
|---|---|---|
| 4 s | $0.1188 | $0.36 |
| 6 s | $0.1782 | $0.54 |
| 8 s (par défaut) | $0.2376 | $0.72 |
| 10 s | $0.297 | $0.90 |
Dix secondes de 4K, à $0.18 la seconde, font $1.80 — la plus grosse facture unitaire de cette page.
Générez une clé depuis le dashboard, gardez-la hors du client, puis postez le job. prompt est le seul champ obligatoire.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/text-to-video",
"input": {
"prompt": "Une soudeuse rabat son masque, les étincelles projettent une lumière bleue sur des tôles empilées. Lent travelling latéral vers la gauche. Crépitement de la soudure, un ventilateur hors champ.",
"resolution": "360p",
"duration": "6",
"seed": 20260828
}
}'
C'est une passe de brouillon : six secondes en 360p, $0.1782. Passez resolution à 720p et elle coûte $0.54.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/text-to-video",
input: { prompt: "La pluie martèle un abribus dans la nuit.", duration: "4" },
}),
}).then((r) => r.json());
for (let attempt = 0; attempt < 360; attempt++) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
const { status } = job.data;
if (status === "completed") { await archive(job.data.outputs[0].url); break; }
if (status === "failed" || status === "cancelled") throw new Error(status);
await new Promise((r) => setTimeout(r, 5000));
}
Comptez quatre minutes par job, ou passez plutôt un webhookUrl. Deux pièges : duration et resolution voyagent en chaînes, "10" et non 10 ; et l'URL renvoyée expire, donc copiez le fichier quelque part de permanent au moment même où vous la lisez. Tous les champs figurent dans la spécification lisible par machine.
Du moins cher au plus cher :
| Modèle | À appeler quand | 8 s en 720p |
|---|---|---|
| Veo 3.1 Fast text-to-video | Un clip isolé, qui ne tient qu'à lui-même | $0.08 |
| Omni 1.1 Flash text-to-video | Dix secondes, la 4K, ou une boucle de brouillons en 360p | $0.72 |
| Omni 1.1 Flash start-end-frame | Les deux extrémités existent déjà | $0.72 |
| Omni 1.1 Flash reference-to-video | Un sujet revient d'un clip à l'autre | $0.72 |
| Omni Flash text-to-video | Jamais ; Google le retire le 30 septembre 2026 | $0.66 |
Lisez la première ligne contre la deuxième. Neuf fois le prix, c'est cher payé pour un clip que personne ne montera avec quoi que ce soit ; c'est la continuité qu'achète le surcoût. Tout le reste de ce qui transforme un prompt en images est listé sous text-to-video, et tous les modèles que nous opérons tiennent sur une seule page.
La sortie est figée : 24 fps, de trois à dix secondes, 16:9 ou 9:16. Ce dix compte, parce que Veo s'arrête à huit. La model card nomme trois modes d'échec :
« Maintenir une cohérence totale d'un bout à l'autre des retouches, générer des scènes au mouvement complexe ou rendre du texte parfaitement exact reste un défi. »
Le texte à l'écran piège beaucoup de monde : demandez l'enseigne d'une boutique et attendez-vous à des lettres qui s'effondrent dès qu'on les regarde de près. Les foules, l'eau et les mains sont les cas de mouvement.
SynthID marque chaque image de façon invisible et personne ne peut l'enlever. L'anglais est la seule langue de prompt que Google ait évaluée, et Google a fondu Vertex AI dans la Gemini Enterprise Agent Platform le 22 avril 2026 — c'est là que ce modèle est référencé pour les acheteurs entreprise.
Le modèle a vos mots et un seed ; tout ce que vous laissez non dit devient sa décision. Décrivez un plan, jamais une séquence — trois temps en huit secondes vous donnent un mauvais raccord ou un flou.
Fixez la caméra. « Plan large fixe », « lent travelling latéral gauche », « caméra portée en suivi ». Une caméra non précisée dérive.
Fixez la lumière. Lampadaire au sodium, après-midi couvert, une seule source dans le champ. C'est l'éclairage qui sépare un cadre voulu d'un simple rendu.
Fixez le son. Vous payez l'audio que vous l'ayez prévu ou non : nommez donc l'ambiance et la moindre réplique — sinon le modèle invente un lit sonore qui se battra avec votre montage.
Ensuite, gardez le seed et changez une clause à la fois. Notre guide de prompting Gemini Omni va plus loin.
$0.09 par seconde de sortie 720p — $0.72 pour les huit secondes par défaut, $0.90 au plafond de dix secondes. Une remise de 40 % sur un tarif catalogue de $0.15, vérifiée le 28 août 2026. Les autres paliers : $0.0297 en 360p, $0.135 en 1080p, $0.18 en 4K, audio compris.
Sur les quatre paliers. Google facture la vidéo en tokens de sortie — $17.50 le million, à 1 931 tokens par seconde en 360p, 5 792 en 720p, 8 688 en 1080p et 17 376 en 4K — soit $0.0338, $0.1014, $0.1520 et $0.3041 la seconde, son compris. Son tableau d'annonce arrondit à $0.03, $0.10, $0.15 et $0.30 ; c'est sur les montants non arrondis que la facture est calculée. Face à cela nous sommes environ douze pour cent moins cher en 360p, onze pour cent en 720p et en 1080p, et quarante et un pour cent moins cher en 4K. Les deux barèmes descendent vers le 360p du même pas de 0,33× ; la différence est en haut, là où Google triple son tarif 720p et où nous doublons le nôtre.
Non — c'est plus cher. Omni Flash text-to-video tourne ici à $0.0825 la seconde contre $0.09 sur cette page : huit secondes coûtent $0.66 là-bas et $0.72 ici. Neuf pour cent d'écart. L'ancien modèle n'a pas de palier 360p et n'a jamais livré ni image-to-video ni start-end-frame-to-video sur E2X ; c'est là que part la différence. Appeler Google directement est une autre question : son tarif publié revient à $0.1014 la seconde en 720p, donc cette page comme l'ancienne passent en dessous. L'écart ne vient pas d'un produit plus coûteux : les trois reposent sur le même tarif catalogue de $0.15, et ce qui change c'est la remise permanente — 40 % ici contre 45 % et 50 % sur les pages plus anciennes.
Veo 3.1 Fast, presque toujours — $0.01 la seconde sur la même API, donc huit secondes coûtent $0.08 plutôt que $0.72. Revenez ici quand le clip doit atteindre dix secondes, exige la 4K, ou doit s'accorder avec d'autres images.
À itérer. Quatre secondes en 360p coûtent $0.1188 contre $0.36 en 720p : les brouillons ne valent qu'une fraction des rendus que vous gardez, et vous pouvez vous permettre de vous tromper plus souvent.
De trois à dix secondes, à 24 fps. L'enum duration expose 4, 6, 8 et 10, sous forme de chaînes. Les pièces plus longues viennent de plusieurs appels — ce que les fonctions de continuité de la 1.1 existent précisément pour rendre supportable.
Oui, sur chaque ligne de chaque comparaison de cette page. Il n'existe aucun interrupteur audio : dialogues et ambiance sont générés avec l'image, et aucun fournisseur de cette liste ne les facture séparément.
En général parce que ce n'est pas le même modèle. La fiche google/gemini-omni-flash sans version, chez fal.ai, facture les poids preview dépréciés autour de $0.125 la seconde ; sa page v1.1 affiche $0.10, et notre tableau utilise la v1.1. Vérifiez d'abord la version et la date.