Loading...
Loading...
Niveau Veo 3.1 plus rapide et plus économique, couvrant texte-vidéo, image-vidéo, référence-vidéo et transitions entre image de début et de fin.
Connectez-vous pour exécuter des modèles
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Coût estimé par génération selon la durée et la résolution. Vous ne payez que ce que vous utilisez.
Veo 3.1 Fast, c'est le Veo 3.1 de Google réglé pour la vitesse : mêmes résolutions, mêmes durées de 4/6/8 secondes, même audio natif toujours actif, rendu plus vite et tarifé plus bas. Nous l'exposons sous google/veo-3.1-fast/text-to-video et nous facturons à la seconde de sortie — $0.01 la seconde, ×1.5 quand la piste audio est active. Un clip de 8 secondes en 720p avec du son revient à $0.12. Rien à uploader. Un prompt, c'est toute l'entrée.
Vous avez plutôt une image fixe à faire vivre ? Alors c'est Veo 3.1 Fast image-to-video qu'il vous faut — même modèle, une image de départ. Il faut que le même visage et la même veste survivent sur toute une série de plans ? C'est Veo 3.1 Fast reference-to-video.
Tous les providers sérieux de ce modèle facturent à la seconde, nous compris. La seule comparaison honnête est donc à configuration fixe — la voici en 720p avec l'audio actif, vérifiée le 26 août 2026 :
| Provider API | Facturation | Tarif (720p, audio actif) | Clip de 8 secondes | vs. nous |
|---|---|---|---|---|
| E2X (actuel) | à la seconde | $0.01/s ×1.5 audio | $0.12 | — |
| Google Gemini API | à la seconde | $0.10/s | $0.80 | 6,7× notre prix |
| fal.ai | à la seconde | $0.15/s | $1.20 | 10× notre prix |
| Replicate | à la seconde | $0.15/s | $1.20 | 10× notre prix |
| Tarif public E2X (avant remise) | à la seconde | $0.10/s ×1.5 | $1.20 | notre tarif sans remise |
Lisez la dernière ligne face à fal.ai et Replicate. Notre tarif public pour un clip de 8 secondes est de $1.20 — exactement ce qu'ils facturent. Ce que vous payez aujourd'hui en est le dixième, et reste 6,7× sous l'API de Google elle-même pour la requête identique.
Budgétez en tenant compte d'une nuance : passer de 720p à 1080p est gratuit sur fal.ai et Replicate, alors que Google facture plus cher à la seconde. La résolution est aussi un multiplicateur de notre côté : allez chercher le chiffre en vigueur dans le llms.txt de ce modèle avant de vous engager sur un pipeline 1080p.
Les prix et les conditions produit peuvent changer. Vérifiez les tarifs en vigueur de chaque provider avant toute décision d'achat. La tarification Google Batch ou Flex n'est pas directement équivalente à une requête API on-demand standard, car les conditions de planification, de disponibilité et de traitement diffèrent ; elle est donc exclue de cette comparaison. Il s'agit d'une comparaison délimitée, et non d'une affirmation selon laquelle E2X serait l'option la moins chère au monde dans toutes les configurations.
La plupart des modèles text-to-video vous rendent un MP4 muet et vous laissent le son sur les bras. Pas Veo 3.1 Fast. L'API de Google génère l'audio nativement et vous ne pouvez pas le désactiver chez eux — dialogue synchronisé, bruitages et ambiance de pièce, produits en même temps que l'image et calés sur les frames. L'exemple de prompt documenté par Google contient lui-même des répliques parlées.
Cela change ce que vaut un seul appel. Écrivez « un poissonnier claque une caisse sur l'étal et crie arrivage, il y a cinq minutes » et vous obtenez le claquement et le cri sur les bonnes frames — pas un mime qu'il faudra sonoriser plus tard. Pour des formats sociaux et des animatiques, une étape entière de post-production disparaît.
Ce que vous pouvez, vous, choisir :
has_sound, par défaut à true, qui pilote le multiplicateur ×1.5.Huit secondes, c'est le plafond pour un clip. Les séquences, ce sont plusieurs appels.
Créez une API key dans le dashboard, gardez-la côté serveur, postez le job. Seul prompt est obligatoire.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/text-to-video",
"input": {
"prompt": "Plan caméra portée descendant une ruelle à Osaka luisante de pluie, la nuit. Un vendeur de ramen soulève le noren, la vapeur se déverse, et il lance à un cycliste qui passe : \"Dernier bol de la nuit !\" Les reflets néon frissonnent dans les flaques.",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
Nous renvoyons un job ID. Faites du polling, ou pas :
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/text-to-video",
input: {
prompt:
"Lent travelling avant sur une gardienne de phare qui écrit dans un journal de bord. Le vent fait vibrer la vitre. Elle murmure : \"Troisième nuit, toujours aucun signal.\" Le faisceau balaie son visage toutes les quatre secondes.",
aspect_ratio: "9:16",
resolution: "720p",
duration: "6",
has_sound: "true",
seed: 41205,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Les statuts vont pending → processing → completed, ou atterrissent sur failed / cancelled. Envoyez plutôt un webhookUrl et c'est nous qui vous appellerons. Comptez environ quatre minutes par job ; Google publie un plancher de 11 secondes et un plafond de 6 minutes aux heures de pointe : construisez pour le plafond.
Un piège de schema : duration et resolution sont des chaînes. "8", pas 8.
Mêmes poids, même prix à la seconde, trois portes d'entrée différentes. C'est l'entrée dont vous disposez déjà qui tranche :
| Endpoint | Clip 8 s, 720p + audio | À choisir quand |
|---|---|---|
| Veo 3.1 Fast text-to-video | $0.12 | Vous avez des mots et rien d'autre — et vous voulez du 4 s ou du 6 s |
| Veo 3.1 Fast image-to-video | $0.12 | Une image fixe existe et doit devenir la première frame |
| Veo 3.1 Fast reference-to-video | $0.12 | Une personne, un produit ou un lieu doit rester identique d'un plan à l'autre |
Le prix ne départagera rien : suivez donc le brief. Si un client a déjà validé un visuel clé, l'envoyer comme image de départ vaut mieux que de le redécrire en prose. Si six clips doivent ressembler à une même campagne, chargez jusqu'à trois références — en sachant que reference-to-video impose 8 secondes, sans exception. Cet endpoint-ci conserve les durées courtes, ce qui en fait la façon la moins chère de remplir un storyboard de mouvement grossier. Le reste de ce que nous opérons se trouve dans la catégorie text-to-video et dans le catalogue complet des modèles.
Traitez le prompt comme une liste de plans avec un mixage son attaché. Quatre choses pèsent plus que les adjectifs :
Nommez le mouvement de caméra. « Plan large fixe », « lent travelling avant », « caméra portée en suivi » — le modèle les respecte. Un cadrage vague vous donne un mouvement flottant, sans intention.
Écrivez les dialogues entre guillemets. Des répliques courtes, une ou deux par clip. Huit secondes, ce n'est pas long. Une intention paraphrasée (« il dit quelque chose d'encourageant ») produit un marmonnement de remplissage.
Demandez l'ambiance. La pluie sur la tôle, le ronflement d'un frigo, la circulation au loin. Le modèle invente un lit sonore si vous ne le nommez pas, et il peut ne pas coller à votre montage.
Dites ce que fait la lumière. Midi couvert, lampadaire au sodium, une seule source pratique dans le cadre. La lumière décide si un clip de palier Fast se lit comme un parti pris ou comme un rendu.
L'anglais est entièrement supporté ; Google n'a pas évalué d'autres langues ici. Écrivez le dialogue dans la langue que vous voulez entendre parler et attendez-vous à plus de variance en dehors de l'anglais.
Téléchargez dans les 48 heures. Google conserve le fichier deux jours — leur formulation : vous devez télécharger votre vidéo dans les 2 jours suivant la génération. Copiez chaque sortie dans votre propre bucket, dans le job même qui lit outputs[0].url. Un lien CDN n'est pas une archive.
Chaque frame porte SynthID. Le watermark imperceptible de Google est appliqué à toutes les sorties Veo et vérifiable sur leur plateforme de vérification. Personne ne peut le désactiver, nous compris.
Règles régionales sur les personnes. Dans l'UE, au Royaume-Uni, en Suisse et dans la région MENA, personGeneration est restreint à allow_adult.
Nous facturons à la seconde : $0.01 par seconde de sortie, multiplié par 1,5 quand l'audio est activé. Un clip de 8 secondes en 720p avec du son coûte $0.12, un de 6 secondes $0.09, et 4 secondes $0.06. Une résolution au-dessus de 720p porte son propre multiplicateur.
À la configuration et à la date que nous avons vérifiées — 8 secondes, 720p, audio actif, 26 août 2026 — oui : $0.12 chez nous contre $1.20 là-bas. Notre propre tarif public sans remise est ce même $1.20. L'écart est une remise, pas un produit différent.
Notre schema expose has_sound et nous le mettons à true par défaut. L'API Gemini de Google, elle, n'offre aucun interrupteur : mieux vaut donc considérer l'audio comme faisant partie de ce qu'est ce modèle — c'est également vrai sur notre endpoint image-to-video. C'est aussi la raison du multiplicateur de prix ×1.5.
Huit secondes, en un seul appel. Vous pouvez demander 4 ou 6 sur cet endpoint, mais la 1080p et la 4k exigent les 8 complètes. Des séquences plus longues supposent d'assembler vous-même plusieurs jobs, ou de tenir un look stable avec reference-to-video.
16:9 et 9:16 uniquement, en 24 fps, en 720p, 1080p ou 4k. Nous partons sur 16:9 et 720p par défaut. Il n'y a ni carré ni 4:5 : recadrez en post si vous en avez besoin.
Oui — chaque sortie Veo est watermarkée avec SynthID, le marqueur de provenance imperceptible de Google, et cela se vérifie via leur plateforme. Aucun provider n'expose de paramètre pour le désactiver.
Nous budgétons environ quatre minutes par job. Google publie un minimum de 11 secondes et un maximum de 6 minutes aux heures de pointe : utilisez donc un webhook plutôt qu'une boucle de polling serrée pour du travail en masse.