Retour aux modèles

Veo 3.1 Fast

Niveau Veo 3.1 plus rapide et plus économique, couvrant texte-vidéo, image-vidéo, référence-vidéo et transitions entre image de début et de fin.

Tarificationà partir de $0.01/requête
Latence~240 secondes en moyenne
Résolution720P/1080P/4K
Idéal pourvideo, google, high-fidelity

Paramètres

Coût estimé

Vous économisez 90 % sur ce modèle
Coût de base par second$0.10
Remise-90%
Votre total$0.01
Vous économisez $0.09 par requête

Connectez-vous pour exécuter des modèles

Output Preview

Ready

No output yet

Run the model to see generated results.

Exemple de résultat

Exemple d'API— Paramètres actuels

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/veo-3.1-fast/text-to-video',
  'input': {}
}
)

Obtenir la tâche— Interroger le résultat

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Détail des tarifs

Coût estimé par génération selon la durée et la résolution. Vous ne payez que ce que vous utilisez.

Durée
720P
1080P
4K
4
$0.40
$0.40
$0.60
6
$0.60
$0.60
$0.90
8
$0.80
$0.80
$1.20
Explorer les alternatives

Modèles similaires

Découvrez d'autres modèles d'IA pour Texte en vidéo

Voir tous les modèles

API Veo 3.1 Fast Text-to-Video sur E2X

Veo 3.1 Fast, c'est le Veo 3.1 de Google réglé pour la vitesse : mêmes résolutions, mêmes durées de 4/6/8 secondes, même audio natif toujours actif, rendu plus vite et tarifé plus bas. Nous l'exposons sous google/veo-3.1-fast/text-to-video et nous facturons à la seconde de sortie — $0.01 la seconde, ×1.5 quand la piste audio est active. Un clip de 8 secondes en 720p avec du son revient à $0.12. Rien à uploader. Un prompt, c'est toute l'entrée.

Vous avez plutôt une image fixe à faire vivre ? Alors c'est Veo 3.1 Fast image-to-video qu'il vous faut — même modèle, une image de départ. Il faut que le même visage et la même veste survivent sur toute une série de plans ? C'est Veo 3.1 Fast reference-to-video.

Ce que coûte un clip de 8 secondes, partout

Tous les providers sérieux de ce modèle facturent à la seconde, nous compris. La seule comparaison honnête est donc à configuration fixe — la voici en 720p avec l'audio actif, vérifiée le 26 août 2026 :

Provider APIFacturationTarif (720p, audio actif)Clip de 8 secondesvs. nous
E2X (actuel)à la seconde$0.01/s ×1.5 audio$0.12—
Google Gemini APIà la seconde$0.10/s$0.806,7× notre prix
fal.aià la seconde$0.15/s$1.2010× notre prix
Replicateà la seconde$0.15/s$1.2010× notre prix
Tarif public E2X (avant remise)à la seconde$0.10/s ×1.5$1.20notre tarif sans remise

Lisez la dernière ligne face à fal.ai et Replicate. Notre tarif public pour un clip de 8 secondes est de $1.20 — exactement ce qu'ils facturent. Ce que vous payez aujourd'hui en est le dixième, et reste 6,7× sous l'API de Google elle-même pour la requête identique.

Budgétez en tenant compte d'une nuance : passer de 720p à 1080p est gratuit sur fal.ai et Replicate, alors que Google facture plus cher à la seconde. La résolution est aussi un multiplicateur de notre côté : allez chercher le chiffre en vigueur dans le llms.txt de ce modèle avant de vous engager sur un pipeline 1080p.

Les prix et les conditions produit peuvent changer. Vérifiez les tarifs en vigueur de chaque provider avant toute décision d'achat. La tarification Google Batch ou Flex n'est pas directement équivalente à une requête API on-demand standard, car les conditions de planification, de disponibilité et de traitement diffèrent ; elle est donc exclue de cette comparaison. Il s'agit d'une comparaison délimitée, et non d'une affirmation selon laquelle E2X serait l'option la moins chère au monde dans toutes les configurations.

La piste audio est le vrai titre

La plupart des modèles text-to-video vous rendent un MP4 muet et vous laissent le son sur les bras. Pas Veo 3.1 Fast. L'API de Google génère l'audio nativement et vous ne pouvez pas le désactiver chez eux — dialogue synchronisé, bruitages et ambiance de pièce, produits en même temps que l'image et calés sur les frames. L'exemple de prompt documenté par Google contient lui-même des répliques parlées.

Cela change ce que vaut un seul appel. Écrivez « un poissonnier claque une caisse sur l'étal et crie arrivage, il y a cinq minutes » et vous obtenez le claquement et le cri sur les bonnes frames — pas un mime qu'il faudra sonoriser plus tard. Pour des formats sociaux et des animatiques, une étape entière de post-production disparaît.

Ce que vous pouvez, vous, choisir :

  • La durée : 4, 6 ou 8 secondes. C'est le seul de nos trois endpoints Veo 3.1 Fast où ce choix est réellement ouvert. Un clip de 4 secondes en 720p avec audio revient à $0.06 ; 6 secondes, c'est $0.09.
  • La résolution : 720p (notre défaut), 1080p ou 4k, en 24 fps. La 1080p et la 4k sont réservées aux 8 secondes — c'est une contrainte de Google, pas de nous.
  • L'aspect ratio : 16:9 (défaut) ou 9:16. Pas de carré, pas de 4:5.
  • has_sound, par défaut à true, qui pilote le multiplicateur ×1.5.

Huit secondes, c'est le plafond pour un clip. Les séquences, ce sont plusieurs appels.

Requête API : prompt en entrée, MP4 en sortie

Créez une API key dans le dashboard, gardez-la côté serveur, postez le job. Seul prompt est obligatoire.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/veo-3.1-fast/text-to-video",
    "input": {
      "prompt": "Plan caméra portée descendant une ruelle à Osaka luisante de pluie, la nuit. Un vendeur de ramen soulève le noren, la vapeur se déverse, et il lance à un cycliste qui passe : \"Dernier bol de la nuit !\" Les reflets néon frissonnent dans les flaques.",
      "aspect_ratio": "16:9",
      "resolution": "720p",
      "duration": "8",
      "has_sound": "true"
    }
  }'

Nous renvoyons un job ID. Faites du polling, ou pas :

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/veo-3.1-fast/text-to-video",
    input: {
      prompt:
        "Lent travelling avant sur une gardienne de phare qui écrit dans un journal de bord. Le vent fait vibrer la vitre. Elle murmure : \"Troisième nuit, toujours aucun signal.\" Le faisceau balaie son visage toutes les quatre secondes.",
      aspect_ratio: "9:16",
      resolution: "720p",
      duration: "6",
      has_sound: "true",
      seed: 41205,
    },
  }),
}).then((r) => r.json());

const jobId = submitted.data.jobId;

while (true) {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") {
    console.log(job.data.outputs[0].url);
    break;
  }
  if (job.data.status === "failed") {
    throw new Error(job.data.error?.message || "Generation failed");
  }
  await new Promise((r) => setTimeout(r, 5000));
}

Les statuts vont pending → processing → completed, ou atterrissent sur failed / cancelled. Envoyez plutôt un webhookUrl et c'est nous qui vous appellerons. Comptez environ quatre minutes par job ; Google publie un plancher de 11 secondes et un plafond de 6 minutes aux heures de pointe : construisez pour le plafond.

Un piège de schema : duration et resolution sont des chaînes. "8", pas 8.

Choisir parmi nos endpoints Veo 3.1 Fast

Mêmes poids, même prix à la seconde, trois portes d'entrée différentes. C'est l'entrée dont vous disposez déjà qui tranche :

EndpointClip 8 s, 720p + audioÀ choisir quand
Veo 3.1 Fast text-to-video$0.12Vous avez des mots et rien d'autre — et vous voulez du 4 s ou du 6 s
Veo 3.1 Fast image-to-video$0.12Une image fixe existe et doit devenir la première frame
Veo 3.1 Fast reference-to-video$0.12Une personne, un produit ou un lieu doit rester identique d'un plan à l'autre

Le prix ne départagera rien : suivez donc le brief. Si un client a déjà validé un visuel clé, l'envoyer comme image de départ vaut mieux que de le redécrire en prose. Si six clips doivent ressembler à une même campagne, chargez jusqu'à trois références — en sachant que reference-to-video impose 8 secondes, sans exception. Cet endpoint-ci conserve les durées courtes, ce qui en fait la façon la moins chère de remplir un storyboard de mouvement grossier. Le reste de ce que nous opérons se trouve dans la catégorie text-to-video et dans le catalogue complet des modèles.

Des prompts qui méritent leur son

Traitez le prompt comme une liste de plans avec un mixage son attaché. Quatre choses pèsent plus que les adjectifs :

Nommez le mouvement de caméra. « Plan large fixe », « lent travelling avant », « caméra portée en suivi » — le modèle les respecte. Un cadrage vague vous donne un mouvement flottant, sans intention.

Écrivez les dialogues entre guillemets. Des répliques courtes, une ou deux par clip. Huit secondes, ce n'est pas long. Une intention paraphrasée (« il dit quelque chose d'encourageant ») produit un marmonnement de remplissage.

Demandez l'ambiance. La pluie sur la tôle, le ronflement d'un frigo, la circulation au loin. Le modèle invente un lit sonore si vous ne le nommez pas, et il peut ne pas coller à votre montage.

Dites ce que fait la lumière. Midi couvert, lampadaire au sodium, une seule source pratique dans le cadre. La lumière décide si un clip de palier Fast se lit comme un parti pris ou comme un rendu.

L'anglais est entièrement supporté ; Google n'a pas évalué d'autres langues ici. Écrivez le dialogue dans la langue que vous voulez entendre parler et attendez-vous à plus de variance en dehors de l'anglais.

Ce qu'il faut vérifier avant de livrer

Téléchargez dans les 48 heures. Google conserve le fichier deux jours — leur formulation : vous devez télécharger votre vidéo dans les 2 jours suivant la génération. Copiez chaque sortie dans votre propre bucket, dans le job même qui lit outputs[0].url. Un lien CDN n'est pas une archive.

Chaque frame porte SynthID. Le watermark imperceptible de Google est appliqué à toutes les sorties Veo et vérifiable sur leur plateforme de vérification. Personne ne peut le désactiver, nous compris.

Règles régionales sur les personnes. Dans l'UE, au Royaume-Uni, en Suisse et dans la région MENA, personGeneration est restreint à allow_adult.

Questions fréquentes

Combien coûte Veo 3.1 Fast text-to-video sur E2X ?

Nous facturons à la seconde : $0.01 par seconde de sortie, multiplié par 1,5 quand l'audio est activé. Un clip de 8 secondes en 720p avec du son coûte $0.12, un de 6 secondes $0.09, et 4 secondes $0.06. Une résolution au-dessus de 720p porte son propre multiplicateur.

E2X est-il vraiment dix fois moins cher que fal.ai pour ce modèle ?

À la configuration et à la date que nous avons vérifiées — 8 secondes, 720p, audio actif, 26 août 2026 — oui : $0.12 chez nous contre $1.20 là-bas. Notre propre tarif public sans remise est ce même $1.20. L'écart est une remise, pas un produit différent.

Puis-je désactiver l'audio ?

Notre schema expose has_sound et nous le mettons à true par défaut. L'API Gemini de Google, elle, n'offre aucun interrupteur : mieux vaut donc considérer l'audio comme faisant partie de ce qu'est ce modèle — c'est également vrai sur notre endpoint image-to-video. C'est aussi la raison du multiplicateur de prix ×1.5.

Quelle peut être la durée d'un clip généré ?

Huit secondes, en un seul appel. Vous pouvez demander 4 ou 6 sur cet endpoint, mais la 1080p et la 4k exigent les 8 complètes. Des séquences plus longues supposent d'assembler vous-même plusieurs jobs, ou de tenir un look stable avec reference-to-video.

Quels aspect ratios et quelles résolutions sont supportés ?

16:9 et 9:16 uniquement, en 24 fps, en 720p, 1080p ou 4k. Nous partons sur 16:9 et 720p par défaut. Il n'y a ni carré ni 4:5 : recadrez en post si vous en avez besoin.

Les vidéos portent-elles un watermark ?

Oui — chaque sortie Veo est watermarkée avec SynthID, le marqueur de provenance imperceptible de Google, et cela se vérifie via leur plateforme. Aucun provider n'expose de paramètre pour le désactiver.

Combien de temps prend une génération ?

Nous budgétons environ quatre minutes par job. Google publie un minimum de 11 secondes et un maximum de 6 minutes aux heures de pointe : utilisez donc un webhook plutôt qu'une boucle de polling serrée pour du travail en masse.