Loading...
Loading...
Livello Veo 3.1 più veloce ed economico, con testo-video, immagine-video, riferimento-video e transizioni tra fotogramma iniziale e finale.
Accedi per eseguire i modelli
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Costo stimato per generazione in base a durata e risoluzione. Paghi solo per ciò che esegui.
Veo 3.1 Fast è il Veo 3.1 di Google ottimizzato per la velocità: stesse risoluzioni, stesse durate da 4/6/8 secondi, stesso audio nativo sempre attivo, consegnato più in fretta e a un prezzo più basso. Lo esponiamo come google/veo-3.1-fast/text-to-video e fatturiamo al secondo di output — $0.01 al secondo, ×1,5 quando la traccia audio è attiva. Una clip da 8 secondi in 720p con il sonoro viene $0.12. Nulla da caricare. Un prompt è tutto l'input.
Ha invece un'immagine ferma da far prendere vita? Allora Le serve Veo 3.1 Fast image-to-video — stesso modello, un fotogramma di partenza. Le serve che lo stesso volto e la stessa giacca sopravvivano a una serie di inquadrature? Quello è Veo 3.1 Fast reference-to-video.
Ogni provider serio di questo modello fattura al secondo, noi compresi. Quindi l'unico confronto onesto è a configurazione fissa — eccolo a 720p con audio attivo, verificato il 26 agosto 2026:
| Provider API | Fatturazione | Tariffa (720p, audio attivo) | Clip da 8 secondi | vs. noi |
|---|---|---|---|---|
| E2X (attuale) | al secondo | $0.01/s ×1,5 audio | $0.12 | — |
| Google Gemini API | al secondo | $0.10/s | $0.80 | 6,7× il nostro prezzo |
| fal.ai | al secondo | $0.15/s | $1.20 | 10× il nostro prezzo |
| Replicate | al secondo | $0.15/s | $1.20 | 10× il nostro prezzo |
| Listino E2X (pre-sconto) | al secondo | $0.10/s ×1,5 | $1.20 | la nostra tariffa non scontata |
Legga l'ultima riga contro fal.ai e Replicate. Il nostro prezzo di listino per una clip da 8 secondi è $1.20 — esattamente quello che chiedono loro. Quello che paga oggi è un decimo, e resta comunque 6,7 volte sotto l'API di Google stessa per la request identica.
Metta in conto una sfumatura: passare da 720p a 1080p è gratis su fal.ai e Replicate, mentre Google chiede di più al secondo. Anche dal nostro lato la risoluzione è un moltiplicatore, quindi prenda il dato aggiornato dal llms.txt di questo modello prima di impegnarsi in una pipeline 1080p.
I prezzi e le condizioni dei prodotti possono cambiare nel tempo. Verifichi i prezzi aggiornati di ciascun provider prima di prendere una decisione d'acquisto. Il prezzo Google Batch o Flex non è direttamente equivalente a una request API on-demand standard, perché le condizioni di pianificazione, disponibilità ed elaborazione sono diverse; è quindi escluso da questo confronto. Si tratta di un confronto circoscritto a uno scenario d'uso specifico, non dell'affermazione che E2X sia l'opzione più economica al mondo in ogni configurazione.
La maggior parte dei modelli text-to-video Le consegna un MP4 muto e Le lascia il sonoro. Veo 3.1 Fast no. L'API di Google genera l'audio in modo nativo e lì non può disattivarlo — dialoghi sincronizzati, foley e room tone, prodotti insieme all'immagine e agganciati ai fotogrammi. L'esempio di prompt documentato da Google contiene battute parlate.
Questo cambia quanto vale una singola chiamata. Scriva "un pescivendolo sbatte giù una cassetta e grida fresco, arrivato cinque minuti fa" e ottiene il colpo e il grido sui fotogrammi giusti — non un mimo da sonorizzare dopo. Per i tagli social e gli animatic, sparisce un intero passaggio di post-produzione.
Quello che invece può scegliere:
has_sound, impostato di default su true, che guida il moltiplicatore ×1,5.Otto secondi è il tetto per una clip. Le sequenze sono più chiamate.
Crei una API key nella dashboard, la tenga lato server, invii il job. Solo prompt è obbligatorio.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/text-to-video",
"input": {
"prompt": "Ripresa a mano lungo un vicolo di Osaka lucido di pioggia, di notte. Un venditore di ramen solleva il noren, il vapore esce a fiotti e chiama un ciclista di passaggio: \"Ultima ciotola della serata!\" I riflessi al neon tremolano nelle pozzanghere.",
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
Restituiamo un job ID. Faccia polling, oppure no:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/text-to-video",
input: {
prompt:
"Lenta carrellata in avanti su una guardiana del faro che scrive sul registro. Il vento fa vibrare i vetri. Lei mormora: \"Terza notte, ancora nessun segnale.\" La lampada le passa sul viso ogni quattro secondi.",
aspect_ratio: "9:16",
resolution: "720p",
duration: "6",
has_sound: "true",
seed: 41205,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
Gli status vanno da pending → processing → completed, oppure finiscono su failed / cancelled. Invii piuttosto un webhookUrl e La chiamiamo noi. Metta in conto circa quattro minuti per job; Google pubblica un minimo di 11 secondi e un massimo di 6 minuti nelle ore di punta, quindi progetti per il massimo.
Una trappola dello schema: duration e resolution sono stringhe. "8", non 8.
Stessi pesi, stesso prezzo al secondo, tre porte d'ingresso diverse. A decidere è l'input che ha già:
| Endpoint | Clip 8s, 720p + audio | Da scegliere quando |
|---|---|---|
| Veo 3.1 Fast text-to-video | $0.12 | Ha parole e nient'altro — e vuole 4s o 6s |
| Veo 3.1 Fast image-to-video | $0.12 | Esiste un fermo immagine che deve diventare il primo fotogramma |
| Veo 3.1 Fast reference-to-video | $0.12 | Una persona, un prodotto o un luogo deve restare identico fra le inquadrature |
Il prezzo non scioglie il pareggio, quindi segua il brief. Se un cliente ha già approvato un key visual, inviarlo come fotogramma di partenza batte il ridescriverlo in prosa. Se sei clip devono sembrare una sola campagna, carichi fino a tre reference — sapendo però che reference-to-video impone 8 secondi, senza eccezioni. Questo endpoint mantiene le durate più corte, il che lo rende il modo più economico per riempire uno storyboard di movimento grezzo. Il resto di quello che facciamo girare sta nella categoria text-to-video e nel catalogo modelli completo.
Tratti il prompt come una lista di inquadrature con allegato un mix audio. Quattro cose spostano l'ago più degli aggettivi:
Nomini il movimento di macchina. "Campo lungo fisso", "lenta carrellata in avanti", "inseguimento a mano" — il modello li rispetta. Un'inquadratura vaga Le dà un movimento alla deriva e senza convinzione.
Scriva i dialoghi fra virgolette. Battute brevi, una o due per clip. Otto secondi non sono tanti. L'intenzione parafrasata ("dice qualcosa di incoraggiante") produce riempitivo borbottato.
Chieda l'ambiente sonoro. Pioggia sulla lamiera, il ronzio di un frigorifero, traffico lontano. Il modello si inventa un tappeto se non gliene nomina uno, e potrebbe non corrispondere al Suo montaggio.
Dica cosa sta facendo la luce. Mezzogiorno coperto, lampione al sodio, una sola lampada in campo. È l'illuminazione a decidere se una clip di fascia Fast si legge come voluta o come un render.
L'inglese è pienamente supportato; qui Google non ha valutato altre lingue. Scriva i dialoghi nella lingua che vuole sentir parlare e si aspetti più variabilità fuori dall'inglese.
Scarichi entro 48 ore. Google conserva il file per due giorni — le loro parole sono che deve scaricare il Suo video entro 2 giorni dalla generazione. Copi ogni output nel Suo bucket dentro lo stesso job che legge outputs[0].url. Un link CDN non è un archivio.
Ogni fotogramma porta SynthID. Il watermark impercettibile di Google viene applicato a tutto l'output Veo ed è verificabile sulla loro piattaforma di verifica. Nessuno può disattivarlo, noi compresi.
Regole regionali sulle persone. Nell'UE, nel Regno Unito, in Svizzera e nell'area MENA, personGeneration è limitato ad allow_adult.
Fatturiamo al secondo: $0.01 per secondo di output, moltiplicato per 1,5 quando l'audio è abilitato. Una clip da 8 secondi in 720p con il sonoro è $0.12, una da 6 secondi $0.09 e 4 secondi $0.06. La risoluzione sopra il 720p porta con sé il proprio moltiplicatore.
Alla configurazione e alla data che abbiamo verificato — 8 secondi, 720p, audio attivo, 26 agosto 2026 — sì: $0.12 da noi contro $1.20 da loro. Il nostro stesso prezzo di listino non scontato è quegli stessi $1.20. Il divario è uno sconto, non un prodotto diverso.
Il nostro schema espone has_sound e lo impostiamo di default su true. L'API Gemini di Google stessa non offre alcun interruttore di spegnimento, quindi conviene considerare l'audio parte di ciò che questo modello è — lo stesso vale sul nostro endpoint image-to-video. È anche la ragione del moltiplicatore di prezzo ×1,5.
Otto secondi, in una sola chiamata. Su questo endpoint può richiedere 4 o 6, ma 1080p e 4k richiedono gli 8 pieni. Sequenze più lunghe significano cucire insieme più job da sé, oppure tenere ferma l'estetica con reference-to-video.
Solo 16:9 e 9:16, a 24fps, in 720p, 1080p o 4k. Il nostro default è 16:9 e 720p. Non esiste opzione quadrata o 4:5, quindi ritagli in post se Le serve.
Sì — ogni output Veo è marcato con SynthID, il marcatore di provenienza impercettibile di Google, e può essere verificato attraverso la loro piattaforma. Nessun provider espone un parametro per disattivarlo.
Mettiamo in conto circa quattro minuti per job. Google pubblica un minimo di 11 secondi e un massimo di 6 minuti nelle ore di punta, quindi per il lavoro in volume usi un webhook invece di un loop di polling serrato.