Loading...
Loading...
Famiglia di generazione video di Google che crea clip da prompt testuali o immagini di riferimento, ottimizzata per tempi rapidi.
0/7 elementi
Accedi per eseguire i modelli
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Costo stimato per generazione in base a durata e risoluzione. Paghi solo per ciò che esegui.
Omni Flash è il gemini-omni-flash-preview di Google — un modello video della famiglia Gemini, non un Veo — e la presentazione che ne fa DeepMind sta in una frase: "Immaginate Gemini Omni come Nano Banana, ma per il video." Facciamo girare la sua capability reference-to-video come google/omni-flash/reference-to-video, e fatturiamo $0.10 per ogni secondo di video 720p finito. La clip di default da 8 secondi costa quindi $0.80, audio incluso.
Noti l'unità. Qui nessuno vende una clip a forfait, quindi qualsiasi cifra che confronta va moltiplicata per la lunghezza che intende rendere.
Ha una sceneggiatura ma nessuna immagine da portare dentro l'inquadratura? Allora l'endpoint che Le serve è Veo 3.1 Fast text-to-video — parte dal solo prompt e, sulla nostra piattaforma, costa drasticamente meno. Ci torniamo sotto, onestamente.
La nostra posizione rispetto agli altri posti da cui può chiamare questo modello, verificata il 26 agosto 2026:
| Provider API | Al secondo (720p) | Clip da 8 secondi | vs. E2X |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | siamo il 23% più bassi |
| Atlas Cloud | $0.135 | $1.08 | siamo il 26% più bassi |
| Runware | $0.10 | $0.80 | alla pari |
| Google Gemini API | $0.10 | $0.80 | alla pari |
I prezzi e le condizioni dei prodotti possono cambiare nel tempo. Verifichi i prezzi aggiornati di ciascun provider prima di prendere una decisione d'acquisto. Il prezzo Google Batch o Flex non è direttamente equivalente a una request API on-demand standard, perché le condizioni di pianificazione, disponibilità ed elaborazione sono diverse; è quindi escluso da questo confronto. Si tratta di un confronto circoscritto a uno scenario d'uso specifico, non dell'affermazione che E2X sia l'opzione più economica al mondo in ogni configurazione.
Non lo abbelliamo: su questo modello pareggiamo la tariffa di Google invece di andarci sotto, e il risparmio è reale solo rispetto a fal.ai e Atlas. Le reference image incidono a malapena — Google conta un'immagine a 2.040 token, quindi tre di esse costano circa un centesimo. È duration il campo che muove il Suo conto.
Il senso di questo endpoint è la continuità. Consegni al modello un soggetto — una persona, un prodotto, un set, un look —, descriva una scena in cui non è mai stato fotografato, e il soggetto sopravvive al viaggio.
Può allegare diverse reference, non una sola. Gli esempi pubblicati da Google arrivano a sei; nessun massimo ufficiale è stato documentato, e i numeri di terze parti si contraddicono a vicenda, quindi non ne stamperemo uno. Progetti per una manciata e testi il Suo tetto.
L'audio viene generato insieme all'immagine, non attaccato dopo. Si sincronizza con l'azione e lo guida dallo stesso prompt — chieda pioggia su un tetto di lamiera e un room tone basso, ed è quello che torna indietro. Non c'è una traccia audio separata da montare dopo.
Dieci secondi è il tetto. Il nostro enum duration espone 4, 6, 8 e 10; il modello di Google gira da 3 a 10 secondi, e 10 è un limite duro. Nessun endpoint di estensione, nessuna interpolazione. Qualsiasi cosa più lunga è un lavoro di cucitura nel Suo editor — e la continuità fra gli stacchi diventa un Suo problema.
720p, 24 fps, e la lista finisce qui. Il nostro campo resolution porta i valori 1080p e 4k e Google indica le risoluzioni più alte come in arrivo, ma oggi il modello restituisce 720p. Lo lasci sul default. Una pagina di provider che qui pubblicizza il 1080p sta avanti alla documentazione di Google stessa.
Si aspetti circa 45 secondi di elaborazione per una clip standard — un p50 misurato da eachlabs, non un dato ufficiale, quindi lo usi per pianificare e non per promettere.
Due campi sono obbligatori: image_urls e prompt. Generi una API key dalla Sua dashboard, la tenga su un server che controlla, poi invii il job.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "La sneaker della prima immagine è posata su asfalto bagnato mentre dietro un autobus riparte. Lenta carrellata in avanti. Traffico di sottofondo e pioggia leggera, nessuna musica.",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
La response porta un job ID. Il video richiede minuti, quindi faccia polling lentamente — oppure salti il polling e passi un webhookUrl nel body di submit:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"La donna della reference attraversa un mercato notturno, le insegne al neon si riflettono sulla sua giacca. Camera a mano. Brusio della folla e frittura in lontananza.",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
Gli status passano da pending → processing → completed, oppure finiscono su failed o cancelled. Lo schema e il prezzo aggiornati stanno nella specifica leggibile dalle macchine, se preferisce leggerli in modo programmatico.
Il confronto che conta, e non lusinga questa pagina:
| Modello | Il nostro prezzo (8s, 720p, audio) | Da scegliere quando |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | Più reference devono restare coerenti, o Le serve una clip da 10 secondi |
| Veo 3.1 Fast reference-to-video | $0.12 | Fino a tre reference, 8 secondi, e vuole il conto più basso |
| Veo 3.1 Fast image-to-video | $0.12 | Un solo fermo immagine che vuole animare |
| Veo 3.1 Fast text-to-video | $0.12 | Nessun materiale sorgente |
Sulla nostra piattaforma Veo 3.1 Fast costa una frazione di Omni Flash, e arriva a 1080p e 4K, cosa che oggi Omni Flash non può fare. Al prezzo di listino di Google stessa i due stanno agli stessi $0.10 al secondo per il 720p — è il nostro sconto ad aprire il divario. Quindi parta da Veo Fast. Torni qui quando è il suo tetto di tre reference a bloccarLa, quando Le servono quei due secondi in più, o quando vuole il comportamento di editing video dietro alla formula "Nano Banana per il video". Altre opzioni stanno nella categoria reference-to-video, e l'intero catalogo modelli sta in una sola pagina.
Public Preview significa che gli spigoli sono documentati invece che nascosti. Legga questi punti prima di costruire:
Scriva l'inquadratura, non la storia. Un soggetto, un movimento di macchina, una condizione di luce — poi dica come suona, perché l'audio esce dallo stesso prompt e il silenzio è una scelta che si fa ad alta voce.
Etichetti i Suoi allegati quando ne entra più di uno: "l'immagine 1 è la bottiglia, l'immagine 2 è il primo piano dell'etichetta." Nient'altro comunica al modello quale reference è la protagonista. Tenga semplice il linguaggio di macchina — "lenta carrellata in avanti", "camera fissa", "inseguimento a mano" battono un paragrafo di cinematografia.
Ogni clip porta un watermark SynthID — invisibile agli spettatori, rilevabile in modo programmatico — e le content credential C2PA sono allegate di default. Nessun provider che faccia girare questo modello può disattivarle, noi compresi. Se un contratto con un cliente vieta asset IA etichettati, risolva la questione prima di integrare.
Ri-ospiti i Suoi output sul Suo storage dentro l'handler di completamento. Gli URL dei risultati non sono indirizzi permanenti, e un video che non riesce a recuperare è un video che paga due volte.
È il gemini-omni-flash-preview di Google, un modello di generazione e editing video della famiglia Gemini invece che della famiglia Veo. DeepMind lo descrive come "Nano Banana, ma per il video" — l'accento cade sul portare le reference in modo coerente e sul modificare filmati esistenti, mentre Veo punta alla generazione cinematografica da zero. È in Public Preview.
$0.80. Applichiamo una tariffa di $0.10 per secondo di output in 720p, quindi è la lunghezza a guidare il conto — una clip da 4 secondi è $0.40, il massimo da 10 secondi $1.00. Era la nostra tariffa alla verifica del 26 agosto 2026.
Più di una, e gli esempi documentati da Google arrivano a sei — ma non è pubblicato alcun massimo ufficiale. Fonti esterne a Google citano tetti diversi e si contraddicono a vicenda, quindi non ripeteremo un numero che non possiamo verificare. Testi i Suoi payload prima di progettare attorno a un conteggio specifico.
Oggi no. Restituisce 720p a 24 fps, e Google indica le risoluzioni più alte come in arrivo. Se Le serve subito il 1080p o il 4K, Veo 3.1 Fast arriva a entrambi.
Veo 3.1 Fast, per la maggior parte dei lavori. Sulla nostra piattaforma costa $0.12 per una clip da 8 secondi con audio contro gli $0.80 di qui, e arriva al 4K. Scelga Omni Flash quando Le servono più di tre reference image, una durata da 10 secondi o il suo comportamento di editing video.
Sì, in modo nativo e in sincrono con l'azione sullo schermo. Lo dirige dallo stesso prompt — nomini l'ambiente sonoro, gli effetti, oppure chieda della musica. L'audio non può essere modificato in seguito attraverso l'API, quindi un cambiamento significa un nuovo render.
Sì. Ogni output porta un watermark SynthID che gli spettatori non possono vedere ma che gli strumenti di rilevamento leggono, più le content credential C2PA attive di default. Nessun provider espone un parametro per disattivare né l'uno né le altre.
Solo fuori dal SEE, dalla Svizzera e dal Regno Unito — Google limita l'editing di video caricati in quelle regioni. La generazione reference-to-video in sé non è interessata. Noti inoltre che le reference video vengono accettate dallo schema ma non elaborate correttamente, quindi invii immagini.