Loading...
Loading...
Gemini Omni 1.1 Flash generates video from a text prompt, a single image, a start and end frame, or up to seven reference images. Clips run 4 to 10 seconds at resolutions from 360p to 4K.
Accedi per eseguire i modelli
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Costo stimato per generazione in base a durata e risoluzione. Paghi solo per ciò che esegui.
Omni 1.1 Flash è diventato generalmente disponibile in Google il 27 agosto 2026 — un modello della famiglia Gemini, non un Veo. Facciamo girare la sua capability solo-prompt come google/omni-1.1-flash/text-to-video, e la fatturiamo al secondo di output: $0.09 in 720p, su una tariffa di listino di $0.15 dopo uno sconto fisso del 40%. Gli otto secondi di default sono $0.72. Un prompt è tutto il payload.
Un numero, qui, è salito. Il predecessore, Gemini Omni Flash text-to-video, fattura $0.0825 al secondo su questa piattaforma; questa pagina fattura $0.09. Nove per cento in più, ed è meglio leggerlo qui che dedurlo da una fattura. Quel nove per cento non compra un secondo di video migliore. Compra un livello di bozza a $0.0297 per cui il modello vecchio non ha nemmeno l'enum di risoluzione, clip che arrivano a dieci secondi e due capability che il predecessore su E2X non ha mai pubblicato. Le nostre note sull'uscita della 1.1 raccontano il resto.
Ora la frase che gioca contro la nostra stessa fattura. Veo 3.1 Fast text-to-video gira su questa piattaforma a $0.01 al secondo — un nono del prezzo di questa pagina. Una clip sola, nata da una frase, senza che nulla a valle dipenda da essa? Vada lì. Il sovrapprezzo di qui compra dieci secondi, il 4K, una modalità bozza economica e inquadrature che si appartengono. Se non Le serve nessuna di queste cose, non ha comprato niente.
Altro materiale, altro endpoint: un fermo immagine che diventa il primo fotogramma va su image-to-video, due estremi con un vuoto in mezzo su start-end-frame-to-video, un volto che si ripete su reference-to-video.
Ogni cifra qui sotto è stata letta il 28 agosto 2026 sulla pagina versione 1.1 del provider stesso:
| Dove lo chiama | 720p, al secondo | Otto secondi | Rispetto alla nostra tariffa |
|---|---|---|---|
| E2X | $0.09 | $0.72 | — |
| fal.ai | $0.10 | $0.80 | siamo il 10% più bassi |
| Runware | $0.10 | $0.80 | siamo il 10% più bassi |
| Google Gemini API | $0.1014 | $0.81 | siamo l'11% più bassi |
| Wavespeed AI | $0.13 | $1.04 | siamo il 31% più bassi |
La riga di Google è aritmetica sua, pubblicata sulla sua stessa pagina prezzi: $17.50 per milione di token di output, 5.792 token in un secondo di 720p, $0.1014 — ed è per questo che la nota a piè di pagina si assesta su "circa $0.10 al secondo." Ogni riga include il suono, quindi il confronto è alla pari. Questo modello non ha alcun interruttore per l'audio: dialogo e room tone nascono insieme all'immagine, e nessuno in quell'elenco li fattura a parte. Google pubblica la stessa tariffa per ogni risoluzione, sotto forma di conteggio token: 1.931 token al secondo in 360p, 5.792 in 720p, 8.688 in 1080p, 17.376 in 4K — audio incluso in tutte e quattro. La scala qui sotto confronta quindi pari con pari fino in cima.
Ci verifichi pure, ma legga la stringa di versione. fal.ai tiene due schede: una pagina google/gemini-omni-flash senza versione, che prezza i vecchi pesi di preview intorno a $0.125 al secondo, e una pagina v1.1 a $0.10. La nostra è la v1.1. Wavespeed merita la cautela opposta — $0.13 è confermato solo per la sua variante text-to-video, quindi le altre sue cifre restano fuori.
La tariffa 720p non è la metà interessante. Questa lo è:
| Risoluzione | E2X | fal.ai | Runware | Wavespeed | |
|---|---|---|---|---|---|
| 360p | $0.0297 | $0.0338 | $0.03 | $0.036 | $0.039 |
| 720p | $0.09 | $0.1014 | $0.10 | $0.10 | $0.13 |
| 1080p | $0.135 | $0.1520 | $0.15 | $0.16 | $0.195 |
| 4K | $0.18 | $0.3041 | $0.30 | $0.32 | $0.39 |
Il nostro moltiplicatore dal 720p al 4K è 2×. Quello di Google è esattamente 3× — i suoi conteggi token passano da 5.792 a 17.376 — e i rivenditori seguono Google. In basso le due scale hanno la stessa forma — 0,33× fino al 360p da entrambe le parti — e si separano man mano che si sale: arrivati al 4K, Google ha triplicato la sua tariffa 720p mentre noi l'abbiamo raddoppiata. Ecco perché restiamo sotto Google su tutti e quattro i livelli: dodici per cento in 360p, undici per cento in 720p e in 1080p, e quarantuno per cento in 4K. Anche Runware merita uno sguardo: alla pari con Google in 720p, poi $0.16 in 1080p e $0.32 in 4K, sopra la tariffa di Google in entrambi i casi. Una nota se ci verifica: la tabella dell'annuncio di Google arrotonda queste cifre a $0.03, $0.10, $0.15 e $0.30. Quelle qui sopra vengono dai suoi conteggi token per risoluzione, ed è su quelli che viene calcolata la fattura.
I prezzi e le condizioni dei prodotti possono cambiare nel tempo. Verifichi i prezzi aggiornati di ciascun provider prima di prendere una decisione d'acquisto. Il prezzo Google Batch o Flex non è direttamente equivalente a una request API on-demand standard, perché le condizioni di pianificazione, disponibilità ed elaborazione sono diverse; è quindi escluso da questo confronto. Si tratta di un confronto circoscritto a uno scenario d'uso specifico, non dell'affermazione che E2X sia l'opzione più economica al mondo in ogni configurazione.
A svuotare il conto è la ripetizione, non una generazione singola: il settimo tentativo costa quanto il primo.
Quattro secondi in 360p sono $0.1188; gli stessi quattro in 720p sono $0.36. Sei bozze economiche più un render alla risoluzione di default fanno $1.07, contro $2.52 per sette passaggi a prezzo pieno. Google sostiene che il 360p torni anche fino al 60% più in fretta — numero suo, non nostro.
| Durata | Bozza 360p | Render 720p |
|---|---|---|
| 4 s | $0.1188 | $0.36 |
| 6 s | $0.1782 | $0.54 |
| 8 s (default) | $0.2376 | $0.72 |
| 10 s | $0.297 | $0.90 |
Dieci secondi di 4K, a $0.18 al secondo, sono $1.80 — la fattura singola più alta di questa pagina.
Generi una key nella dashboard, la tenga fuori dal client e invii il job. prompt è l'unico campo obbligatorio.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/text-to-video",
"input": {
"prompt": "Una saldatrice abbassa la maschera, le scintille gettano luce blu sull'acciaio accatastato. Lenta carrellata a sinistra. Crepitio dell'arco, un ventilatore fuori campo.",
"resolution": "360p",
"duration": "6",
"seed": 20260828
}
}'
Quello è un passaggio di bozza: sei secondi in 360p, $0.1782. Porti resolution su 720p e costa $0.54.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/text-to-video",
input: { prompt: "La pioggia martella una pensilina dell'autobus di notte.", duration: "4" },
}),
}).then((r) => r.json());
for (let attempt = 0; attempt < 360; attempt++) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
const { status } = job.data;
if (status === "completed") { await archive(job.data.outputs[0].url); break; }
if (status === "failed" || status === "cancelled") throw new Error(status);
await new Promise((r) => setTimeout(r, 5000));
}
Metta in conto quattro minuti per job, oppure passi un webhookUrl. Due trappole: duration e resolution viaggiano come stringhe, "10" e non 10; e l'URL restituito scade, quindi copi il file da qualche parte in modo permanente nel momento stesso in cui lo legge. Ogni campo sta nella specifica leggibile dalle macchine.
Dal più economico:
| Modello | Da chiamare quando | 8 s in 720p |
|---|---|---|
| Veo 3.1 Fast text-to-video | Una clip sola, che sta in piedi da sé | $0.08 |
| Omni 1.1 Flash text-to-video | Dieci secondi, 4K, o un ciclo di bozze in 360p | $0.72 |
| Omni 1.1 Flash start-end-frame | Entrambi gli estremi esistono già | $0.72 |
| Omni 1.1 Flash reference-to-video | Un soggetto si ripete da una clip all'altra | $0.72 |
| Omni Flash text-to-video | Mai; Google lo ritira il 30 settembre 2026 | $0.66 |
Legga la prima riga contro la seconda. Nove volte il prezzo è tanto per una clip che nessuno monterà accanto a qualcos'altro; la continuità è ciò che il sovrapprezzo compra. Tutto il resto che trasforma un prompt in girato sta sotto text-to-video; tutti i modelli che facciamo girare stanno in una pagina sola.
L'output è fisso: 24 fps, da tre a dieci secondi, 16:9 o 9:16. Quel dieci conta, perché Veo si ferma a otto. La model card nomina tre modalità di fallimento:
"Mantenere una coerenza completa lungo tutte le modifiche, generare scene con movimenti complessi o restituire testo perfettamente accurato resta una sfida."
Il testo a schermo frega parecchia gente: chieda l'insegna di un negozio e si aspetti lettere che crollano appena le si guarda da vicino. Folle, acqua e mani sono i casi difficili di movimento.
SynthID marca ogni fotogramma in modo invisibile e nessuno può rimuoverlo. L'inglese è l'unica lingua di prompt che Google abbia valutato, e il 22 aprile 2026 Google ha fatto confluire Vertex AI nella Gemini Enterprise Agent Platform: è lì che il modello è elencato per i clienti enterprise.
Il modello ha le Sue parole e un seed; tutto quello che Lei non dice diventa una sua decisione. Descriva una sola inquadratura, mai una sequenza — tre momenti in otto secondi Le portano un brutto stacco o una macchia.
Fissi la macchina da presa. "Campo largo fisso", "lenta carrellata a sinistra", "inseguimento a mano". Una macchina non dichiarata va alla deriva.
Fissi la luce. Lampione al sodio, pomeriggio coperto, una sola luce pratica in campo. È l'illuminazione a separare un'inquadratura voluta da un render.
Fissi il suono. L'audio lo paga che lo avesse previsto o no, quindi nomini l'ambiente sonoro e qualsiasi battuta parlata — altrimenti il modello si inventa un tappeto che litiga con il Suo montaggio.
Poi tenga fermo il seed e cambi una clausola alla volta. La nostra guida al prompting per Gemini Omni va più a fondo.
$0.09 per ogni secondo di output in 720p — $0.72 per gli otto secondi di default, $0.90 al tetto dei dieci secondi. Uno sconto del 40% su una tariffa di listino di $0.15, verificato il 28 agosto 2026. Gli altri livelli: $0.0297 in 360p, $0.135 in 1080p, $0.18 in 4K, audio incluso.
Su tutti e quattro i livelli. Google fattura il video in token di output — $17.50 per milione, a 1.931 token al secondo per il 360p, 5.792 per il 720p, 8.688 per il 1080p e 17.376 per il 4K — che fanno $0.0338, $0.1014, $0.1520 e $0.3041 al secondo, audio incluso. La tabella dell'annuncio li arrotonda a $0.03, $0.10, $0.15 e $0.30; la fattura si calcola sulle cifre non arrotondate. Rispetto a questo siamo circa il dodici per cento più economici in 360p, l'undici per cento in 720p e 1080p, e il quarantuno per cento più economici in 4K. Entrambe le scale scendono al 360p con lo stesso passo di 0,33×; la differenza è in cima, dove Google triplica la sua tariffa 720p e noi raddoppiamo la nostra.
No — costa di più. Omni Flash text-to-video gira qui a $0.0825 al secondo contro $0.09 di questa pagina, quindi otto secondi costano $0.66 lì e $0.72 qui. Nove per cento di differenza. Il modello vecchio non ha il livello 360p e su E2X non ha mai pubblicato né image-to-video né start-end-frame-to-video: è lì che va la differenza. Chiamare Google direttamente è un'altra domanda: la sua tariffa pubblicata fa $0.1014 al secondo in 720p, quindi sia questa pagina sia quella più vecchia restano sotto. Lo scarto non è il prodotto che costa di più: tutti e tre stanno sullo stesso listino di $0.15, e a cambiare è lo sconto fisso — 40% qui contro 45% e 50% sulle pagine più vecchie.
Veo 3.1 Fast, quasi sempre — $0.01 al secondo sulla stessa API, quindi otto secondi costano $0.08 invece di $0.72. Torni qui quando la clip deve arrivare a dieci secondi, quando Le serve il 4K o quando deve reggere il confronto con altro girato.
All'iterazione. Quattro secondi in 360p sono $0.1188 contro $0.36 in 720p, quindi le riprese che butta via costano una frazione di quella che tiene.
Da tre a dieci secondi, a 24 fps. L'enum duration espone 4, 6, 8 e 10, come stringhe. I pezzi più lunghi nascono da più chiamate — ed è proprio per rendere sopportabile questa cosa che esistono le funzioni di continuità della 1.1.
Sì, su ogni riga di ogni confronto di questa pagina. Non esiste alcun interruttore per l'audio: dialogo e ambiente nascono insieme all'immagine, e nessun provider di quell'elenco li prezza a parte.
Di solito perché è un modello diverso. La scheda google/gemini-omni-flash di fal.ai, quella senza versione, prezza i pesi di preview deprecati intorno a $0.125 al secondo; la sua pagina v1.1 riporta $0.10, e la nostra tabella usa la v1.1. Controlli prima la versione e la data.