Loading...
Loading...
Generate smooth video transitions between two key frames with Gemini Omni 1.1 Flash. Provide a start frame, an end frame and a text prompt to guide the in-between motion.
Accedi per eseguire i modelli
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/start-end-frame-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Costo stimato per generazione in base a durata e risoluzione. Paghi solo per ciò che esegui.
Gemini Omni 1.1 Flash è il gemini-omni-1.1-flash di Google, GA dal 27 agosto 2026 e modello della famiglia Gemini più che un Veo. Facciamo girare la sua capability a due fotogrammi come google/omni-1.1-flash/start-end-frame-to-video e fatturiamo al secondo di output — $0.09 in 720p, uno sconto fisso del 40% sulla tariffa di listino di $0.15. La clip di default da otto secondi è $0.72.
Entrano tre campi: un fotogramma iniziale, un fotogramma finale, un prompt. La Sua prima immagine diventa il primo fotogramma, la seconda l'ultimo, tutto ciò che sta in mezzo viene inventato. Non è la richiesta di una clip ma di un ponte, e un ponte vale quanto valgono le sue due sponde.
Anche questa è una novità — la generazione Omni Flash precedente è uscita senza, la prova più semplice della tesi che sosteniamo nel nostro resoconto sull'uscita della 1.1. Un rilascio di continuità, non di qualità.
Le nostre tariffe, verificate il 28 agosto 2026:
| Durata | 360p | 720p | 1080p | 4K |
|---|---|---|---|---|
| 4 s | $0.1188 | $0.36 | $0.54 | $0.72 |
| 6 s | $0.1782 | $0.54 | $0.81 | $1.08 |
| 8 s (default) | $0.2376 | $0.72 | $1.08 | $1.44 |
| 10 s | $0.297 | $0.90 | $1.35 | $1.80 |
Il 1080p e il 4K sono ottenuti in upscaling, non nativi.
Il tweening è il modello mentale sbagliato. Uno strumento di tweening sfuma il pixel A verso il pixel B. Questo modello legge entrambe le immagini, decide quale evento abbia plausibilmente portato la scena dall'una all'altra, e renderizza quello — audio compreso, generato nativamente dallo stesso prompt. Nessun campo has_sound, nessun interruttore per il muto.
A 24 fps un ponte da quattro secondi è novantasei fotogrammi, due dei quali li ha forniti Lei. Gli altri novantaquattro sono una tesi sulla fisica, sostenuta che regga o meno. L'inquadratura è 16:9 o 9:16; metta in conto quattro minuti per job.
Tre domande risolvono la coppia. Stesso soggetto? Non simile — lo stesso. Stessa luce? Direzione della chiave, temperatura colore, contrasto. Una macchina da presa avrebbe potuto fare quel movimento? Se non riesce a dirlo in una frase che un operatore seguirebbe, non ci riesce nemmeno il modello.
Quando la risposta è no, non va in errore niente — il modello tampona il vuoto, in quattro forme:
Una clip che non può usare costa quanto una che può usare.
A $0.0297 al secondo un test da quattro secondi in 360p è $0.1188; il finale da otto secondi in 720p è $0.72, cinque volte tanto. E il 360p, troppo piccolo per giudicare un volto, va benissimo per giudicare quello che c'è in mezzo. Uno stacco è uno stacco a qualsiasi risoluzione. Un morphing è un morphing. Google sostiene inoltre che quel livello giri fino al 60% più in fretta — parole del blog di lancio, non un numero dalla documentazione API.
È questo a rendere lo storyboard economico da iterare. Due key frame per ogni beat, la scaletta lanciata a quattro secondi e 360p, riprodotta come animatic — dodici beat per circa $1.73. I fallimenti sono quasi sempre un problema di coppia di fotogrammi, che si risolve ridisegnando una tavola invece di riscrivere il prompt cinque volte. Renderizzi solo i sopravvissuti. Veo 3.1 Fast start-end-frame-to-video non ha alcun livello per le bozze.
duration accetta 4, 6, 8 o 10, come stringa. Ogni secondo costa uguale, quindi sembra una manopola di budget. È una manopola di regia.
Gli stessi due fotogrammi a quattro secondi e a dieci sono due inquadrature diverse. Quattro forzano il transito — la macchina si impegna, resta poco spazio per inventare. Dieci vanno riempiti, e il modello troverà da sé il riempitivo: una deriva, un tempo sospeso, un secondo gesto. Quel movimento inventato è l'output meno prevedibile che c'è qui.
Faccia coincidere la durata con la distanza: due angolazioni di prodotto a trenta gradi l'una dall'altra, tirate a dieci secondi, comprano un rallentamento e del vuoto. Dieci è il tetto di Omni ed è un vantaggio vero — Veo si ferma a otto.
Generi una key, la tenga lato server, invii il job. prompt, start_frame_url e end_frame_url sono obbligatori, e le due immagini le scarichiamo noi, quindi ciascun URL deve rispondere a una request non autenticata.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/start-end-frame-to-video",
"input": {
"prompt": "La camera compie un arco verso destra attorno alla macchina per l'espresso mentre il vapore sale. Ronzio del macinacaffè, chiacchiericcio da bar.",
"start_frame_url": "https://example.com/07a-left.jpg",
"end_frame_url": "https://example.com/07b-right.jpg",
"duration": "6",
"resolution": "360p"
}
}'
Faccia polling sul job id, oppure passi un webhookUrl:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/start-end-frame-to-video",
input: {
prompt: "Una lenta discesa in gru dal parapetto sul tetto al tavolo nel cortile. Un unico movimento continuo.",
start_frame_url: "https://example.com/12a-roof.jpg",
end_frame_url: "https://example.com/12b-courtyard.jpg",
duration: "10",
resolution: "720p",
},
}),
}).then((r) => r.json());
let url = null;
while (!url) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") url = job.data.outputs[0].url;
else if (["failed", "cancelled"].includes(job.data.status))
throw new Error(job.data.error?.message ?? job.data.status);
else await new Promise((r) => setTimeout(r, 5000));
}
Lo stato passa per pending, processing, completed, oppure si ferma su failed/cancelled. Due trappole nello schema: duration e resolution sono stringhe, e i campi si chiamano start_frame_url ed end_frame_url, non il singolare image_url usato altrove. I valori aggiornati stanno nella specifica leggibile dalle macchine.
Veo 3.1 Fast fa lo stesso lavoro per un nono dei soldi:
| Endpoint | 8 s in 720p | Da scegliere quando |
|---|---|---|
| Veo 3.1 Fast start-end-frame-to-video | $0.08 | I fotogrammi si collegano e otto secondi bastano |
| Omni 1.1 Flash start-end-frame-to-video | $0.72 | Le servono dieci secondi, il 4K, o un passaggio di bozza |
| Omni 1.1 Flash image-to-video | $0.72 | È fissato un solo estremo dell'inquadratura |
| Omni 1.1 Flash reference-to-video | $0.72 | Un soggetto deve restare sé stesso lungo molte inquadrature |
| Omni 1.1 Flash text-to-video | $0.72 | Non esiste alcun fotogramma di partenza |
I prezzi e le condizioni dei prodotti possono cambiare nel tempo. Verifichi i prezzi aggiornati di ciascun provider prima di prendere una decisione d'acquisto. Il prezzo Google Batch o Flex non è direttamente equivalente a una request API on-demand standard, perché le condizioni di pianificazione, disponibilità ed elaborazione sono diverse; è quindi escluso da questo confronto. Si tratta di un confronto circoscritto a uno scenario d'uso specifico, non dell'affermazione che E2X sia l'opzione più economica al mondo in ogni configurazione.
Parta da Veo. Torni qui quando il suo muro degli otto secondi Le sta fra i piedi, quando la consegna è in 4K, o quando un passaggio di bozza fa risparmiare più di quanto costa. Il resto sta sotto image-to-video e text-to-video, e l'intero catalogo modelli sta in una pagina sola.
Descriva il transito, non lo scenario — il modello vede già entrambi gli estremi. Nomini il movimento che li collega ("arco verso destra", "discesa in gru", "cambio fuoco sulla finestra in fondo"), poi dica come deve suonare — l'audio nasce da quella stessa riga. Non chieda eventi che nessuno dei due fotogrammi lascia intuire. Altro vocabolario di macchina sta nella nostra guida al prompting per Omni; l'inglese è l'unica lingua di prompt valutata.
Tre cose prima che questo finisca davanti a un cliente. Ogni fotogramma porta SynthID, il marcatore di provenienza invisibile di Google, e nessun provider può rimuoverlo. La model card di Google è netta: "mantenere una coerenza completa lungo tutte le modifiche, generare scene con movimenti complessi o restituire testo perfettamente accurato resta una sfida" — e il movimento complesso è esattamente ciò che chiede un ampio salto fra i fotogrammi. Nello SEE, in Svizzera e nel Regno Unito non può caricare immagini che contengano minori o certe persone riconoscibili — un limite sui Suoi input. Gli URL dei risultati sono temporanei: li ri-ospiti nell'handler di completamento.
Facciamo pagare $0.09 per ogni secondo di output in 720p, quindi una clip da otto secondi è $0.72 e il massimo da dieci secondi $0.90 — il 40% in meno su una tariffa di listino di $0.15. La risoluzione moltiplica, e così una bozza da quattro secondi in 360p è $0.1188 e un render da dieci secondi in 4K $1.80. Verificato il 28 agosto 2026.
Stesso soggetto, stesso impianto di luce e un movimento di macchina che potrebbe fisicamente andare dall'uno all'altro nel tempo richiesto. Due fermi immagine dello stesso shooting, a pochi minuti di distanza, funzionano quasi sempre. Fotogrammi ripresi in condizioni diverse costringono il modello a risolvere la differenza sullo schermo.
Non va in errore niente. Riceve una clip che nasconde il vuoto in quattro modi possibili: uno stacco inventato, un morphing attraverso una geometria impossibile, uno sbalzo di luce, o figure che compaiono in dissolvenza dal nulla. Tutte costano quanto un render riuscito, ed è per questo che la bozza da $0.1188 si ripaga da sola.
Prima Veo 3.1 Fast, nella maggior parte dei casi — fa fotogramma iniziale e finale a $0.01 al secondo contro i nostri $0.09, quindi otto secondi costano $0.08 e non $0.72. Omni si guadagna la differenza in tre punti: la durata da dieci secondi, l'output in 4K e il livello di test in 360p.
Da tre a dieci secondi per chiamata. L'enum duration porta 4, 6, 8, 10, tutti come stringhe. Dieci è il tetto duro, e qualsiasi cosa più lunga si cuce insieme da più job.
Sì. Entrambi vengono scaricati lato server, quindi ciascuno deve rispondere a una request non autenticata finché il job non finisce. URL firmati a vita breve, bucket privati, indirizzi localhost e data URI falliscono.
Sì — ogni fotogramma è marcato con SynthID, il segnale di provenienza impercettibile di Google, invisibile agli spettatori e verificabile con i suoi strumenti. Nessun provider può disattivarlo. Chiarisca la questione con il Suo cliente se un contratto vieta gli asset IA etichettati.