Gemini Omni 1.1 Flash è uscito oggi. La notizia è l'editing, non la generazione
Google ha reso gemini-omni-1.1-flash generalmente disponibile oggi. Legga l'elenco delle novità e una cosa salta all'occhio: quasi niente riguarda il fare una clip di otto secondi migliore.
L'estensione di scena che legge dieci secondi di contesto invece di uno. La possibilità di passare al modello un primo frame e un ultimo frame e fargli costruire quello che sta in mezzo. Clip di riferimento che portano un personaggio da un'inquadratura all'altra. Sono funzioni di continuità. Sono le cose che servono quando una clip non è il deliverable ma un suo pezzo, e spedirle tutte insieme è una dichiarazione di direzione più chiara di quanto sarebbe stata qualsiasi rivendicazione sulla qualità.

Cosa c'è davvero di nuovo
Il predecessore qui è Gemini Omni Flash — gemini-omni-flash-preview, in preview API dal 30 giugno 2026. Faccia attenzione ai nomi, perché internet li sta già sbagliando: non esiste alcun prodotto chiamato "Omni Flash 1.0". La stringa scritta da Google è "Gemini Omni 1.1 Flash", e la cosa che sostituisce si chiama semplicemente Gemini Omni Flash.
| Capacità | Gemini Omni Flash (preview) | Gemini Omni 1.1 Flash |
|---|---|---|
| Contesto per l'estensione di scena | Ultimo secondo della clip | Fino a 10 secondi di girato precedente |
| Lunghezza totale estesa | — | 40 secondi, costruiti in continuazioni da 3–10s |
| Primo e ultimo frame | — | Fornisce entrambi, il modello genera quello che sta in mezzo |
| Clip di riferimento | — | Fino a 3 clip, 3 secondi ciascuna |
| Risoluzioni | 720p | 360p, 720p, 1080p e 4K (le due più alte in upscaling) |
| Durata per generazione | 3–10 secondi | 3–10 secondi |
Il cambiamento sull'estensione è quello da leggere due volte. Un modello che vede solo l'ultimo frame di ciò che sta continuando non ha idea di cosa stesse facendo la camera, quindi le estensioni derivano — la luce si sposta, una giacca cambia colore, il dolly che si muoveva verso sinistra si ferma. Dieci secondi di contesto bastano a portare un movimento di macchina e un impianto luci attraverso la giuntura. Google descrive le continuazioni come segmenti da 3–10 secondi fino a un totale di 40 secondi, quindi la dimensione del blocco non è fissa: sta cucendo insieme pezzi di lunghezza variabile.
C'è anche una modalità 360p, che secondo Google gira fino al 60% più veloce a un terzo del costo del 720p. Quel dato viene dal blog di annuncio e non dalla documentazione API, quindi lo tratti come una dichiarazione del vendor e non come un numero misurato — ma la forma della cosa è evidentemente giusta, e un tier di bozza economico è esattamente quello che mancava al lavoro video iterativo.
Quanto costa direttamente da Google
L'output video viene fatturato a $17.50 per milione di token, e la nota sui prezzi di Google fa la conversione per Lei: 5.792 token per secondo di video 720p, "un prezzo effettivo di circa $0.10 al secondo." L'input è $1.50 per milione. Per l'output video non esiste un free tier.
Anche le altre risoluzioni sono pubblicate, solo da nessuna parte vicino a quella nota, ed è per questo che quasi nessuno le cita. L'annuncio di lancio di Google porta una tabella prezzi come immagine, e la sua pagina Cloud pricing porta la versione esatta sotto forma di frase: Omni fattura 1.931 token al secondo a 360p, 5.792 a 720p, 8.688 a 1080p e 17.376 a 4K. A $17.50 per milione fanno $0.0338, $0.1014, $0.1520 e $0.3041 al secondo. Guardi la forma più che le cifre — rispetto al 720p quei conteggi di token sono esattamente un terzo, uno, uno e mezzo e tre. Dal 720p al 4K la scala triplica, il che vale la pena ricordare quando viene la tentazione di renderizzare una prima passata a piena risoluzione.
Dieci centesimi al secondo meritano un momento di riflessione. Una sequenza da quaranta secondi, montata a partire dalle estensioni a 720p, è circa quattro dollari di output prima ancora di aver generato una singola take alternativa. Il pricing del video non è il pricing delle immagini, e le abitudini di iterazione che funzionano a una frazione di centesimo per immagine qui Le svuotano l'account.
Dove può chiamarlo oggi
- Gemini API (
generativelanguage.googleapis.com) — GA - Google AI Studio — GA
- Gemini Enterprise Agent Platform — per l'accesso API enterprise
- Google Flow — per gli abbonati AI Plus, Pro e Ultra
- App Gemini — estensione di scena per Plus, Pro e Ultra
Non su Vertex AI. Le sue release notes non menzionano Omni da nessuna parte, e l'annuncio di Google indirizza gli utenti enterprise all'Agent Platform. Se ha letto il contrario, quella pagina sta tirando a indovinare.
Sotto tutto questo c'è una voce con una data: l'endpoint di preview gemini-omni-flash-preview è programmato per la deprecazione il 30 settembre 2026. Qualsiasi cosa abbia costruito sulla preview durante l'estate ha circa un mese di autonomia.

Le specifiche, tutte in un posto
L'output per generazione va da 3 a 10 secondi a 24 FPS, in 16:9 o 9:16 — sono gli unici due aspect ratio, quindi le inquadrature quadrate e in cinema verticale sono escluse. L'audio è generato nativamente insieme all'immagine, e non può caricare un riferimento audio per guidarlo. Qualsiasi video fornisca per l'editing o l'estensione deve essere di 10 secondi o meno.
Ogni frame porta SynthID, il watermark di provenienza invisibile di Google. È impercettibile per chi guarda e non può essere disattivato da nessun provider, il che conta solo se ha un contratto che vieta deliverable con watermark.
Nella model card Google è anche onesta su ciò che ancora non funziona:
"Mantenere una coerenza completa lungo tutte le modifiche, generare scene con movimento complesso o rendere testo perfettamente accurato resta una sfida."
La legga accanto all'elenco delle funzioni ed è una tensione utile. Le aggiunte di punta sono funzioni di coerenza; la model card dice che la coerenza è ancora la parte difficile. Entrambe le cose sono vere, e un post di lancio che citasse solo la prima Le starebbe vendendo qualcosa.
Una capacità è trattenuta deliberatamente. Il modello sa alterare il parlato registrato, e Google ha scelto di non rilasciarlo:
"Gemini Omni Flash è in grado di modificare il parlato delle persone. Per ora stiamo limitando questa capacità e stiamo lavorando per capire meglio come portarla ai nostri utenti in modo sicuro e responsabile."
Ci sono anche limiti regionali: in SEE, Svizzera e Regno Unito non può caricare o modificare immagini che contengono minori o certe persone riconoscibili.
Cosa significa su E2X
Avevamo detto che su questo non avremmo messo una data. È arrivato il giorno dopo. Gemini Omni 1.1 Flash è andato live su E2X il 28 agosto 2026, con tutte e quattro le sue capability chiamabili attraverso la stessa forma di endpoint di ogni altra cosa nel catalogo.
Un solo prezzo copre tutte e quattro: $0.09 al secondo a 720p per text-to-video, image-to-video, start-end-frame-to-video e reference-to-video, verificati il 28 agosto 2026. Durate di 4, 6, 8 e 10 secondi, a 360p, 720p, 1080p o 4K — $0.0297 al secondo sul tier di bozza, $0.18 a 4K. Le due centrali sono una novità qui: su questa piattaforma la generazione precedente ha sempre offerto solo text-to-video e reference-to-video, quindi animare un fermo immagine e interpolare tra un primo e un ultimo frame sono entrambe capability inedite per questa famiglia.
Metta quel dato accanto ai prezzi al secondo di Google e la differenza è in realtà una differenza di moltiplicatori. Salendo, Google applica $0.0338, $0.1014, $0.1520 e $0.3041; noi applichiamo $0.0297, $0.09, $0.135 e $0.18. Le due scale partono con la stessa forma — a 360p un terzo della tariffa 720p, a 1080p una volta e mezza — e poi si separano in cima, dove Google triplica e noi raddoppiamo. Questo ci lascia sotto Google a ogni gradino: circa il 12 per cento a 360p, l'11 a 720p e 1080p e il 41 a 4K. Quello che il prezzo compra in più è un'unica superficie API e un solo set di credenziali valido su ogni modello del nostro catalogo, il che vale qualcosa senza essere la pretesa di essere i più economici in ogni configurazione.
L'opzione davvero economica sta lì accanto, e la maggior parte dei lettori dovrebbe guardare prima quella. Veo 3.1 Fast text-to-video costa $0.01 al secondo — un nono di Omni 1.1 Flash. È anche l'unico dato di questa pagina che non è in bilico: la tabella di Google stessa prezza Veo 3.1 Fast a $0.10 al secondo a 720p, quindi lo stesso modello qui costa un decimo di quanto costa lì. Per una semplice inquadratura text-to-video senza editing, senza estensione e senza continuità di personaggio, il premio di nove volte rispetto a lui Le compra pochissimo. Preferiremmo che spendesse un dollaro invece di nove e tornasse.
Dove Omni si guadagna la differenza è esattamente dove puntano le funzioni della 1.1: continuazione, controllo del primo e dell'ultimo frame, e trasporto di un soggetto da un'inquadratura all'altra. Se il Suo lavoro è una clip alla volta, Veo 3.1 Fast è la scelta migliore, e copre anche i job di image-to-video, reference-to-video e start-and-end-frame.
I prezzi e le condizioni di prodotto possono cambiare. Verifichi il pricing corrente di ogni provider prima di prendere una decisione d'acquisto. Questo è un confronto circoscritto, non l'affermazione che E2X sia l'opzione più economica in ogni configurazione.
Cosa fare questa settimana
Se era sull'endpoint di preview, metta in calendario la data del 30 settembre e si muova. Se sta scegliendo un modello video per la prima volta, parta da Veo 3.1 Fast a un centesimo al secondo e salga solo quando un lavoro ha davvero bisogno di continuità. E se preferisce confrontare schemi invece di leggere prosa, ogni modello pubblica una spec leggibile da macchina — quella di Omni 1.1 Flash elenca ogni parametro, vincolo e prezzo corrente.
Sfogli il resto per job da text-to-video o reference-to-video.
Domande frequenti
Che cos'è Gemini Omni 1.1 Flash?
Gemini Omni 1.1 Flash è il modello di generazione ed editing video di Google, reso generalmente disponibile il 27 agosto 2026 con l'id API gemini-omni-1.1-flash. Genera clip da 3 a 10 secondi a 24 FPS con audio nativo, e aggiunge funzioni di editing che al suo predecessore mancavano: estensione di scena fino a 40 secondi, interpolazione tra primo e ultimo frame, e clip di riferimento per la coerenza dei personaggi.
Quando è stato rilasciato Gemini Omni 1.1 Flash?
Il 27 agosto 2026, come modello generalmente disponibile e non come preview. Il changelog dell'API di Google lo registra come "Gemini Omni Flash generally available (GA): Released gemini-omni-1.1-flash". Il modello di preview precedente, gemini-omni-flash-preview, era disponibile dal 30 giugno 2026 ed è programmato per la deprecazione il 30 settembre 2026.
Esiste una Omni Flash 1.0?
No. Google non ha mai rilasciato un prodotto chiamato Omni Flash 1.0. Il modello che precede Gemini Omni 1.1 Flash si chiama Gemini Omni Flash, ha l'id API gemini-omni-flash-preview, ed era un rilascio in preview. Le pagine che descrivono una "Omni Flash 1.0" si stanno inventando un numero di versione che non esiste.
Quanto costa Gemini Omni 1.1 Flash?
Chiamando Google direttamente, l'output video viene fatturato a $17.50 per milione di token, con l'input a $1.50 per milione e nessun free tier per il video. La pagina Cloud pricing di Google indica il costo in token di un secondo a ogni risoluzione — 1.931 a 360p, 5.792 a 720p, 8.688 a 1080p e 17.376 a 4K — il che fa $0.0338, $0.1014, $0.1520 e $0.3041 al secondo. Su E2X gli stessi tier costano $0.0297, $0.09, $0.135 e $0.18, il che porta la clip predefinita da otto secondi a 720p a $0.72.
Quanto può durare un video di Gemini Omni 1.1 Flash?
Una singola generazione produce da 3 a 10 secondi. Usando l'estensione di scena può arrivare a un totale di 40 secondi, aggiungendo continuazioni da 3 a 10 secondi a una clip esistente. Qualsiasi video fornisca in input per l'editing o l'estensione deve a sua volta essere di 10 secondi o meno.
Posso usare Gemini Omni 1.1 Flash su Vertex AI?
Non al 27 agosto 2026. Le release notes di Vertex AI non menzionano la famiglia Omni. L'annuncio di Google indirizza gli utenti API enterprise alla Gemini Enterprise Agent Platform, e il modello è disponibile anche tramite la Gemini API, AI Studio, Flow e l'app Gemini.
Gemini Omni 1.1 Flash è disponibile su E2X?
Sì, dal 28 agosto 2026, su tutte e quattro le capability: text-to-video, image-to-video, start-end-frame-to-video e reference-to-video. Costa $0.09 al secondo a 720p, con $0.0297 a 360p, $0.135 a 1080p e $0.18 a 4K, e durate di 4, 6, 8 e 10 secondi. Questo sta sotto il prezzo al secondo di Google su ogni tier — circa il 12 per cento a 360p, l'11 per cento a 720p e 1080p e il 41 per cento a 4K. L'audio è generato in modo nativo e non può essere disattivato. Per clip singole senza esigenze di editing o continuità, Veo 3.1 Fast a $0.01 al secondo resta di solito il rapporto migliore.