Torna al Blog

Le scene da 40 secondi di Gemini Omni 1.1 Flash sono quattro fatture separate

E2X Team··15 min di lettura
gemini-omnigooglevideo-generationpricingapi

Il numero in ogni titolo di questa settimana è quaranta. Scene da quaranta secondi dal nuovo modello video di Google — che suona come se scrivesse un prompt e Le tornassero indietro quaranta secondi.

Non è così. Una singola chiamata a gemini-omni-1.1-flash restituisce da tre a dieci secondi. Quaranta è dove arriva estendendo quella clip altre tre volte — quattro lavori in tutto, ognuno fatturato a parte. Nessuno ha mentito — l'annuncio di Google descrive le continuazioni in modo chiaro — ma il numero ha fatto molta strada da quella frase, ed è arrivato a un sacco di gente come una cifra per singola generazione.

Questo è il briefing che vorremmo avere prima di mettere giù una carta: quanto costano quaranta secondi, a cosa serve il tier a 360p, e i vincoli sepolti nella documentazione — uno dei quali blocca gli sviluppatori europei fuori dalla funzione di punta, del tutto.

Quattro ciak di ottone appoggiati uno dopo l'altro in fila su ardesia scura, ciascuno leggermente disallineato così che le giunture tra loro restino visibili

Quaranta secondi sono quattro lavori, e quattro fatture

I modelli video fatturano al secondo di output, e l'estensione non ha nessuno sconto — una continuazione costa quanto una generazione nuova, quindi quaranta secondi si prezzano come quattro clip da dieci secondi. A ogni tier:

RisoluzioneSu E2XDiretto da Google
360p$1.19$1.35
720p$3.60$4.06
1080p$5.40$6.08
4K$7.20$12.16

Quattro volte dieci secondi a ciascuna tariffa al secondo. I nostri vengono dal catalogo live; le pagine dei modelli portano la cifra corrente se questa dovesse invecchiare.

Quella colonna di Google merita una parola, perché le tariffe sono inaspettatamente difficili da trovare. Due pagine ufficiali portano la scala completa e una ricerca testuale non ne prende nessuna delle due. Nell'annuncio di lancio i prezzi stanno dentro un'immagine — leggibili da un umano, invisibili al Ctrl-F. Sulla pagina Cloud pricing compaiono come token al secondo contro un contatore da $17.50 per milione, quindi non sembrano prezzi finché non moltiplica. La pagina che aprirebbe per prima, la documentazione dei prezzi API, dà un gradino su quattro: "un prezzo effettivo di circa $0.10 al secondo" a 720p.

Le due concordano, con una piega di arrotondamento — l'annuncio mostra un ordinato $0.03 / $0.10 / $0.15 / $0.30, la matematica dei token atterra un po' sopra ciascuno. La fatturazione segue i token, quindi anche la colonna qui sopra lo fa; il post di lancio ha il conto tier per tier.

Cinque dollari e quaranta per quaranta secondi di 1080p, sei e spiccioli da Google. Questo è il prezzo di listino prima di una sola ripresa alternativa — e le farà, perché è nell'ultima estensione che si vede la deriva. Metta a budget il taglio che tiene più i due che cestina e una sequenza finita da quaranta secondi fa sedici dollari, non cinque.

La riga del 360p era quella che perdevamo, e fino a poco fa lo scrivevamo qui. È cambiata: il nostro tier di bozza ora è $0.0297 al secondo contro i $0.0338 di Google, il dodici per cento sotto. Non ci legga troppo dentro. fal sta a $0.03 — uno scarto dell'uno per cento, rumore statistico travestito da vittoria, e il genere di cosa che si ribalta quando qualcuno modifica un moltiplicatore. Il flusso di lavoro con le bozze qui sotto regge da chiunque lo compri; non è mai dipeso dal fatto che il prezzo fosse il nostro.

Il vero salto della 1.1 è la memoria, non la durata

La durata era grossomodo raggiungibile già prima. Quello che la rende usabile è ciò che il modello vede quando continua.

La preview di giugno leggeva l'ultimo secondo della clip che stava estendendo. Un secondo Le dice cosa c'è in campo e quasi niente su cosa stava succedendo, quindi le estensioni andavano alla deriva. La ripresa in movimento smetteva di seguire. Una giacca cambiava di una sfumatura. La luce si ricostruiva a ogni giunzione.

Gemini Omni 1.1 Flash legge fino a dieci secondi del girato precedente. Dieci secondi bastano per sapere che il carrello era ancora in movimento, da che lato veniva la luce principale e più o meno di che colore era il cappotto — ed è per questo che ora una sequenza in quattro parti sta insieme. Se qualcuno Le dice che la funzione di punta della 1.1 è la durata, ha capito al contrario. La durata era aritmetica. La memoria è il modello.

1080p e 4K sono upscale, non render

Una parentesi nella documentazione di Google cambia ciò per cui dovrebbe pagare. Dalla reference del modello, alla lettera: "1080p output (upscaled)" e "4K output (upscaled)". Il modello renderizza sotto quelle risoluzioni e poi scala verso l'alto. La cima della scala non è più dettaglio — è un file più grande che porta la stessa informazione.

Il che ricolora la riga del 4K qui sopra. Dodici dollari e spiccioli, da Google, per quaranta secondi di output upscalato. Se una specifica cliente pretende dimensioni 4K, li paghi. Se ha scelto il 4K pensando che si veda meglio, sta pagando esattamente il triplo della tariffa 720p di Google per un ridimensionamento che potrebbe fare in ffmpeg.

Abbozzi a 360p, finisca a 720p

Questa è la parte che fa risparmiare, e nessuno l'ha messa in un titolo.

Il 360p qui costa $0.0297 al secondo — una bozza da quattro secondi è dodici centesimi, contro $0.36 a 720p e $0.54 a 1080p. Google sostiene anche che il 360p vada fino al 60% più veloce, un numero del fornitore e non uno che abbiamo misurato noi, anche se la direzione è evidentemente giusta.

Ora l'aritmetica. Diciamo che un'inquadratura richieda dieci tentativi prima che il movimento sia giusto — realistico per qualsiasi cosa con un movimento di camera specifico.

  • Dieci passate dritte a 1080p → $5.40
  • Dieci passate a 360p → $1.19, poi una vincitrice ri-renderizzata a 1080p → $1.73

Sessantotto per cento in meno, per una generazione in più alla fine. Sia onesto su cosa può dirLe una passata a 360p: composizione, movimento di camera, se il modello ha infilato stacchi che non ha mai chiesto. La texture fine non la può giudicare — non c'è abbastanza risoluzione per portarla.

Ecco lo stesso prompt a entrambi i tier, stesso seed, quattro secondi ciascuno. Prima la bozza:

Poi il render a 720p dello stesso identico prompt e seed:

Entrambi mostrano un cronometro d'ottone su ardesia scura, camera in carrello da sinistra, una luce calda che raschia il metallo. Il prompt per entrambi, alla lettera:

Editorial slow-motion macro shot of a brass mechanical stopwatch resting on a dark slate table, its second hand sweeping forward in a single continuous shot with no scene cuts. Camera performs a slow dolly in from the left, shallow depth of field, one warm amber key light raking across the metal, cool blue rim light behind. Fine dust drifts through the beam. Clean dark background, no text, no logos, no people. Sound design: a soft mechanical tick and low room tone, nothing else.

(Il prompt è lasciato in inglese: il modello è stato valutato solo per l'inglese.)

Dodici centesimi contro trentasei. La bozza ci ha detto che il carrello si legge e che il modello ha tenuto una sola inquadratura — tutto quello che ci serviva prima di impegnarci. Faccia girare il Suo ciclo laggiù.

L'estensione va solo in avanti

L'estensione di scena accoda, e la forma di quel limite decide come pianifica una sequenza. Non può inserire nel mezzo di una clip. Non può estendere all'indietro per costruire un'introduzione. Non esiste un "tieni il finale, ricostruisci i primi quattro secondi" — la capability va in una direzione sola. Se l'inquadratura tre è sbagliata, tutto quello che sta a valle finisce nel cestino con lei.

Quindi carichi lo sforzo all'inizio. La prima generazione fissa linguaggio di camera, palette e illuminazione per tutto quello che segue, ed è l'unico segmento che può rivedere a poco prezzo. Alla terza estensione è profondo quattro lavori senza modo di tornare indietro.

C'è un'altra cosa che l'estensione non fa. Le dia un video di qualcuno che parla, chieda un dialogo nuovo, e rifiuta — Google limita la modifica del parlato. La stampa di lancio lo legge come una scelta deliberata di rilascio responsabile più che come una funzione mancante; quell'inquadramento è del giornalista, ma la restrizione è nella documentazione. Non costruisca un prodotto di doppiaggio su questo modello.

Sviluppatori europei, legga questa riga due volte

Sepolta nella documentazione come una singola frase: nello Spazio economico europeo, in Svizzera e nel Regno Unito, modificare ed estendere un video caricato non è disponibile.

Non è una restrizione morbida. La funzione di punta — prendi del girato, continualo — non funziona nella maggior parte d'Europa. Text-to-video e image-to-video girano comunque. Ma se il piano era uno strumento che estende le clip caricate dai Suoi utenti, e quegli utenti stanno a Berlino o a Manchester, il piano è morto e l'annuncio non lo menziona mai.

Lo verifichi rispetto alla Sua region di deployment prima di scrivere una riga di codice di integrazione. È la voce più costosa qui dentro da scoprire tardi.

Le manopole che non esistono

Arrivando da un modello di testo, cercherà parametri che qui non ci sono. La documentazione di Google segna l'intera superficie di campionamento come non supportata: niente temperature, niente top_p, niente istruzioni di sistema, niente stop sequence, niente negative prompt. Niente di niente.

La Sua unica superficie di controllo è il prompt stesso, e la documentazione di terze parti mette il tetto a 40.000 caratteri — parecchia corda, anche se quella cifra non l'abbiamo trovata nella reference di Google. Tutto quello che normalmente farebbe con un parametro di campionamento va invece scritto in inglese. Se vuole sapere come scrivere bene quell'inglese, abbiamo trattato la sintassi dei prompt in un post a parte, inclusa la struttura a tag e il problema degli stacchi di scena, e non ha senso ripeterlo qui.

Un'avvertenza. La documentazione di schema di terze parti per questo modello elenca temperature e top_p come campi accettati, mentre la reference di Google dice che non sono supportati. Non Le diremo quale sia giusta — Le stiamo dicendo che le due si contraddicono. Non progetti intorno a quei parametri sulla forza di una voce di schema; prima verifichi se cambiano qualcosa.

Un suono che non può spegnere, un inglese da cui non può uscire

L'audio è generato in modo nativo con ogni clip e non c'è un interruttore per spegnerlo. Nessun parametro, nessun flag, nessuna modalità silenziosa. Lo può guidare — una frase Sound design: fa un lavoro reale — ma non lo può rifiutare. Per un embed su un blog significa mettere il muto nel player, che è quello che fanno entrambe le clip qui sopra.

Non può nemmeno fornire audio come reference, modificare l'audio generato dopo, o conservare l'audio di un video che carica per l'estensione. Tutte e tre sono aspettative ragionevoli. Nessuna è supportata.

Il supporto linguistico è più stretto di quanto suggerisca il marketing: l'inglese è l'unica lingua pienamente supportata. Il giapponese e le altre sono documentate come non valutate — un modo prudente di dire che i risultati sono imprevedibili. Se i Suoi prompt o dialoghi non sono in inglese, metta a budget delle sorprese.

Conosca i limiti sulle reference prima di progettare una pipeline di input. Reference video: fino a tre clip, tre secondi ciascuna, e Google avverte che fornirne diverse insieme può degradare i risultati — tratti tre come un tetto, non come un obiettivo. Le proporzioni sono 16:9 o 9:16, anch'esse di Google. Due numeri citati accanto a quelli non lo sono: il frame rate di 24 fps e l'intervallo da uno a sette immagini per reference-to-video vengono entrambi da documentazione di schema di terze parti. Ogni fotogramma porta un watermark SynthID, e non abbiamo trovato un provider che esponga un interruttore per toglierlo.

Prima di spendere qualsiasi cosa, faccia questo

Quattro controlli, in ordine. Il primo uccide più integrazioni di tutti gli altri messi insieme.

  1. Confermi la Sua region. Se sta nello Spazio economico europeo, in Svizzera o nel Regno Unito e il Suo prodotto estende video caricati, si fermi qui. Questo modello non può fare quel lavoro per Lei.
  2. Prezzi la sequenza, non la clip. Moltiplichi per le estensioni, poi per le riprese che farà davvero. Quaranta secondi di 1080p sono $5.40 qui nel caso migliore, realisticamente il triplo una volta contate le ripetizioni.
  3. Si chieda se Le serve Omni. Un secondo di Veo 3.1 Fast qui costa un centesimo, contro i nove di Omni a 720p. Una sola inquadratura, nessuna continuazione, nessuna interpolazione di frame, nessuno che debba avere lo stesso aspetto due clip più avanti — allora quel multiplo è denaro dato alle fiamme.
  4. Costruisca il Suo ciclo sul tier di bozza. Itera a 360p, promuova la vincitrice. Il sessantotto per cento non è un errore di arrotondamento.

Omni si guadagna il multiplo esattamente dove puntano le funzioni della 1.1: continuare un'inquadratura, interpolare tra un primo e un ultimo frame, animare un fermo immagine, o portare un soggetto attraverso gli stacchi. Fuori da lì, è un modo costoso di comprare una clip.

Gli altri angoli stanno qui accanto: cosa è uscito davvero il giorno del lancio, cosa dicono e cosa non dicono le classifiche — i ranking dell'arena che girano questa settimana appartengono al modello precedente — e uno spaccato dei prezzi piattaforma per piattaforma. Schemi e prezzi live stanno nel catalogo.

Prezzi e condizioni di prodotto cambiano. Verifichi i prezzi correnti di ogni provider prima di prendere una decisione d'acquisto.

Domande frequenti

Gemini Omni 1.1 Flash può davvero fare video da 40 secondi?

Sì, ma non in una sola chiamata. Una singola generazione restituisce da 3 a 10 secondi. Quaranta secondi sono il totale cumulativo a cui arriva estendendo una clip esistente altre tre volte — quattro lavori — e ogni estensione è fatturata a parte alla stessa tariffa al secondo di una generazione nuova. Su E2X una sequenza da 40 secondi a 1080p costa $5.40, contro $6.08 chiamando Google direttamente.

Quanto costa una sequenza Gemini Omni da 40 secondi?

Moltiplichi 40 secondi per la tariffa al secondo della Sua risoluzione; le estensioni non hanno sconti. Su E2X fa $1.19 a 360p, $3.60 a 720p, $5.40 a 1080p e $7.20 a 4K. Direttamente da Google, lavorando dalle sue tariffe pubblicate in token al secondo, le stesse durate costano $1.35, $4.06, $6.08 e $12.16. Aggiunga le riprese scartate e si aspetti dalle due alle tre volte la cifra da titolo.

L'output 4K di Gemini Omni 1.1 Flash è vero 4K?

No. La documentazione di Google etichetta sia il tier 1080p sia il 4K come "upscaled" — il modello renderizza più in basso e poi scala il risultato. Il file ha dimensioni 4K; l'immagine non porta dettaglio 4K. A meno che una specifica di consegna non richieda quelle dimensioni, la tariffa del tier più alto compra un ridimensionamento e non più informazione.

Posso usare Gemini Omni 1.1 Flash nell'UE?

In parte. Text-to-video e image-to-video funzionano, ma modificare o estendere un video caricato non è disponibile nello Spazio economico europeo, in Svizzera e nel Regno Unito. Dato che l'estensione è la capability di punta, questo blocca qualsiasi prodotto europeo costruito intorno alla continuazione di girato fornito dagli utenti. Lo verifichi rispetto alla Sua region di deployment prima di integrare.

Gemini Omni 1.1 Flash supporta temperature o i negative prompt?

La reference di Google segna la superficie di campionamento come non supportata — niente temperature, top_p, istruzioni di sistema, stop sequence o negative prompt. Il testo del prompt è il Suo unico controllo, con la documentazione di schema di terze parti che mette il tetto a 40.000 caratteri. Quella stessa documentazione di terze parti elenca temperature e top_p come campi accettati, in contraddizione con Google, quindi li verifichi prima di dipenderne.

Posso disattivare l'audio nell'output di Gemini Omni?

No. Il modello costruisce una colonna sonora dentro ogni clip per impostazione predefinita, e nessun parametro la spegne. Un'istruzione di sound design nel prompt guida quello che ottiene, ma non lo può rifiutare, né fornire un audio di reference, né modificare il risultato, né conservare l'audio di un video che carica per l'estensione. Per una riproduzione silenziosa, metta il muto nel player.

Gemini Omni può estendere un video all'indietro o modificare il centro di una scena?

No. L'estensione accoda soltanto alla fine di una clip — nessuna estensione all'indietro per costruire un'introduzione, nessun inserimento nel mezzo di una sequenza. Pianifichi di conseguenza: la prima generazione fissa il linguaggio di camera e di luce per tutto ciò che viene dopo, e un errore all'inizio invalida ogni estensione costruita sopra.

Gemini Omni 1.1 Flash vale la pena rispetto a Veo 3.1 Fast?

Solo se Le serve quello che Omni aggiunge. Veo 3.1 Fast gira a $0.01 al secondo su E2X contro i $0.09 di Omni a 720p. Per una clip singola senza estensione, senza controllo del primo e dell'ultimo frame e senza continuità tra inquadrature, Veo vince con ampio margine. Omni si guadagna il sovrapprezzo sulle sequenze a più inquadrature e sul lavoro di continuità guidato da reference.