Le parole di camera su cui Gemini Omni 1.1 Flash agisce, e quelle che ignora
Legga abbastanza a lungo il materiale di Google sul prompting video e troverà due frasi separate da qualche paragrafo. Una pubblica un elenco di movimenti di camera — dolly, truck, pedestal, gru, whip pan, arc — come se stesse ordinando da un menu. L'altra avverte che "alcune angolazioni di camera avanzate non sono ufficialmente supportate. I risultati e l'affidabilità possono variare a seconda del prompt complessivo e del caso d'uso specifico."
Sono vere entrambe, e nello spazio tra le due nasce la maggior parte delle clip deludenti. Un movimento nominato è una richiesta che il modello probabilmente esaudirà, non un parametro che deve eseguire. Non esiste alcun campo per la posa della camera su gemini-omni-1.1-flash — niente rig, niente ottica, solo parole in concorrenza con le Sue altre parole. Questo articolo riguarda quali di quelle parole si guadagnano il posto, ricavato da ciò che Google documenta, da ciò che riporta Runway e da ciò che espone lo schema.

Le parole che cadono subito
Cominci con la sottrazione: non costa nulla e libera spazio nel prompt. Il riferimento di Runway sul prompting di camera è netto sulle due parole più diffuse nei prompt video generati con IA: "'Cinematic' e '4k' saltano perché non fanno alcun lavoro. Nessuna delle due cambia ciò che fa la camera, e lo spazio di prompt che occupano è speso meglio sul movimento."
È un'affermazione sui loro strumenti, non su quelli di Google, ma il ragionamento regge. "Cinematic" descrive un'impressione, non un punto di vista: non dice dove stare, a che distanza, cosa tenere a fuoco o in che direzione muoversi. Lo stesso vale per il carico al seguito — masterpiece, award-winning, 8k, ultra detailed — ereditato dalla cultura di prompt dei modelli di immagine, dove quei token funzionavano come formule di qualità contro una distribuzione di training molto diversa.
La forma positiva è altrettanto semplice: nomini un movimento specifico invece di chiedere una "camera cinematica dinamica", perché questi modelli trattano le "istruzioni di camera come direzione spaziale, non come decorazione." Niente lì dice che "cinematic" faccia danno. Dice che la parola sposta qualcosa di migliore, e in un prompt di qualche decina di parole lo spostamento è tutto il gioco.
L'elenco di Google, e quanto fidarsene
Il vocabolario documentato batte qualsiasi cosa circoli nei thread sui prompt:
| Categoria | Cosa nomina Google |
|---|---|
| Movimento | static · pan · tilt · dolly (in, out) · truck (left, right) · pedestal (up, down) · zoom · crane · aerial o drone · handheld · whip pan · arc |
| Angolazione e scala | eye-level · low · high · bird's-eye · Dutch · point-of-view · over-the-shoulder · extreme close-up · close-up · medium · full · wide o establishing |
| Ottica | wide-angle · telephoto · deep e shallow depth of field · lens flare · rack focus · fisheye · dolly zoom |
Due dettagli ripagano l'attenzione. Google separa deliberatamente lo zoom dal dolly, perché i modelli li confondono: uno zoom è un cambio di lunghezza focale, e "questo è diverso da un dolly, perché la camera stessa non si muove." Vuole che lo sfondo si dilati rispetto al soggetto? Chieda un dolly. Vuole che l'inquadratura si stringa senza cambiare la geometria? Chieda uno zoom. Scriva "zoom in slowly as the camera pushes forward" e ne ha ordinati due — un dolly zoom, quasi mai ciò che si intendeva.
Secondo: termini ampiamente attribuiti a Google non stanno sulle sue pagine. Oner, push in e natural smartphone zoom compaiono in guide che citano la documentazione Google; noi lì non li abbiamo trovati. Non documentato non significa vietato, ma non portano più autorità di una formula che inventi Lei. La sintassi documentata completa sta nella nostra guida al prompting.
Un movimento per clip
Il risultato più affilato del riferimento Runway non riguarda quali verbi funzionino, ma quanti.
"Verbi impilati (inaffidabile): 'Orbit the subject and crane up and push in.' Descrizione per fasi (affidabile): 'The camera arcs around the seated figure, then rises above the table to reveal the empty chairs surrounding her.'"
Il consiglio che segue è di descrivere cosa riempie l'inquadratura in ciascuna fase invece di impilare verbi, e se il movimento composto continua a fallire, di "tornare a un solo movimento e generare il secondo tempo come clip a sé."
Omni aggiunge a questo un taglio meccanico, dalla documentazione di Google: il modello produce più inquadrature per impostazione predefinita salvo indicazione contraria. Chieda tre movimenti simultanei e gli avrà consegnato una via d'uscita: lo stacco. Due secondi di arc, stacco, due di gru, stacco, un push in per il resto. Ogni istruzione onorata, nulla di quello che voleva. La correzione in una clausola, "In a single continuous shot" oppure "No scene cuts", impedisce al modello di risolvere la Sua ambiguità con un montaggio.
Una scena, generata due volte, cambiando solo la clausola di camera:
Quattro secondi per lato a 720p, trentasei centesimi ciascuno. Soggetto, stanza, luce e traccia sonora sono identici; cambia solo la prima frase, un'inquadratura bloccata contro un dolly in lento. La clausola di camera è la frase con più leva dell'intero prompt, e quella che la maggior parte delle persone scrive per ultima.
La focale è direzione, non ottica
Non c'è nessun obiettivo. Vale la pena dirlo chiaramente, perché il modello mentale conta. Scriva "85mm" e il modello non sta calcolando un angolo di campo; attinge a tutto ciò che nei dati di training è etichettato così, e le fotografie portano quell'etichetta a milioni. Quello che torna è il look attaccato al numero: sfondo compresso, soggetto ritagliato su un campo morbido, distanze appiattite. Su una focale corta, prospettiva stirata, più stanza nell'inquadratura, bordi che si incurvano.
Il che rende la lunghezza focale una delle parole più efficienti disponibili, perché muove inquadratura e sensazione insieme in quattro caratteri. Le indicazioni in circolazione sono coerenti — grosso modo 24mm per contesto ampio, 35mm per una sensazione documentaristica, 50mm per narrazione neutra, 85mm per lavoro intimo e compresso — da leggere come direzione visiva, non come promessa di ottica letterale.

Ne seguono due abitudini. Dia un compito al numero invece di lasciarlo come aggettivo: "35mm" da solo è un token, mentre "35mm, the workshop visible behind her throughout" dice a cosa serve il grandangolo, e quella clausola sopravvive anche se il numero viene ignorato. I termini ottici documentati da Google — shallow depth of field, deep focus, rack focus, telephoto — fanno lo stesso lavoro in parole semplici. E non accosti mai una focale a un'istruzione che la contraddice: "85mm wide establishing shot of the valley" chiede compressione e ampiezza insieme.
L'inquadratura è la cosa più affidabile che può specificare
Ordini il linguaggio di camera per quanto affidabilmente arriva e compare uno schema: le proprietà statiche battono quelle temporali.
La scala dell'inquadratura — dall'extreme close-up al wide establishing — è una proprietà di un singolo fotogramma. Lo è anche l'angolazione, e così la geometria di un piano a due o di una ripresa da sopra la spalla. Il modello può soddisfarne una qualsiasi già nel primo fotogramma che rende, e poi tenerla.
Un dolly in è un'affermazione sul fotogramma uno rispetto al fotogramma novantasei, e deve sopravvivere a ogni fotogramma intermedio, in un processo privo di rappresentazione esplicita di dove sia la camera. È esattamente lo scarto che la letteratura di ricerca esiste per colmare: CameraCtrl, il lavoro di riferimento sul controllo di camera nella diffusione video, si apre notando che i modelli esistenti "mancano del controllo sulla posa della camera, che funge da linguaggio cinematografico per esprimere sfumature narrative più profonde", e poi aggiunge un modulo di condizionamento sulla posa perché il testo da solo non bastava. Nessuna API video di produzione a noi nota espone quel canale.
Da qui una gerarchia che vale la pena memorizzare. Inquadratura e angolazione: le specifichi liberamente, si aspetti che vengano rispettate. Un movimento nominato: se lo aspetti quasi sempre. Due movimenti, o un movimento con velocità e punto d'arresto dichiarati: metta in conto diverse prese, oppure divida il tempo.

Prima e dopo
Un prompt scritto come vengono scritti quasi tutti i prompt di camera. Ogni parola che contiene l'abbiamo usata anche noi.
Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.
Conti cosa è azionabile. Tre verbi impilati che non possono reggere tutti in una sola presa. Nessuna scala d'inquadratura, nessuna focale, nessuna istruzione sul numero di inquadrature — quindi il default multi-inquadratura documentato è libero di scattare, e con tre movimenti in concorrenza sul tavolo lo stacco è la via di minor resistenza.
La stessa inquadratura, riscritta per dire solo ciò su cui il modello può agire:
In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.
Quattro cambiamenti, in ordine di peso. La clausola sul numero di inquadrature viene per prima, così l'ambiguità non può essere risolta con un montaggio. Tre movimenti collassano in uno, con inquadratura d'apertura e di chiusura nominate — la descrizione per fasi che Runway raccomanda, scritta come un unico spostamento. La focale arriva agganciata a una conseguenza. E il suono ottiene frasi proprie, secondo l'indicazione di Google di descrivere l'audio separatamente, con le negazioni come brevi clausole finali. La riscrittura è più piana e più noiosa da leggere, che di solito è il segno che un prompt ha smesso di descrivere un'atmosfera e ha iniziato a descrivere un'inquadratura.
Dove va la camera nel prompt
L'ordine è la domanda per cui non ci aspettavamo risposta. Una c'è, dalle indicazioni Veo di Google più che dalla pagina Omni: la formula lì è cinematography, subject, action, context, style and ambiance — la camera per prima, prima di nominare chi è nell'inquadratura — perché quell'elemento "è lo strumento più potente per trasmettere tono ed emozione." La documentazione propria di Omni elenca gli elementi diversamente, con la camera a metà lista: Google pubblica quindi due ordinamenti e noi non abbiamo condotto alcun confronto controllato.
Aprire con la camera regge comunque al contatto con l'altro comportamento documentato di Omni, dato che l'istruzione sul numero di inquadrature deve arrivare prima che il modello inizi a costruire una narrazione. Rende anche un prompt verificabile: se la prima frase non descrive un punto di vista, non ha diretto un'inquadratura.
Cosa lo schema non Le darà
Due limiti strutturali, nessuno dei due risolvibile con una formulazione migliore.
Il primo è la ripetibilità. La documentazione API di Google afferma che "istruzioni di sistema, temperature, top_p, sequenze di stop e prompt negativi non sono supportati", e Le dice di scrivere invece le negazioni nel prompt. Non c'è alcun sampler da stringere. Resta seed, un intero opzionale nel nostro schema per questo modello, e quella è tutta la superficie di controllo.
Per il lavoro di camera questo conta più che per qualsiasi altra parte di un prompt. Una luce che torna leggermente diversa è un'altra gradazione della stessa inquadratura; un dolly che torna come una panoramica è un'altra inquadratura. Tenere fermo un movimento tra una presa e l'altra significa quindi fissare il seed e non cambiare nient'altro — e modificare una parola significa campionare da capo. Tratti un seed che funziona come un bene e lo annoti accanto al prompt.
Il secondo limite è che la velocità della camera non ha vocabolario. "Slow dolly in" è la superficie di controllo: nessuna unità, nessuna durata, nessun modo di dire che la spinta deve finire entro il quinto secondo e poi tenere. La sintassi di timecode aiuta un poco — Omni accetta intervalli tra parentesi quadre — quindi un prompt può chiedere alla camera di assestarsi a quattro secondi. Se poi lo faccia è un altro discorso.
Angolo di otturazione e mosso stanno nella stessa colonna: nessuno dei due compare nel vocabolario documentato da Google. Il frame rate ci va vicino — 24 fps compare sulla pagina Omni solo dentro un esempio di timing, "12 frames at 24fps", non come leva di prompt. Utile per ragionare sui timecode; non qualcosa da scrivere aspettandosi di guidare.
Quanto costano gli esperimenti di camera, al tier che conta
Il lavoro di camera è la parte del prompting che non viene giusta in una passata sola: sta chiedendo un comportamento nel tempo senza alcun parametro che lo vincoli, quindi genera, guarda, corregge, genera di nuovo. Il numero che conta è il prezzo di una presa.
A 4K una presa di otto secondi costa $1.44 qui contro $2.43 chiamando Google direttamente. Sei prese per far atterrare un movimento — poche, per qualsiasi cosa con uno spostamento specifico — fanno $8.64 contro $14.60. Quel divario è del 41%, di gran lunga il più ampio delle quattro risoluzioni e il motivo per cui la riga 4K è l'unica su cui valga la pena discutere. Altrove un secondo di 4K costa $0.30 da fal, $0.32 da Runware e $0.39 da WaveSpeed, contro $0.18 qui; Replicate elenca il modello senza alcuna tariffa al secondo.
Il modo per spendere meno, però, non è un secondo di 4K più economico ma smettere di testare i movimenti di camera a 4K. Dieci bozze da otto secondi sul tier 360p costano $2.38, e 360p basta a vedere se la camera ha fatto quello che le ha chiesto: un movimento è leggibile a qualsiasi risoluzione, ed è ciò che lo rende economico da testare. Dieci bozze più un keeper a 4K fanno $3.82, contro $14.40 per dieci prese a 4K.
I due gradini più alti sono upscale, non render nativi — il riferimento modello di Google li etichetta come "1080p output (upscaled)" e "4K output (upscaled)" — quindi una presa a 4K compra dimensioni di consegna, non dettaglio in più nell'inquadratura che sta valutando. Il nostro articolo sulle scene da quaranta secondi spiega dove convenga pagarlo comunque.
Prezzi e condizioni di prodotto possono cambiare. Verifichi i prezzi correnti di ciascun fornitore prima di prendere una decisione d'acquisto.
La versione breve
Dica per prima cosa il numero di inquadrature, poi un movimento, poi l'inquadratura su cui inizia e finisce. Dia a una focale un motivo per esserci. Metta l'audio in frasi proprie. Cancelli ogni parola che descrive come il video dovrebbe far sentire qualcuno, e spenda quello spazio su dove sta la camera.
Cosa è stato rilasciato nella 1.1 sta nel resoconto del lancio, e l'audit dei prezzi dei fornitori spiega perché pesi identici costano cifre diverse a seconda della pagina. Parametri e tariffe correnti stanno sulla pagina del modello text-to-video. Per un singolo movimento da cui non dipende nulla, prezzi prima Veo 3.1 Fast a un centesimo al secondo — il vocabolario di camera viene dalla guida che Google pubblica per entrambi, quindi la pratica si trasferisce.
Domande frequenti
Quali termini di movimento di camera capisce Gemini Omni 1.1 Flash?
Google nomina un vocabolario di movimento — static, pan e tilt, le coppie dolly, truck e pedestal, zoom, crane, drone o aerial, handheld, whip pan, arc — più termini di angolazione, scala d'inquadratura e ottica. Avverte anche che alcune angolazioni avanzate non sono ufficialmente supportate e che l'affidabilità varia con il prompt: legga un movimento nominato come una richiesta e non come un parametro.
Scrivere "cinematic" in un prompt video serve a qualcosa?
Da solo, poco. Il riferimento di Runway sul prompting di camera elimina sia "cinematic" sia "4k", sul presupposto che nessuno dei due cambi ciò che fa la camera e che lo spazio sia speso meglio nominando un movimento. La parola descrive un'impressione anziché un punto di vista, quindi non dà al modello nulla su cui agire — come "masterpiece", "8k" e il resto del carico ereditato dal prompting di immagini.
I numeri di focale come 35mm o 85mm cambiano l'output?
Spostano il look, perché le fotografie nei dati di training portano la focale nei metadati e il numero si legge come indizio di stile. Un'ottica lunga tende a comprimere lo sfondo e a staccare il soggetto; una corta stira la prospettiva e fa entrare più stanza. Lo tratti come direzione visiva anziché ottica letterale, e lo agganci a una conseguenza.
Dove va la direzione di camera in un prompt Omni?
La guida al prompting di Veo di Google mette la cinematografia per prima, davanti a soggetto, azione, contesto e stile, definendola l'elemento più potente per trasmettere il tono. La documentazione propria di Omni colloca i termini di camera a metà lista. Entrambe sono Google. Aprire con la camera ha un vantaggio pratico: l'istruzione sul numero di inquadrature è una decisione di camera e deve registrarsi prima che il modello inizi a costruire una narrazione.
Si può ottenere due volte lo stesso movimento di camera da Gemini Omni 1.1 Flash?
Solo riusando un seed. La documentazione di Google dice che temperature, top_p, istruzioni di sistema, sequenze di stop e prompt negativi non sono supportati, il che lascia seed — un intero opzionale nel nostro schema — come unico controllo di riproducibilità. Cambi una parola del prompt e sta campionando da capo: annoti il seed che ha prodotto un movimento riuscito nel momento stesso in cui ha funzionato.
Perché la camera stacca a metà inquadratura se ho chiesto un solo movimento?
Perché il default sono più inquadrature. Google documenta che Omni tenterà diverse inquadrature e costruirà una narrazione salvo indicazione contraria, quindi un prompt che impila due o tre movimenti gli dà la scusa per soddisfarne ciascuno in uno stacco separato. La correzione documentata è una clausola che chiede una scena ininterrotta, e tornare a un solo movimento nominato toglie l'incentivo.
Si possono specificare tempo di otturazione o frame rate in un prompt Gemini Omni?
Nulla nel vocabolario di camera documentato da Google copre angolo di otturazione o mosso, e non sosterremmo che quei termini vengano rispettati. Nemmeno il frame rate è una leva di prompt: 24 fps compare sulla pagina Omni di Google dentro un esempio di timing — "12 frames at 24fps" — non come specifica impostabile. Il frame rate lo gestisca in post.
Quanto costa testare i prompt di camera a 4K?
Una presa da otto secondi a 4K costa $1.44 su E2X contro $2.43 chiamando Google direttamente, quindi sei prese fanno $8.64 anziché $14.60 — un divario del 41%, il più ampio delle quattro risoluzioni. Testare a 4K però di solito è sprecato: un movimento è leggibile a 360p, dove dieci bozze da otto secondi totalizzano $2.38, e un keeper a 4K porta la serie a $3.82.