Persone fotorealistiche su Gemini Omni 1.1 Flash: cancelli la parola «bella»
Il modo più rapido per far sembrare finto un essere umano generato è chiederne uno attraente.
Scriva beautiful woman, perfect skin, flawless, stunning e il modello obbedisce: attinge alla regione dei suoi dati di training dove vivono quelle didascalie, cioè la fotografia commerciale ritoccata. Pori spariti, asimmetrie sparite, e con loro le piccole tensioni che fanno leggere un volto come abitato da qualcuno. Niente nell'output è sbagliato. Il prompt ha chiesto una pubblicità di cosmetici e l'ha ottenuta.
Le indicazioni sui prompt di Google puntano nella direzione opposta in una frase sola: "sia estremamente dettagliato nelle descrizioni di personaggi e ambienti." Dettagliato, non lusinghiero. Sono istruzioni diverse e producono volti diversi. Quello che segue è la differenza: volti, mani, l'audio che non può spegnere, e dove Google ha deciso che non può andare.

Un volto è un elenco di fatti, non un elenco di complimenti
Ogni aggettivo è un voto per un cluster di didascalie, e gorgeous vota per lo stock. 8k, hyperrealistic, masterpiece arrivano dal folklore dei modelli di immagine, dove servivano da token di qualità; su un modello video privo di parametri di campionamento fanno solo concorrenza alle parole che descrivono la Sua inquadratura. I sostituti sono specifici e noiosi, ed è proprio questo il punto:
L'età come numero o decennio. "Una donna sulla fine dei quaranta" è un vincolo; "una giovane donna" è un biglietto della lotteria.
Un'imperfezione nominata. Una cicatrice in rilievo, un incisivo scheggiato, un naso rotto una volta e ricomposto un po' storto. Una basta; tre si leggono come una scheda personaggio.
La pelle come superficie. Pori visibili su naso e guance, lucido sulla fronte, capillari rotti all'ala del naso. La sostituzione più redditizia del prompt: "perfect skin" e "visible pores across the nose" stanno agli estremi opposti dello spazio delle didascalie.
Uno sguardo con una direzione e un cambio. Non "looking at the camera" ma "reads something off frame to the right, then her eyes flick to the lens for about a second and away again". Un contatto visivo ininterrotto per un'intera clip è qualcosa che quasi nessun essere umano fa, quindi una linea dello sguardo non specificata lascia il modello a indovinare proprio la cosa che uno spettatore legge per prima.
Una micro-espressione, a tempo. "The corner of her mouth tightens once." Un evento messo in scena batte "emotional", perché il modello un evento sa metterlo in scena e un'astrazione no.
Usura su tutto ciò che non è pelle. Un colletto lavato duecento volte, un cinturino d'orologio ammorbidito, un alone di caffè sulle carte. Il guardaroba vende una persona più affidabilmente di un volto.
Lo scambio, reso concreto. Prima la versione che sembra una foto di stock che ha imparato a sbattere le palpebre:
A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.
Quasi tutte quelle parole descrivono una fotografia; nessuna descrive una persona. La riscrittura tiene l'inquadratura e scambia ogni complimento con un fatto:
In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.
Nella seconda versione niente chiede qualità. Fornisce una texture da rendere, un motivo per la linea dello sguardo e un evento a tempo: tre cose su cui il modello può agire, dove "stunning" ne è tre su cui non può. Noti anche la clausola sul numero di inquadrature in apertura: Omni per default costruisce più inquadrature, come abbiamo visto nella guida al prompting, e un ritratto che stacca due volte in sei secondi non può tenere un volto.

Un'avvertenza sugli occhi: "wet eyes" e "glossy tear film" sono parole di qualità in costume tecnico, nominano un riflesso invece di una causa. Dia all'occhio qualcosa da fare e lasci che lo speculare segua dalla luce che ha già specificato.
Mani: dia loro un compito
Le mani sono l'imbarazzo tradizionale del video generativo e restano la cosa che più facilmente manda a monte una presa. La scheda modello di DeepMind non le isola, ma ne nomina la categoria: "mantenere una coerenza completa lungo le modifiche, generare scene con movimento complesso o rendere testo perfettamente accurato resta una sfida." Le dita sono movimento complesso in una piccola porzione di inquadratura, articolate in molti modi e costantemente auto-occludenti.
La soluzione è controintuitiva. Non descriva le mani — assegni loro un compito. Una mano che tiene un oggetto specifico con una presa dichiarata ha una forma e un punto di contatto a cui ancorarsi. "Beautiful, elegant hands" non fornisce né l'una né l'altro, e lascia il conteggio delle dita all'invenzione del modello.
Confronti:
- Debole: her hands rest naturally at her sides
- Meglio: she holds a chipped enamel mug in both hands, thumbs overlapping on the near side
- Debole: he gestures while speaking
- Meglio: he turns a pen over in his right hand twice, then sets it down on the papers
La seconda forma di ciascuna coppia fissa implicitamente il numero di dita, dà al movimento un inizio e una fine, e produce un tempo su cui poter staccare.
Un'avvertenza che governa ogni dato di terze parti in questo articolo. Le due recensioni pratiche pubblicate che siamo riusciti a trovare — quella di invideo e il test multi-turno del team JXP, datato 21 maggio 2026 — chiamano entrambe il modello testato Gemini Omni Flash, senza alcun suffisso 1.1. Nessuna delle due misura il modello di cui parla questo articolo; le legga come indizi sulla famiglia. JXP riferisce che al quinto turno di editing di un'inquadratura di violino "la sua mano sinistra è scivolata leggermente fuori dalla tastiera." Le mani hanno ceduto per prime, mentre tutto il resto reggeva ancora.
Altre due regole che non costano nulla. Tenga le mani su un solo piano di fuoco — una mano spinta verso un grandangolo è la cosa più difficile che possa chiedere. E tenga le mani lontane dal volto, perché l'occlusione tra due strutture difficili moltiplica l'errore invece di mediarlo.

Sta dirigendo una voce, che lo volesse o no
Qui l'audio è nativo: prodotto nella stessa passata dell'immagine, non disabilitabile da alcun parametro, non fatturato a parte da nessun fornitore che abbiamo controllato. Un prompt che non dice nulla sul suono non è quindi una richiesta di silenzio: è un brief senza supervisione, e il modello lo riempirà.
Scriva dunque l'audio deliberatamente, in frasi proprie. La forma di dialogo documentata da Google è un due punti senza virgolette — the man says: We lost it — e l'affermazione tanto ripetuta che le virgolette attivino una modalità di lip-sync non compare in nessun documento Google.
Quattro cose decidono se un'inquadratura parlata funziona:
La lunghezza della battuta. invideo, in una recensione che chiama il modello testato Gemini Omni Flash, riferisce che "con una sola persona che parla, il lip sync regge fino a circa 6 o 7 secondi prima di iniziare a calare." Un'indicazione più che una specifica, ma punta in una direzione sola: una battuta di quattro-dodici parole piazzata presto, poi silenzio e una reazione, batte una frase che corre per tutta la durata della presa.
Un solo parlante in inquadratura. La stessa recensione è netta: "due parlanti nella stessa inquadratura restano un punto debole, dato che Omni spesso perde il sync o attribuisce male il dialogo, quindi le inquadrature a parlante singolo oggi sono la scelta sicura." Faccia della seconda persona una spalla al bordo dell'inquadratura, fuori fuoco, e giri la sua battuta come generazione separata.
Direzione vocale in prosa. Non esiste alcun parametro di voce, quindi accento, età, registro e ritmo entrano come inglese ordinario: tired, quiet, American accent, no rise at the end.
Silenzio esplicito. Scriva No dialogue. oppure No music.
Prima e dopo per un'inquadratura di dialogo. La versione debole commette tutti gli errori qui sopra in una volta: due parlanti in inquadratura, virgolette, una battuta a testa, aggettivi al posto della direzione:
A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.
La riscrittura toglie un parlante dall'inquadratura, riduce la battuta a quattro parole e descrive la voce invece di lodarla:
In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.
La risposta di lei appartiene a una seconda generazione, inquadrata su di lei: due clip invece di una, e comunque più economico che rilanciare otto volte un campo-controcampo sperando che il sync cada bene su entrambi i volti insieme.
Un confine documentato: non può prendere un video caricato di qualcuno che parla ed estenderlo con nuovo dialogo. È trattenuto, non assente, e la scheda modello lo dice chiaramente: "nell'ambito dell'editing video, Gemini Omni Flash è in grado di modificare il parlato delle persone. Per ora stiamo limitando questa capacità e stiamo lavorando per capire meglio come portarla ai nostri utenti in modo sicuro e responsabile." Il modello può ri-doppiare una persona; Google ha deciso che Lei non può. Il doppiaggio non è un prodotto che si possa costruire qui.
Folle, figure di sfondo e dove non conviene spendere
Le persone di sfondo ricevono l'attenzione che avanza, e una strada affollata di passanti è una fila di volti che non sopravvivrà al tasto pausa. Dia un numero — "four people at scattered tables" batte "a crowded café", perché una quantità vaga invita alle approssimazioni. Le tenga fuori dal piano di fuoco, dato che figure ammorbidite da un 50mm aperto sono credibili là dove le stesse figure nitide a f/11 sono una galleria di quasi-errori. E dia loro un'azione ciascuna, di spalle: le nuche sono gratis. Se un volto di sfondo specifico conta, lo promuova a inquadratura propria.
Quanto costano le prese, e perché il 4K è il numero che conta
I volti sono il punto in cui si bruciano generazioni: si rilancia per la linea dello sguardo, poi per la mano, poi perché la voce è uscita vent'anni troppo giovane. Prezzare onestamente questo lavoro significa prezzare prese, non clip. E il divario tra fornitori è più ampio in cima alla scala. Dieci secondi a 4K, al 29 agosto 2026:
| Dove lo chiama | 10 s a 4K |
|---|---|
| E2X | $1.80 |
| fal | $3.00 |
| Google, diretto | $3.04 |
| Runware | $3.20 |
| WaveSpeed | $3.90 |
Il dato di Google deriva dalla sua tariffa pubblicata in token al secondo più che da un prezzo di listino, e quello di fal è un passthrough della lista di Google più che una lettura indipendente del calcolo. Lo scarto è strutturale: dalla base 720p Google triplica per il 4K dove noi raddoppiamo. Il 41% in meno a 4K è il più ampio dei nostri quattro tier, e una presa da otto secondi costa $1.44 qui contro $2.43 in diretta. L'audit fornitore per fornitore contiene il resto.
L'altra metà dell'aritmetica è dove si itera. Dieci passate di ricerca a 360p più una rifinitura a 1080p fanno $1.73 contro $5.40 per dieci passate dritte a 1080p: sessantotto per cento in meno per una generazione in più. Una passata di bozza porta risoluzione sufficiente per linea dello sguardo, blocking e per capire se la mano ha trovato la tazza; non abbastanza per texture della pelle o lip sync, quindi metta in conto due prese a piena risoluzione dopo che il ciclo si è chiuso. E si chieda se l'inquadratura ha bisogno di questo modello: Veo 3.1 Fast qui costa un centesimo al secondo, e per un singolo ritratto senza continuazione il sovrapprezzo di nove volte compra pochissimo.
I limiti, detti chiaramente
Non è una sezione di avvertenze legali. Ogni voce qui sotto ha già cambiato il piano di progetto a qualcuno.
SynthID è in ogni fotogramma, e non c'è alcun interruttore. Le parole di Google: "tutti i video generati includono la filigrana SynthID, invisibile agli spettatori ma rilevabile a livello programmatico per la verifica della provenienza." Nessun fornitore espone un interruttore, e poiché il marchio è costruito per sopravvivere a ricodifica, ritaglio e modifiche di colore, "lo togliamo in post" non è un piano. Se un contratto di consegna vieta asset con filigrana, chiarisca la cosa prima di rendere.
L'editing di video caricati non è disponibile nel SEE, in Svizzera e nel Regno Unito. La riga di Google, inclusa la parentesi che decide quanto sia grave per Lei: "la modifica o l'estensione di video caricati non è attualmente disponibile per gli utenti nello Spazio economico europeo (SEE), in Svizzera e nel Regno Unito (la modifica o l'estensione di video generati dal modello è supportata)." Un team europeo può ancora generare un'inquadratura ed estendere il proprio output; quello che non può fare è continuare del girato caricato da un utente. Ne abbiamo trattato le conseguenze nell'articolo sulle scene da quaranta secondi — la voce qui più costosa da scoprire tardi.
I caricamenti che contengono certe persone vengono rifiutati. Altre due righe dalla stessa sezione sui limiti, entrambe circoscritte a quelle regioni: "il caricamento e la modifica di immagini contenenti minori non è supportato nello Spazio economico europeo, in Svizzera e nel Regno Unito", e "il caricamento e la modifica di immagini contenenti certe persone riconoscibili non è supportato nello Spazio economico europeo, in Svizzera e nel Regno Unito." La superficie di rifiuto sembra più ampia di quella formulazione: JXP, nella stessa recensione dell'epoca del predecessore, riferisce che un prompt che nominava un marchio reale "è stato bloccato all'invio con un messaggio generico di policy", e che anche una richiesta di "invecchiare di dieci anni un personaggio adulto generico" è stata bloccata. Non costruisca una pipeline che dipende dal fatto che i rifiuti non accadano.
Le persone reali sono una questione legale prima che tecnica. Una somiglianza riconoscibile di una persona reale, prodotta senza il suo consenso, incontra diritti della personalità e di sfruttamento dell'immagine che variano per giurisdizione e non decadono perché l'output è sintetico. Separatamente, gli obblighi di trasparenza dell'articolo 50 dell'AI Act europeo si applicano dal 2 agosto 2026: i deployer devono dichiarare che il contenuto è generato o manipolato artificialmente, in modo chiaro e alla prima esposizione. SynthID risponde a un requisito di marcatura leggibile dalle macchine; non risponde al dovere di dirlo alla persona che guarda. È una decisione di etichettatura da prendere con un legale, non un flag in una chiamata API.
Un volto generato non è una persona, ma può stare abbastanza vicino a una perché qualcuno ne venga danneggiato. Consenso, dichiarazione e la disponibilità a non fare l'inquadratura appartengono a questo mestiere quanto la lunghezza focale.
Domande frequenti
Come si ottiene una pelle realistica in Gemini Omni 1.1 Flash?
Descriva la superficie invece di lodarla. "Perfect skin", "flawless" e "beautiful" selezionano immagini commerciali ritoccate e appiattiscono la texture. Le sostituisca con fatti osservabili — pori visibili su naso e guance, lucido sulla fronte, una piccola cicatrice — e dichiari un'età. Google chiede una descrizione del personaggio estremamente dettagliata, che non è la stessa cosa che chiedere un personaggio attraente.
Perché le mani vengono male nel video IA, e come si risolve nel prompt?
Le dita sono movimento complesso in una regione piccola e auto-occludente, e la scheda modello di Google nomina il movimento complesso come qualcosa che "resta una sfida." Dia alle mani un compito invece di descriverle: un oggetto specifico con una presa dichiarata, oppure un'azione con un inizio e una fine. Le tenga su un solo piano di fuoco, lontane dal volto.
Si può disattivare l'audio in Gemini Omni 1.1 Flash?
No. L'audio è generato nativamente insieme all'immagine, nessun parametro lo disabilita, e non è fatturato separatamente dalla tariffa al secondo. Può guidarlo con una frase "Sound design:" e clausole esplicite "No dialogue." o "No music.", ma non rifiutarlo. Per una riproduzione muta, silenzi il player.
Come va scritto il dialogo in un prompt Omni?
Usi la forma documentata da Google: parlante, due punti, battuta, senza virgolette. La direzione vocale segue in prosa semplice, dato che non esiste alcun parametro di voce: accento, età, registro e ritmo arrivano tutti in inglese. Tenga le battute corte, le piazzi presto, descriva il tono invece di chiedere una recitazione "emotional".
Per quanto tempo Gemini Omni tiene il lip sync?
invideo, in una recensione che chiama il modello testato Gemini Omni Flash e non 1.1, riferisce che con una sola persona che parla il lip sync regge circa sei-sette secondi prima di calare, e definisce due parlanti nella stessa inquadratura un punto debole in cui il modello perde il sync o attribuisce male il dialogo. È il risultato di un tester su un modello precedente, non una specifica Google, ma depone a favore di un parlante per generazione e di battute brevi piazzate presto.
Gemini Omni 1.1 Flash può generare le sembianze di una persona reale?
Non in modo affidabile, e ci pensi bene prima di provarci. La documentazione di Google dice che il caricamento e la modifica di immagini contenenti certe persone riconoscibili non sono supportati nel SEE, in Svizzera e nel Regno Unito, e i tester riferiscono rifiuti per nomi di marchi reali e per normali modifiche ai personaggi. Oltre al filtro, i diritti sull'immagine variano per giurisdizione e non decadono perché il girato è sintetico.
La filigrana SynthID compare su ogni fotogramma, e si può rimuovere?
Ogni video generato porta SynthID, incorporato al momento della generazione, invisibile agli spettatori e rilevabile a livello programmatico. Nessun fornitore espone un interruttore, e il marchio sopravvive a compressione, ritaglio e modifiche di colore, quindi la rimozione non è un flusso di lavoro su cui pianificare. Se una specifica di consegna vieta materiale con filigrana, chiarisca il punto prima di rendere.
Conviene iterare sui volti a bassa risoluzione?
Sì, e parecchio. Dieci passate di ricerca a 360p più una rifinitura a 1080p costano $1.73 su E2X contro $5.40 per dieci passate a 1080p: sessantotto per cento in meno per una generazione in più. Le passate di bozza portano risoluzione sufficiente per linea dello sguardo e blocking, ma non per texture della pelle o lip sync, quindi preveda due prese a piena risoluzione dopo la chiusura del ciclo di bozze.
Prezzi e condizioni di prodotto cambiano. Verifichi i prezzi correnti di ciascun fornitore prima di prendere una decisione d'acquisto.
Schemi e tariffe correnti per tutte e quattro le capability stanno sulla pagina del modello. Qui accanto: la sintassi di prompt documentata, quanto costano davvero le sequenze da quaranta secondi, e dove gli stessi pesi costano di più.