Volver al Blog

Personas fotorrealistas en Gemini Omni 1.1 Flash: borre la palabra «beautiful»

E2X Team··19 min de lectura
gemini-omniprompt-engineeringphotorealismtext-to-videogoogle

La forma más rápida de que un humano generado parezca falso es pedir uno atractivo.

Escriba beautiful woman, perfect skin, flawless, stunning y el modelo obedece: va a buscar la región de sus datos de entrenamiento donde viven esos pies de foto, que es la fotografía comercial retocada. Adiós a los poros, adiós a la asimetría, y adiós con ellos a las pequeñas tensiones que hacen que una cara se lea como habitada por alguien. Nada en la salida está mal. El prompt pedía un anuncio de cosmética y lo ha conseguido.

La propia guía de prompts de Google apunta en el sentido contrario en una sola frase: «sea extremadamente detallado en sus descripciones de personajes y entornos». Detallado, no elogioso. Son instrucciones distintas y producen caras distintas. Lo que viene a continuación es esa diferencia: caras, manos, el audio que no se puede apagar, y dónde ha decidido Google que usted no puede ir.

Primerísimo primer plano del retrato de un hombre de sesenta y tantos junto a una ventana orientada al norte, llenando el encuadre de la frente al mentón, con luz de día suave y direccional que resuelve la textura de los poros y la barba incipiente gris

Una cara es una lista de hechos, no una lista de cumplidos

Cada adjetivo es un voto por un grupo de pies de foto, y gorgeous vota por el banco de imágenes. 8k, hyperrealistic, masterpiece vienen del folclore de los modelos de imagen, donde servían como tokens de calidad; en un modelo de vídeo sin parámetros de muestreo solo compiten con las palabras que describen su plano. Los sustitutos son concretos y aburridos, que es justo la idea:

La edad como número o como década. «A woman in her late forties» es una restricción; «a young woman» es un boleto de lotería.

Una imperfección con nombre. Una cicatriz en relieve, un incisivo mellado, una nariz rota una vez y recolocada ligeramente torcida. Con una basta; tres se leen como una ficha de personaje.

La piel como superficie. Poros visibles en la nariz y las mejillas, brillo en la frente, capilares rotos junto a la aleta de la nariz. La sustitución de mayor rendimiento de todo el prompt: «perfect skin» y «visible pores across the nose» están en extremos opuestos del espacio de pies de foto.

La mirada, con dirección y con un cambio. No «looking at the camera», sino «reads something off frame to the right, then her eyes flick to the lens for about a second and away again». Mantener el contacto visual durante un clip entero es algo que casi ningún humano hace, así que una línea de mirada sin especificar deja al modelo adivinando justo aquello que un espectador lee primero.

Una microexpresión, con su momento. «The corner of her mouth tightens once.» Un suceso puesto en escena le gana a «emotional», porque el modelo puede poner en escena un suceso y no puede poner en escena una abstracción.

Desgaste en todo lo que no sea piel. Un cuello de camisa lavado doscientas veces, una correa de reloj blanda, un cerco de café sobre los papeles. El vestuario vende a una persona con más fiabilidad que su cara.

El cambio, en concreto. Primero, la versión que parece una foto de banco de imágenes que ha aprendido a parpadear:

A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.

La mayoría de esas palabras describen una fotografía; ninguna describe a una persona. La reescritura mantiene el plano y cambia cada cumplido por un hecho:

In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.

Nada en la segunda versión pide calidad. Aporta una textura que renderizar, un motivo para la línea de mirada y un suceso con su momento: tres cosas sobre las que el modelo puede actuar, allí donde «stunning» son tres cosas sobre las que no puede. Fíjese también en la cláusula de número de planos al principio: Omni construye varios planos por defecto, como cubrimos en la guía de prompting, y un retrato que corta dos veces en seis segundos no puede sostener una cara.

Macro extremo de una mejilla y una sien humanas iluminadas por una luz rasante dura desde el extremo izquierdo, con media imagen brillante y texturada y la otra media cayendo en sombra

Una advertencia sobre los ojos: «wet eyes» y «glossy tear film» son palabras de calidad disfrazadas de tecnicismo, porque nombran un brillo en lugar de su causa. Déle al ojo algo que hacer y deje que el especular salga de la luz que ya ha especificado.

Manos: déles un trabajo

Las manos son la vergüenza tradicional del vídeo generativo y siguen siendo lo que con más probabilidad arruina una toma. La model card de DeepMind no las señala aparte, pero sí nombra su categoría: «mantener una consistencia completa a lo largo de las ediciones, generar escenas con movimiento complejo o renderizar texto perfectamente exacto sigue siendo un reto». Los dedos son movimiento complejo en un trozo pequeño del encuadre, articulados de muchas formas y ocluyéndose constantemente entre sí.

El arreglo es contraintuitivo. No describa las manos: asígneles una tarea. Una mano que sujeta un objeto concreto con un agarre declarado tiene una forma y un punto de contacto a los que anclarse. «Beautiful, elegant hands» no aporta ninguno de los dos, y deja que el modelo se invente el número de dedos.

Compare:

  • Flojo: her hands rest naturally at her sides
  • Mejor: she holds a chipped enamel mug in both hands, thumbs overlapping on the near side
  • Flojo: he gestures while speaking
  • Mejor: he turns a pen over in his right hand twice, then sets it down on the papers

La segunda forma de cada pareja fija el número de dedos de manera implícita, le da al movimiento un principio y un final, y produce un tiempo por el que se puede cortar.

Una salvedad que gobierna todas las cifras de terceros de este post. Las dos pruebas prácticas publicadas que hemos podido encontrar —la de invideo y la prueba multiturno del equipo de JXP, firmada el 21 de mayo de 2026— nombran el modelo probado como Gemini Omni Flash, sin sufijo 1.1 en ninguna de las dos piezas. Ninguna mide el modelo del que trata este post; léalas como evidencia sobre la familia. JXP informa de que en el quinto turno de edición de un plano de violín, «su mano izquierda se desplazó ligeramente fuera del diapasón». Las manos cayeron primero, mientras todo lo demás todavía aguantaba.

Dos reglas más que no cuestan nada. Mantenga las manos en un solo plano de enfoque: una mano lanzada hacia un gran angular es lo más difícil que puede pedir. Y mantenga las manos lejos de la cara, porque la oclusión entre dos estructuras difíciles compone el fallo en lugar de promediarlo.

Fotografía macro de las dos manos mojadas de un alfarero cerrándose alrededor de un cilindro de barro en rotación, con la barbotina corriendo entre los dedos y los tendones y los pliegues de los nudillos realzados por la luz

Está dirigiendo una voz, lo pretendiera o no

El audio aquí es nativo: se produce en la misma pasada que la imagen, no lo desactiva ningún parámetro y no lo factura aparte ningún proveedor que hayamos comprobado. Un prompt que no dice nada sobre el sonido no es, por tanto, una petición de silencio: es un encargo sin supervisar, y el modelo lo va a rellenar.

Así que escriba el audio a propósito, en frases propias. La forma de diálogo documentada por Google son dos puntos y ninguna comilla —the man says: We lost it—, y la tan repetida afirmación de que las comillas activan un modo de sincronización labial no aparece en ningún documento de Google.

Cuatro cosas deciden si un plano hablado funciona:

La longitud de la línea. invideo, en una prueba que nombra el modelo probado como Gemini Omni Flash, informa de que «con una sola persona hablando, la sincronización labial aguanta hasta unos 6 o 7 segundos antes de empezar a decaer». Es una dirección, no una especificación, pero apunta a un solo sitio: una línea de cuatro a doce palabras colocada pronto, y después silencio y una reacción, le gana a una frase que dura toda la toma.

Un solo hablante en el encuadre. La misma prueba es tajante: «dos hablantes en un mismo encuadre siguen siendo un punto débil, ya que Omni pierde a menudo la sincronía o atribuye mal el diálogo, así que hoy por hoy los planos de un solo hablante son la apuesta segura». Convierta a la segunda persona en un hombro al borde del encuadre, desenfocado, y ruede su línea como una generación aparte.

La dirección de voz en prosa. No existe ningún parámetro de voz, así que el acento, la edad, el registro y el ritmo entran como inglés corriente: tired, quiet, American accent, no rise at the end.

El silencio explícito. Escriba No dialogue. o No music.

Antes y después de un plano de diálogo. La versión floja comete todos los fallos anteriores a la vez: dos hablantes en el encuadre, comillas, una línea cada uno, adjetivos haciendo las veces de dirección:

A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.

La reescritura deja a un hablante fuera de encuadre, recorta la línea a cuatro palabras y describe la voz en lugar de elogiarla:

In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.

La respuesta de ella pertenece a una segunda generación, encuadrada sobre ella: dos clips en lugar de uno, y aun así más barato que volver a tirar ocho veces un plano de dos esperando que la sincronía aterrice en las dos caras a la vez.

Un límite documentado: no puede coger un vídeo subido de alguien hablando y extenderlo con diálogo nuevo. Esto está retenido, no ausente, y la model card lo dice con todas las letras: «como parte de la edición de vídeos, Gemini Omni Flash es capaz de cambiar el habla de las personas. Por ahora restringimos esta capacidad y trabajamos para entender mejor cómo llevarla a nuestros usuarios de forma segura y responsable». El modelo puede volver a poner voz a una persona; Google ha decidido que usted no. El doblaje no es un producto que se pueda construir aquí.

Multitudes, figuras de fondo y dónde no gastar

La gente de fondo recibe la atención que sobra, y una calle concurrida de peatones es una fila de caras que no sobrevivirán al botón de pausa. Dé un número: «four people at scattered tables» le gana a «a crowded café», porque una cantidad vaga invita a la aproximación. Manténgalos fuera del plano de enfoque, ya que unas figuras suavizadas por un 50mm de poca profundidad de campo resultan creíbles allí donde esas mismas figuras nítidas a f/11 son una galería de casi-aciertos. Y déles una acción cada uno, de espaldas: los cogotes salen gratis. Si una cara de fondo concreta importa, asciéndala a su propio plano.

Lo que cuestan las tomas, y por qué 4K es la cifra que importa

Las caras son donde se queman las generaciones: se vuelve a tirar por la línea de mirada, luego por la mano, luego porque la voz salió veinte años demasiado joven. Poner precio a este trabajo honestamente significa poner precio a las tomas, no a los clips. Y la diferencia entre proveedores es más ancha en lo alto de la escalera. Diez segundos de 4K, a 29 de agosto de 2026:

Dónde lo llama10 s en 4K
E2X$1.80
fal$3.00
Google, directo$3.04
Runware$3.20
WaveSpeed$3.90

La cifra de Google se deriva de su tarifa publicada de tokens por segundo y no de un precio de etiqueta, y la de fal es una repercusión de la lista de Google y no una lectura independiente del cómputo. La horquilla es estructural: desde la base de 720p, Google cobra el triple por el 4K donde nosotros cobramos el doble. Un 41 % menos en 4K es la diferencia más ancha de nuestros cuatro niveles, y una toma de ocho segundos son $1.44 aquí frente a $2.43 directos. La auditoría proveedor por proveedor tiene el resto.

La otra mitad de la aritmética es dónde itera. Diez pasadas de búsqueda a 360p más un acabado en 1080p salen por $1.73 frente a $5.40 por diez pasadas seguidas en 1080p: un sesenta y ocho por ciento menos a cambio de una generación extra. Una pasada de borrador lleva resolución suficiente para la línea de mirada, la puesta en escena y para saber si la mano encontró la taza; no la suficiente para la textura de piel ni para la sincronía labial, así que presupueste dos tomas a resolución completa una vez cerrado el bucle. Y pregúntese si el plano necesita este modelo: Veo 3.1 Fast va a un centavo por segundo aquí, y para un retrato suelto sin continuación la prima de nueve veces compra muy poco.

Los límites, dichos sin rodeos

No es una sección de descargo. Cada punto de abajo le ha cambiado el plan de proyecto a alguien.

SynthID va en cada fotograma, y no hay interruptor. En palabras de Google: «todos los vídeos generados incluyen marca de agua SynthID, invisible para el espectador pero detectable programáticamente para verificar la procedencia». Ningún proveedor expone un interruptor y, como la marca está hecha para sobrevivir a la recodificación, al recorte y a los cambios de color, «ya lo quitaremos en posproducción» no es un plan. Si un contrato de entrega prohíbe activos con marca de agua, resuélvalo antes de renderizar.

La edición de vídeos subidos no está disponible en el EEE, Suiza y el Reino Unido. La frase de Google, incluido el paréntesis que decide cuánto le afecta esto: «la edición o extensión de vídeos subidos no está disponible actualmente para usuarios del Espacio Económico Europeo (EEE), Suiza y el Reino Unido (sí está soportada la edición o extensión de vídeos generados por el modelo)». Un equipo europeo todavía puede generar un plano y extender su propia salida; lo que no puede es continuar metraje que haya subido un usuario. Cubrimos las consecuencias en el post de las escenas de cuarenta segundos: lo más caro de esta lista de descubrir tarde.

Las subidas con ciertas personas se rechazan. Dos frases más de la misma sección de limitaciones, ambas acotadas a esas regiones: «la subida y edición de imágenes que contienen menores no está soportada en el Espacio Económico Europeo, Suiza y el Reino Unido» y «la subida y edición de imágenes que contienen a ciertas personas reconocibles no está soportada en el Espacio Económico Europeo, Suiza y el Reino Unido». La superficie de rechazo parece más ancha que ese texto: JXP, en la misma prueba de la era anterior, informa de que un prompt que nombraba una marca real «fue bloqueado al enviarlo con un mensaje genérico de política», y de que una petición de «envejecer diez años a un personaje adulto genérico» también quedó bloqueada. No construya un pipeline que dependa de que los rechazos no ocurran.

Las personas reales son una cuestión legal antes que técnica. El parecido reconocible de una persona real, hecho sin su acuerdo, choca con derechos de personalidad e imagen que varían según la jurisdicción y que no decaen porque la salida sea sintética. Aparte, las obligaciones de transparencia del artículo 50 del Reglamento de IA de la UE se aplican desde el 2 de agosto de 2026: los responsables del despliegue deben revelar que el contenido está generado o manipulado artificialmente, con claridad y en la primera exposición. SynthID responde a un requisito de marcado legible por máquina; no responde al deber de decírselo a quien está mirando. Esa es una decisión de etiquetado que se toma con asesoría jurídica, no un flag en una llamada de API.

Una cara generada no es una persona, pero puede quedar lo bastante cerca de una como para que alguien salga perjudicado. El consentimiento, la divulgación y la disposición a no hacer el plano pertenecen a este oficio igual que la distancia focal.

Preguntas frecuentes

¿Cómo se consigue una piel realista en Gemini Omni 1.1 Flash?

Describa la superficie en lugar de elogiarla. «Perfect skin», «flawless» y «beautiful» seleccionan imaginería comercial retocada y aplanan la textura. Cámbielos por hechos observables —poros visibles en la nariz y las mejillas, brillo en la frente, una cicatriz pequeña— y declare una edad. Google pide una descripción de personaje extremadamente detallada, que no es lo mismo que pedir un personaje atractivo.

¿Por qué salen mal las manos en el vídeo con IA y cómo se arregla desde el prompt?

Los dedos son movimiento complejo en una región pequeña que se autoocluye, y la model card de Google nombra el movimiento complejo como algo que «sigue siendo un reto». Déles un trabajo a las manos en lugar de describirlas: un objeto concreto con un agarre declarado, o una acción con principio y final. Manténgalas en un solo plano de enfoque y lejos de la cara.

¿Se puede desactivar el audio en Gemini Omni 1.1 Flash?

No. El audio se genera de forma nativa junto con la imagen, ningún parámetro lo desactiva y no se factura aparte de la tarifa por segundo. Puede dirigirlo con una frase «Sound design:» y con cláusulas explícitas de «No dialogue.» o «No music.», pero no rechazarlo. Para reproducción en silencio, silencie el reproductor.

¿Cómo debe escribirse el diálogo en un prompt de Omni?

Use la forma documentada por Google: hablante, dos puntos, línea, sin comillas. La dirección de voz va después en prosa llana, ya que no existe ningún parámetro de voz: acento, edad, registro y ritmo llegan todos como inglés. Mantenga las líneas cortas, colóquelas pronto y describa el tono en lugar de pedir una interpretación «emotional».

¿Cuánto tiempo aguanta la sincronía labial de Gemini Omni?

invideo, en una prueba que nombra el modelo probado como Gemini Omni Flash y no como 1.1, informa de que con una sola persona hablando la sincronía labial aguanta unos seis o siete segundos antes de decaer, y llama punto débil a los dos hablantes en un mismo encuadre, donde el modelo pierde la sincronía o atribuye mal el diálogo. Es el hallazgo de un evaluador sobre un modelo anterior, no una especificación de Google, pero apunta a un hablante por generación y a líneas cortas colocadas pronto.

¿Puede Gemini Omni 1.1 Flash generar el parecido de una persona real?

No de forma fiable, y piénselo mucho antes de intentarlo. La documentación de Google dice que la subida y edición de imágenes que contienen a ciertas personas reconocibles no está soportada en el EEE, Suiza y el Reino Unido, y los evaluadores informan de rechazos por nombres de marcas reales y por ediciones de personaje corrientes. Más allá del filtro, los derechos de imagen varían según la jurisdicción y no decaen porque el metraje sea sintético.

¿La marca de agua SynthID aparece en todos los fotogramas y se puede quitar?

Todo vídeo generado lleva SynthID, incrustado en el momento de la generación, invisible para el espectador y detectable programáticamente. Ningún proveedor expone un interruptor, y la marca sobrevive a la compresión, al recorte y a los cambios de color, así que quitarla no es un flujo de trabajo con el que se pueda contar. Si un pliego de entrega prohíbe material con marca de agua, resuélvalo antes de renderizar.

¿Sale más barato iterar sobre caras a baja resolución?

Sí, mucho. Diez pasadas de búsqueda a 360p más un acabado en 1080p cuestan $1.73 en E2X frente a $5.40 por diez pasadas en 1080p: un sesenta y ocho por ciento menos a cambio de una generación extra. Las pasadas de borrador llevan resolución suficiente para la línea de mirada y la puesta en escena, pero no para la textura de piel ni para la sincronía labial, así que planifique dos tomas a resolución completa una vez cerrado el bucle de borradores.

Los precios y las condiciones de producto cambian. Compruebe el precio vigente de cada proveedor antes de tomar una decisión de compra.

Los esquemas y las tarifas en vivo de las cuatro capacidades están en la página del modelo. Al lado: la sintaxis de prompt documentada, qué cuestan de verdad las secuencias de cuarenta segundos y dónde los mismos pesos se venden más caros.