Voltar ao Blog

Pessoas fotorrealistas no Gemini Omni 1.1 Flash: apague a palavra 'linda'

E2X Team··18 min de leitura
gemini-omniprompt-engineeringphotorealismtext-to-videogoogle

O jeito mais rápido de fazer um humano gerado parecer falso é pedir um humano atraente.

Escreva beautiful woman, perfect skin, flawless, stunning e o modelo obedece — ele busca a região dos dados de treinamento onde essas legendas vivem, que é a fotografia comercial retocada. Poros sumiram, assimetria sumiu, e as pequenas tensões que fazem um rosto ser lido como ocupado por alguém sumiram junto. Nada na saída está errado. O prompt pediu um anúncio de beleza e recebeu um.

A orientação de prompt do próprio Google aponta para o outro lado numa frase — "Seja extremamente detalhado nas suas descrições de personagens e ambientes." Detalhado, não elogioso. São instruções diferentes e produzem rostos diferentes. O que vem a seguir é a diferença: rostos, mãos, o áudio que você não consegue desligar, e onde o Google decidiu que você não pode ir.

Retrato em close extremo de um homem na casa dos sessenta ao lado de uma janela voltada para o norte, preenchendo o quadro da testa ao queixo, luz do dia suave e direcional resolvendo a textura dos poros e a barba grisalha por fazer

Um rosto é uma lista de fatos, não uma lista de elogios

Todo adjetivo é um voto num agrupamento de legendas, e gorgeous vota em banco de imagens. 8k, hyperrealistic, masterpiece vieram do folclore dos modelos de imagem, onde serviam como tokens de qualidade; num modelo de vídeo sem parâmetros de amostragem eles só competem com as palavras que descrevem o seu plano. As substituições são específicas e chatas, que é justamente o ponto:

Idade como número ou década. "Uma mulher no fim dos quarenta" é uma restrição; "uma mulher jovem" é um bilhete de loteria.

Uma imperfeição nomeada. Uma cicatriz elevada, um dente da frente lascado, um nariz quebrado uma vez e mal alinhado. Uma basta; três já lê como ficha de personagem.

Pele como superfície. Poros visíveis no nariz e nas bochechas, brilho na testa, capilares rompidos na narina. A substituição de maior rendimento no prompt: "pele perfeita" e "poros visíveis no nariz" ficam em pontas opostas do espaço de legendas.

Olhar com direção e mudança. Não "olhando para a câmera", mas "lê algo fora de quadro à direita, depois os olhos dela saltam para a lente por cerca de um segundo e desviam de novo". Contato visual ininterrupto por um clipe inteiro é algo que quase nenhum humano faz, então um eixo de olhar não especificado deixa o modelo adivinhando justamente a coisa que o espectador lê primeiro.

Uma microexpressão, cronometrada. "O canto da boca dela retesa uma vez." Um evento encenado ganha de "emocionante", porque o modelo consegue encenar um evento e não consegue encenar uma abstração.

Desgaste em tudo que não é pele. Uma gola lavada duzentas vezes, uma pulseira de relógio amolecida, um anel de café nos papéis. Figurino vende uma pessoa de forma mais confiável do que um rosto.

A troca, em concreto. Primeiro, a versão que parece uma foto de banco de imagens que aprendeu a piscar:

A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.

A maioria dessas palavras descreve uma fotografia; nenhuma descreve uma pessoa. A reescrita mantém o plano e troca cada elogio por um fato:

In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.

Nada na segunda versão pede qualidade. Ela fornece uma textura para renderizar, um motivo para o eixo de olhar e um evento cronometrado — três coisas sobre as quais o modelo pode agir, onde "stunning" são três coisas sobre as quais ele não pode. Repare também na oração de quantidade de planos logo no início: o Omni constrói vários planos por padrão, como cobrimos no guia de prompting, e um retrato que corta duas vezes em seis segundos não consegue segurar um rosto.

Macro extremo de uma bochecha e uma têmpora humanas iluminadas por luz rasante dura vinda da extrema esquerda, metade do quadro clara e texturizada e a outra metade caindo na sombra

Uma ressalva sobre olhos: "olhos molhados" e "filme lacrimal brilhante" são palavras de qualidade fantasiadas de técnicas, nomeando um brilho em vez de uma causa. Dê ao olho algo para fazer e deixe o especular decorrer da luz que você já especificou.

Mãos: dê a elas um trabalho

Mãos são o constrangimento tradicional do vídeo generativo e ainda a coisa com mais chance de encerrar uma tomada. O model card da DeepMind não as destaca, mas nomeia a categoria delas: "manter consistência completa ao longo de edições, gerar cenas com movimento complexo ou renderizar texto perfeitamente preciso continuam sendo um desafio." Dedos são movimento complexo num pedaço pequeno do quadro, articulados de muitas formas e se auto-ocluindo o tempo todo.

A correção é contraintuitiva. Não descreva as mãos — atribua uma tarefa a elas. Uma mão segurando um objeto específico com uma pegada declarada tem uma forma e um ponto de contato para se ancorar. "Mãos lindas e elegantes" não fornece nenhum dos dois, e deixa a contagem de dedos para o modelo inventar.

Compare:

  • Fraco: as mãos dela descansam naturalmente ao lado do corpo
  • Melhor: ela segura uma caneca de esmalte lascada com as duas mãos, os polegares sobrepostos do lado próximo
  • Fraco: ele gesticula enquanto fala
  • Melhor: ele gira uma caneta duas vezes na mão direita, depois a apoia sobre os papéis

A segunda forma de cada par fixa implicitamente a contagem de dedos, dá ao movimento um começo e um fim, e produz um tempo em que você pode cortar.

Uma ressalva que governa toda cifra de terceiros neste post. As duas resenhas práticas publicadas que conseguimos encontrar — a da invideo e o teste multi-turno do time da JXP, assinado em 21 de maio de 2026 — nomeiam o modelo testado como Gemini Omni Flash, sem nenhum sufixo 1.1 em nenhuma das duas peças. Nenhuma delas mede o modelo de que trata este post; leia-as como evidência sobre a família. A JXP relata que, no quinto turno de edição de um plano de violino, "A mão esquerda dela deslizou ligeiramente para fora do espelho." As mãos foram primeiro, enquanto todo o resto ainda se sustentava.

Mais duas regras que não custam nada. Mantenha as mãos num único plano de foco — uma mão empurrada contra uma grande-angular é a coisa mais difícil que você pode pedir. E mantenha as mãos longe do rosto, porque a oclusão entre duas estruturas difíceis compõe a falha em vez de fazer a média dela.

Fotografia macro das duas mãos molhadas de um ceramista fechando-se em torno de um cilindro de argila girando, barbotina escorrendo entre os dedos, tendões e dobras dos nós dos dedos realçados pela luz

Você está dirigindo uma voz, tendo pretendido ou não

O áudio aqui é nativo: produzido na mesma passada que a imagem, desligado por nenhum parâmetro, cobrado à parte por nenhum provedor que tenhamos verificado. Um prompt que não diz nada sobre som não é, portanto, um pedido de silêncio — é um briefing sem supervisão, e o modelo vai preenchê-lo.

Então escreva o áudio deliberadamente, em frases próprias. A forma de diálogo documentada pelo Google é dois-pontos sem aspas — the man says: We lost it — e a alegação muito repetida de que aspas disparam um modo de lip-sync não aparece em documento nenhum do Google.

Quatro coisas decidem se um plano falado funciona:

Comprimento da fala. A invideo, numa resenha que nomeia o modelo testado como Gemini Omni Flash, relata que "Para uma única pessoa falando, o lip sync se sustenta até cerca de 6 a 7 segundos antes de começar a cair." Uma direção e não uma especificação, mas ela aponta para um lado: uma fala de quatro a doze palavras colocada cedo, depois silêncio e uma reação, ganha de uma frase que corre pela tomada inteira.

Um falante em quadro. A mesma resenha é direta: "Dois falantes em um mesmo quadro seguem sendo um ponto fraco, já que o Omni muitas vezes perde o sync ou atribui o diálogo errado, então planos de um único falante são a aposta segura hoje." Faça da segunda pessoa um ombro na borda do quadro, fora de foco, e grave a fala dela como uma geração separada.

Direção de voz em prosa. Não existe parâmetro de voz, então sotaque, idade, registro e ritmo entram como inglês comum: tired, quiet, American accent, no rise at the end.

Silêncio explícito. Diga No dialogue. ou No music.

Antes e depois de um plano de diálogo. A versão fraca comete todas as falhas acima de uma vez — dois falantes em quadro, aspas, uma fala para cada, adjetivos no lugar de direção:

A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.

A reescrita tira um falante do quadro, corta a fala para quatro palavras e descreve a voz em vez de elogiá-la:

In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.

A resposta dela pertence a uma segunda geração, enquadrada nela — dois clipes em vez de um, e ainda mais barato do que refazer um plano de dois oito vezes torcendo para o sync aterrissar nos dois rostos ao mesmo tempo.

Um limite documentado: você não pode pegar um vídeo enviado de alguém falando e estendê-lo com diálogo novo. Isso é retido, não ausente, e o model card diz isso com todas as letras — "Como parte da edição de vídeos, o Gemini Omni Flash é capaz de mudar a fala das pessoas. Por ora, estamos restringindo essa capacidade e trabalhando para entender melhor como levá-la aos nossos usuários de forma segura e responsável." O modelo consegue redublar uma pessoa; o Google decidiu que você não pode. Dublagem não é um produto que você possa construir aqui.

Multidões, figuras de fundo e onde não gastar

Pessoas de fundo recebem a atenção que sobrou, e uma rua movimentada de pedestres é uma fileira de rostos que não sobrevive a um botão de pausa. Dê um número — "quatro pessoas em mesas espalhadas" ganha de "um café lotado", porque quantidade vaga convida a aproximações. Mantenha-as fora do plano focal, já que figuras suavizadas por uma 50mm de campo raso são críveis onde as mesmas figuras nítidas em f/11 são uma galeria de quase-acertos. E dê a elas uma ação cada, de costas: nucas são de graça. Se um rosto de fundo específico importa, promova-o ao plano dele.

Quanto custam as tomadas, e por que 4K é o número que importa

Rostos são onde você queima gerações — você refaz pelo eixo de olhar, depois pela mão, depois porque a voz saiu vinte anos jovem demais. Precificar esse trabalho com honestidade significa precificar tomadas, não clipes. E a diferença entre provedores é maior no topo da escada. Dez segundos de 4K, em 29 de agosto de 2026:

Onde você chama10s em 4K
E2X$1.80
fal$3.00
Google, direto$3.04
Runware$3.20
WaveSpeed$3.90

A cifra do Google deriva da taxa publicada de tokens por segundo e não de um preço de etiqueta, e a da fal é um repasse da lista do Google e não uma leitura independente da computação. A diferença é estrutural: a partir da base de 720p, o Google cobra o triplo pelo 4K onde nós cobramos o dobro. 41% menos em 4K é a maior dos nossos quatro tiers, e uma tomada de oito segundos sai $1.44 aqui contra $2.43 direto. A auditoria provedor por provedor tem o resto.

A outra metade da aritmética é onde você itera. Dez passadas de busca em 360p mais um acabamento em 1080p dão $1.73 contra $5.40 por dez passadas diretas em 1080p — sessenta e oito por cento a menos por uma geração a mais. Uma passada de rascunho carrega resolução suficiente para eixo de olhar, marcação e se a mão achou a caneca; não o bastante para textura de pele ou lip sync, então orce duas tomadas em resolução plena depois que o loop fechar. E pergunte se o plano precisa deste modelo: o Veo 3.1 Fast roda a um centavo por segundo aqui, e para um retrato único sem continuação o prêmio de nove vezes compra muito pouco.

Os limites, ditos sem rodeios

Não é uma seção de aviso legal. Todo item abaixo já mudou o plano de projeto de alguém.

O SynthID está em todo frame, e não há chave. Nas palavras do Google: "Todos os vídeos gerados incluem a marca-d'água SynthID, que é invisível para os espectadores mas pode ser detectada programaticamente para verificação de proveniência." Nenhum provedor expõe um botão e, como a marca é construída para sobreviver a recompressão, corte e mudanças de cor, "a gente tira na pós" não é um plano. Se um contrato de entrega proíbe ativos com marca-d'água, resolva isso antes de renderizar.

Edição de vídeo enviado não está disponível no EEE, na Suíça e no Reino Unido. A linha do Google, incluindo o parêntese que decide quão ruim isso é para você: "Editar ou estender vídeos enviados não está disponível no momento para usuários no Espaço Econômico Europeu (EEE), na Suíça e no Reino Unido (editar ou estender vídeos gerados pelo modelo é suportado)." Um time europeu ainda pode gerar um plano e estender a própria saída; o que não pode é continuar material que um usuário enviou. Cobrimos as consequências no post das cenas de quarenta segundos — o item mais caro daqui para se descobrir tarde.

Envios contendo certas pessoas são recusados. Mais duas linhas da mesma seção de limitações, ambas restritas àquelas regiões: "Subir e editar imagens contendo menores de idade não é suportado no Espaço Econômico Europeu, na Suíça e no Reino Unido", e "Subir e editar imagens contendo certas pessoas reconhecíveis não é suportado no Espaço Econômico Europeu, na Suíça e no Reino Unido." A superfície de recusa parece mais ampla que essa formulação: a JXP, na mesma resenha da era anterior, relata que um prompt que nomeava uma marca real "foi bloqueado na submissão com uma mensagem genérica de política", e um pedido para "envelhecer um personagem adulto genérico em dez anos" também foi bloqueado. Não construa um pipeline que dependa de recusas não acontecerem.

Pessoas reais são uma questão jurídica antes de ser técnica. Uma semelhança reconhecível de uma pessoa real, feita sem o acordo dela, esbarra em direitos de personalidade e de imagem que variam por jurisdição e não são renunciados porque a saída é sintética. Separadamente, obrigações de transparência sob o Artigo 50 do AI Act da UE valem a partir de 2 de agosto de 2026: quem implanta deve divulgar que o conteúdo é gerado ou manipulado artificialmente, com clareza e na primeira exposição. O SynthID responde a um requisito de marcação legível por máquina; não responde ao dever de contar à pessoa que está assistindo. Essa é uma decisão de rotulagem para tomar com o jurídico, não uma flag numa chamada de API.

Um rosto gerado não é uma pessoa, mas pode ficar perto o bastante de uma para que alguém seja prejudicado. Consentimento, divulgação e disposição para não fazer o plano pertencem a este ofício do mesmo jeito que distância focal pertence.

Perguntas frequentes

Como obter pele realista no Gemini Omni 1.1 Flash?

Descreva a superfície em vez de elogiá-la. "Pele perfeita", "impecável" e "linda" selecionam imagens comerciais retocadas e achatam a textura. Troque-as por fatos observáveis — poros visíveis no nariz e nas bochechas, brilho na testa, uma pequena cicatriz — e declare uma idade. O Google pede descrição de personagem extremamente detalhada, o que não é o mesmo que pedir um personagem atraente.

Por que as mãos saem erradas em vídeo de IA, e como corrigir isso no prompt?

Dedos são movimento complexo numa região pequena e auto-oclusiva, e o model card do Google nomeia movimento complexo como algo que "continua sendo um desafio". Dê às mãos um trabalho em vez de descrevê-las: um objeto específico com uma pegada declarada, ou uma ação com começo e fim. Mantenha-as num único plano de foco, longe do rosto.

Dá para desligar o áudio no Gemini Omni 1.1 Flash?

Não. O áudio é gerado nativamente junto com a imagem, nenhum parâmetro o desativa e ele não é cobrado à parte da taxa por segundo. Você pode dirigi-lo com uma frase "Sound design:" e orações explícitas "No dialogue." ou "No music.", mas não recusá-lo. Para reprodução silenciosa, mude o player.

Como o diálogo deve ser escrito num prompt do Omni?

Use a forma documentada pelo Google: falante, dois-pontos, fala, sem aspas. A direção de voz vem em seguida em prosa simples, já que não existe parâmetro de voz — sotaque, idade, registro e ritmo chegam todos como inglês. Mantenha as falas curtas, coloque-as cedo, descreva o tom em vez de pedir uma entrega "emocionante".

Por quanto tempo o Gemini Omni segura o lip sync?

A invideo, numa resenha que nomeia o modelo testado como Gemini Omni Flash e não 1.1, relata que com uma única pessoa falando o lip sync se sustenta por cerca de seis a sete segundos antes de cair, e chama dois falantes num mesmo quadro de ponto fraco onde o modelo perde o sync ou atribui o diálogo errado. Uma constatação de resenhista sobre um modelo anterior, não uma especificação do Google, mas ela argumenta a favor de um falante por geração e de falas curtas colocadas cedo.

O Gemini Omni 1.1 Flash consegue gerar a semelhança de uma pessoa real?

Não de forma confiável, e pense bem antes de tentar. A documentação do Google diz que subir e editar imagens contendo certas pessoas reconhecíveis não é suportado no EEE, na Suíça e no Reino Unido, e testadores relatam recusas para nomes de marcas reais e para edições comuns de personagem. Além do filtro, direitos de imagem variam por jurisdição e não são renunciados porque o material é sintético.

A marca-d'água SynthID aparece em todo frame, e dá para removê-la?

Todo vídeo gerado carrega o SynthID, embutido no momento da geração, invisível para os espectadores e detectável programaticamente. Nenhum provedor expõe uma chave, e a marca sobrevive a compressão, corte e mudanças de cor, então remoção não é um fluxo que você possa planejar. Se uma especificação de entrega proíbe material com marca-d'água, resolva isso antes de renderizar.

É mais barato iterar em rostos em resolução baixa?

Sim, e bastante. Dez passadas de busca em 360p mais um acabamento em 1080p custam $1.73 na E2X contra $5.40 por dez passadas em 1080p — sessenta e oito por cento a menos por uma geração a mais. Passadas de rascunho carregam resolução suficiente para eixo de olhar e marcação, mas não para textura de pele ou lip sync, então planeje duas tomadas em resolução plena depois que o loop de rascunho fechar.

Preços e termos de produto mudam. Verifique o preço atual de cada provedor antes de tomar uma decisão de compra.

Schemas e taxas ao vivo para as quatro capacidades ficam na página do modelo. Ao lado: a sintaxe de prompt documentada, quanto sequências de quarenta segundos custam de verdade e onde os mesmos pesos são vendidos por mais.