Voltar ao Blog

As palavras de câmera nas quais o Gemini Omni 1.1 Flash age, e as que ele ignora

E2X Team··18 min de leitura
gemini-omniprompt-engineeringcinematographytext-to-videovideo-generation

Leia o material de prompting de vídeo do Google por tempo suficiente e você esbarra em duas frases separadas por alguns parágrafos. Uma publica uma lista de movimentos de câmera — dolly, truck, pedestal, grua, whip pan, arco — como se você estivesse pedindo de um cardápio. A outra avisa que "Alguns ângulos de câmera avançados não são oficialmente suportados. Os resultados e a confiabilidade podem variar dependendo do prompt como um todo e do seu caso de uso específico."

As duas são verdadeiras, e a lacuna entre elas é de onde vem a maioria dos clipes decepcionantes. Um movimento nomeado é um pedido que o modelo provavelmente vai honrar, não um parâmetro que ele precisa executar. Não existe campo de pose de câmera no gemini-omni-1.1-flash — sem rig, sem lente, só palavras competindo com as suas outras palavras. Este post é sobre quais dessas palavras merecem seu lugar, trabalhado a partir do que o Google documenta, do que a Runway relata e do que o schema expõe.

Cinco lentes prime de cinema antigas em pé sobre veludo preto numa locadora de equipamento na penumbra, dispostas da mais curta para a mais longa, os anéis de foco de latão pegando uma única luz lateral dura vinda da esquerda

As palavras que caem fora de cara

Comece pela subtração, que não custa nada e compra espaço de prompt. A referência de prompting de câmera da Runway é direta sobre as duas palavras mais comuns em prompts de vídeo de IA: "'Cinematográfico' e '4k' saem porque não estão fazendo trabalho nenhum. Nenhuma das duas muda o que a câmera faz, e o espaço de prompt que elas ocupam é mais bem gasto no movimento."

Essa é uma afirmação sobre as ferramentas deles, não as do Google, mas o raciocínio se transfere. "Cinematográfico" descreve uma impressão, não um ponto de vista: não diz onde ficar, a que distância, o que manter nítido, nem para que lado viajar. O mesmo vale para a carga que vem atrás — masterpiece, award-winning, 8k, ultra detailed — herdada da cultura de prompt dos modelos de imagem, onde esses tokens funcionavam como encantamentos de qualidade contra uma distribuição de treinamento muito diferente.

A forma positiva é igualmente simples: nomeie um movimento específico em vez de pedir "câmera cinematográfica dinâmica", porque esses modelos tratam "instruções de câmera como direção espacial, não como decoração." Nada ali diz que "cinematográfico" atrapalha. Diz que a palavra desloca algo melhor, e num prompt de algumas dezenas de palavras, deslocamento é o jogo inteiro.

A lista do Google, e até onde confiar nela

O vocabulário documentado bate qualquer coisa que circula em threads de prompt:

CategoriaO que o Google nomeia
Movimentoestático · pan · tilt · dolly (para dentro, para fora) · truck (esquerda, direita) · pedestal (cima, baixo) · zoom · grua · aéreo ou drone · câmera na mão · whip pan · arco
Ângulo e escalana altura dos olhos · baixo · alto · olho de pássaro · holandês · ponto de vista · por cima do ombro · close extremo · close · plano médio · plano inteiro · geral ou de apresentação
Ópticagrande-angular · teleobjetiva · profundidade de campo profunda e rasa · lens flare · rack focus · olho de peixe · dolly zoom

Dois detalhes recompensam atenção. O Google separa zoom de dolly deliberadamente, porque os modelos confundem os dois: um zoom é uma mudança de distância focal, e "Isso é diferente de um dolly, já que a câmera em si não se move." Quer que o fundo cresça em relação ao seu sujeito? Peça um dolly. Quer que o quadro feche com a geometria inalterada? Peça um zoom. Escreva "zoom in slowly as the camera pushes forward" e você pediu os dois — um dolly zoom, e quase nunca o que se queria.

Segundo, termos amplamente creditados ao Google não estão nas páginas dele. Oner, push in e natural smartphone zoom aparecem em guias que citam a documentação do Google; não conseguimos encontrá-los lá. Não documentado não é proibido, mas eles não carregam mais autoridade que uma expressão que você invente. A sintaxe documentada completa está no nosso guia de prompting.

Um movimento por clipe

A descoberta mais afiada da referência da Runway não é quais verbos funcionam, e sim quantos.

"Verbos empilhados (não confiável): 'Orbite o sujeito e suba de grua e faça um push in.' Descrição em fases (confiável): 'A câmera faz um arco em torno da figura sentada, depois sobe acima da mesa para revelar as cadeiras vazias ao redor dela.'"

O conselho que vem em seguida é descrever o que preenche o quadro em cada etapa em vez de empilhar verbos e, se o movimento composto ainda falhar, "voltar para um movimento só e gerar o segundo tempo como um clipe próprio."

O Omni dá a isso um agravante mecânico, vindo da própria documentação do Google: o modelo produz vários planos por padrão a menos que seja instruído do contrário. Peça três movimentos simultâneos e você entregou a ele uma saída — cortar. Orbita dois segundos, corta, grua por dois, corta, push in no resto. Toda instrução honrada, nada do que você queria. A correção de uma oração, "In a single continuous shot" ou "No scene cuts", impede o modelo de resolver a sua ambiguidade com uma montagem.

Uma cena, gerada duas vezes, mudando só a oração de câmera:

Quatro segundos de cada lado em 720p, trinta e seis centavos cada. Sujeito, sala, luz e linha de som são idênticos; só a frase de abertura difere, um quadro travado contra um dolly in lento. A oração de câmera é a frase de maior alavancagem do prompt, e a que a maioria das pessoas escreve por último.

Distância focal é direção, não óptica

Não existe lente. Vale dizer sem rodeios, porque o modelo mental importa. Escreva "85mm" e o modelo não está calculando um ângulo de visão; ele busca tudo que nos dados de treinamento está rotulado assim, e fotografias carregam esse rótulo aos milhões. O que volta é o look preso ao número: fundo comprimido, sujeito recortado de um campo suave, distância achatada. Numa lente curta, perspectiva esticada, mais sala no quadro, bordas curvando.

O que faz da distância focal uma das palavras mais eficientes disponíveis, movendo enquadramento e sensação juntos em quatro caracteres. A orientação que circula é consistente — mais ou menos 24mm para contexto amplo, 35mm para uma sensação documental, 50mm para narrativa neutra, 85mm para trabalho íntimo e comprimido — lida como direção visual, não como promessa de óptica literal.

Cinco tubos telescópicos de latão polido de comprimento crescente, em pé numa fileira sobre um piso de concreto aparente, o mais curto à esquerda

Dois hábitos decorrem daí. Dê ao número um trabalho em vez de deixá-lo como adjetivo: "35mm" sozinho é um token, enquanto "35mm, a oficina visível atrás dela o tempo todo" diz para que serve a grande-angular, e essa oração sobrevive mesmo que o número seja ignorado. Os termos ópticos documentados pelo Google — profundidade de campo rasa, foco profundo, rack focus, teleobjetiva — fazem o mesmo trabalho em palavras simples. E nunca combine uma distância focal com uma instrução contraditória: "85mm wide establishing shot of the valley" pede compressão e amplitude ao mesmo tempo.

Enquadramento é a coisa mais confiável que você pode especificar

Ordene a linguagem de câmera por quão confiavelmente ela aterrissa e um padrão aparece: propriedades estáticas ganham das temporais.

Escala de plano — do close extremo ao geral de apresentação — é uma propriedade de um único frame. O ângulo também, e a geometria de um plano de dois ou de um por cima do ombro também. O modelo pode satisfazer qualquer uma delas no primeiro frame que renderiza e depois segurar.

Um dolly in é uma afirmação sobre o frame um contra o frame noventa e seis, e precisa sobreviver a cada frame no meio, num processo sem representação explícita de onde a câmera está. Essa é a lacuna que a literatura de pesquisa existe para fechar: o CameraCtrl, o trabalho de referência sobre controle de câmera em difusão de vídeo, abre notando que os modelos existentes "carecem de controle da pose de câmera, que serve como uma linguagem cinematográfica para expressar nuances narrativas mais profundas", e então acrescenta um módulo de condicionamento de pose porque texto sozinho não bastava. Nenhuma API de vídeo em produção que conheçamos expõe esse canal.

Daí uma hierarquia que vale memorizar. Enquadramento e ângulo: especifique à vontade, espere obediência. Um movimento nomeado: espere que aconteça na maioria das vezes. Dois movimentos, ou um movimento com velocidade e ponto de parada declarados: espere várias tomadas, ou divida o tempo.

Uma mão segurando à distância do braço um visor de diretor de cartolina preta, contra uma paisagem costeira desfocada ao anoitecer

Antes e depois

Um prompt escrito do jeito que a maioria dos prompts de câmera é escrita. Cada palavra dele é uma que já usamos.

Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.

Conte o que é acionável. Três verbos empilhados que não conseguem se sustentar todos numa tomada só. Nenhuma escala de plano, nenhuma distância focal, nenhuma instrução sobre quantidade de planos — então o padrão documentado de múltiplos planos fica livre para disparar e, com três movimentos concorrentes na mesa, cortar é o caminho de menor resistência.

O mesmo plano, reescrito para dizer só o que o modelo pode acionar:

In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.

Quatro mudanças, em ordem de peso. A oração de quantidade de planos vem primeiro, para que a ambiguidade não possa ser respondida com uma montagem. Três movimentos colapsam em um, com o enquadramento de abertura e de fechamento nomeados — a descrição em fases que a Runway recomenda, escrita como um único trajeto. A distância focal chega presa a uma consequência. E o som ganha frases próprias, conforme a orientação do Google de descrever áudio separadamente, com os negativos como orações curtas no fim. A reescrita é mais simples e mais chata de ler, o que costuma ser o sinal de que um prompt parou de descrever um clima e começou a descrever um plano.

Onde a câmera entra no prompt

Ordem é a pergunta para a qual esperávamos não haver resposta. Há uma, vinda da orientação de Veo do Google e não da página do Omni: a fórmula lá é cinematografia, sujeito, ação, contexto, estilo e ambiência — câmera primeiro, antes de você nomear quem está no plano — porque esse elemento "é a ferramenta mais poderosa para transmitir tom e emoção." A documentação do próprio Omni lista os elementos de outro jeito, com a câmera no meio da lista, então o Google publica duas ordenações e nós não rodamos nenhuma comparação controlada.

Liderar com a câmera de fato sobrevive ao contato com o outro comportamento documentado do Omni, já que a instrução de quantidade de planos precisa aterrissar antes de o modelo começar a construir uma narrativa. Também torna um prompt auditável: se a primeira frase não descreve um ponto de vista, você não dirigiu um plano.

O que o schema não vai te dar

Dois limites estruturais, nenhum deles corrigível com uma redação melhor.

O primeiro é repetibilidade. A documentação da API do Google afirma que "Instruções de sistema, temperature, top_p, stop sequences e prompts negativos não são suportados", dizendo para você escrever os negativos dentro do prompt. Não há sampler para apertar. O que sobra é o seed, um inteiro opcional no nosso schema para este modelo, e essa é a superfície de controle inteira.

Isso importa mais para trabalho de câmera do que para qualquer outra coisa num prompt. Iluminação que volta ligeiramente diferente é uma gradação diferente do mesmo plano; um dolly que volta como um pan é um plano diferente. Segurar um movimento estável entre tomadas significa, portanto, fixar o seed e não mudar mais nada — e editar uma palavra significa amostrar do zero. Trate um seed que funciona como um ativo e anote-o ao lado do prompt.

O segundo limite é que velocidade de câmera não tem vocabulário. "Slow dolly in" é a superfície de controle: sem unidade, sem duração, sem jeito de dizer que o push deve terminar no quinto segundo e segurar. Sintaxe de timecode ajuda um pouco — o Omni aceita faixas entre colchetes — então um prompt pode pedir que a câmera se acomode aos quatro segundos. Se ela vai fazer isso é outra história.

Ângulo de obturador e motion blur ficam na mesma coluna: nenhum dos dois aparece no vocabulário documentado do Google. Taxa de quadros passa perto — 24 fps aparece na página do Omni só dentro de um exemplo de cronometragem, "12 frames at 24fps", não como uma alavanca de prompt. Útil para raciocinar sobre timecodes; não é algo para escrever esperando dirigir.

Quanto custam experimentos de câmera, no tier que importa

Trabalho de câmera é a parte do prompting que você não acerta numa passada: você está pedindo comportamento ao longo do tempo sem parâmetro para restringi-lo, então gera, assiste, ajusta, gera de novo. O número que importa é o preço de uma tomada.

Em 4K, uma tomada de oito segundos sai $1.44 aqui contra $2.43 chamando o Google direto. Seis tomadas para acertar um movimento — modesto para qualquer coisa com um trajeto específico — são $8.64 contra $14.60. Essa diferença é de 41%, por larga margem a maior das quatro resoluções e a razão de a linha do 4K ser a única sobre a qual vale discutir. Em outros lugares um segundo de 4K custa $0.30 na fal, $0.32 na Runware e $0.39 na WaveSpeed, contra $0.18 aqui; a Replicate lista o modelo sem nenhuma taxa por segundo.

O jeito de gastar menos, porém, não é um segundo de 4K mais barato, e sim parar de testar movimentos de câmera em 4K. Dez rascunhos de oito segundos no tier de 360p custam $2.38, e 360p basta para ver se a câmera fez o que você pediu — um movimento é legível em qualquer resolução, que é o que o torna barato de testar. Dez rascunhos mais um take de 4K que você fica são $3.82, contra $14.40 por dez tomadas em 4K.

Os dois degraus do topo são upscale, não render nativo — a referência de modelo do Google os rotula "1080p output (upscaled)" e "4K output (upscaled)" — então uma tomada em 4K compra dimensões de entrega, não detalhe extra no plano que você está auditando. Nosso post sobre cenas de quarenta segundos cobre onde isso vale a pena pagar mesmo assim.

Preços e termos de produto podem mudar. Verifique o preço atual de cada provedor antes de tomar uma decisão de compra.

A versão curta

Diga a quantidade de planos primeiro, depois um movimento, depois o enquadramento em que ele começa e termina. Dê à distância focal um motivo para estar ali. Coloque o áudio em frases próprias. Apague toda palavra que descreve como o vídeo deve fazer alguém se sentir, e gaste o espaço em onde a câmera está.

O que saiu no 1.1 está no texto de lançamento, e a auditoria de preços dos provedores explica por que pesos idênticos custam valores diferentes conforme a página. Parâmetros e taxas atuais ficam na página do modelo de text-to-video. Para um movimento único sem nada dependendo dele, precifique antes o Veo 3.1 Fast a um centavo por segundo — o vocabulário de câmera vem do guia que o Google publica para os dois, então a prática se transfere.

Perguntas frequentes

Quais termos de movimento de câmera o Gemini Omni 1.1 Flash entende?

O Google nomeia um vocabulário de movimento — estático, pan e tilt, os pares dolly, truck e pedestal, zoom, grua, drone ou aéreo, câmera na mão, whip pan, arco — além de termos de ângulo, escala de plano e óptica. Ele também avisa que alguns ângulos de câmera avançados não são oficialmente suportados e que a confiabilidade varia com o prompt, então leia um movimento nomeado como um pedido e não como um parâmetro.

Escrever "cinematográfico" num prompt de vídeo faz alguma coisa?

Sozinho, não muito. A referência de prompting de câmera da Runway tira tanto "cinematográfico" quanto "4k", sob o argumento de que nenhum dos dois muda o que a câmera faz e de que o espaço é mais bem gasto nomeando um movimento. A palavra descreve uma impressão em vez de um ponto de vista, então não dá ao modelo nada sobre o que agir — como acontece com "masterpiece", "8k" e o resto da carga vinda do prompting de imagem.

Números de distância focal como 35mm ou 85mm mudam a saída?

Eles deslocam o look, porque fotografias nos dados de treinamento carregam a distância focal nos metadados e o número é lido como uma pista de estilo. Uma lente longa tende a comprimir o fundo e separar o sujeito; uma curta estica a perspectiva e admite mais da sala. Trate isso como direção visual e não como óptica literal, e prenda o número a uma consequência.

Onde a direção de câmera deve ficar num prompt do Omni?

O guia de prompting de Veo do Google coloca a cinematografia primeiro, à frente de sujeito, ação, contexto e estilo, chamando-a de o elemento mais poderoso para transmitir tom. A documentação do próprio Omni coloca os termos de câmera no meio da lista. As duas são do Google. Liderar com a câmera tem uma vantagem prática: a instrução de quantidade de planos é uma decisão de câmera e precisa registrar antes de o modelo começar a construir uma narrativa.

Dá para obter o mesmo movimento de câmera duas vezes no Gemini Omni 1.1 Flash?

Só reutilizando um seed. A documentação do Google diz que temperature, top_p, instruções de sistema, stop sequences e prompts negativos não são suportados, o que deixa o seed — um inteiro opcional no nosso schema — como o controle inteiro de reprodutibilidade. Mude uma palavra do prompt e você está amostrando do zero, então registre o seed que produziu um movimento de que você gostou no momento em que ele funcionou.

Por que a câmera corta no meio do plano quando eu pedi um movimento só?

Porque múltiplos planos são o padrão. O Google documenta que o Omni vai tentar vários planos e construir uma narrativa a menos que seja instruído do contrário, então um prompt que empilha dois ou três movimentos dá a ele uma desculpa para satisfazer cada um num corte separado. A correção documentada é uma oração pedindo uma cena única e ininterrupta, e voltar para um único movimento nomeado remove o incentivo.

Dá para especificar velocidade de obturador ou taxa de quadros num prompt do Gemini Omni?

Nada no vocabulário de câmera documentado pelo Google cobre ângulo de obturador ou motion blur, e não afirmaríamos que esses termos são honrados. Taxa de quadros também não é uma alavanca de prompt: 24 fps aparece na página do Omni do Google dentro de um exemplo de cronometragem — "12 frames at 24fps" — não como uma especificação que você possa definir. Trate a taxa de quadros na pós.

Quanto custa testar prompts de câmera em 4K?

Uma tomada de oito segundos em 4K sai $1.44 na E2X contra $2.43 chamando o Google direto, então seis tomadas dão $8.64 em vez de $14.60 — uma diferença de 41%, a maior das quatro resoluções. Testar em 4K costuma ser desperdício, porém: um movimento é legível em 360p, onde dez rascunhos de oito segundos somam $2.38, e uma tomada de 4K que você fica leva a rodada a $3.82.