As cenas de 40 segundos do Gemini Omni 1.1 Flash são quatro faturas separadas
O número em toda manchete desta semana é quarenta. Cenas de quarenta segundos do novo modelo de vídeo do Google — o que soa como se você digitasse um prompt e recebesse quarenta segundos de volta.
Não é assim. Uma única chamada ao gemini-omni-1.1-flash devolve de três a dez segundos. Quarenta é onde você chega estendendo esse clipe mais três vezes — quatro trabalhos no total, cada um cobrado à parte. Ninguém mentiu — o próprio anúncio do Google descreve as continuações com clareza — mas o número viajou muito longe daquela frase, e chegou a muita gente como uma cifra por geração.
Este é o briefing que a gente ia querer antes de colocar um cartão na mesa: quanto quarenta segundos custam, para que serve o tier de 360p, e as restrições enterradas na documentação — uma das quais bloqueia desenvolvedores europeus da funcionalidade principal, inteiramente.

Quarenta segundos são quatro trabalhos, e quatro faturas
Modelos de vídeo cobram por segundo de saída, e a extensão não tem desconto — uma continuação custa o que uma geração nova custa, então quarenta segundos se precificam como quatro clipes de dez segundos. Em todos os tiers:
| Resolução | Na E2X | Direto do Google |
|---|---|---|
| 360p | $1.19 | $1.35 |
| 720p | $3.60 | $4.06 |
| 1080p | $5.40 | $6.08 |
| 4K | $7.20 | $12.16 |
Quatro vezes dez segundos a cada taxa por segundo. Os nossos vêm do catálogo no ar; as páginas dos modelos carregam a cifra atual se este texto envelhecer.
Aquela coluna do Google merece uma palavra, porque as taxas são inesperadamente difíceis de achar. Duas páginas oficiais carregam a escada completa e uma busca textual não pega nenhuma das duas. No anúncio de lançamento os preços ficam dentro de uma imagem — legíveis para um humano, invisíveis para o Ctrl-F. Na página de Cloud pricing eles aparecem como tokens por segundo contra um medidor de $17.50 por milhão, então não parecem preços até você multiplicar. A página que você abriria primeiro, a documentação de preços da API, dá um degrau de quatro: "um preço efetivo de aproximadamente $0.10 por segundo" em 720p.
As duas concordam, com uma dobra de arredondamento — o anúncio mostra um arrumadinho $0.03 / $0.10 / $0.15 / $0.30, a matemática dos tokens cai um pouco acima de cada um. A cobrança segue os tokens, então a coluna acima também segue; o post de lançamento tem a conta tier por tier.
Cinco dólares e quarenta por quarenta segundos de 1080p, seis e pouco do Google. Esse é o preço de etiqueta antes de uma única tomada alternativa — e você vai fazer, porque é na última extensão que o desvio aparece. Orce o corte que você fica mais os dois que joga fora e uma sequência finalizada de quarenta segundos são dezesseis dólares, não cinco.
A linha do 360p era a que a gente perdia, e escrevíamos isso aqui até pouco tempo atrás. Mudou: nosso tier de rascunho agora é $0.0297 por segundo contra $0.0338 do Google, doze por cento abaixo. Não leia muito nisso. A fal está em $0.03 — uma diferença de um por cento, ruído estatístico vestido de vitória, e o tipo de coisa que vira quando alguém edita um multiplicador. O fluxo de rascunho abaixo vale de quem quer que você compre; ele nunca dependeu de o preço ser o nosso.
O verdadeiro salto do 1.1 é memória, não duração
Duração já era mais ou menos alcançável antes. O que a torna usável é o que o modelo enxerga quando continua.
O preview de junho lia o último segundo do clipe que estava estendendo. Um segundo te diz o que está no quadro e quase nada sobre o que estava acontecendo, então as extensões desviavam. A tomada em movimento parava de acompanhar. Um casaco mudava de tom. A luz se reconstruía a cada emenda.
O Gemini Omni 1.1 Flash lê até dez segundos do material anterior. Dez segundos bastam para saber que o travelling ainda estava andando, de que lado vinha a luz principal e mais ou menos de que cor era o casaco — que é por que uma sequência de quatro partes agora se sustenta. Se alguém te disser que a funcionalidade principal do 1.1 é duração, entendeu ao contrário. Duração era aritmética. Memória é o modelo.
1080p e 4K são upscale, não render
Um parêntese na documentação do Google muda pelo que você deveria pagar. Da referência do modelo, na íntegra: "1080p output (upscaled)" e "4K output (upscaled)". O modelo renderiza abaixo dessas resoluções e amplia. O topo da escada não é mais detalhe — é um arquivo maior carregando a mesma informação.
O que recolore a linha do 4K acima. Doze dólares e pouco, do Google, por quarenta segundos de saída ampliada. Se uma especificação de cliente exige dimensões 4K, pague. Se você escolheu 4K achando que fica melhor, está pagando exatamente o triplo da taxa de 720p do Google por um redimensionamento que daria para rodar no ffmpeg.
Rascunhe em 360p, finalize em 720p
Esta é a parte que economiza dinheiro, e ninguém colocou numa manchete.
360p custa $0.0297 por segundo aqui — um rascunho de quatro segundos são doze centavos, contra $0.36 em 720p e $0.54 em 1080p. O Google também afirma que o 360p roda até 60% mais rápido, um número do fornecedor e não um que a gente mediu, embora a direção esteja obviamente certa.
Agora a aritmética. Digamos que uma tomada leve dez tentativas até o movimento ficar certo — realista para qualquer coisa com um movimento de câmera específico.
- Dez passadas direto em 1080p → $5.40
- Dez passadas em 360p → $1.19, depois uma vencedora re-renderizada em 1080p → $1.73
Sessenta e oito por cento a menos, por uma geração extra no fim. Seja honesto sobre o que uma passada em 360p consegue te dizer: composição, movimento de câmera, se o modelo enfiou cortes que você nunca pediu. Textura fina ela não julga — não há resolução suficiente para carregar isso.
Aqui está o mesmo prompt nos dois tiers, mesmo seed, quatro segundos cada. Primeiro o rascunho:
Depois o render em 720p do prompt e do seed idênticos:
Os dois mostram um cronômetro de latão sobre ardósia escura, câmera em travelling vindo da esquerda, uma luz quente raspando o metal. O prompt para os dois, na íntegra:
Editorial slow-motion macro shot of a brass mechanical stopwatch resting on a dark slate table, its second hand sweeping forward in a single continuous shot with no scene cuts. Camera performs a slow dolly in from the left, shallow depth of field, one warm amber key light raking across the metal, cool blue rim light behind. Fine dust drifts through the beam. Clean dark background, no text, no logos, no people. Sound design: a soft mechanical tick and low room tone, nothing else.
(O prompt foi deixado em inglês: o modelo só foi avaliado para inglês.)
Doze centavos contra trinta e seis. O rascunho nos disse que o travelling lê e que o modelo segurou uma tomada só — tudo o que precisávamos antes de nos comprometer. Rode o seu loop lá embaixo.
A extensão só anda para frente
A extensão de cena acrescenta ao fim, e o formato desse limite decide como você planeja uma sequência. Você não pode inserir no meio de um clipe. Você não pode estender para trás para construir uma entrada. Não existe um "mantém o final, refaz os primeiros quatro segundos" — a capacidade anda numa direção só. Se a tomada três está errada, tudo o que vem depois vai para o lixo junto.
Então concentre o esforço no começo. A primeira geração fixa linguagem de câmera, paleta e iluminação para tudo que vem depois, e é o único segmento que você pode revisar barato. Na terceira extensão você está quatro trabalhos fundo sem jeito de voltar.
Tem mais uma coisa que a extensão não faz. Entregue a ela um vídeo de alguém falando, peça um diálogo novo, e ela recusa — o Google restringe modificação de fala. A cobertura do lançamento lê isso como uma retenção deliberada de lançamento responsável e não como uma funcionalidade faltando; esse enquadramento é do jornalista, mas a restrição está na documentação. Não construa um produto de dublagem em cima deste modelo.
Desenvolvedores europeus, leiam esta linha duas vezes
Enterrada na documentação como uma única frase: no Espaço Econômico Europeu, na Suíça e no Reino Unido, editar e estender um vídeo enviado não está disponível.
Isso não é uma restrição leve. A funcionalidade principal — pega um material, continua ele — não funciona na maior parte da Europa. Text-to-video e image-to-video seguem rodando. Mas se o plano era uma ferramenta que estende clipes que seus usuários enviam, e esses usuários estão em Berlim ou em Manchester, o plano morreu e o anúncio nunca menciona isso.
Confira contra a sua região de deployment antes de escrever uma linha de código de integração. É o item mais caro aqui de se descobrir tarde.
Os botões que não existem
Vindo de um modelo de texto, você vai procurar parâmetros que aqui não existem. A documentação do Google marca toda a superfície de amostragem como não suportada: sem temperature, sem top_p, sem instruções de sistema, sem stop sequences, sem negative prompt. Nada disso.
Sua única superfície de controle é o próprio prompt, e a documentação de terceiros coloca o teto em 40.000 caracteres — bastante corda, embora essa cifra não seja uma que a gente tenha achado na referência do próprio Google. Tudo que você normalmente faria com um parâmetro de amostragem tem que ser escrito em inglês. Se você quer saber como escrever esse inglês bem, cobrimos a sintaxe de prompt em um post próprio, incluindo a estrutura de tags e o problema dos cortes de cena, e não há razão para repetir aqui.
Uma ressalva. A documentação de schema de terceiros para este modelo lista temperature e top_p como campos aceitos, enquanto a referência do Google diz que não são suportados. Não vamos te dizer qual está certa — estamos te dizendo que as duas se contradizem. Não projete em cima desses parâmetros na força de uma listagem de schema; teste primeiro se eles mudam alguma coisa.
Som que você não desliga, inglês do qual você não sai
O áudio é gerado nativamente com todo clipe e não há chave para desligar. Nenhum parâmetro, nenhuma flag, nenhum modo silencioso. Você pode direcionar — uma frase Sound design: faz trabalho de verdade — mas não pode recusar. Para um embed de blog isso significa mutar no player, que é o que os dois clipes acima fazem.
Você também não pode fornecer áudio como referência, editar o áudio gerado depois, nem preservar o áudio de um vídeo que você envia para extensão. As três são expectativas razoáveis. Nenhuma é suportada.
O suporte a idiomas é mais estreito do que o marketing sugere: o inglês é o único idioma plenamente suportado. Japonês e outros estão documentados como não avaliados — um jeito cuidadoso de dizer que os resultados são imprevisíveis. Se seus prompts ou diálogos não são em inglês, orce surpresas.
Conheça os limites de referência antes de projetar um pipeline de entrada. Referências de vídeo: até três clipes, de três segundos cada, e o Google avisa que fornecer vários de uma vez pode degradar os resultados — trate três como teto, não como meta. As proporções são 16:9 ou 9:16, também do Google. Dois números citados ao lado desses não são: a taxa de 24 fps e a faixa de uma a sete imagens para reference-to-video vêm ambos de documentação de schema de terceiros. Todo frame carrega uma marca-d'água SynthID, e não encontramos um provedor que exponha uma chave para ela.
Antes de gastar qualquer coisa, faça isto
Quatro verificações, em ordem. A primeira mata mais integrações do que o resto somado.
- Confirme sua região. Se você está no Espaço Econômico Europeu, na Suíça ou no Reino Unido e seu produto estende vídeo enviado, pare aqui. Este modelo não faz esse trabalho para você.
- Precifique a sequência, não o clipe. Multiplique pelas extensões, depois pelas tomadas que você vai realmente rodar. Quarenta segundos de 1080p são $5.40 aqui no melhor caso, realisticamente o triplo disso quando você conta as repetições.
- Pergunte se você precisa do Omni. Um segundo de Veo 3.1 Fast custa um centavo aqui, contra nove no Omni em 720p. Uma tomada, sem continuação, sem interpolação de frames, ninguém que precise parecer o mesmo dois clipes depois — aí esse múltiplo é dinheiro tocado fogo.
- Construa seu loop no tier de rascunho. Itere em 360p, promova a vencedora. Sessenta e oito por cento não é erro de arredondamento.
O Omni ganha o múltiplo exatamente onde as funcionalidades do 1.1 apontam: continuar uma tomada, interpolar entre um primeiro e um último frame, animar uma imagem parada, ou carregar um sujeito através dos cortes. Fora disso, é um jeito caro de comprar um clipe.
Os outros ângulos moram ao lado: o que de fato saiu no dia do lançamento, o que os rankings dizem e não dizem — as posições de arena circulando esta semana pertencem ao modelo anterior — e um detalhamento de preços plataforma por plataforma. Schemas e preços no ar ficam no catálogo.
Preços e termos de produto mudam. Verifique os preços atuais de cada provedor antes de tomar uma decisão de compra.
Perguntas frequentes
O Gemini Omni 1.1 Flash consegue mesmo fazer vídeos de 40 segundos?
Consegue, mas não em uma chamada. Uma geração única devolve de 3 a 10 segundos. Quarenta segundos é o total acumulado que você alcança estendendo um clipe existente mais três vezes — quatro trabalhos — e cada extensão é cobrada à parte, na mesma taxa por segundo de uma geração nova. Na E2X uma sequência de 40 segundos em 1080p custa $5.40, contra $6.08 chamando o Google direto.
Quanto custa uma sequência de 40 segundos do Gemini Omni?
Multiplique 40 segundos pela taxa por segundo da sua resolução; extensões não têm desconto. Na E2X isso dá $1.19 em 360p, $3.60 em 720p, $5.40 em 1080p e $7.20 em 4K. Direto do Google, trabalhando a partir das taxas publicadas de tokens por segundo, as mesmas durações custam $1.35, $4.06, $6.08 e $12.16. Some as tomadas descartadas e espere duas a três vezes o valor de manchete.
A saída 4K do Gemini Omni 1.1 Flash é 4K de verdade?
Não. A documentação do Google rotula tanto o tier de 1080p quanto o de 4K como "upscaled" — o modelo renderiza mais baixo e amplia o resultado. O arquivo tem dimensões 4K; a imagem não carrega detalhe 4K. A menos que uma especificação de entrega exija essas dimensões, a taxa do topo compra um redimensionamento, não mais informação.
Posso usar o Gemini Omni 1.1 Flash na União Europeia?
Parcialmente. Text-to-video e image-to-video funcionam, mas editar ou estender um vídeo enviado não está disponível no Espaço Econômico Europeu, na Suíça e no Reino Unido. Como a extensão é a capacidade principal, isso bloqueia qualquer produto europeu construído em torno de continuar material fornecido pelo usuário. Verifique contra a sua região de deployment antes de integrar.
O Gemini Omni 1.1 Flash suporta temperature ou negative prompts?
A referência do Google marca a superfície de amostragem como não suportada — sem temperature, top_p, instruções de sistema, stop sequences ou negative prompt. O texto do prompt é o seu único controle, com a documentação de schema de terceiros colocando o teto em 40.000 caracteres. Essa mesma documentação de terceiros lista temperature e top_p como campos aceitos, contradizendo o Google, então teste antes de depender deles.
Posso desligar o áudio na saída do Gemini Omni?
Não. O modelo constrói uma trilha em todo clipe por padrão, e nenhum parâmetro desliga isso. Uma instrução de sound design no prompt direciona o que você recebe, mas você não pode recusar, nem fornecer uma referência de áudio, nem editar o resultado, nem preservar o áudio de um vídeo que você envia para extensão. Para reprodução silenciosa, mute no player.
O Gemini Omni consegue estender um vídeo para trás ou editar o meio de uma cena?
Não. A extensão só acrescenta ao fim de um clipe — sem extensão para trás para construir uma entrada, sem inserção no meio de uma sequência. Planeje de acordo: a primeira geração fixa a linguagem de câmera e de luz para tudo que vem depois, e um erro no começo invalida toda extensão construída em cima dele.
O Gemini Omni 1.1 Flash vale a pena em vez do Veo 3.1 Fast?
Só se você precisa do que o Omni acrescenta. O Veo 3.1 Fast roda a $0.01 por segundo na E2X contra os $0.09 do Omni em 720p. Para um clipe único sem extensão, sem controle de primeiro e último frame e sem continuidade entre tomadas, o Veo ganha por larga margem. O Omni ganha o seu prêmio em sequências de várias tomadas e em trabalho de continuidade guiado por reference.