O Gemini Omni 1.1 Flash saiu hoje. A novidade é edição, não geração
O Google disponibilizou o gemini-omni-1.1-flash de forma geral hoje. Leia a lista de recursos e uma coisa salta aos olhos: quase nada ali tem a ver com fazer um clipe de oito segundos melhor.
Extensão de cena que lê dez segundos de contexto em vez de um. A possibilidade de entregar ao modelo um primeiro frame e um último frame e deixar que ele construa o meio. Clipes de referência que carregam um personagem de um plano para outro. Esses são recursos de continuidade. São o que você precisa quando um clipe não é a entrega, e sim um pedaço dela, e lançar tudo isso junto é uma declaração de direção mais clara do que qualquer alegação de qualidade seria.

O que é realmente novo
O antecessor aqui é o Gemini Omni Flash — gemini-omni-flash-preview, em preview na API desde 30 de junho de 2026. Preste atenção no nome, porque a internet já está errando: não existe um produto chamado "Omni Flash 1.0". A string do próprio Google é "Gemini Omni 1.1 Flash", e o que ele substitui é simplesmente o Gemini Omni Flash.
| Capacidade | Gemini Omni Flash (preview) | Gemini Omni 1.1 Flash |
|---|---|---|
| Contexto da extensão de cena | Último segundo do clipe | Até 10 segundos de imagem anterior |
| Duração total estendida | — | 40 segundos, montados em continuações de 3–10s |
| Primeiro e último frame | — | Forneça os dois, o modelo gera o que vem entre eles |
| Clipes de referência | — | Até 3 clipes, de 3 segundos cada |
| Resoluções | 720p | 360p, 720p, 1080p e 4K (as duas maiores por upscale) |
| Duração por geração | 3–10 segundos | 3–10 segundos |
A mudança na extensão é a que merece uma segunda leitura. Um modelo que enxerga só o último frame daquilo que está continuando não faz ideia do que a câmera estava fazendo, então as extensões derivam — a luz muda, uma jaqueta troca de cor, o travelling que ia para a esquerda para. Dez segundos de contexto bastam para levar um movimento de câmera e um esquema de luz através da emenda. O Google descreve as continuações como segmentos de 3–10 segundos até um total de 40 segundos, então não é um tamanho de bloco fixo; você está costurando pedaços de tamanho variável.
Há também um modo 360p, que segundo o Google roda até 60% mais rápido por um terço do custo do 720p. Esse número vem do blog de anúncio e não da referência da API, então trate como alegação do fornecedor e não como número medido — mas o formato da coisa é obviamente correto, e um tier barato de rascunho é exatamente o que estava faltando no trabalho iterativo com vídeo.
Quanto custa direto do Google
A saída de vídeo é cobrada a $17.50 por milhão de tokens, e a nota de rodapé de preços do Google já converte isso para você: 5.792 tokens por segundo de vídeo em 720p, "um preço efetivo de aproximadamente $0.10 por segundo." A entrada é $1.50 por milhão. Não há tier gratuito para saída de vídeo.
As outras resoluções também são publicadas, só que em lugar nenhum perto daquela nota, e é por isso que quase ninguém as cita. O anúncio de lançamento do Google traz uma tabela de preços como imagem, e a página de Cloud pricing traz a versão exata em forma de frase: o Omni cobra 1.931 tokens por segundo em 360p, 5.792 em 720p, 8.688 em 1080p e 17.376 em 4K. A $17.50 por milhão isso dá $0.0338, $0.1014, $0.1520 e $0.3041 por segundo. Repare no formato mais do que nos dígitos — contra o 720p essas contagens de tokens são exatamente um terço, um, um e meio e três. A escada triplica de 720p para 4K, o que vale lembrar quando bater a tentação de renderizar uma primeira passada em resolução cheia.
Dez centavos por segundo merece um instante de reflexão. Uma sequência de quarenta segundos, montada a partir de extensões em 720p, dá cerca de quatro dólares de saída antes de você ter gerado uma única tomada alternativa. Preço de vídeo não é preço de imagem, e os hábitos de iteração que funcionam a uma fração de centavo por imagem vão esvaziar uma conta aqui.
Onde você pode chamá-lo hoje
- Gemini API (
generativelanguage.googleapis.com) — GA - Google AI Studio — GA
- Gemini Enterprise Agent Platform — para acesso corporativo à API
- Google Flow — para assinantes AI Plus, Pro e Ultra
- App do Gemini — extensão de cena para Plus, Pro e Ultra
Na Vertex AI, não. As notas de versão dela não mencionam o Omni em momento algum, e o anúncio do Google encaminha usuários corporativos para a Agent Platform. Se você leu o contrário, aquela página está chutando.
Um item com data marcada fica por baixo de tudo isso: o endpoint de preview gemini-omni-flash-preview está programado para ser descontinuado em 30 de setembro de 2026. Qualquer coisa que você construiu sobre o preview durante o verão tem cerca de um mês de pista.

As especificações, num lugar só
A saída por geração vai de 3 a 10 segundos a 24 FPS, em 16:9 ou 9:16 — essas são as duas únicas proporções, então enquadramentos quadrados e de cinema vertical estão fora. O áudio é gerado nativamente junto com a imagem, e você não pode subir uma referência de áudio para conduzi-lo. Qualquer vídeo que você forneça para edição ou extensão precisa ter 10 segundos ou menos.
Todo frame carrega o SynthID, a marca d'água invisível de proveniência do Google. Ela é indetectável para quem assiste e não pode ser desligada por nenhum provedor, o que só importa se você tiver um contrato que proíba entregas com marca d'água.
O Google também é franco no model card sobre o que ainda não funciona:
"Manter consistência completa ao longo das edições, gerar cenas com movimento complexo ou renderizar texto perfeitamente preciso continua sendo um desafio."
Leia isso ao lado da lista de recursos e é uma tensão útil. As adições de destaque são recursos de consistência; o model card diz que consistência ainda é a parte difícil. As duas coisas são verdadeiras, e um post de lançamento que citasse só a primeira estaria vendendo alguma coisa para você.
Uma capacidade foi deliberadamente segurada. O modelo consegue alterar fala gravada, e o Google optou por não lançar isso:
"O Gemini Omni Flash é capaz de mudar a fala das pessoas. Por ora, estamos restringindo essa capacidade e trabalhando para entender melhor como levá-la aos nossos usuários de forma segura e responsável."
Há limites regionais também: no EEE, na Suíça e no Reino Unido você não pode subir nem editar imagens que contenham menores de idade ou certas pessoas reconhecíveis.
O que isso significa na E2X
A gente disse que não ia colocar data nessa. Ela caiu no dia seguinte. O Gemini Omni 1.1 Flash entrou no ar na E2X em 28 de agosto de 2026, com todas as suas quatro capacidades chamáveis pelo mesmo formato de endpoint de todo o resto do catálogo.
Um preço só cobre as quatro: $0.09 por segundo em 720p para text-to-video, image-to-video, start-end-frame-to-video e reference-to-video, verificados em 28 de agosto de 2026. Durações de 4, 6, 8 e 10 segundos, em 360p, 720p, 1080p ou 4K — $0.0297 por segundo no tier de rascunho, $0.18 em 4K. As duas do meio são novidade aqui: nesta plataforma a geração anterior só chegou a entregar text-to-video e reference-to-video, então animar uma imagem parada e interpolar entre um primeiro e um último frame são capacidades inéditas para esta família.
Coloque isso ao lado das taxas por segundo do próprio Google e a diferença é, na real, uma diferença de multiplicadores. Conforme você sobe, o Google cobra $0.0338, $0.1014, $0.1520 e $0.3041; a gente cobra $0.0297, $0.09, $0.135 e $0.18. As duas escadas começam com o mesmo formato — um terço da taxa de 720p lá embaixo em 360p, uma vez e meia em 1080p — e depois se separam no topo, onde o Google triplica e a gente dobra. Isso nos deixa abaixo do Google em todos os degraus: cerca de 12 por cento em 360p, 11 em 720p e 1080p e 41 em 4K. O que o preço também compra é uma única superfície de API e um só conjunto de credenciais para todos os modelos do nosso catálogo, o que vale alguma coisa sem ser uma alegação de ser o mais barato em toda configuração.
A opção genuinamente barata fica logo ao lado, e a maioria dos leitores deveria olhar para ela primeiro. O Veo 3.1 Fast text-to-video custa $0.01 por segundo — um nono do Omni 1.1 Flash. É também o único número desta página que não é disputado: a própria tabela do Google precifica o Veo 3.1 Fast em $0.10 por segundo em 720p, ou seja, o mesmo modelo custa aqui um décimo do que custa lá. Para uma tomada direta de texto para vídeo, sem edição, sem extensão e sem continuidade de personagem, o prêmio de nove vezes sobre ele compra muito pouco. Preferimos que você gaste um dólar em vez de nove e volte.
Onde o Omni justifica a diferença é exatamente para onde os recursos do 1.1 apontam: continuação, controle de primeiro e último frame e carregar um sujeito de um plano para outro. Se o seu trabalho é um clipe de cada vez, o Veo 3.1 Fast é a escolha melhor, e ele também cobre trabalhos de image-to-video, reference-to-video e start-and-end-frame.
Preços e termos de produto podem mudar. Verifique o preço atual de cada provedor antes de tomar uma decisão de compra. Esta é uma comparação com escopo definido, não uma afirmação de que a E2X é a opção mais barata em toda configuração.
O que fazer esta semana
Se você estava no endpoint de preview, coloque a data de 30 de setembro no calendário e se mexa. Se você está escolhendo um modelo de vídeo pela primeira vez, comece pelo Veo 3.1 Fast a um centavo por segundo e só suba quando um trabalho de fato precisar de continuidade. E se você quiser comparar schemas em vez de ler prosa, todo modelo publica uma especificação legível por máquina — a do Omni 1.1 Flash lista cada parâmetro, restrição e preço atual.
Navegue pelo resto por tipo de trabalho a partir de text-to-video ou reference-to-video.
Perguntas frequentes
O que é o Gemini Omni 1.1 Flash?
O Gemini Omni 1.1 Flash é o modelo de geração e edição de vídeo do Google, disponibilizado de forma geral em 27 de agosto de 2026 sob o id de API gemini-omni-1.1-flash. Ele gera clipes de 3 a 10 segundos a 24 FPS com áudio nativo, e acrescenta recursos de edição que faltavam ao antecessor: extensão de cena até 40 segundos, interpolação entre primeiro e último frame e clipes de referência para consistência de personagem.
Quando o Gemini Omni 1.1 Flash foi lançado?
27 de agosto de 2026, como modelo geralmente disponível e não como preview. O changelog da API do Google registra assim: "Gemini Omni Flash geralmente disponível (GA): lançado o gemini-omni-1.1-flash". O modelo de preview anterior, gemini-omni-flash-preview, estava disponível desde 30 de junho de 2026 e está programado para ser descontinuado em 30 de setembro de 2026.
Existe um Omni Flash 1.0?
Não. O Google nunca lançou um produto chamado Omni Flash 1.0. O modelo que veio antes do Gemini Omni 1.1 Flash se chama Gemini Omni Flash, com o id de API gemini-omni-flash-preview, e era um lançamento em preview. Páginas que descrevem um "Omni Flash 1.0" estão inventando um número de versão que não existe.
Quanto custa o Gemini Omni 1.1 Flash?
Chamando o Google direto, a saída de vídeo é cobrada a $17.50 por milhão de tokens, com a entrada a $1.50 por milhão e sem tier gratuito para vídeo. A página de Cloud pricing do Google dá o custo em tokens de um segundo em cada resolução — 1.931 em 360p, 5.792 em 720p, 8.688 em 1080p e 17.376 em 4K — o que dá $0.0338, $0.1014, $0.1520 e $0.3041 por segundo. Na E2X os mesmos tiers custam $0.0297, $0.09, $0.135 e $0.18, o que coloca o clipe padrão de oito segundos em 720p em $0.72.
Qual a duração máxima de um vídeo do Gemini Omni 1.1 Flash?
Uma única geração produz de 3 a 10 segundos. Usando extensão de cena você pode chegar a 40 segundos no total, acrescentando continuações de 3 a 10 segundos a um clipe existente. Qualquer vídeo que você forneça como entrada para edição ou extensão precisa, ele próprio, ter 10 segundos ou menos.
Posso usar o Gemini Omni 1.1 Flash na Vertex AI?
Não, até 27 de agosto de 2026. As notas de versão da Vertex AI não mencionam a família Omni. O anúncio do Google direciona usuários corporativos de API para a Gemini Enterprise Agent Platform, e o modelo também está disponível pela Gemini API, pelo AI Studio, pelo Flow e pelo app do Gemini.
O Gemini Omni 1.1 Flash está disponível na E2X?
Sim, desde 28 de agosto de 2026, nas quatro capacidades: text-to-video, image-to-video, start-end-frame-to-video e reference-to-video. São $0.09 por segundo em 720p, com $0.0297 em 360p, $0.135 em 1080p e $0.18 em 4K, e durações de 4, 6, 8 e 10 segundos. Isso fica abaixo da taxa por segundo do próprio Google em todos os tiers — cerca de 12 por cento em 360p, 11 por cento em 720p e 1080p e 41 por cento em 4K. O áudio é gerado nativamente e não pode ser desligado. Para clipes únicos sem exigência de edição ou continuidade, o Veo 3.1 Fast a $0.01 por segundo ainda costuma ser o melhor custo-benefício.