Voltar ao Blog

Cinco lugares vendem o Gemini Omni 1.1 Flash. O preço varia 44%

E2X Team··17 min de leitura
gemini-omnigooglepricingtext-to-videovideo-generation

Ninguém sai pesquisando preço de pesos de modelo. Você escolhe um nome de modelo, cai na página do provedor que o Google colocou na sua frente e paga o que a página diz.

Em 28 de agosto de 2026 fomos atrás de todo lugar que publica um preço chamável para um único modelo — gemini-omni-1.1-flash, lançado pelo Google no dia anterior. Cinco publicam. Mesmos pesos, mesmo áudio nativo, mesma marca-d'água SynthID em todo frame. O número no rodapé da página variava quarenta e quatro por cento.

O que vem a seguir é essa auditoria — incluindo a parte em que dizemos para você comprar algo nove vezes mais barato do que o modelo sobre o qual este post fala.

Uma fileira de latas idênticas e sem rótulo sobre um balcão de zinco gasto, cada uma com uma etiqueta de papel em branco pendurada em uma altura diferente

Os cinco preços, lidos na mesma tarde

Tudo abaixo é 720p, por segundo de vídeo finalizado, lido da página no ar de cada provedor em 28 de agosto de 2026. O áudio está incluído em todos: o modelo não tem chave de áudio, então o som é gerado junto com a imagem e ninguém cobra por ele à parte.

Onde você chamaPor segundo, 720pClipe de oito segundos
E2X$0.09$0.72
fal.ai v1.1/edit$0.10$0.80
Runware$0.10$0.80
Google, direto$0.1014 efetivos$0.81
fal.ai base text-to-video$0.125$1.00
fal.ai base reference / image-to-video$0.13$1.04
WaveSpeed$0.13$1.04

De baixo para cima, $0.09 contra $0.13. É esse o quarenta e quatro por cento, e ele não compra nada — nenhum segundo de vídeo melhor, nenhum clipe mais longo, nenhum teto mais alto. Mesmo arquivo, mesmo datacenter.

Três dessas linhas pertencem a uma única empresa, e é a próxima seção.

A linha do Google precisa de uma nota, porque a página de preços do Google cobra em tokens e não em segundos. A saída de vídeo é $17.50 por milhão de tokens, e o 720p consome 5.792 tokens por segundo; multiplique e você chega a $0.1014. Essa conversão é aritmética do próprio Google, não nossa — a página imprime assim: "um preço efetivo de aproximadamente $0.10 por segundo."

Uma empresa, uma família de modelos, duas lógicas de preço

A descoberta mais estranha não é um concorrente. É a fal.ai discordando de si mesma.

Abra fal.ai/models/google/gemini-omni-flash/v1.1/edit e você encontra $0.10 por segundo, numa escada idêntica à lista arredondada do Google, degrau por degrau, sem margem nenhuma. Isso não é um preço independente, é um passthrough — trate como um segundo dado e você está contando o Google duas vezes. Abra as páginas base gemini-omni-flash no mesmo domínio e o modelo é precificado em tokens, a $21.875 por milhão — cerca de $0.125 para text-to-video, $0.13 para trabalhos com reference e imagem. Mesma empresa, mesma família, uma listagem a custo e outra com markup.

Esse markup é exatamente vinte e cinco por cento acima da taxa por token do Google. Não há nada de errado nisso: um agregador que cuida de retries e te dá uma única superfície de autenticação tem direito de cobrar. Mas significa que "o preço do Omni 1.1 Flash" não tem um referente único nem dentro de uma mesma vitrine. Então confira a string de versão na página contra a qual você está sendo cobrado — uma página escrita gemini-omni-flash sem versão pode não estar te vendendo nem o 1.1 nem o preço dele.

Uma parede de caixas postais antigas idênticas em latão, com uma portinha entreaberta mostrando um interior escuro e vazio

Um provedor não tem número nenhum. A Replicate lista o modelo e não publica nenhuma taxa por segundo para ele — nós procuramos, e não há o que citar. Isso é um achado, não uma omissão nossa: um modelo de vídeo cujo custo você não consegue ler antes de rodar é um modelo que você não consegue orçar.

A escada de resoluções do Google é publicada duas vezes, em dois formatos diferentes

Tudo acima é um degrau só. O Omni 1.1 Flash vende quatro, e achar os outros três demorou muito mais do que deveria.

O Google publica duas vezes, em nenhum dos dois lugares onde você olharia. A nota de rodapé da página de Cloud pricing dá as contagens de tokens por segundo, por tier — a verdade da cobrança, já que a fatura é cortada em cima dos tokens. O anúncio de lançamento traz uma tabela em dólares arredondada, mas como imagem renderizada, então scrapers e os artigos construídos a partir deles passam batido. A página de preços da Gemini API, a parada óbvia, tem só a célula de 720p.

A gente foi longe o bastante nesse caminho para concluir que a escada de quatro degraus era invenção de revendedor, e chegou a escrever uma seção dizendo isso, antes de voltar e ler a imagem. Vale admitir, porque é exatamente o modo de falha sobre o qual este post fala: um número publicado, com fonte e correto ainda pode ser invisível ao jeito como a maioria das pessoas verifica.

A escada que sai das contagens de tokens, que é o que você realmente paga:

ResoluçãoTokens/seg do Google$/seg do GoogleE2XDiferença
360p1.931$0.0338$0.0297E2X 12% mais barato
720p5.792$0.1014$0.09E2X 11% mais barato
1080p8.688$0.1520$0.135E2X 11% mais barato
4K17.376$0.3041$0.18E2X 41% mais barato

Leia a primeira linha pela coisa que de fato muda o jeito de trabalhar. Um segundo em 360p custa exatamente um terço de um segundo em 720p na nossa escada — $0.0297 contra $0.09 — então três rascunhos custam o que uma passada em resolução cheia custa. Esse é o argumento inteiro a favor de um tier de rascunho em uma frase, e é por isso que o degrau barato vale a pena mesmo quando a qualidade é visivelmente pior.

Agora a última linha, onde trabalhar a partir das contagens de tokens compensa: o argumento dos multiplicadores deixa de ser retórica e vira dado do próprio Google. Tome 720p como 1×. Os tiers do Google andam 0,33 · 1 · 1,5 · 3. Os nossos andam 0,33 · 1 · 1,5 · 2. Idênticos embaixo, idênticos no meio, e aí o Google triplica no 4K onde a gente dobra — que é por que dez segundos de 4K são $3.04 chamando o Google e $1.80 chamando a gente.

Quatro provetas de vidro altas sobre pedra calcária clara, cada uma cheia de água limpa até um nível progressivamente mais alto, luz suave de janela vindo da direita

Aqui as quatro capacidades cobram nessa mesma escada — reference-to-video custa o que start-end-frame-to-video custa, que é o que image-to-video e o text-to-video simples custam. Não é universal: nas páginas base da fal, trabalhos com reference e imagem custam mais do que os que só têm prompt.

O degrau barato da Runware fica em cima de um caro

Em 720p a Runware empata com o resto do campo em $0.10. Suba um degrau e ela cobra $0.16 em 1080p e $0.32 em 4K — contra os $0.1520 e $0.3041 do próprio Google. Ela é mais cara do que a fonte que revende exatamente nas duas resoluções em que um segundo custa mais. Só uns cinco por cento acima do Google; mas compare provedores pelo primeiro número que aparece, escolha ela para um trabalho em 4K, e você paga quase o dobro dos $0.18 que esse degrau custa aqui.

A lição vale mais do que o número: compare no tier em que você realmente renderiza. Uma taxa de vitrine é quase sempre o degrau útil mais barato de um provedor, e a razão entre os degraus quem define é o revendedor.

O que chamar o Google direto não inclui

O instinto manda cortar a camada do meio e comprar da fonte. Aqui a fonte não é nem a opção mais barata nem a menos restritiva.

  • Sem tier gratuito para saída de vídeo. Texto e imagem funcionam no tier gratuito do Gemini; vídeo não. Não há nada contra o que testar.
  • Sem desconto de Batch. Outros modelos Gemini 3.x tiram uns cinquenta por cento para envio em batch. Vídeo está fora, então a alavanca que corta um trabalho grande pela metade não existe.
  • Tratamento de dados. Mesmo no tier pago, os termos do Google marcam o conteúdo enviado a este modelo como utilizável para melhoria de produto.
  • Um preço que você precisa caçar. A documentação mostra uma célula de vídeo; a escada é uma imagem dentro de um post de blog.

Nada disso torna errado chamar o Google. Torna "compre direto, pule a margem" uma heurística mais fraca do que parece — neste modelo mal existe margem para pular, já que o revendedor que espelha o preço de tabela entrega a você a custo.

O clipe abaixo custou $0.72

Geramos ele com o próprio Omni 1.1 Flash, oito segundos em 720p, pelo preço sobre o qual este post está discutindo. Oito vezes nove centavos.

Um aéreo noturno sobre a midtown de Manhattan avança para dentro da Times Square até um painel digital preencher o quadro: OMNI FLASH 1.1, depois AVAILABLE NOW ON E2X.AI, resolvendo no logo da E2X sobre asfalto molhado.

O prompt, na íntegra:

Cinematic 8-second commercial set in New York City at night. Opens on a wide aerial shot of Manhattan, then pushes rapidly into Times Square. Neon billboards, yellow taxis, pedestrians, wet asphalt reflecting colored light. The camera flies toward one massive digital billboard dominating the square. On the billboard, clearly readable text appears: "OMNI FLASH 1.1". Then: "THE LOWEST PRICE." The billboard transitions to: "AVAILABLE NOW ON E2X.AI". Final text: "START USING OMNI FLASH 1.1 TODAY". End with a clean bold E2X.AI logo filling the billboard. Fast energetic camera movement, realistic New York atmosphere, cinematic lighting, photorealistic detail, premium tech commercial look, high contrast, shallow depth of field, realistic reflections, subtle lens flares, smooth transitions. No narration, no one speaks. The message is carried entirely by the giant Times Square billboard. Sound design: city ambience, distant traffic, a rising synth swell, no voices, no speech.

(O prompt foi deixado em inglês: o modelo só foi avaliado para inglês.)

Rodado como text-to-video, oito segundos, 720p, 16:9. Voltou em 94 segundos contra a estimativa de cerca de 240 do nosso próprio pipeline — essa estimativa é nossa; o Google não publica número de latência. Uma amostra não é um benchmark, mas se você vinha orçando quatro minutos por geração, orce menos.

Agora leia o prompt contra a imagem, porque isto virou um teste acidental da habilidade mais fraca do modelo. O prompt nomeia o texto do painel quatro vezes, entre aspas, e o painel principal entrega — as duas linhas limpas, logo no lugar. Todo outro painel no quadro, aqueles que o prompt só acenou com "neon billboards", volta como rabisco convincente. Então a regra não é "este modelo não sabe fazer texto", e sim algo mais estreito: texto que você especifica tende a renderizar; texto que o modelo inventa para vestir o cenário, não. Renderização instável de texto vem sendo relatada nesta família desde o lançamento — a implicator.ai apontou, e não conseguimos encontrar isso dito assim no model card do Google — então tome o clipe como evidência nossa, não como admissão do fornecedor.

Antes de pagar nove centavos, olhe um centavo

Aqui é onde a auditoria argumenta contra o próprio assunto.

O Veo 3.1 Fast custa $0.01 por segundo na mesma API, com a mesma chave — um nono do Omni 1.1 Flash. O clipe acima teria custado oito centavos lá em vez de setenta e dois, e para uma tomada isolada da qual nada depende, muito provavelmente teria sido bom o bastante. Na tabela do próprio Google o Veo 3.1 Fast aparece a $0.10 por segundo, então lá a gente é um décimo da fonte, e não onze por cento abaixo dela.

Então o ranking honesto não é "o Omni é o mais barato aqui". É que a maioria das pessoas lendo um post sobre o jeito mais barato de chamar o Omni deveria estar chamando outra coisa. Recorra a ele quando o trabalho precisa do que só ele faz — um primeiro e um último frame especificados, um personagem que sobrevive entre tomadas, extensão até quarenta segundos. Um travelling não é uma dessas coisas.

Uma comparação seria desonesta feita ao contrário. O Omni Flash, o preview de junho, cobra $0.0825 por segundo para text-to-video e $0.075 para trabalhos com reference aqui — ou seja, o 1.1 é de nove a vinte por cento mais caro do que o modelo que ele substitui, não mais barato. Vale ser preciso sobre de onde isso vem: os três saem da mesma tabela de $0.15 e diferem só no desconto que aplicamos, 40 por cento contra 45 e 50. O aumento é um desconto menor, não um produto mais caro. O que ele compra é image-to-video e controle de primeiro e último frame, um degrau de 360p que o enum antigo não tem entrada para, e um teto de dez segundos — uma troca justa, mas um aumento, e quem te disser que o modelo novo é mais barato está com a direção invertida.

Fazendo esta auditoria por conta própria

Cinco hábitos que vão sobreviver a estes números específicos:

  1. Leia a string de versão, não o nome do modelo. Duas páginas em um único domínio nos venderam a mesma família a $0.10 e a $0.125 numa mesma tarde.
  2. Verifique se a fonte é texto. A escada em dólares do Google é uma imagem e a real é uma nota de rodapé em tokens, então scrapers citam só o número que está na documentação como HTML.
  3. Precifique o tier em que você renderiza, não aquele com que o provedor abre. A Runware empata em 720p e é a listagem mais cara em 4K.
  4. Converta tokens em segundos antes de comparar. $17.50 por milhão não significa nada até você multiplicar pelos tokens que o seu tier queima.
  5. Verifique se existe um preço por segundo. A Replicate carrega o modelo sem publicar um.

Preços e termos de produto podem mudar. Verifique os preços atuais de cada provedor antes de tomar uma decisão de compra. O preço de Batch ou Flex do Google não é diretamente equivalente a uma requisição de API on-demand padrão, porque agendamento, disponibilidade e condições de processamento diferem; por isso está excluído aqui. Esta é uma comparação delimitada aos cinco provedores que publicam um preço por segundo chamável, não uma alegação de que a E2X seja a opção mais barata em toda configuração. O jeito mais barato de fazer a maioria dos clipes não é este modelo, como diz a seção acima.

Depois rascunhe no degrau mais barato que você tolerar e renderize o escolhido em 720p. Parâmetros e taxas atuais por capacidade estão na especificação legível por máquina; a linha completa está no nosso catálogo. Cobrimos separadamente o que saiu no 1.1, o que os rankings mediram, como escrever os prompts e por que uma cena de 40 segundos chega como quatro faturas separadas.

Perguntas frequentes

Qual é o jeito mais barato de chamar o Gemini Omni 1.1 Flash?

Entre os cinco provedores que publicavam um preço chamável em 28 de agosto de 2026, a E2X saiu como a mais baixa nos quatro degraus — $0.0297 por um segundo em 360p, nove centavos em 720p, $0.135 um tier acima, $0.18 em 4K. O campo de 720p vai de $0.10 na página v1.1 da fal.ai e na Runware, $0.1014 do Google, até $0.13 na WaveSpeed e nos endpoints base de reference e imagem da fal. Nossa margem é mais fina em 360p, cerca de um por cento contra a fal, e mais larga em 4K.

Quanto custa o Gemini Omni 1.1 Flash se eu chamar o Google direto?

O Google cobra em tokens, não em segundos: $17.50 por milhão para saída de vídeo. A nota de rodapé da página de Cloud pricing lista os tokens que cada resolução queima por segundo, e multiplicando dá um pouco acima de três centavos por um segundo em 360p, um pouco acima de dez para 720p, quinze e um quinto para 1080p e logo passando de trinta em 4K. Uma versão arredondada da mesma escada aparece no anúncio de lançamento, como imagem e não como texto. Sem tier gratuito, sem desconto de Batch.

Por que provedores diferentes cobram preços diferentes pelo mesmo modelo?

Porque precificam em bases diferentes. Alguns espelham a lista arredondada do Google, que é por que a página v1.1 da fal.ai e a Runware caem as duas em $0.10. Outros precificam em tokens com margem adicionada: as páginas base da fal usam $21.875 por milhão contra os $17.50 do Google, um acréscimo de 25% que chega a $0.125 e $0.13. A WaveSpeed declara um valor fixo de $0.13. Os pesos e a saída são idênticos em todos os casos.

A Replicate publica um preço para o Gemini Omni 1.1 Flash?

A Replicate lista o modelo mas não publica nenhuma taxa por segundo para ele, em 28 de agosto de 2026. Isso torna impossível incluí-la numa comparação equivalente e difícil de orçar, já que a cobrança de vídeo escala com duração e resolução, e não com número de requisições.

O Gemini Omni 1.1 Flash é mais barato do que o modelo que ele substitui?

Não. O preview anterior, Gemini Omni Flash, cobra $0.0825 por segundo para text-to-video e $0.075 para reference-to-video na E2X, contra $0.09 do Omni 1.1 Flash — de nove a vinte por cento a mais. Os três saem da mesma tabela de $0.15 e diferem só no desconto, então a alta é um desconto menor e não um modelo mais caro. O extra compra image-to-video, controle de primeiro e último frame, um degrau de rascunho em 360p e clipes de dez segundos.

Em qual resolução eu devo gerar para segurar os custos?

Rascunhe em 360p e renderize só o escolhido em 720p. Na E2X um segundo em 360p é exatamente um terço de um em 720p, então quatro segundos custam $0.1188 contra $0.36 — cinco rascunhos mais um render completo dão $0.954, ainda abaixo de três tentativas diretas em 720p a $1.08. O 4K raramente se paga para entrega web: dez segundos são $1.80 aqui contra $3.04 do Google.

Existe um modelo de vídeo mais barato do que o Gemini Omni 1.1 Flash?

Existe, e para a maioria dos trabalhos de clipe único ele é a melhor escolha. O Veo 3.1 Fast é um centavo por segundo na E2X — um nono do Omni 1.1 Flash, e um décimo dos $0.10 com que o próprio Google o lista — cobrindo trabalhos só com prompt, imagens animadas, clipes com reference e trabalho de primeiro e último frame. O Omni ganha o seu prêmio só em extensão de cena, gerações de dez segundos, o tier de 360p ou consistência por reference entre tomadas.