Voltar para Modelos

Omni Flash

Família de geração de vídeo do Google que cria clipes a partir de prompts de texto ou imagens de referência, otimizada para entregas rápidas.

Referência para Vídeoa partir de$0.075Texto para Vídeoa partir de$0.075
Preçosa partir de $0.075/solicitação
Latência~240 segundos em média
Resolução4K/720P/1080P
Melhor paravideo, google, high-fidelity

Parâmetros

0/7 itens

Custo Estimado

Você economiza 50% neste modelo
Custo base por second$0.15
Desconto-50%
Seu Total$0.075
Você economiza $0.075 por solicitação

Entre para executar modelos

Output Preview

Ready

No output yet

Run the model to see generated results.

Exemplo de Saída

Exemplo de API— Parâmetros Atuais

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/omni-flash/reference-to-video',
  'input': {}
}
)

Obter Trabalho— Consultar resultado

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

Detalhamento de Preços

Custo estimado por geração de acordo com duração e resolução. Você só paga pelo que executar.

Duração
4K
720P
1080P
4
$1.20
$0.60
$0.90
6
$1.80
$0.90
$1.35
8
$2.40
$1.20
$1.80
10
$3.00
$1.50
$2.25
Explorar alternativas

Modelos relacionados

Descubra mais modelos de IA para Referência para Vídeo

Ver todos os modelos

API Reference-to-Video do Gemini Omni Flash na E2X

O Omni Flash é o gemini-omni-flash-preview do Google — um modelo de vídeo da família Gemini, não um Veo — e o pitch da própria DeepMind cabe em uma frase: "Pense no Gemini Omni como o Nano Banana, mas para vídeo." Rodamos a capability reference-to-video dele como google/omni-flash/reference-to-video, e cobramos $0.10 por cada segundo de vídeo 720p finalizado. O clipe padrão de 8 segundos custa, portanto, $0.80, áudio incluído.

Repare na unidade. Ninguém vende um clipe aqui por preço fechado, então qualquer número que você comparar precisa ser multiplicado pela duração que você pretende renderizar.

Tem roteiro mas nenhuma imagem para levar para dentro da cena? Então o Veo 3.1 Fast text-to-video é o endpoint que você quer — ele parte só do prompt, e na nossa plataforma custa dramaticamente menos. Voltamos a isso mais abaixo, com honestidade.

Nossa posição frente aos outros lugares onde você pode chamar este modelo, checada em 26 de agosto de 2026:

Provider de APIPor segundo (720p)Clipe de 8 segundosvs. E2X
E2X$0.10$0.80—
fal.ai$0.13$1.04somos 23% mais baratos
Atlas Cloud$0.135$1.08somos 26% mais baratos
Runware$0.10$0.80empatado
Google Gemini API$0.10$0.80empatado

Os preços e as condições dos produtos podem mudar. Verifique o preço atual de cada provider antes de tomar uma decisão de compra. O preço do Google Batch ou Flex não é diretamente equivalente a um request de API on-demand padrão, porque as condições de agendamento, disponibilidade e processamento são diferentes; por isso ele ficou fora desta comparação. Esta é uma comparação de escopo limitado, não uma afirmação de que a E2X é a opção mais barata do mundo em qualquer configuração.

Não vamos maquiar isso: neste modelo nós empatamos com a taxa do Google em vez de ficar abaixo dela, e a economia só é real contra a fal.ai e a Atlas. As imagens de referência mal aparecem na conta — o Google conta uma imagem como 2.040 tokens, então três delas custam cerca de um centavo. duration é o campo que mexe na sua fatura.

O que as imagens de referência realmente compram

O ponto deste endpoint é continuidade. Entregue um sujeito ao modelo — uma pessoa, um produto, um cenário, um visual —, descreva uma cena em que ele nunca foi fotografado, e o sujeito sobrevive à viagem.

Você pode anexar várias referências, não só uma. Os exemplos publicados pelo Google vão até seis; nenhum máximo oficial foi documentado, e os números de terceiros se contradizem, então não vamos imprimir nenhum. Construa pensando em um punhado e teste o seu próprio teto.

O áudio é gerado junto com a imagem, não colado depois. Ele sincroniza com a ação, e você o dirige pelo mesmo prompt — peça chuva num telhado de zinco e um ruído de sala grave, e é isso que volta. Não existe uma trilha de áudio separada para editar depois.

Dez segundos é o teto. Nosso enum duration expõe 4, 6, 8 e 10; o modelo do Google roda de 3 a 10 segundos, e 10 é limite duro. Sem endpoint de extensão, sem interpolação. Qualquer coisa mais longa é trabalho de costura no seu próprio editor — e a continuidade entre os cortes vira problema seu.

720p, 24 fps, e a lista acaba aí. Nosso campo resolution carrega os valores 1080p e 4k e o Google lista resoluções maiores como em breve, mas hoje o modelo devolve 720p. Deixe no padrão. Uma página de provider que anuncia 1080p aqui está adiantada em relação à documentação do próprio Google.

Conte com uns 45 segundos de processamento para um clipe padrão — um p50 medido pela eachlabs, não um número oficial, então planeje com ele em vez de prometer com ele.

Request de API: referências entram, clipe sai

Dois campos são obrigatórios: image_urls e prompt. Gere uma key no seu dashboard, mantenha ela num servidor que você controla, e então poste o job.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/omni-flash/reference-to-video",
    "input": {
      "prompt": "O tênis da imagem 1 está sobre asfalto molhado enquanto um ônibus se afasta atrás dele. Push-in lento. Trânsito ambiente e chuva fina, sem música.",
      "image_urls": [
        "https://example.com/sneaker-front.jpg",
        "https://example.com/sneaker-side.jpg"
      ],
      "duration": "8",
      "aspect_ratio": "16:9",
      "resolution": "720p"
    }
  }'

A response carrega um ID de job. Vídeo leva minutos, então faça polling devagar — ou pule o polling e passe um webhookUrl no corpo do submit:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/omni-flash/reference-to-video",
    input: {
      prompt:
        "A mulher da referência atravessa um mercado noturno, letreiros de neon refletindo na jaqueta dela. Câmera na mão. Murmúrio de multidão e fritura ao longe.",
      image_urls: ["https://example.com/talent.jpg"],
      duration: "10",
      aspect_ratio: "9:16",
    },
  }),
}).then((r) => r.json());

const poll = async (id, attempt = 0) => {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") return job.data.outputs[0].url;
  if (job.data.status === "failed") throw new Error(job.data.error?.message);
  if (attempt > 90) throw new Error("Timed out waiting for the render");

  await new Promise((r) => setTimeout(r, 5000));
  return poll(id, attempt + 1);
};

const videoUrl = await poll(data.jobId);

Os status vão de pending → processing → completed, ou param em failed ou cancelled. O schema e o preço ao vivo estão na spec legível por máquina se você preferir lê-los programaticamente.

Escolhendo entre os nossos modelos de vídeo

A comparação que importa, e ela não favorece esta página:

ModeloNosso preço (8s, 720p, áudio)Escolha quando
Omni Flash reference-to-video$0.80Várias referências precisam ficar consistentes, ou você precisa de um clipe de 10 segundos
Veo 3.1 Fast reference-to-video$0.12Até três referências, 8 segundos, e você quer a fatura mais barata
Veo 3.1 Fast image-to-video$0.12Um frame parado que você quer animar
Veo 3.1 Fast text-to-video$0.12Nenhum material de origem

O Veo 3.1 Fast custa uma fração do Omni Flash na nossa plataforma, e alcança 1080p e 4K, coisa que o Omni Flash hoje não faz. No preço de tabela do próprio Google os dois ficam nos mesmos $0.10 por segundo em 720p — é o nosso desconto que abre a diferença. Então comece pelo Veo Fast. Volte para cá quando o teto de três referências dele for o que está te travando, quando você precisar desses dois segundos a mais, ou quando quiser o comportamento de edição de vídeo por trás do enquadramento "Nano Banana para vídeo". Mais opções estão na categoria reference-to-video, e o catálogo de modelos inteiro cabe em uma página.

As restrições que o Google publica

Public Preview significa que as arestas estão documentadas em vez de escondidas. Leia isto antes de construir:

  • Referências em vídeo de até três segundos são aceitas pelo schema da API mas, nas palavras do próprio Google, "não são processadas corretamente pelo modelo." Trate referência em vídeo como não funcional e envie stills — e note que referenciar ou raciocinar sobre vários vídeos não é suportado de jeito nenhum.
  • Editar um vídeo enviado por você está indisponível no EEE, na Suíça e no Reino Unido. Se seus usuários ou sua infraestrutura estão lá, essa metade do apelo do modelo sai da mesa.
  • Só o inglês tem suporte completo. Outros idiomas de prompt não foram avaliados.
  • Uma narrativa longa, com várias cenas, numa geração só, falha. Este modelo renderiza um plano contínuo; peça três em sequência e você recebe uma bagunça.

Escrevendo prompt de imagem e som juntos

Escreva o plano, não a história. Um sujeito, um movimento de câmera, uma condição de luz — e então diga como aquilo soa, porque o áudio sai do mesmo prompt e silêncio é uma escolha que você faz em voz alta.

Rotule seus anexos quando entra mais de um: "imagem 1 é a garrafa, imagem 2 é o close do rótulo". Nada além disso diz ao modelo qual referência é a protagonista. Mantenha a linguagem de câmera simples — "push-in lento", "câmera fixa", "follow na mão" funcionam melhor que um parágrafo de fotografia.

Antes de colocar em produção

Todo clipe carrega um watermark SynthID — invisível para quem assiste, detectável programaticamente — e credenciais de conteúdo C2PA vêm anexadas por padrão. Nenhum provider que roda este modelo consegue desligar as duas coisas, nós inclusive. Se um contrato de cliente proíbe assets de IA rotulados, resolva isso antes de integrar.

Re-hospede suas saídas no seu próprio storage dentro do handler de conclusão. As URLs de resultado não são endereços permanentes, e um vídeo que você não consegue recuperar é um vídeo que você paga duas vezes.

Perguntas frequentes

O que é o Gemini Omni Flash?

É o gemini-omni-flash-preview do Google, um modelo de geração e edição de vídeo da família Gemini, e não da família Veo. A DeepMind o descreve como "Nano Banana, mas para vídeo" — a ênfase cai em carregar referências de forma consistente e editar material já existente, enquanto o Veo mira geração cinematográfica do zero. Está em Public Preview.

Quanto custa um vídeo de 8 segundos do Omni Flash na E2X?

$0.80. Cobramos $0.10 por segundo de saída em 720p, então a duração comanda a fatura — um clipe de 4 segundos sai por $0.40, e o máximo de 10 segundos, $1.00. Essa era a nossa taxa na checagem de 26 de agosto de 2026.

Quantas imagens de referência o Omni Flash aceita?

Mais de uma, e os exemplos documentados pelo Google vão até seis — mas não há máximo oficial publicado. Fontes fora do Google citam tetos diferentes e se contradizem, então não vamos repetir um número que não podemos verificar. Teste seus próprios payloads antes de projetar em cima de uma contagem específica.

O Omni Flash consegue gerar vídeo em 1080p ou 4K?

Hoje não. Ele entrega 720p a 24 fps, e o Google lista resoluções maiores como em breve. Se você precisa de 1080p ou 4K agora, o Veo 3.1 Fast alcança os dois.

Devo usar o Omni Flash ou o Veo 3.1 Fast?

O Veo 3.1 Fast, para a maioria dos trabalhos. Ele custa $0.12 por um clipe de 8 segundos com áudio na nossa plataforma, contra $0.80 aqui, e vai até 4K. Escolha o Omni Flash quando você precisar de mais de três imagens de referência, de uma duração de 10 segundos, ou do comportamento de edição de vídeo dele.

O vídeo gerado tem som?

Sim, nativamente e em sincronia com a ação na tela. Você dirige o som pelo mesmo prompt — nomeie a ambiência, os efeitos, ou peça música. O áudio não pode ser editado depois pela API, então mudar significa renderizar de novo.

Os vídeos do Omni Flash têm watermark?

Sim. Toda saída carrega um watermark SynthID que quem assiste não vê mas as ferramentas de detecção leem, mais credenciais de conteúdo C2PA ligadas por padrão. Nenhum provider expõe um parâmetro para desligar nenhum dos dois.

Posso editar um vídeo enviado com este modelo?

Só fora do EEE, da Suíça e do Reino Unido — o Google restringe a edição de vídeo enviado nessas regiões. A geração reference-to-video em si não é afetada. Note também que referências em vídeo são aceitas pelo schema mas não processadas corretamente, então envie imagens.