Loading...
Loading...
Família de geração de vídeo do Google que cria clipes a partir de prompts de texto ou imagens de referência, otimizada para entregas rápidas.
0/7 itens
Entre para executar modelos
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Custo estimado por geração de acordo com duração e resolução. Você só paga pelo que executar.
O Omni Flash é o gemini-omni-flash-preview do Google — um modelo de vídeo da família Gemini, não um Veo — e o pitch da própria DeepMind cabe em uma frase: "Pense no Gemini Omni como o Nano Banana, mas para vídeo." Rodamos a capability reference-to-video dele como google/omni-flash/reference-to-video, e cobramos $0.10 por cada segundo de vídeo 720p finalizado. O clipe padrão de 8 segundos custa, portanto, $0.80, áudio incluído.
Repare na unidade. Ninguém vende um clipe aqui por preço fechado, então qualquer número que você comparar precisa ser multiplicado pela duração que você pretende renderizar.
Tem roteiro mas nenhuma imagem para levar para dentro da cena? Então o Veo 3.1 Fast text-to-video é o endpoint que você quer — ele parte só do prompt, e na nossa plataforma custa dramaticamente menos. Voltamos a isso mais abaixo, com honestidade.
Nossa posição frente aos outros lugares onde você pode chamar este modelo, checada em 26 de agosto de 2026:
| Provider de API | Por segundo (720p) | Clipe de 8 segundos | vs. E2X |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | somos 23% mais baratos |
| Atlas Cloud | $0.135 | $1.08 | somos 26% mais baratos |
| Runware | $0.10 | $0.80 | empatado |
| Google Gemini API | $0.10 | $0.80 | empatado |
Os preços e as condições dos produtos podem mudar. Verifique o preço atual de cada provider antes de tomar uma decisão de compra. O preço do Google Batch ou Flex não é diretamente equivalente a um request de API on-demand padrão, porque as condições de agendamento, disponibilidade e processamento são diferentes; por isso ele ficou fora desta comparação. Esta é uma comparação de escopo limitado, não uma afirmação de que a E2X é a opção mais barata do mundo em qualquer configuração.
Não vamos maquiar isso: neste modelo nós empatamos com a taxa do Google em vez de ficar abaixo dela, e a economia só é real contra a fal.ai e a Atlas. As imagens de referência mal aparecem na conta — o Google conta uma imagem como 2.040 tokens, então três delas custam cerca de um centavo. duration é o campo que mexe na sua fatura.
O ponto deste endpoint é continuidade. Entregue um sujeito ao modelo — uma pessoa, um produto, um cenário, um visual —, descreva uma cena em que ele nunca foi fotografado, e o sujeito sobrevive à viagem.
Você pode anexar várias referências, não só uma. Os exemplos publicados pelo Google vão até seis; nenhum máximo oficial foi documentado, e os números de terceiros se contradizem, então não vamos imprimir nenhum. Construa pensando em um punhado e teste o seu próprio teto.
O áudio é gerado junto com a imagem, não colado depois. Ele sincroniza com a ação, e você o dirige pelo mesmo prompt — peça chuva num telhado de zinco e um ruído de sala grave, e é isso que volta. Não existe uma trilha de áudio separada para editar depois.
Dez segundos é o teto. Nosso enum duration expõe 4, 6, 8 e 10; o modelo do Google roda de 3 a 10 segundos, e 10 é limite duro. Sem endpoint de extensão, sem interpolação. Qualquer coisa mais longa é trabalho de costura no seu próprio editor — e a continuidade entre os cortes vira problema seu.
720p, 24 fps, e a lista acaba aí. Nosso campo resolution carrega os valores 1080p e 4k e o Google lista resoluções maiores como em breve, mas hoje o modelo devolve 720p. Deixe no padrão. Uma página de provider que anuncia 1080p aqui está adiantada em relação à documentação do próprio Google.
Conte com uns 45 segundos de processamento para um clipe padrão — um p50 medido pela eachlabs, não um número oficial, então planeje com ele em vez de prometer com ele.
Dois campos são obrigatórios: image_urls e prompt. Gere uma key no seu dashboard, mantenha ela num servidor que você controla, e então poste o job.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "O tênis da imagem 1 está sobre asfalto molhado enquanto um ônibus se afasta atrás dele. Push-in lento. Trânsito ambiente e chuva fina, sem música.",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
A response carrega um ID de job. Vídeo leva minutos, então faça polling devagar — ou pule o polling e passe um webhookUrl no corpo do submit:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"A mulher da referência atravessa um mercado noturno, letreiros de neon refletindo na jaqueta dela. Câmera na mão. Murmúrio de multidão e fritura ao longe.",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
Os status vão de pending → processing → completed, ou param em failed ou cancelled. O schema e o preço ao vivo estão na spec legível por máquina se você preferir lê-los programaticamente.
A comparação que importa, e ela não favorece esta página:
| Modelo | Nosso preço (8s, 720p, áudio) | Escolha quando |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | Várias referências precisam ficar consistentes, ou você precisa de um clipe de 10 segundos |
| Veo 3.1 Fast reference-to-video | $0.12 | Até três referências, 8 segundos, e você quer a fatura mais barata |
| Veo 3.1 Fast image-to-video | $0.12 | Um frame parado que você quer animar |
| Veo 3.1 Fast text-to-video | $0.12 | Nenhum material de origem |
O Veo 3.1 Fast custa uma fração do Omni Flash na nossa plataforma, e alcança 1080p e 4K, coisa que o Omni Flash hoje não faz. No preço de tabela do próprio Google os dois ficam nos mesmos $0.10 por segundo em 720p — é o nosso desconto que abre a diferença. Então comece pelo Veo Fast. Volte para cá quando o teto de três referências dele for o que está te travando, quando você precisar desses dois segundos a mais, ou quando quiser o comportamento de edição de vídeo por trás do enquadramento "Nano Banana para vídeo". Mais opções estão na categoria reference-to-video, e o catálogo de modelos inteiro cabe em uma página.
Public Preview significa que as arestas estão documentadas em vez de escondidas. Leia isto antes de construir:
Escreva o plano, não a história. Um sujeito, um movimento de câmera, uma condição de luz — e então diga como aquilo soa, porque o áudio sai do mesmo prompt e silêncio é uma escolha que você faz em voz alta.
Rotule seus anexos quando entra mais de um: "imagem 1 é a garrafa, imagem 2 é o close do rótulo". Nada além disso diz ao modelo qual referência é a protagonista. Mantenha a linguagem de câmera simples — "push-in lento", "câmera fixa", "follow na mão" funcionam melhor que um parágrafo de fotografia.
Todo clipe carrega um watermark SynthID — invisível para quem assiste, detectável programaticamente — e credenciais de conteúdo C2PA vêm anexadas por padrão. Nenhum provider que roda este modelo consegue desligar as duas coisas, nós inclusive. Se um contrato de cliente proíbe assets de IA rotulados, resolva isso antes de integrar.
Re-hospede suas saídas no seu próprio storage dentro do handler de conclusão. As URLs de resultado não são endereços permanentes, e um vídeo que você não consegue recuperar é um vídeo que você paga duas vezes.
É o gemini-omni-flash-preview do Google, um modelo de geração e edição de vídeo da família Gemini, e não da família Veo. A DeepMind o descreve como "Nano Banana, mas para vídeo" — a ênfase cai em carregar referências de forma consistente e editar material já existente, enquanto o Veo mira geração cinematográfica do zero. Está em Public Preview.
$0.80. Cobramos $0.10 por segundo de saída em 720p, então a duração comanda a fatura — um clipe de 4 segundos sai por $0.40, e o máximo de 10 segundos, $1.00. Essa era a nossa taxa na checagem de 26 de agosto de 2026.
Mais de uma, e os exemplos documentados pelo Google vão até seis — mas não há máximo oficial publicado. Fontes fora do Google citam tetos diferentes e se contradizem, então não vamos repetir um número que não podemos verificar. Teste seus próprios payloads antes de projetar em cima de uma contagem específica.
Hoje não. Ele entrega 720p a 24 fps, e o Google lista resoluções maiores como em breve. Se você precisa de 1080p ou 4K agora, o Veo 3.1 Fast alcança os dois.
O Veo 3.1 Fast, para a maioria dos trabalhos. Ele custa $0.12 por um clipe de 8 segundos com áudio na nossa plataforma, contra $0.80 aqui, e vai até 4K. Escolha o Omni Flash quando você precisar de mais de três imagens de referência, de uma duração de 10 segundos, ou do comportamento de edição de vídeo dele.
Sim, nativamente e em sincronia com a ação na tela. Você dirige o som pelo mesmo prompt — nomeie a ambiência, os efeitos, ou peça música. O áudio não pode ser editado depois pela API, então mudar significa renderizar de novo.
Sim. Toda saída carrega um watermark SynthID que quem assiste não vê mas as ferramentas de detecção leem, mais credenciais de conteúdo C2PA ligadas por padrão. Nenhum provider expõe um parâmetro para desligar nenhum dos dois.
Só fora do EEE, da Suíça e do Reino Unido — o Google restringe a edição de vídeo enviado nessas regiões. A geração reference-to-video em si não é afetada. Note também que referências em vídeo são aceitas pelo schema mas não processadas corretamente, então envie imagens.