Loading...
Loading...
Gemini Omni 1.1 Flash generates video from a text prompt, a single image, a start and end frame, or up to seven reference images. Clips run 4 to 10 seconds at resolutions from 360p to 4K.
Entre para executar modelos
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Custo estimado por geração de acordo com duração e resolução. Você só paga pelo que executar.
O Omni 1.1 Flash entrou em disponibilidade geral no Google em 27 de agosto de 2026 — um modelo da família Gemini, não um Veo. Rodamos a capability que parte só do prompt como google/omni-1.1-flash/text-to-video, cobrada por segundo de saída: $0.09 em 720p, a partir de uma tabela de $0.15 depois de um desconto fixo de 40%. Os oito segundos padrão saem por $0.72. Um prompt é o payload inteiro.
Um número aqui subiu. O antecessor, Gemini Omni Flash text-to-video, cobra $0.0825 por segundo nesta plataforma; esta página cobra $0.09. Nove por cento a mais, e é melhor ler isso aqui do que deduzir de uma fatura. Os nove por cento não compram um segundo de vídeo melhor. Compram um nível de rascunho a $0.0297 para o qual o modelo antigo nem tem enum de resolução, clipes que chegam a dez segundos e duas capabilities que o antecessor nunca publicou na E2X. Nossas notas sobre o lançamento do 1.1 percorrem o resto.
Agora a frase que joga contra a nossa própria fatura. O Veo 3.1 Fast text-to-video roda nesta mesma plataforma por $0.01 o segundo — um nono do preço desta página. Um clipe só, saído de uma frase, sem nada depois dependendo dele? Vá para lá. O prêmio que você paga aqui compra dez segundos, 4K, um modo de rascunho barato e planos que pertencem uns aos outros. Não compre nenhum deles e você não comprou nada.
Outro material, outro endpoint: um frame parado que vira o primeiro quadro vai para image-to-video, duas pontas com um vão entre elas para start-end-frame-to-video, um rosto que se repete para reference-to-video.
Todos os números abaixo foram lidos em 28 de agosto de 2026, na página da versão 1.1 de cada provider:
| Onde você chama | 720p, por segundo | Oito segundos | Contra a nossa taxa |
|---|---|---|---|
| E2X | $0.09 | $0.72 | — |
| fal.ai | $0.10 | $0.80 | somos 10% mais baratos |
| Runware | $0.10 | $0.80 | somos 10% mais baratos |
| Google Gemini API | $0.1014 | $0.81 | somos 11% mais baratos |
| Wavespeed AI | $0.13 | $1.04 | somos 31% mais baratos |
A linha do Google é aritmética dele mesmo, publicada na própria página de preços: $17.50 por milhão de tokens de saída, 5.792 tokens em um segundo de 720p, $0.1014 — que é por que a nota de rodapé de lá fecha em "aproximadamente $0.10 por segundo." Toda linha inclui som, então a comparação é igual para igual. Este modelo não tem nenhum toggle de áudio: diálogo e ruído de sala nascem junto com a imagem, e ninguém daquela lista cobra por eles à parte. O Google publica a mesma taxa em cada resolução, como contagem de tokens: 1.931 tokens por segundo em 360p, 5.792 em 720p, 8.688 em 1080p, 17.376 em 4K — com áudio incluído nas quatro. Então a escala abaixo compara igual com igual até o topo.
Confira por conta própria, mas leia a string de versão. A fal.ai mantém dois anúncios: uma página google/gemini-omni-flash sem versão, que precifica os pesos antigos de preview perto de $0.125 o segundo, e uma página v1.1 a $0.10. A nossa é a v1.1. A Wavespeed merece a ressalva inversa — $0.13 está confirmado só para a variante text-to-video dela, então os outros números dela ficaram de fora.
A taxa de 720p não é a metade interessante. Esta é:
| Resolução | E2X | fal.ai | Runware | Wavespeed | |
|---|---|---|---|---|---|
| 360p | $0.0297 | $0.0338 | $0.03 | $0.036 | $0.039 |
| 720p | $0.09 | $0.1014 | $0.10 | $0.10 | $0.13 |
| 1080p | $0.135 | $0.1520 | $0.15 | $0.16 | $0.195 |
| 4K | $0.18 | $0.3041 | $0.30 | $0.32 | $0.39 |
Nosso multiplicador de 720p para 4K é 2×. O do Google é exatamente 3× — as contagens de tokens dele vão de 5.792 a 17.376 — e os revendedores acompanham o Google. Embaixo as duas escalas têm o mesmo formato — 0,33× até 360p dos dois lados — e se separam conforme você sobe: ao chegar em 4K, o Google triplicou a taxa de 720p enquanto nós dobramos a nossa. É por isso que ficamos abaixo do Google nos quatro níveis: doze por cento em 360p, onze por cento em 720p e em 1080p, e quarenta e um por cento em 4K. A Runware também rende um olhar: empatada com o Google em 720p, depois $0.16 em 1080p e $0.32 em 4K — acima da própria taxa do Google nos dois casos. Uma nota, caso você confira: a tabela do anúncio do Google arredonda esses valores para $0.03, $0.10, $0.15 e $0.30. Os de cima vêm das contagens de tokens por resolução dele mesmo, e é sobre elas que a fatura é calculada.
Os preços e as condições dos produtos podem mudar. Verifique o preço atual de cada provider antes de tomar uma decisão de compra. O preço do Google Batch ou Flex não é diretamente equivalente a um request de API on-demand padrão, porque as condições de agendamento, disponibilidade e processamento são diferentes; por isso ele ficou fora desta comparação. Esta é uma comparação de escopo limitado, não uma afirmação de que a E2X é a opção mais barata do mundo em qualquer configuração.
O que esvazia a conta é a repetição, não uma geração isolada: a sétima tentativa custa o mesmo que a primeira.
Quatro segundos em 360p custam $0.1188; os mesmos quatro em 720p, $0.36. Seis rascunhos baratos mais uma renderização no padrão dão $1.07, contra $2.52 de sete passadas a preço cheio. O Google ainda afirma que 360p volta até 60% mais rápido — número dele, não nosso.
| Duração | Rascunho 360p | Final 720p |
|---|---|---|
| 4 s | $0.1188 | $0.36 |
| 6 s | $0.1782 | $0.54 |
| 8 s (padrão) | $0.2376 | $0.72 |
| 10 s | $0.297 | $0.90 |
Dez segundos de 4K, a $0.18 o segundo, são $1.80 — a maior fatura individual desta página.
Gere uma key no dashboard, mantenha ela fora do client e poste o job. prompt é o único campo obrigatório.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/text-to-video",
"input": {
"prompt": "Uma soldadora baixa a máscara, faíscas jogando luz azul sobre chapas de aço empilhadas. Dolly lento para a esquerda. Estalo do arco elétrico, um ventilador fora de quadro.",
"resolution": "360p",
"duration": "6",
"seed": 20260828
}
}'
Isso é uma passada de rascunho: seis segundos em 360p, $0.1782. Troque resolution para 720p e ela custa $0.54.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/text-to-video",
input: { prompt: "A chuva castiga um ponto de ônibus à noite.", duration: "4" },
}),
}).then((r) => r.json());
for (let attempt = 0; attempt < 360; attempt++) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
const { status } = job.data;
if (status === "completed") { await archive(job.data.outputs[0].url); break; }
if (status === "failed" || status === "cancelled") throw new Error(status);
await new Promise((r) => setTimeout(r, 5000));
}
Conte com quatro minutos por job, ou passe um webhookUrl. Duas armadilhas: duration e resolution viajam como strings, "10" e não 10; e a URL devolvida expira, então copie o arquivo para algum lugar permanente na hora em que você a ler. Todos os campos estão na spec legível por máquina.
Do mais barato para o mais caro:
| Modelo | Chame quando | 8 s em 720p |
|---|---|---|
| Veo 3.1 Fast text-to-video | Um clipe só, sozinho | $0.08 |
| Omni 1.1 Flash text-to-video | Dez segundos, 4K, ou um loop de rascunho em 360p | $0.72 |
| Omni 1.1 Flash start-end-frame | As duas pontas já existem | $0.72 |
| Omni 1.1 Flash reference-to-video | Um sujeito se repete entre clipes | $0.72 |
| Omni Flash text-to-video | Nunca; o Google o aposenta em 30 de setembro de 2026 | $0.66 |
Leia a primeira linha contra a segunda. Nove vezes o preço é muito por um clipe que ninguém vai montar contra nada; o que o prêmio compra é continuidade. Todo o resto que transforma prompt em imagem está em text-to-video; cada modelo que rodamos cabe em uma página.
A saída é fixa: 24 fps, de três a dez segundos, 16:9 ou 9:16. Esses dez importam, porque o Veo para em oito. O model card nomeia três modos de falha:
"Manter consistência completa ao longo das edições, gerar cenas com movimento complexo ou renderizar texto perfeitamente correto continua sendo um desafio."
Texto na tela pega muita gente: peça a placa de uma loja e espere letras que desmoronam sob inspeção. Multidão, água e mãos são os casos de movimento.
O SynthID marca cada quadro de forma invisível e ninguém consegue remover. O inglês é o único idioma de prompt que o Google avaliou, e o Google incorporou o Vertex AI à Gemini Enterprise Agent Platform em 22 de abril de 2026 — é lá que este modelo aparece para compradores corporativos.
O modelo tem as suas palavras e uma seed; tudo o que você deixar de dizer vira decisão dele. Descreva um plano, nunca uma sequência — três acontecimentos em oito segundos rendem um corte ruim ou um borrão.
Fixe a câmera. "Plano geral fixo", "dolly lento para a esquerda", "câmera na mão seguindo". Câmera não declarada fica à deriva.
Fixe a luz. Poste de sódio, tarde nublada, uma única luz prática. A iluminação é o que separa um quadro pensado de uma renderização.
Fixe o som. Você paga pelo áudio tendo planejado ou não, então nomeie a ambiência e qualquer fala — ou o modelo inventa uma cama sonora que briga com a sua edição.
Depois segure a seed e mude uma oração de cada vez. Nosso guia de prompt do Gemini Omni vai mais longe.
$0.09 por segundo de saída em 720p — $0.72 pelos oito segundos padrão, $0.90 no teto de dez segundos. Um desconto de 40% sobre uma tabela de $0.15, checado em 28 de agosto de 2026. Outras faixas: $0.0297 em 360p, $0.135 em 1080p, $0.18 em 4K, áudio incluído.
Nos quatro níveis. O Google cobra vídeo em tokens de saída — $17.50 por milhão, a 1.931 tokens por segundo em 360p, 5.792 em 720p, 8.688 em 1080p e 17.376 em 4K —, o que dá $0.0338, $0.1014, $0.1520 e $0.3041 por segundo, com áudio incluído. A tabela do anúncio arredonda para $0.03, $0.10, $0.15 e $0.30; a fatura sai pelos valores não arredondados. Contra isso somos cerca de doze por cento mais baratos em 360p, onze por cento em 720p e 1080p, e quarenta e um por cento mais baratos em 4K. As duas escalas descem até 360p pelo mesmo passo de 0,33×; a diferença está no topo, onde o Google triplica a taxa de 720p e nós dobramos a nossa.
Não — custa mais. Omni Flash text-to-video roda aqui a $0.0825 por segundo contra os $0.09 desta página, então oito segundos saem por $0.66 lá e $0.72 aqui. Nove por cento de diferença. O modelo antigo não tem nível de 360p e nunca publicou nem image-to-video nem start-end-frame-to-video na E2X; é para lá que vai a diferença. Chamar o Google direto é outra questão: a taxa publicada dele dá $0.1014 por segundo em 720p, então tanto esta página quanto a antiga ficam abaixo. A diferença não é o produto custar mais: os três partem da mesma tabela de $0.15, e o que muda é o desconto permanente — 40% aqui contra 45% e 50% nas páginas antigas.
Veo 3.1 Fast, quase sempre — $0.01 o segundo na mesma API, então oito segundos custam $0.08 em vez de $0.72. Volte para cá quando o clipe precisar chegar a dez segundos, precisar de 4K, ou tiver que combinar com outro material.
Iteração. Quatro segundos em 360p são $0.1188 contra $0.36 em 720p, então as tomadas que você joga fora custam uma fração da que você guarda.
De três a dez segundos, a 24 fps. O enum duration expõe 4, 6, 8 e 10, como strings. Peças mais longas saem de várias chamadas — que é justamente o que os recursos de continuidade do 1.1 existem para tornar viável.
Sim, em toda linha de toda comparação desta página. Não existe nenhum toggle de áudio: diálogo e ambiência nascem junto com a imagem, e nenhum provedor daquela lista cobra por eles em separado.
Normalmente porque é outro modelo. O anúncio google/gemini-omni-flash sem versão da fal.ai precifica os pesos de preview descontinuados perto de $0.125 o segundo; a página v1.1 dela marca $0.10, e a nossa tabela usa a v1.1. Cheque a versão e a data primeiro.