Loading...
Loading...
A família GPT Image 2 da OpenAI para gerar imagens a partir de texto e editá-las com referências pela OpenAI Images API.
Entre para executar modelos
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'openai/gpt-image-2/edit-image',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)GPT Image 2 edit-image é o gpt-image-2-2026-04-21 da OpenAI apontado para imagens que você já tem: retoque, composição, inpainting com mask, outpainting e reescrita do texto embutido em um layout. Rodamos como openai/gpt-image-2/edit-image e cobramos $0.0525 por imagem de saída em resolution=1K, o nosso padrão. O request equivalente de tier alto na fal.ai fica em $0.211.
Não tem imagem de origem para trabalhar? Então o que você quer é o GPT Image 2 text-to-image — mesmo modelo, mesma tabela de preços, só prompt.
O nosso preço é multiplicativo, e um dos dois multiplicadores é uma armadilha. quality aplica ×7 em qualquer valor — low, medium e high cobram idêntico, então um tier mais baixo te custa qualidade de imagem e não economiza nada. É uma peculiaridade de como a nossa config mapeia o parâmetro, e não estamos escondendo isso numa nota de rodapé. Mande high.
resolution é o multiplicador que mexe no dinheiro: ×1 em 1K, ×2 em 2K, ×3 em 4K. O número $0.0075 que circula por aí como "preço do GPT Image 2" é a nossa taxa base antes dos multiplicadores, alcançável só por um request que não mande nenhum valor de quality — e quality é obrigatório neste endpoint, então você não chega lá nem por acidente. Preços em 26 de agosto de 2026:
| Tamanho de saída | E2X, qualquer valor de quality | fal.ai (high) | vs. E2X |
|---|---|---|---|
| 1024×1024 (1K, o nosso padrão) | $0.0525 | $0.211 | somos 75% mais baratos |
| 2560×1440 (2K) | $0.105 | $0.222 | somos 53% mais baratos |
| 3840×2160 (4K) | $0.1575 | $0.401 | somos 61% mais baratos |
Leia as colunas uma contra a outra. O preço da fal mal se mexe entre 1K e 2K enquanto o nosso dobra, então uma diferença que parece enorme em 1K cai quase pela metade em 2K. Ainda a nosso favor em todos os tiers que checamos. Faça o orçamento pelo tier que você vai colocar em produção de verdade.
A OpenAI não cabe nessa tabela. Ela mede este modelo em tokens ($5.00/1M de input de texto, $8.00/1M de input de imagem, $30.00/1M de output de imagem; Batch pela metade), então um "preço por edição" só existe depois que você assume um tamanho de imagem e um comprimento de prompt. Nós cobramos por request.
Os preços e as condições dos produtos podem mudar. Verifique o preço atual de cada provider antes de tomar uma decisão de compra. O preço do Google Batch ou Flex não é diretamente equivalente a um request de API on-demand padrão, porque as condições de agendamento, disponibilidade e processamento são diferentes; por isso ele ficou fora desta comparação. Esta é uma comparação de escopo limitado, não uma afirmação de que a E2X é a opção mais barata do mundo em qualquer configuração.
A OpenAI removeu o parâmetro input_fidelity nesta geração. Toda imagem de origem que você anexa passa agora por processamento em alta fidelidade, sem nenhum ajuste mais barato para onde recuar — mais tokens de input por anexo, sempre. O mercado mostra isso: na fal.ai o endpoint de edição roda mais ou menos o dobro da taxa de text-to-image no tier baixo. Não presuma que um pipeline de edição e um de geração do zero custam a mesma coisa por baixo.
Reescrever texto dentro de arte já pronta. O motivo mais forte para trazer uma imagem para cá em vez de levar a um modelo do Google. Entregue um infográfico pronto em inglês, peça a versão em alemão — o texto volta legível e o layout fica no lugar. O mesmo vale para rótulos de produto, texto de embalagem, cardápios e screenshots de UI.
Composições de várias fontes. Até 16 imagens de referência por request, e até 10 saídas devolvidas — variações para escolher sem um round trip para cada uma.
Inpainting com mask. Anexe uma mask com canal alpha e a região branca marca o que o modelo pode mudar. A mask é opcional; sem ela, o seu prompt delimita a edição. Vale citar a formulação da própria OpenAI em vez de parafrasear: o "modelo usa a mask como orientação, mas pode não seguir o formato exato dela com precisão completa". Uma dica forte, não um traçado de recorte. Outpainting funciona do mesmo jeito.
Transparência. background: "transparent" devolve um canal alpha — PNG ou WebP, nunca JPEG.
As regras de tamanho valem para os inputs também: maior lado até 3840px, os dois lados múltiplos de 16, aspect ratio não mais largo que 3:1, total de pixels entre 655.360 e 8.294.400.
Três campos são obrigatórios aqui: prompt, image_urls e quality.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-image-2/edit-image",
"input": {
"prompt": "Substitua o título na embalagem por \"CAFÉ NOIR — GRAND CRU\" na mesma fonte e no mesmo peso. Deixe a ilustração, o código de barras e o fundo intactos.",
"image_urls": ["https://example.com/coffee-box.png"],
"aspect_ratio": "4:5",
"resolution": "2K",
"quality": "high"
}
}'
Você recebe um job ID de volta. Faça polling nele, ou registre um webhookUrl e deixe a gente te chamar.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "openai/gpt-image-2/edit-image",
input: {
prompt: "Componha o relógio da imagem 1 sobre a superfície de mármore da imagem 2. Acompanhe a direção da luz da imagem 2. Mantenha a gravação do mostrador legível.",
image_urls: [
"https://example.com/watch-cutout.png",
"https://example.com/marble-scene.jpg",
],
aspect_ratio: "1:1",
resolution: "1K",
quality: "high",
},
}),
}).then((r) => r.json());
const { jobId } = submitted.data;
for (;;) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
job.data.outputs.forEach((o) => console.log(o.url));
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Edit failed");
}
await new Promise((r) => setTimeout(r, 3000));
}
Os jobs passam por pending → processing → completed, ou param em failed ou cancelled. Os valores de resolution vão em maiúscula — 1K, 2K, 4K — e o nosso padrão de aspect ratio é 1:1. O modelo planeja e se autoverifica antes de renderizar, então publicamos um ETA de 60 segundos em vez de prometer velocidade de tier flash. Schema e preço ficam na spec legível por máquina.
Cinco editores, uma decisão, e ela se resume a saber se as letras importam.
| Modelo | Preço / imagem | Escolha quando |
|---|---|---|
| GPT Image 2 edit | $0.0525 (high/1K) | Reescrita de texto, inpainting com mask, transparência, 4K |
| Nano Banana Pro | $0.075 | Rostos, consistência de personagem, referências com papel definido |
| Nano Banana 2 | $0.04 | O padrão de uso geral para a maioria das edições |
| Nano Banana 2 Lite | $0.0238 | Troca de fundo e mudança de cor, em volume |
| Nano Banana (legado) | $0.0312 | Só se você ainda não migrou dele |
Resposta direta: se a sua edição não mexe em texto, você provavelmente não deveria estar aqui. O Nano Banana 2 dá conta do retoque comum — remover um objeto, trocar um fundo, esquentar o tratamento de cor — por menos, e mais rápido. Editando um retrato, ou mantendo a mesma pessoa reconhecível entre referências? O Nano Banana Pro é a ferramenta melhor mesmo custando mais.
Venha para cá pelo que a família Google não faz tão bem: reescrever texto dentro de um design existente, inpainting delimitado por mask, saída transparente. O resto está na categoria image-to-image e no nosso catálogo de modelos.
Descreva a diferença, não o destino. Um prompt que redescreve a cena inteira compete com a origem, e você recebe uma regeneração à deriva em vez de uma edição. Diga o que muda, depois o que precisa sobreviver: "mantenha o enquadramento, a sombra e a posição do rótulo idênticos" vale o espaço que ocupa.
Quando várias imagens entram, rotule por índice: imagem 1 é o sujeito, imagem 2 o ambiente, imagem 3 só referência de cor. Nada mais diz ao modelo qual anexo era para ser uma paleta.
Para edições de texto, cole a string exata de substituição entre aspas e diga o que acontece com a antiga. Paráfrase convida à reinterpretação, e reinterpretação num rótulo de produto é reimpressão. Dentro de uma mask, deixe alguns pixels de margem em volta de tudo que for precioso — a borda é orientação, não recorte.
Duas camadas de watermark caem em toda saída, em todo tier de quality, e essa parte não vamos suavizar. Os metadados de proveniência C2PA identificam o arquivo como gerado pelo ChatGPT Images — X, Meta, LinkedIn e TikTok leem isso e aplicam o rótulo "Made with AI" automaticamente. Por baixo fica um watermark imperceptível em nível de pixel dentro dos dados da imagem, que não some quando os metadados somem.
Nenhuma das duas camadas tem botão de desligar, nem para nós nem para qualquer outro revendedor. Não podemos prometer saída white-label neste modelo. Editando assets de cliente sob um contrato que proíbe material rotulado como IA? Tenha essa conversa agora.
Uma nota de custo, já que aqui o instinto engana: passes de rascunho baratos não vêm de quality. Vinte iterações em low cobram exatamente o que vinte em high cobram. Para um ciclo de revisão barato, rascunhe em 1K e guarde 2K ou 4K para a versão que vai para o ar.
$0.0525 por imagem de saída nos nossos padrões de quality=high e resolution=1K. 2K dá $0.105 e 4K dá $0.1575, já que a resolução multiplica por dois e por três. O tier de quality não muda nenhum desses números. Valores da nossa checagem de 26 de agosto de 2026.
Até 16, pela superfície documentada da OpenAI, e um request pode devolver até 10 saídas. Mais anexos significam mais tokens de input, então uma composição com 16 referências não é a mesma carga de trabalho que um retoque de imagem única.
low é mais barata que uma em high?Não. O nosso multiplicador é ×7 seja qual for o valor que você mandar, então low, medium e high cobram todos $0.0525 em 1K. O campo é obrigatório aqui, e nenhum ajuste dele reduz o seu custo. Use resolution para controlar o gasto.
Porque o input_fidelity foi removido: toda imagem anexada é processada em alta fidelidade, sem opção mais barata, então uma edição queima mais tokens de input do que um request só de prompt. Isso aparece no mercado inteiro — o endpoint de edição da fal.ai roda quase o dobro da taxa de text-to-image dela no tier baixo.
Dá, e é o motivo principal para escolher este modelo em vez de uma alternativa do Google. Cite a string exata de substituição e diga o que deve acontecer com a original. Trocas multilíngues também funcionam, incluindo CJK, sem redesenhar o layout em volta delas.
Saem. Toda saída carrega metadados C2PA que as plataformas leem para aplicar o rótulo "Made with AI", mais um watermark de pixel imperceptível nos dados da imagem. Os dois valem em todo tier de quality e nenhum provider consegue desativá-los.
Quando a edição gira em torno de uma pessoa — realismo de retrato e consistência de personagem entre referências são onde o tier Pro do Google é mais forte. Para trabalho rotineiro de fundo e cor, o Nano Banana 2 a $0.04 já basta; a nossa vantagem em texto não te compra nada ali.