Voltar para Modelos

GPT Image 2

A família GPT Image 2 da OpenAI para gerar imagens a partir de texto e editá-las com referências pela OpenAI Images API.

Texto para Imagema partir de$0.0075Edição de Imagema partir de$0.0075
Preçosa partir de $0.0075/solicitação
Latência~60 segundos em média
Resolução1K/2K/4K
Melhor paraimage, openai, gpt-image-2

Parâmetros

Custo Estimado

Você economiza 75% neste modelo
Custo base por request$0.03
Desconto-75%
Seu Total$0.0075
Você economiza $0.023 por solicitação

Entre para executar modelos

Output Preview

Ready

No output yet

Run the model to see generated results.

Exemplo de Saída

Exemplo de API— Parâmetros Atuais

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'openai/gpt-image-2/edit-image',
  'input': {}
}
)

Obter Trabalho— Consultar resultado

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)
Explorar alternativas

Modelos relacionados

Descubra mais modelos de IA para Edição de Imagem

Ver todos os modelos

API de Edição de Imagem e Inpainting do GPT Image 2 na E2X

GPT Image 2 edit-image é o gpt-image-2-2026-04-21 da OpenAI apontado para imagens que você já tem: retoque, composição, inpainting com mask, outpainting e reescrita do texto embutido em um layout. Rodamos como openai/gpt-image-2/edit-image e cobramos $0.0525 por imagem de saída em resolution=1K, o nosso padrão. O request equivalente de tier alto na fal.ai fica em $0.211.

Não tem imagem de origem para trabalhar? Então o que você quer é o GPT Image 2 text-to-image — mesmo modelo, mesma tabela de preços, só prompt.

O que custa uma edição aqui

O nosso preço é multiplicativo, e um dos dois multiplicadores é uma armadilha. quality aplica ×7 em qualquer valor — low, medium e high cobram idêntico, então um tier mais baixo te custa qualidade de imagem e não economiza nada. É uma peculiaridade de como a nossa config mapeia o parâmetro, e não estamos escondendo isso numa nota de rodapé. Mande high.

resolution é o multiplicador que mexe no dinheiro: ×1 em 1K, ×2 em 2K, ×3 em 4K. O número $0.0075 que circula por aí como "preço do GPT Image 2" é a nossa taxa base antes dos multiplicadores, alcançável só por um request que não mande nenhum valor de quality — e quality é obrigatório neste endpoint, então você não chega lá nem por acidente. Preços em 26 de agosto de 2026:

Tamanho de saídaE2X, qualquer valor de qualityfal.ai (high)vs. E2X
1024×1024 (1K, o nosso padrão)$0.0525$0.211somos 75% mais baratos
2560×1440 (2K)$0.105$0.222somos 53% mais baratos
3840×2160 (4K)$0.1575$0.401somos 61% mais baratos

Leia as colunas uma contra a outra. O preço da fal mal se mexe entre 1K e 2K enquanto o nosso dobra, então uma diferença que parece enorme em 1K cai quase pela metade em 2K. Ainda a nosso favor em todos os tiers que checamos. Faça o orçamento pelo tier que você vai colocar em produção de verdade.

A OpenAI não cabe nessa tabela. Ela mede este modelo em tokens ($5.00/1M de input de texto, $8.00/1M de input de imagem, $30.00/1M de output de imagem; Batch pela metade), então um "preço por edição" só existe depois que você assume um tamanho de imagem e um comprimento de prompt. Nós cobramos por request.

Os preços e as condições dos produtos podem mudar. Verifique o preço atual de cada provider antes de tomar uma decisão de compra. O preço do Google Batch ou Flex não é diretamente equivalente a um request de API on-demand padrão, porque as condições de agendamento, disponibilidade e processamento são diferentes; por isso ele ficou fora desta comparação. Esta é uma comparação de escopo limitado, não uma afirmação de que a E2X é a opção mais barata do mundo em qualquer configuração.

A razão estrutural de edições custarem mais para rodar

A OpenAI removeu o parâmetro input_fidelity nesta geração. Toda imagem de origem que você anexa passa agora por processamento em alta fidelidade, sem nenhum ajuste mais barato para onde recuar — mais tokens de input por anexo, sempre. O mercado mostra isso: na fal.ai o endpoint de edição roda mais ou menos o dobro da taxa de text-to-image no tier baixo. Não presuma que um pipeline de edição e um de geração do zero custam a mesma coisa por baixo.

Para que este endpoint é bom

Reescrever texto dentro de arte já pronta. O motivo mais forte para trazer uma imagem para cá em vez de levar a um modelo do Google. Entregue um infográfico pronto em inglês, peça a versão em alemão — o texto volta legível e o layout fica no lugar. O mesmo vale para rótulos de produto, texto de embalagem, cardápios e screenshots de UI.

Composições de várias fontes. Até 16 imagens de referência por request, e até 10 saídas devolvidas — variações para escolher sem um round trip para cada uma.

Inpainting com mask. Anexe uma mask com canal alpha e a região branca marca o que o modelo pode mudar. A mask é opcional; sem ela, o seu prompt delimita a edição. Vale citar a formulação da própria OpenAI em vez de parafrasear: o "modelo usa a mask como orientação, mas pode não seguir o formato exato dela com precisão completa". Uma dica forte, não um traçado de recorte. Outpainting funciona do mesmo jeito.

Transparência. background: "transparent" devolve um canal alpha — PNG ou WebP, nunca JPEG.

As regras de tamanho valem para os inputs também: maior lado até 3840px, os dois lados múltiplos de 16, aspect ratio não mais largo que 3:1, total de pixels entre 655.360 e 8.294.400.

Request de API: fontes, prompt, mask opcional

Três campos são obrigatórios aqui: prompt, image_urls e quality.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-image-2/edit-image",
    "input": {
      "prompt": "Substitua o título na embalagem por \"CAFÉ NOIR — GRAND CRU\" na mesma fonte e no mesmo peso. Deixe a ilustração, o código de barras e o fundo intactos.",
      "image_urls": ["https://example.com/coffee-box.png"],
      "aspect_ratio": "4:5",
      "resolution": "2K",
      "quality": "high"
    }
  }'

Você recebe um job ID de volta. Faça polling nele, ou registre um webhookUrl e deixe a gente te chamar.

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "openai/gpt-image-2/edit-image",
    input: {
      prompt: "Componha o relógio da imagem 1 sobre a superfície de mármore da imagem 2. Acompanhe a direção da luz da imagem 2. Mantenha a gravação do mostrador legível.",
      image_urls: [
        "https://example.com/watch-cutout.png",
        "https://example.com/marble-scene.jpg",
      ],
      aspect_ratio: "1:1",
      resolution: "1K",
      quality: "high",
    },
  }),
}).then((r) => r.json());

const { jobId } = submitted.data;

for (;;) {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
    .then((r) => r.json());
  if (job.data.status === "completed") {
    job.data.outputs.forEach((o) => console.log(o.url));
    break;
  }
  if (job.data.status === "failed") {
    throw new Error(job.data.error?.message || "Edit failed");
  }
  await new Promise((r) => setTimeout(r, 3000));
}

Os jobs passam por pending → processing → completed, ou param em failed ou cancelled. Os valores de resolution vão em maiúscula — 1K, 2K, 4K — e o nosso padrão de aspect ratio é 1:1. O modelo planeja e se autoverifica antes de renderizar, então publicamos um ETA de 60 segundos em vez de prometer velocidade de tier flash. Schema e preço ficam na spec legível por máquina.

Escolhendo entre os nossos modelos de edição de imagem

Cinco editores, uma decisão, e ela se resume a saber se as letras importam.

ModeloPreço / imagemEscolha quando
GPT Image 2 edit$0.0525 (high/1K)Reescrita de texto, inpainting com mask, transparência, 4K
Nano Banana Pro$0.075Rostos, consistência de personagem, referências com papel definido
Nano Banana 2$0.04O padrão de uso geral para a maioria das edições
Nano Banana 2 Lite$0.0238Troca de fundo e mudança de cor, em volume
Nano Banana (legado)$0.0312Só se você ainda não migrou dele

Resposta direta: se a sua edição não mexe em texto, você provavelmente não deveria estar aqui. O Nano Banana 2 dá conta do retoque comum — remover um objeto, trocar um fundo, esquentar o tratamento de cor — por menos, e mais rápido. Editando um retrato, ou mantendo a mesma pessoa reconhecível entre referências? O Nano Banana Pro é a ferramenta melhor mesmo custando mais.

Venha para cá pelo que a família Google não faz tão bem: reescrever texto dentro de um design existente, inpainting delimitado por mask, saída transparente. O resto está na categoria image-to-image e no nosso catálogo de modelos.

Notas de uso do endpoint

Descreva a diferença, não o destino. Um prompt que redescreve a cena inteira compete com a origem, e você recebe uma regeneração à deriva em vez de uma edição. Diga o que muda, depois o que precisa sobreviver: "mantenha o enquadramento, a sombra e a posição do rótulo idênticos" vale o espaço que ocupa.

Quando várias imagens entram, rotule por índice: imagem 1 é o sujeito, imagem 2 o ambiente, imagem 3 só referência de cor. Nada mais diz ao modelo qual anexo era para ser uma paleta.

Para edições de texto, cole a string exata de substituição entre aspas e diga o que acontece com a antiga. Paráfrase convida à reinterpretação, e reinterpretação num rótulo de produto é reimpressão. Dentro de uma mask, deixe alguns pixels de margem em volta de tudo que for precioso — a borda é orientação, não recorte.

Antes de colocar um asset editado em produção

Duas camadas de watermark caem em toda saída, em todo tier de quality, e essa parte não vamos suavizar. Os metadados de proveniência C2PA identificam o arquivo como gerado pelo ChatGPT Images — X, Meta, LinkedIn e TikTok leem isso e aplicam o rótulo "Made with AI" automaticamente. Por baixo fica um watermark imperceptível em nível de pixel dentro dos dados da imagem, que não some quando os metadados somem.

Nenhuma das duas camadas tem botão de desligar, nem para nós nem para qualquer outro revendedor. Não podemos prometer saída white-label neste modelo. Editando assets de cliente sob um contrato que proíbe material rotulado como IA? Tenha essa conversa agora.

Uma nota de custo, já que aqui o instinto engana: passes de rascunho baratos não vêm de quality. Vinte iterações em low cobram exatamente o que vinte em high cobram. Para um ciclo de revisão barato, rascunhe em 1K e guarde 2K ou 4K para a versão que vai para o ar.

Perguntas frequentes

Quanto custa uma edição do GPT Image 2 na E2X?

$0.0525 por imagem de saída nos nossos padrões de quality=high e resolution=1K. 2K dá $0.105 e 4K dá $0.1575, já que a resolução multiplica por dois e por três. O tier de quality não muda nenhum desses números. Valores da nossa checagem de 26 de agosto de 2026.

Quantas imagens de referência cabem em um único request de edição?

Até 16, pela superfície documentada da OpenAI, e um request pode devolver até 10 saídas. Mais anexos significam mais tokens de input, então uma composição com 16 referências não é a mesma carga de trabalho que um retoque de imagem única.

Uma edição em low é mais barata que uma em high?

Não. O nosso multiplicador é ×7 seja qual for o valor que você mandar, então low, medium e high cobram todos $0.0525 em 1K. O campo é obrigatório aqui, e nenhum ajuste dele reduz o seu custo. Use resolution para controlar o gasto.

Por que edições custam mais para rodar do que gerações comuns?

Porque o input_fidelity foi removido: toda imagem anexada é processada em alta fidelidade, sem opção mais barata, então uma edição queima mais tokens de input do que um request só de prompt. Isso aparece no mercado inteiro — o endpoint de edição da fal.ai roda quase o dobro da taxa de text-to-image dela no tier baixo.

Dá para mudar as palavras dentro de uma imagem que eu já tenho?

Dá, e é o motivo principal para escolher este modelo em vez de uma alternativa do Google. Cite a string exata de substituição e diga o que deve acontecer com a original. Trocas multilíngues também funcionam, incluindo CJK, sem redesenhar o layout em volta delas.

As imagens editadas saem com watermark?

Saem. Toda saída carrega metadados C2PA que as plataformas leem para aplicar o rótulo "Made with AI", mais um watermark de pixel imperceptível nos dados da imagem. Os dois valem em todo tier de quality e nenhum provider consegue desativá-los.

Quando devo usar a edição do Nano Banana Pro em vez desta?

Quando a edição gira em torno de uma pessoa — realismo de retrato e consistência de personagem entre referências são onde o tier Pro do Google é mais forte. Para trabalho rotineiro de fundo e cor, o Nano Banana 2 a $0.04 já basta; a nossa vantagem em texto não te compra nada ali.