Volver a Modelos

GPT Image 2

La familia GPT Image 2 de OpenAI para generar imágenes a partir de texto y editarlas con referencias mediante la OpenAI Images API.

Texto a imagendesde$0.0075Edición de imagendesde$0.0075
Preciosdesde $0.0075/solicitud
Latencia~60 segundos en promedio
Resolución1K/2K/4K
Ideal paraimage, openai, gpt-image-2

Parámetros

Costo Estimado

Ahorras 75% en este modelo
Costo base por request$0.03
Descuento-75%
Tu Total$0.0075
Ahorras $0.023 por solicitud

Inicia sesión para ejecutar modelos

Output Preview

Ready

No output yet

Run the model to see generated results.

Ejemplo de salida

Ejemplo de API— Parámetros Actuales

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'openai/gpt-image-2/edit-image',
  'input': {}
}
)

Obtener trabajo— Consultar resultado

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)
Explorar alternativas

Modelos relacionados

Descubre más modelos de IA para Edición de imagen

Ver todos los modelos

API de edición de imágenes e inpainting con GPT Image 2 en E2X

GPT Image 2 edit-image es el gpt-image-2-2026-04-21 de OpenAI apuntado a imágenes que ya tiene: retoque, composición, inpainting con mask, outpainting y reescritura del texto incrustado en una maquetación. Lo operamos como openai/gpt-image-2/edit-image y facturamos $0.0525 por imagen de salida con resolution=1K, nuestro valor por defecto. El request equivalente de nivel alto en fal.ai está en $0.211.

¿No tiene una imagen de partida? Entonces lo que quiere es GPT Image 2 text-to-image: mismo modelo, misma tarifa, solo prompt.

Lo que cuesta aquí una edición

Nuestro precio es multiplicativo, y uno de los dos multiplicadores es una trampa. quality aplica ×7 en todos sus valores —low, medium y high facturan idéntico—, así que un nivel más bajo le cuesta calidad de imagen y no le ahorra nada. Es una peculiaridad de cómo nuestra configuración mapea el parámetro, y no la escondemos en una nota al pie. Envíe high.

resolution es el multiplicador que mueve dinero: ×1 en 1K, ×2 en 2K, ×3 en 4K. La cifra de $0.0075 que circula como «el precio de GPT Image 2» es nuestra tarifa base previa a los multiplicadores, alcanzable solo por un request que no envíe ningún valor de quality; y quality es obligatorio en este endpoint, así que aquí no puede llegar a ella ni por accidente. Tarifas a 26 de agosto de 2026:

Tamaño de salidaE2X, cualquier valor de qualityfal.ai (high)vs. E2X
1024×1024 (1K, nuestro valor por defecto)$0.0525$0.211somos un 75% más baratos
2560×1440 (2K)$0.105$0.222somos un 53% más baratos
3840×2160 (4K)$0.1575$0.401somos un 61% más baratos

Lea las columnas unas contra otras. El precio de fal apenas se mueve entre 1K y 2K mientras que el nuestro se duplica, así que una brecha que parece enorme en 1K se reduce aproximadamente a la mitad en 2K. Sigue a nuestro favor en todos los niveles que comprobamos. Presupueste sobre el nivel que realmente vaya a publicar.

OpenAI no puede aparecer en esa tabla en absoluto. Mide este modelo en tokens ($5.00/1M de texto de entrada, $8.00/1M de imagen de entrada, $30.00/1M de imagen de salida; Batch a la mitad de tarifa), así que un «precio por edición» solo existe una vez que usted asume un tamaño de imagen y una longitud de prompt. Nosotros cobramos por request.

Los precios y las condiciones de los productos pueden cambiar con el tiempo; consulte los precios vigentes de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a un request estándar de API bajo demanda, porque la programación, la disponibilidad y las condiciones de procesamiento son distintas; por eso quedan excluidos de esta comparación. Se trata de una comparación acotada, no de una afirmación de que E2X sea la opción más barata del mundo en cualquier configuración.

La razón estructural por la que las ediciones cuestan más

OpenAI eliminó el parámetro input_fidelity en esta generación. Cada imagen de origen que adjunta se procesa ahora en alta fidelidad, sin un ajuste más barato al que recurrir: más tokens de entrada por adjunto, siempre. El mercado lo refleja: en fal.ai el endpoint de edición cuesta aproximadamente el doble que la tarifa de text-to-image en el nivel bajo. No dé por hecho que un pipeline de edición y uno de generación desde cero cuestan lo mismo por debajo.

Para qué sirve este endpoint

Reescribir texto dentro de arte ya existente. La razón más fuerte para traer una imagen aquí en lugar de a un modelo de Google. Déle una infografía terminada en inglés, pida la versión en alemán: la tipografía vuelve legible y la maquetación se queda donde estaba. Lo mismo para etiquetas de producto, textos de packaging, cartas de menú y capturas de UI.

Composiciones a partir de muchas fuentes. Hasta 16 imágenes de referencia por request, y hasta 10 salidas devueltas: variantes entre las que elegir sin una ida y vuelta por cada una.

Inpainting con mask. Adjunte un mask con canal alfa y la región blanca marcará lo que el modelo puede cambiar. El mask es opcional; sin él, su prompt acota la edición. Merece la pena citar las palabras de OpenAI en vez de parafrasearlas: el «modelo usa el mask como guía, pero puede no seguir su forma exacta con precisión completa». Una indicación fuerte, no un trazado de recorte. El outpainting funciona igual.

Transparencia. background: "transparent" devuelve un canal alfa: PNG o WebP, nunca JPEG.

Las reglas de tamaño también se aplican a las entradas: lado más largo hasta 3840px, ambos lados múltiplos de 16, aspect ratio no más ancho que 3:1 y un total de píxeles de entre 655.360 y 8.294.400.

Request de API: fuentes, prompt y mask opcional

Aquí son obligatorios tres campos: prompt, image_urls y quality.

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-image-2/edit-image",
    "input": {
      "prompt": "Sustituye el titular del packaging por \"CAFÉ NOIR — GRAND CRU\" en la misma tipografía y el mismo grosor. No toques la ilustración, el código de barras ni el fondo.",
      "image_urls": ["https://example.com/coffee-box.png"],
      "aspect_ratio": "4:5",
      "resolution": "2K",
      "quality": "high"
    }
  }'

Recibirá un job ID de vuelta. Haga polling, o registre un webhookUrl y deje que le llamemos nosotros.

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "openai/gpt-image-2/edit-image",
    input: {
      prompt: "Compón el reloj de la imagen 1 sobre la superficie de mármol de la imagen 2. Iguala la dirección de la luz de la imagen 2. Mantén legible el grabado de la esfera.",
      image_urls: [
        "https://example.com/watch-cutout.png",
        "https://example.com/marble-scene.jpg",
      ],
      aspect_ratio: "1:1",
      resolution: "1K",
      quality: "high",
    },
  }),
}).then((r) => r.json());

const { jobId } = submitted.data;

for (;;) {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
    .then((r) => r.json());
  if (job.data.status === "completed") {
    job.data.outputs.forEach((o) => console.log(o.url));
    break;
  }
  if (job.data.status === "failed") {
    throw new Error(job.data.error?.message || "Edit failed");
  }
  await new Promise((r) => setTimeout(r, 3000));
}

Los jobs pasan de pending → processing → completed, o se detienen en failed o cancelled. Los valores de resolution van en mayúscula —1K, 2K, 4K— y nuestro valor por defecto de aspect ratio es 1:1. El modelo planifica y se autocomprueba antes de renderizar, así que publicamos un ETA de 60 segundos en lugar de una promesa de nivel flash. El schema y el precio viven en la especificación legible por máquina.

Cómo elegir entre nuestros modelos de edición de imágenes

Cinco editores, una decisión, y se reduce a si las letras importan.

ModeloPrecio / imagenElíjalo cuando
GPT Image 2 edit$0.0525 (high/1K)Reescritura de texto, inpainting con mask, transparencia, 4K
Nano Banana Pro$0.075Caras, consistencia de personaje, referencias tipadas por rol
Nano Banana 2$0.04El valor por defecto de propósito general para la mayoría de ediciones
Nano Banana 2 Lite$0.0238Cambios de fondo y de color, a volumen
Nano Banana (legacy)$0.0312Solo si todavía no ha migrado fuera de él

Respuesta directa: si su edición no toca la tipografía, probablemente no debería estar aquí. Nano Banana 2 resuelve el retoque corriente —quitar un objeto, cambiar un fondo, calentar el grado de color— por menos y más rápido. ¿Edita un retrato, o mantiene a una persona reconocible entre referencias? Nano Banana Pro es la mejor herramienta incluso a un precio más alto.

Venga aquí por lo que la familia de Google no hace igual de bien: reescribir texto dentro de un diseño existente, inpainting acotado por mask, salida transparente. El resto está en la categoría edit-image y en nuestro catálogo de modelos.

Notas de trabajo del endpoint

Describa el delta, no el destino. Un prompt que vuelve a describir la escena entera compite con la fuente, y obtiene una regeneración a la deriva en lugar de una edición. Nombre lo que cambia y después lo que debe sobrevivir: «mantén el encuadre, la sombra y la posición de la etiqueta idénticos» se gana su sitio.

Cuando entran varias imágenes, etiquételas por índice: la imagen 1 es el sujeto, la imagen 2 el entorno, la imagen 3 solo referencia de color. Nada más le dice al modelo qué adjunto pretendía ser una paleta.

Para ediciones de texto, pegue la cadena de reemplazo exacta entre comillas y diga qué pasa con la antigua. Parafrasear invita a la reinterpretación, y una reinterpretación en la etiqueta de un producto es una reimpresión. Dentro de un mask, deje unos píxeles de margen alrededor de todo lo que sea valioso: el borde es una guía, no un recorte.

Antes de publicar un asset editado

Dos capas de watermark aterrizan en cada salida, en todos los niveles de calidad, y esta parte no la vamos a suavizar. Los metadatos de procedencia C2PA identifican el archivo como generado por ChatGPT Images: X, Meta, LinkedIn y TikTok los analizan y aplican el etiquetado «Made with AI» automáticamente. Debajo hay un watermark imperceptible a nivel de píxel en los datos de la imagen, que no desaparece cuando desaparecen los metadatos.

Ninguna de las dos capas tiene interruptor de apagado, ni para nosotros ni para ningún otro revendedor. No podemos prometer salida white-label en este modelo. ¿Edita assets de un cliente bajo un contrato que prohíbe material etiquetado como IA? Tenga esa conversación ahora.

Una nota de coste, ya que aquí el instinto se equivoca: las pasadas de borrador baratas no salen de quality. Veinte iteraciones en low facturan exactamente lo mismo que veinte en high. Para un bucle de revisión barato, haga borradores en 1K y deje 2K o 4K para la versión que se publica.

Preguntas frecuentes

¿Cuánto cuesta una edición con GPT Image 2 en E2X?

$0.0525 por imagen de salida con nuestros valores por defecto de quality=high y resolution=1K. 2K sale a $0.105 y 4K a $0.1575, ya que la resolución multiplica por dos y por tres. El nivel de calidad no cambia ninguno de esos números. Cifras de nuestra comprobación del 26 de agosto de 2026.

¿Cuántas imágenes de referencia admite un solo request de edición?

Hasta 16, según la superficie documentada por OpenAI, y un solo request puede devolver hasta 10 salidas. Más adjuntos significan más tokens de entrada, así que un composite de 16 referencias no es la misma carga de trabajo que el retoque de una sola imagen.

¿Una edición con quality en low es más barata que una en high?

No. Nuestro multiplicador es ×7 sea cual sea el valor que envíe, así que low, medium y high facturan todos $0.0525 en 1K. El campo es obligatorio aquí, y ningún ajuste suyo le baja el coste. Use resolution para controlar el gasto.

¿Por qué las ediciones cuestan más de ejecutar que las generaciones normales?

Porque se eliminó input_fidelity: cada imagen adjunta se procesa en alta fidelidad sin una opción más barata, así que una edición quema más tokens de entrada que un request solo con prompt. Se nota en todo el mercado: el endpoint de edición de fal.ai cuesta aproximadamente el doble que su tarifa de text-to-image en el nivel bajo.

¿Puedo cambiar las palabras dentro de una imagen que ya tengo?

Sí, y es la razón principal para elegir este modelo frente a una alternativa de Google. Cite la cadena de reemplazo exacta y diga qué debería pasar con la original. Los cambios multilingües también funcionan, incluido CJK, sin redibujar la maquetación a su alrededor.

¿Las imágenes editadas salen con watermark?

Sí. Cada salida lleva metadatos C2PA que las plataformas leen para aplicar etiquetas «Made with AI», más un watermark de píxel imperceptible en los datos de la imagen. Ambos se aplican en todos los niveles de calidad y ningún proveedor puede desactivarlos.

¿Cuándo debería usar la edición con Nano Banana Pro en su lugar?

Cuando la edición gira en torno a una persona: el realismo de retrato y la consistencia de personaje entre referencias son donde el nivel Pro de Google es más fuerte. Para trabajo rutinario de fondo y color, Nano Banana 2 a $0.04 es suficiente; ahí nuestra ventaja en texto no le aporta nada.