Loading...
Loading...
La familia GPT Image 2 de OpenAI para generar imágenes a partir de texto y editarlas con referencias mediante la OpenAI Images API.
Inicia sesión para ejecutar modelos
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'openai/gpt-image-2/edit-image',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)GPT Image 2 edit-image es el gpt-image-2-2026-04-21 de OpenAI apuntado a imágenes que ya tiene: retoque, composición, inpainting con mask, outpainting y reescritura del texto incrustado en una maquetación. Lo operamos como openai/gpt-image-2/edit-image y facturamos $0.0525 por imagen de salida con resolution=1K, nuestro valor por defecto. El request equivalente de nivel alto en fal.ai está en $0.211.
¿No tiene una imagen de partida? Entonces lo que quiere es GPT Image 2 text-to-image: mismo modelo, misma tarifa, solo prompt.
Nuestro precio es multiplicativo, y uno de los dos multiplicadores es una trampa. quality aplica ×7 en todos sus valores —low, medium y high facturan idéntico—, así que un nivel más bajo le cuesta calidad de imagen y no le ahorra nada. Es una peculiaridad de cómo nuestra configuración mapea el parámetro, y no la escondemos en una nota al pie. Envíe high.
resolution es el multiplicador que mueve dinero: ×1 en 1K, ×2 en 2K, ×3 en 4K. La cifra de $0.0075 que circula como «el precio de GPT Image 2» es nuestra tarifa base previa a los multiplicadores, alcanzable solo por un request que no envíe ningún valor de quality; y quality es obligatorio en este endpoint, así que aquí no puede llegar a ella ni por accidente. Tarifas a 26 de agosto de 2026:
| Tamaño de salida | E2X, cualquier valor de quality | fal.ai (high) | vs. E2X |
|---|---|---|---|
| 1024×1024 (1K, nuestro valor por defecto) | $0.0525 | $0.211 | somos un 75% más baratos |
| 2560×1440 (2K) | $0.105 | $0.222 | somos un 53% más baratos |
| 3840×2160 (4K) | $0.1575 | $0.401 | somos un 61% más baratos |
Lea las columnas unas contra otras. El precio de fal apenas se mueve entre 1K y 2K mientras que el nuestro se duplica, así que una brecha que parece enorme en 1K se reduce aproximadamente a la mitad en 2K. Sigue a nuestro favor en todos los niveles que comprobamos. Presupueste sobre el nivel que realmente vaya a publicar.
OpenAI no puede aparecer en esa tabla en absoluto. Mide este modelo en tokens ($5.00/1M de texto de entrada, $8.00/1M de imagen de entrada, $30.00/1M de imagen de salida; Batch a la mitad de tarifa), así que un «precio por edición» solo existe una vez que usted asume un tamaño de imagen y una longitud de prompt. Nosotros cobramos por request.
Los precios y las condiciones de los productos pueden cambiar con el tiempo; consulte los precios vigentes de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a un request estándar de API bajo demanda, porque la programación, la disponibilidad y las condiciones de procesamiento son distintas; por eso quedan excluidos de esta comparación. Se trata de una comparación acotada, no de una afirmación de que E2X sea la opción más barata del mundo en cualquier configuración.
OpenAI eliminó el parámetro input_fidelity en esta generación. Cada imagen de origen que adjunta se procesa ahora en alta fidelidad, sin un ajuste más barato al que recurrir: más tokens de entrada por adjunto, siempre. El mercado lo refleja: en fal.ai el endpoint de edición cuesta aproximadamente el doble que la tarifa de text-to-image en el nivel bajo. No dé por hecho que un pipeline de edición y uno de generación desde cero cuestan lo mismo por debajo.
Reescribir texto dentro de arte ya existente. La razón más fuerte para traer una imagen aquí en lugar de a un modelo de Google. Déle una infografía terminada en inglés, pida la versión en alemán: la tipografía vuelve legible y la maquetación se queda donde estaba. Lo mismo para etiquetas de producto, textos de packaging, cartas de menú y capturas de UI.
Composiciones a partir de muchas fuentes. Hasta 16 imágenes de referencia por request, y hasta 10 salidas devueltas: variantes entre las que elegir sin una ida y vuelta por cada una.
Inpainting con mask. Adjunte un mask con canal alfa y la región blanca marcará lo que el modelo puede cambiar. El mask es opcional; sin él, su prompt acota la edición. Merece la pena citar las palabras de OpenAI en vez de parafrasearlas: el «modelo usa el mask como guía, pero puede no seguir su forma exacta con precisión completa». Una indicación fuerte, no un trazado de recorte. El outpainting funciona igual.
Transparencia. background: "transparent" devuelve un canal alfa: PNG o WebP, nunca JPEG.
Las reglas de tamaño también se aplican a las entradas: lado más largo hasta 3840px, ambos lados múltiplos de 16, aspect ratio no más ancho que 3:1 y un total de píxeles de entre 655.360 y 8.294.400.
Aquí son obligatorios tres campos: prompt, image_urls y quality.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-image-2/edit-image",
"input": {
"prompt": "Sustituye el titular del packaging por \"CAFÉ NOIR — GRAND CRU\" en la misma tipografía y el mismo grosor. No toques la ilustración, el código de barras ni el fondo.",
"image_urls": ["https://example.com/coffee-box.png"],
"aspect_ratio": "4:5",
"resolution": "2K",
"quality": "high"
}
}'
Recibirá un job ID de vuelta. Haga polling, o registre un webhookUrl y deje que le llamemos nosotros.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "openai/gpt-image-2/edit-image",
input: {
prompt: "Compón el reloj de la imagen 1 sobre la superficie de mármol de la imagen 2. Iguala la dirección de la luz de la imagen 2. Mantén legible el grabado de la esfera.",
image_urls: [
"https://example.com/watch-cutout.png",
"https://example.com/marble-scene.jpg",
],
aspect_ratio: "1:1",
resolution: "1K",
quality: "high",
},
}),
}).then((r) => r.json());
const { jobId } = submitted.data;
for (;;) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
job.data.outputs.forEach((o) => console.log(o.url));
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Edit failed");
}
await new Promise((r) => setTimeout(r, 3000));
}
Los jobs pasan de pending → processing → completed, o se detienen en failed o cancelled. Los valores de resolution van en mayúscula —1K, 2K, 4K— y nuestro valor por defecto de aspect ratio es 1:1. El modelo planifica y se autocomprueba antes de renderizar, así que publicamos un ETA de 60 segundos en lugar de una promesa de nivel flash. El schema y el precio viven en la especificación legible por máquina.
Cinco editores, una decisión, y se reduce a si las letras importan.
| Modelo | Precio / imagen | Elíjalo cuando |
|---|---|---|
| GPT Image 2 edit | $0.0525 (high/1K) | Reescritura de texto, inpainting con mask, transparencia, 4K |
| Nano Banana Pro | $0.075 | Caras, consistencia de personaje, referencias tipadas por rol |
| Nano Banana 2 | $0.04 | El valor por defecto de propósito general para la mayoría de ediciones |
| Nano Banana 2 Lite | $0.0238 | Cambios de fondo y de color, a volumen |
| Nano Banana (legacy) | $0.0312 | Solo si todavía no ha migrado fuera de él |
Respuesta directa: si su edición no toca la tipografía, probablemente no debería estar aquí. Nano Banana 2 resuelve el retoque corriente —quitar un objeto, cambiar un fondo, calentar el grado de color— por menos y más rápido. ¿Edita un retrato, o mantiene a una persona reconocible entre referencias? Nano Banana Pro es la mejor herramienta incluso a un precio más alto.
Venga aquí por lo que la familia de Google no hace igual de bien: reescribir texto dentro de un diseño existente, inpainting acotado por mask, salida transparente. El resto está en la categoría edit-image y en nuestro catálogo de modelos.
Describa el delta, no el destino. Un prompt que vuelve a describir la escena entera compite con la fuente, y obtiene una regeneración a la deriva en lugar de una edición. Nombre lo que cambia y después lo que debe sobrevivir: «mantén el encuadre, la sombra y la posición de la etiqueta idénticos» se gana su sitio.
Cuando entran varias imágenes, etiquételas por índice: la imagen 1 es el sujeto, la imagen 2 el entorno, la imagen 3 solo referencia de color. Nada más le dice al modelo qué adjunto pretendía ser una paleta.
Para ediciones de texto, pegue la cadena de reemplazo exacta entre comillas y diga qué pasa con la antigua. Parafrasear invita a la reinterpretación, y una reinterpretación en la etiqueta de un producto es una reimpresión. Dentro de un mask, deje unos píxeles de margen alrededor de todo lo que sea valioso: el borde es una guía, no un recorte.
Dos capas de watermark aterrizan en cada salida, en todos los niveles de calidad, y esta parte no la vamos a suavizar. Los metadatos de procedencia C2PA identifican el archivo como generado por ChatGPT Images: X, Meta, LinkedIn y TikTok los analizan y aplican el etiquetado «Made with AI» automáticamente. Debajo hay un watermark imperceptible a nivel de píxel en los datos de la imagen, que no desaparece cuando desaparecen los metadatos.
Ninguna de las dos capas tiene interruptor de apagado, ni para nosotros ni para ningún otro revendedor. No podemos prometer salida white-label en este modelo. ¿Edita assets de un cliente bajo un contrato que prohíbe material etiquetado como IA? Tenga esa conversación ahora.
Una nota de coste, ya que aquí el instinto se equivoca: las pasadas de borrador baratas no salen de quality. Veinte iteraciones en low facturan exactamente lo mismo que veinte en high. Para un bucle de revisión barato, haga borradores en 1K y deje 2K o 4K para la versión que se publica.
$0.0525 por imagen de salida con nuestros valores por defecto de quality=high y resolution=1K. 2K sale a $0.105 y 4K a $0.1575, ya que la resolución multiplica por dos y por tres. El nivel de calidad no cambia ninguno de esos números. Cifras de nuestra comprobación del 26 de agosto de 2026.
Hasta 16, según la superficie documentada por OpenAI, y un solo request puede devolver hasta 10 salidas. Más adjuntos significan más tokens de entrada, así que un composite de 16 referencias no es la misma carga de trabajo que el retoque de una sola imagen.
quality en low es más barata que una en high?No. Nuestro multiplicador es ×7 sea cual sea el valor que envíe, así que low, medium y high facturan todos $0.0525 en 1K. El campo es obligatorio aquí, y ningún ajuste suyo le baja el coste. Use resolution para controlar el gasto.
Porque se eliminó input_fidelity: cada imagen adjunta se procesa en alta fidelidad sin una opción más barata, así que una edición quema más tokens de entrada que un request solo con prompt. Se nota en todo el mercado: el endpoint de edición de fal.ai cuesta aproximadamente el doble que su tarifa de text-to-image en el nivel bajo.
Sí, y es la razón principal para elegir este modelo frente a una alternativa de Google. Cite la cadena de reemplazo exacta y diga qué debería pasar con la original. Los cambios multilingües también funcionan, incluido CJK, sin redibujar la maquetación a su alrededor.
Sí. Cada salida lleva metadatos C2PA que las plataformas leen para aplicar etiquetas «Made with AI», más un watermark de píxel imperceptible en los datos de la imagen. Ambos se aplican en todos los niveles de calidad y ningún proveedor puede desactivarlos.
Cuando la edición gira en torno a una persona: el realismo de retrato y la consistencia de personaje entre referencias son donde el nivel Pro de Google es más fuerte. Para trabajo rutinario de fondo y color, Nano Banana 2 a $0.04 es suficiente; ahí nuestra ventaja en texto no le aporta nada.