Loading...
Loading...
Nivel premium de Nano Banana basado en gemini-3-pro-image: texto a imagen y edición con texto legible dentro de la imagen y salida de hasta 4K.
Inicia sesión para ejecutar modelos
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/nano-banana-pro/text-to-image',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Nano Banana Pro es el nombre comercial que Google da a gemini-3-pro-image, el escalón más alto de su familia de imagen. Operamos su endpoint de generación como google/nano-banana-pro/text-to-image —no entra nada más que un prompt— y cobramos $0.075 por imagen en 1K y 2K, con 4K facturado a $0.15. fal.ai pide el doble por el request idéntico.
¿Ya tiene una imagen que prefiere alterar antes que reemplazar? Nano Banana Pro edit-image es el mismo modelo al mismo precio, con un campo image_urls para sus referencias.
Así estaba nuestra cifra en la comprobación del 26 de agosto de 2026:
| Proveedor de API | Precio (1K/2K) | Precio (4K) | vs. E2X |
|---|---|---|---|
| E2X | $0.075 | $0.15 | — |
| fal.ai | $0.15 | $0.30 | somos un 50% más baratos |
| Google Gemini API | $0.134 | $0.24 | somos un 44% más baratos |
Los precios y las condiciones de los productos pueden cambiar con el tiempo; consulte los precios vigentes de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a un request estándar de API bajo demanda, porque la programación, la disponibilidad y las condiciones de procesamiento son distintas; por eso quedan excluidos de esta comparación. Se trata de una comparación acotada, no de una afirmación de que E2X sea la opción más barata del mundo en cualquier configuración.
resolution es aquí nuestro único factor de facturación. 1K y 2K cuestan los mismos $0.075 —no hay motivo para renderizar en 1K salvo que el ancho de banda le importe— y 4K lo duplica.
Generar desde la nada es un problema más difícil que editar. No hay referencia que ancle la composición, así que todo lo que el modelo acierta tiene que salir de su propio razonamiento sobre su frase. Tres capacidades cargan con casi todo el peso.
Tipografía que sobrevive. Esta es la razón para pagar precios de Pro. El modelo renderiza palabras legibles y con estilo dentro del encuadre —titulares, listas de precios, pizarras de menú, etiquetas de gráficos, copy de packaging— en varios idiomas y a tamaños donde los modelos más baratos producen garabatos decorativos. Un póster con un eslogan de verdad es un solo request, no un request más una hora en una herramienta de diseño.
Grounding con Google Search. El modelo puede consultar búsqueda en vivo mientras compone. Pídale un edificio concreto, un uniforme concreto, un plato emplatado como lo emplata una cocina concreta, y tendrá dónde mirar además de sus propios priors. Eso importa mucho más en text-to-image que en edición, donde la fotografía de origen ya zanja la cuestión de qué aspecto tiene una cosa.
4K de verdad, hasta 4096×4096. No un upscale añadido después. Nuestro enum de resolution va en minúsculas —1k, 2k, 4k— y solo 4k cambia el precio.
Hay una cuarta cosa que conviene saber porque aparece en sus gráficas de latencia y no en sus facturas. El modelo razona visualmente antes de comprometerse, y produce "thought images" intermedias por el camino. Google no las devuelve, y nosotros no las facturamos. Presupueste unos 30 segundos por request y la cifra deja de sorprender.
prompt es el único campo obligatorio. Cree una key en el dashboard, manténgala detrás de su propio backend y haga POST contra nuestro endpoint de submit.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-pro/text-to-image",
"input": {
"prompt": "Un póster de viaje vintage de las Islas Feroe. Aspecto de serigrafía, cuatro colores planos, niebla espesa sobre acantilados de basalto. Las palabras VISIT FAROE compuestas en una sans serif condensada a lo largo del tercio inferior.",
"aspect_ratio": "2:3",
"resolution": "2k"
}
}'
Recibirá un job ID de vuelta. Haga polling, o pásenos un webhookUrl en el body del submit y le avisaremos nosotros:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submit = (input) =>
fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({ model: "google/nano-banana-pro/text-to-image", input }),
}).then((r) => r.json());
const { data } = await submit({
prompt:
"Infografía isométrica de una cadena de suministro de café, seis etapas etiquetadas, paleta terrosa apagada, todas las etiquetas en portugués y legibles a tamaño pequeño.",
aspect_ratio: "16:9",
resolution: "4k",
});
let job;
do {
await new Promise((r) => setTimeout(r, 2500));
job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
} while (job.data.status === "pending" || job.data.status === "processing");
if (job.data.status !== "completed") throw new Error(job.data.error?.message);
console.log(job.data.outputs[0].url);
Dos detalles del schema que pillan a mucha gente. Nuestro valor por defecto de aspect_ratio es 9:16, así que un request que omita el campo vuelve en vertical: indíquelo siempre. Y el enum es amplio: diez ratios, desde 1:1 y 4:5 hasta 21:9, lo que cubre la mayoría de formatos publicitarios y sociales sin recortar después. La especificación legible por máquina lleva la lista actual y el precio actual.
Pro es el generador más caro de esta familia, y hay mucho trabajo que no lo necesita:
| Modelo | Precio / imagen | Elíjalo cuando |
|---|---|---|
| Nano Banana Pro | $0.075 | Texto legible dentro de la imagen, grounding de búsqueda o 4K |
| Nano Banana 2 | $0.04 | Calidad de generación actual a mitad de precio |
| Nano Banana 2 Lite | $0.0238 | Trabajo en volumen a 1K, y la velocidad es lo que más importa |
| Nano Banana (legacy) | $0.0312 | Una integración antigua que todavía no ha movido |
| GPT Image 2 | $0.0525 en high / 1K | Quiere el renderizado de OpenAI, o fondos transparentes |
Empiece por Nano Banana 2. Cuesta algo más de la mitad que Pro, renderiza bien el texto y, en fotos de producto, miniaturas e imagen editorial, rara vez podrá distinguir qué nivel produjo el archivo. Suba a Pro cuando las palabras dentro de la imagen sean el entregable —un menú, una infografía, una pieza de campaña bilingüe— o cuando un cliente necesite 4096 píxeles en el lado largo.
Hay una fila que merece un segundo vistazo: Nano Banana 2 Lite es más barato que el Nano Banana legacy y además es más nuevo. El propio Google llama al original su modelo legacy y recomienda Lite como reemplazo. Si sigue llamando al slug antiguo, eso es dinero gratis encima de la mesa.
GPT Image 2 es el único rival genuino en tipografía, y llega con un look distinto: más frío, más literal y capaz de devolver un fondo transparente, algo que ningún modelo de imagen Gemini hace. El resto de opciones vive en la categoría text-to-image, y todo lo que operamos está en la página del catálogo de modelos.
Cite la cadena que quiere. Póngala entre comillas, escríbala exactamente y diga dónde va: "las palabras 'HALF PRICE TUESDAY' en la parte superior, sans condensada, blanco sobre rojo". Describa el texto y el modelo interpreta; cítelo y el modelo transcribe.
Fije la tipografía antes que la escena. Los prompts que abren con la maquetación y la tipografía, y después describen la imagen alrededor, retienen mejor su copy que los que entierran el texto en la última frase.
Y luego déjelo trabajar. Como este modelo razona antes de pintar, un prompt con restricciones estructurales reales —cuente los elementos, nombre la paleta, fije el orden de lectura— sí se aprovecha. Los adjetivos vagos se promedian.
Cada imagen lleva un watermark SynthID, la señal de procedencia imperceptible de Google. No hay ningún parámetro para desactivarlo en ninguna parte, tampoco aquí. Las herramientas de detección aguas abajo lo verán, así que si un contrato prohíbe entregables con watermark, resuélvalo primero.
Revise sus supuestos sobre el aspect ratio si está migrando una configuración de otro proveedor. El vertical es nuestro valor por defecto, no el cuadrado, y un pipeline que daba por hecho 1:1 producirá archivos 9:16 en silencio hasta que alguien se dé cuenta.
Es gemini-3-pro-image, el nivel premium de la familia Nano Banana de Google. Ese nivel está construido para trabajo visual exigente —tipografía legible dentro de la imagen, detalle apoyado en búsqueda, salida de hasta 4096×4096— y no para el tiempo de respuesta más corto posible.
$0.075 por imagen en 1K y 2K, y $0.15 en 4K. Eso es la mitad de la tarifa de fal.ai y un 44% por debajo de la propia API de Google, según nuestra comprobación del 26 de agosto de 2026. Los precios se mueven, así que confírmelo en la página del modelo en vivo antes de montar un presupuesto sobre ello.
Sí, y es la razón principal para elegir este nivel. Renderiza titulares, etiquetas y texto de cuerpo con estilo dentro de la imagen, en varios idiomas y a tamaños donde la mayoría de modelos de imagen fallan. Ponga el texto entre comillas en su prompt en lugar de parafrasearlo.
Mismo modelo, los mismos $0.075, entrada distinta. Text-to-image toma solo un prompt. Edit-image toma además un array image_urls de referencias, que es lo que quiere cuando una imagen existente tiene que modificarse en lugar de recrearse.
Unos 30 segundos. El modelo produce "thought images" intermedias mientras razona sobre la composición: Google no las devuelve y nosotros no las facturamos, pero ahí es donde se va el tiempo. Los modelos de nivel Flash son varias veces más rápidos si para usted la latencia pesa más que la calidad.
Sí. Cada salida incluye un watermark SynthID, el marcador invisible de Google para contenido generado por IA. Ningún proveedor expone forma de desactivarlo, nosotros incluidos.
Solo a veces. Nano Banana 2 cuesta $0.04 frente a $0.075 y aguanta bien en la mayor parte del trabajo fotográfico e ilustrativo. Pague por Pro cuando la imagen contenga texto que alguien vaya a leer de verdad, cuando necesite precisión apoyada en búsqueda o cuando la salida tenga que ser 4K.
Diez: 1:1, 2:3, 3:2, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9 y 21:9. Nuestro valor por defecto es 9:16, así que indique el campo explícitamente salvo que quiera salida vertical.