Cómo escribir prompts que los modelos Nano Banana sí sigan
Casi todas las guías de prompting son listas de adjetivos. Los adjetivos son la parte de un prompt que menos importa.
Operamos los cuatro modelos Nano Banana detrás de una sola API, y las formas en que falla un prompt son lo bastante consistentes como para escribirlas. Cuarenta palabras gastadas en adjetivos de calidad y dos en la luz. Un brief compositivo de longitud Pro disparado contra el nivel más barato. Una petición de edición que vuelve a describir la escena entera y regresa como otra imagen distinta. Nada de eso son problemas del modelo. Son problemas de escritura, y los problemas de escritura tienen arreglo.

Medio, sujeto, luz, encuadre — en ese orden
Un prompt se lee como un todo, pero las cláusulas iniciales trabajan más que las finales. Fijan el espacio en el que tiene que vivir el resto de la frase. Abra con «una mujer hermosa» y el modelo tiene que adivinar si está haciendo una fotografía, un óleo o un render 3D, y lo adivinará a partir de lo que impliquen estadísticamente sus otras palabras. Abra con «fotografía editorial de 35mm» y todas las decisiones siguientes ya están constreñidas a un solo medio.
Así que el orden:
- Medio. La bifurcación más grande del árbol. Fotografía, render isométrico, ilustración vectorial plana, pintura al gouache, macro de producto. Elija uno y nómbrelo en las primeras cuatro palabras.
- Sujeto. No la categoría, la cosa concreta. «Una mujer en la mesa de un café» es una foto de stock. «Una mujer de cincuenta y tantos, las dos manos alrededor de una taza blanca» es una imagen.
- Luz. Dirección, cualidad, color. Esta única frase mueve el resultado más que ninguna otra, y casi nadie la escribe.
- Encuadre. Altura de cámara, distancia, recorte, profundidad de campo, y dónde va el espacio vacío.
Aquí está la misma petición escrita mal y después escrita bien.
A beautiful woman in a coffee shop, highly detailed, 8k, masterpiece,
trending on artstation, ultra realistic, professional photography, award
winning, sharp focus, bokeh
35mm editorial photograph. A woman in her fifties sits alone at a marble
café table, both hands wrapped around a white cup, looking out of frame to
the left. Low winter sun through the window behind her, rimming her hair and
blowing the street outside to white. Shot from the next table at seated eye
level, waist up, shallow depth of field, background falling off to soft grey.
Qué cambió: el medio se fue al principio, el sujeto recibió un gesto concreto, la luz recibió una dirección y una temperatura, y la cámara recibió una posición. No se añadió nada sobre calidad. El segundo prompt no está más detallado en el sentido vago: está más decidido.
Y deje de escribir «highly detailed, 8k, masterpiece». En estos modelos no hace nada. Esos tokens son carga heredada de la cultura de prompts de Stable Diffusion de 2022, donde empujaban a un modelo mucho más pequeño hacia una porción concreta de sus datos de entrenamiento. Los modelos de generación Gemini no responden a ellos, y cada uno de ellos es presupuesto que podría haber gastado describiendo de dónde viene la luz.

El espacio vacío se rellena salvo que lo reclame
Estos modelos no dejan cosas fuera. Si describe una taza y no dice nada de lo que la rodea, la imagen va a contener un entorno igualmente, y será lo que suele contener una foto de taza: una mesa de madera, una servilleta de lino, una ramita de algo, una ventana desenfocada, y aproximadamente el cuarenta por ciento de las veces, una palabra impresa en la taza.
Esa es la queja más común que oímos, y no es un problema de calidad. Nadie dijo que no lo hiciera.
A ceramic mug on a table, product shot
Macro product photograph of a single unglazed stoneware mug, matte oatmeal
body, thumb-worn handle, standing dead centre on a seamless mid-grey sweep.
Large soft source from the upper left, one gentle shadow falling to the lower
right. No text on the mug, no logo, no other objects, no hands, no props, no
background detail.
La última frase de esa reescritura trabaja más que las tres primeras juntas. Escriba las exclusiones como una lista llana al final del prompt, en el mismo registro que el resto. «No text, no logos, no people, no clutter» es a menudo la línea de más valor del fichero, y en cualquier imagen sobre la que vaya a ir tipografía real después, no es opcional.
Esto importa más de lo normal para cualquier cosa que piense componer. Un fondo generado con una ramita de romero inventada dentro es un fondo que tiene que enmascarar.

Escriba para el nivel que está llamando de verdad
Los cuatro modelos admiten cantidades distintas de prompt, y quieren formas distintas de prompt. Los techos no están donde la gente espera:
| Modelo | Techo de prompt | Qué quiere |
|---|---|---|
| Nano Banana 2 Lite | 32.000 caracteres | Corto, un sujeto, estructura de cláusulas plana |
| Nano Banana 2 | 20.000 caracteres | Longitud media, sostiene dos o tres elementos relacionados |
| Nano Banana Pro | 50.000 caracteres | Briefs compositivos largos con relaciones espaciales |
| Nano Banana (legacy) | — | Se retira el 2 de octubre de 2026; migre en vez de afinar |
Nano Banana 2 tiene el techo más bajo de los tres niveles actuales pese a estar en medio en precio. Eso sorprende a todo el mundo la primera vez.
Los techos no son la restricción de verdad, en cualquier caso. Lite es un modelo lite, y los prompts largos le fallan de una forma concreta: se queda con la primera cláusula y con la última y deja caer el medio en silencio. Las condiciones anidadas («una habitación con una mesa sobre la que hay un cuenco que contiene tres peras, una de ellas magullada») vuelven sin las peras. Escriba frases planas para Lite. Un sujeto, un escenario, una fuente de luz, una lista de exclusiones.
An isometric 3D render of a modern open-plan office at golden hour with
fourteen distinct employees at standing desks, a glass-walled meeting room on
the left containing a whiteboard, potted fiddle-leaf figs in the corners, a
coffee bar along the back wall with a barista, exposed ductwork above,
polished concrete floors reflecting the windows, and a cat asleep on the
third desk from the front
Isometric 3D render of an open-plan office at golden hour. Rows of standing
desks, a glass-walled meeting room on the left, tall windows throwing long
warm light across a polished concrete floor. Muted palette, clean geometry.
No text, no signage, no people.
El primer prompt no está mal. Está mal para Lite. Mándelo a Pro y llegan los catorce empleados, los conductos y el gato. Mándelo a Lite y obtiene una oficina, una ventana y una factura de $0.0238.
Lo cual es la versión útil del consejo en la otra dirección: si su prompt tiene menos de sesenta palabras y un solo sujeto dentro, Pro no le compra nada salvo treinta segundos de espera y unas tres veces el coste. Casi todo lo que genera la gente es trabajo de Lite. Preferimos decírselo antes que venderle el nivel de arriba para un fondo de relleno. Para el desglose completo de qué nivel para qué trabajo, lo escribimos aparte en nuestra comparación a cuatro de Nano Banana.
El aspect ratio es una instrucción de composición, no un recorte
Decida la forma antes de escribir la frase, porque la forma cambia lo que la frase debería decir. Un banner 21:9 quiere un horizonte y un sujeto empujado fuera del centro. Una story 9:16 quiere una pila vertical y aire arriba. Si escribe un prompt para un cuadrado y lo renderiza ancho, obtiene una composición cuadrada con relleno a los lados, y va a parecer exactamente eso.
Diga la composición en voz alta dentro del prompt. «Horizonte en el tercio inferior, sujeto en el tercio derecho, cielo vacío por el cuadrante superior izquierdo para el texto» es una instrucción real y estos modelos la siguen bien.
Y después está la trampa que le cuesta a la gente un lote entero de activos. El aspect ratio por defecto no es el mismo en todos los niveles. En Nano Banana, Nano Banana 2 y Nano Banana Pro nuestro valor por defecto es 9:16. En Nano Banana 2 Lite es 1:1. Así que una configuración que nunca fija aspect_ratio produce imágenes verticales en tres modelos y cuadrados en el cuarto, y si cambia de nivel para ahorrar dinero la forma de su salida cambia en silencio por debajo.
Fíjelo. Siempre, en cada llamada, incluso cuando el valor por defecto resulte ser el que quiere:
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-2-lite/text-to-image",
"input": {
"prompt": "Wide landscape photograph of a granite ridge under flat overcast light, horizon in the lower third, the ridge line entering from the right, empty pale sky across the upper left. No text, no people, no structures.",
"aspect_ratio": "21:9"
}
}'
Una razón más para conocer su nivel: Lite lleva cuatro aspect ratios que no tiene nada más en nuestro catálogo — 1:4, 4:1, 1:8 y 8:1. Son genuinamente útiles y genuinamente poco usados. Un raíl de cabecera para todo el sitio o una unidad lateral alta renderizados a 8:1 le ganan a generar un 16:9 y recortar el 80%, tanto en composición como en lo que pagó por los píxeles que tiró.

Editar es otra habilidad: escriba el delta
Aquí es donde más retroceden los escritores de prompts con más experiencia, porque el instinto que viene de text-to-image es describir la imagen que quiere. En una llamada de edición usted ya tiene la imagen. Describirla otra vez compite con ella.
Un prompt de edición tiene dos trabajos: nombrar qué cambia y nombrar qué no puede cambiar. Ahí dentro no va nada más.
A woman in her fifties at a marble café table in low winter light, wearing a
red coat instead of a blue one, same face, same pose, editorial photograph,
35mm, shallow depth of field, warm tones
Change the coat from navy to deep brick red. Keep the fabric weight, collar
shape and drape identical. Everything else in the frame is unchanged: same
face, same expression, same hands, same cup, same window light, same crop.
La primera versión vuelve a especificar el medio, la lente y el tono, y cada una de esas reespecificaciones es una instrucción nueva sobre la que el modelo puede actuar. Así es como acaba con una cara sutilmente distinta. La segunda versión toca una sola cosa y congela el resto de forma explícita.
Dos hechos mecánicos que conviene saber antes de montar un pipeline de edición. El número de referencias difiere por nivel: el modelo legacy admite tres imágenes, el endpoint de edición de Nano Banana 2 admite catorce, y el de Nano Banana Pro también admite catorce pero las separa por rol: hasta cinco imágenes de personaje para la identidad, seis de objeto para la fidelidad del producto, tres referencias de estilo. Esa separación por roles es la razón de que Pro pueda montar un composite publicitario completo en un solo request, y es un tema entero por sí mismo; lo cubrimos en mantener un personaje consistente entre generaciones de Nano Banana.
Texto dentro de la imagen, y cuándo no molestarse
Las palabras legibles dentro de una imagen llegaron con la generación Gemini 3. El gemini-2.5-flash-image legacy no puede hacerlo: una palabra suelta a veces sobrevive, una frase nunca. Para cualquier cosa con tipografía real dentro quiere Nano Banana 2, y para cualquier cosa donde la tipografía sea el objetivo quiere Pro, que renderiza texto con estilo y multilingüe lo bastante bien como para que le pase una infografía en inglés y le devuelva la versión en español con el arte intacto.
Cuando sí pida texto, las reglas se aprietan:
- Ponga las palabras entre comillas, exactamente como deben aparecer.
- Diga cuántas palabras hay y dónde se sitúan en el encuadre.
- Describa las formas de letra como un estilo, no como un nombre de fuente. «Tall geometric Art Deco capitals, generous letter-spacing» funciona. Nombrar una tipografía concreta mayormente no.
- Cierre con «no other text anywhere», o el modelo añadirá un subtítulo plausible que usted no pidió.
A vintage travel poster for Lisbon with the word LISBOA in art deco letters
Vintage 1930s travel poster illustration, flat screen-print style with
visible registration offsets. A cream tram climbing a steep pastel street,
the Tagus estuary behind it in three flat blues. One line of text only: the
word "LISBOA" in tall geometric Art Deco capitals across the lower quarter,
deep ochre on cream, generous letter-spacing. No other text anywhere in the
image.
Ahora la parte impopular. Casi todo el texto dentro de la imagen no debería estar en la imagen. Si las palabras van a necesitar cambiarse alguna vez, traducirse, seleccionarse, leerse con un lector de pantalla o corregirse después de que legal las mire, genere el arte limpio y componga el texto en HTML, en Figma o en su motor de plantillas. Cocer un titular dentro de los píxeles porque un modelo puede hacerlo es una decisión que va a pagar en la primera revisión de textos. Pida texto renderizado cuando la tipografía sea genuinamente parte del arte —un póster, el rótulo pintado de una tienda, el lomo de un libro en un bodegón— y sáltelo el resto de las veces.
Esto tiene un filo más afilado para cualquier cosa con forma de dato. Un modelo que renderiza texto plausible renderiza también números plausibles y topónimos plausibles, lo cual está bien en un póster y es catastrófico en un gráfico o en un mapa. Entramos exactamente en por qué en por qué los generadores de imágenes de IA son tan malos con los mapas.
Plantillas que merece la pena guardar
Cuatro esqueletos que cubren casi todo lo que genera la gente en realidad. Rellene los corchetes, borre lo que no aplique, y conserve la línea de exclusiones.
Sujeto limpio sobre fondo liso, para componer:
[Medium: macro product photograph / studio still life] of a single [subject
with one specific material detail], centred on a seamless [colour] sweep.
[Light source and size] from the [direction], one shadow falling [direction].
No text, no logo, no props, no hands, no background detail.
Escena editorial con espacio para texto:
[Medium] of [subject doing one specific thing], [setting]. [Light: direction,
quality, colour temperature]. Shot from [camera height and distance],
[crop], [depth of field]. [Subject] at the [left/right] third, empty [surface
or sky] across the [region] for copy. No text, no logos.
Una edición que cambia una sola cosa:
Change [element] from [current state] to [target state]. Keep [the two or
three properties of that element that must survive] identical. Everything
else in the frame is unchanged: same [list the parts most at risk].
Ilustración con una sola línea de texto, nivel Pro:
[Illustration style and era], [technique detail]. [Scene described in two
sentences]. One line of text only: the word "[WORD]" in [letterform
description], [colour] on [colour], positioned [where]. No other text
anywhere in the image.
Cuando el problema no es el prompt
En algún momento el prompt está bien y el problema es el pipeline: reintentos, seeds, encolado, guardar la salida antes de que la URL caduque. Esa es otra disciplina y la escribimos en cómo autogenerar imágenes a volumen. Y si la distancia que intenta cerrar es específicamente la credibilidad fotográfica y no el seguimiento de instrucciones, la lista de comprobación para eso vive en nuestra guía del generador de imágenes de IA más realista.
Cada modelo publica su lista exacta de parámetros —el conjunto completo de aspect ratios, los valores por defecto, lo que rechaza— como una especificación legible por máquina, como el fichero de especificación de Nano Banana 2 Lite. Léalo antes de reescribir un prompt que empezó a portarse mal después de un cambio de modelo. Nueve de cada diez veces el prompt estaba bien y lo que se movió por debajo fue un valor por defecto. Hay un fichero de especificación detrás de cada modelo de la categoría text-to-image, y detrás de todo lo demás que operamos.
Preguntas frecuentes
¿Cómo debería estructurar un prompt para Nano Banana?
Primero el medio, después el sujeto, después la luz, después el encuadre, y después una lista de exclusiones. Nombrar el medio en las primeras palabras constriñe todas las decisiones que siguen, y describir la luz de forma explícita hace más por el resultado que cualquier cantidad de adjetivos de calidad. Termine con lo que no debe aparecer —«no text, no logos, no props»— porque estos modelos rellenan el espacio no especificado en lugar de dejarlo vacío.
¿Ayudan en Nano Banana palabras de calidad como «8k» y «masterpiece»?
No. Esos tokens vienen de modelos de difusión de pesos abiertos anteriores, donde dirigían la salida hacia un subconjunto concreto de los datos de entrenamiento. Los modelos de generación Gemini no responden a ellos, y consumen presupuesto de prompt que estaría mejor gastado en la dirección de la luz, la posición de cámara o las exclusiones.
¿Cómo de largo puede ser un prompt de Nano Banana?
Nano Banana 2 Lite acepta hasta 32.000 caracteres, Nano Banana 2 hasta 20.000, y Nano Banana Pro hasta 50.000. Esos son techos duros, no objetivos. Lite en particular rinde peor con prompts largos bastante antes de llegar a su límite, porque tiende a quedarse con las cláusulas de apertura y cierre y a soltar el medio.
¿Por qué mis imágenes salen con la forma equivocada al cambiar de modelo?
Porque el aspect ratio por defecto difiere según el nivel. Nano Banana, Nano Banana 2 y Nano Banana Pro tienen por defecto 9:16 en nuestra API, mientras que Nano Banana 2 Lite tiene 1:1. Un request que nunca fija aspect_ratio cambiará por tanto de forma al moverse entre esos modelos. Fíjelo explícitamente en cada llamada.
¿Cómo escribo un prompt de edición para Nano Banana?
Escriba el delta, no la escena. Nombre la única cosa que cambia, nombre las propiedades de esa cosa que tienen que sobrevivir, y después declare que todo lo demás queda sin cambios y enumere los elementos más en riesgo: cara, pose, iluminación, recorte. Volver a describir el medio, la lente o la atmósfera en un prompt de edición es lo que provoca cambios no deseados en otras partes de la imagen.
¿Qué modelo Nano Banana puede renderizar texto legible en una imagen?
Nano Banana 2 y Nano Banana Pro pueden, porque el texto legible dentro de la imagen es una capability de la generación Gemini 3. Nano Banana Pro es la elección fiable cuando la tipografía es el objetivo, ya que además maneja texto con estilo y multilingüe. El gemini-2.5-flash-image legacy no puede renderizar texto legible en absoluto.
¿Necesito Nano Banana Pro para que siga mejor el prompt?
Normalmente no. La ventaja de Pro es sostener un brief compositivo largo con varias relaciones espaciales, más las imágenes de referencia separadas por rol y el texto fiable dentro de la imagen. Si su prompt es un solo sujeto en menos de sesenta palabras, Nano Banana 2 Lite a $0.0238 lo seguirá con la misma fidelidad y lo devolverá más rápido.