Generación de imágenes consistente con la API de Nano Banana
Generar una buena imagen está casi resuelto. Generar la vigésima que siga perteneciendo al grupo de las diecinueve anteriores es donde mueren los proyectos.
La distancia no es habilidad con los prompts. Es que «consistencia» son tres problemas de ingeniería distintos vestidos con una sola palabra, y la técnica que arregla uno no hace nada por los otros dos. Operamos los modelos Nano Banana en nuestra API, y esta es la petición que más gente hace mal, no porque los modelos no puedan, sino porque las referencias entran sin etiquetar y el modelo se queda adivinando para qué servía cada una.

Tres problemas, no uno
Sepárelos antes de escribir un prompt. Fallan de forma distinta y cuestan distinto.
Consistencia de personaje. La misma persona a lo largo de muchos fotogramas: la misma cara, la misma complexión y el mismo pelo, reconocible como un individuo tanto sentada en el fotograma cuatro como caminando en el diecinueve. Es un problema de identidad: el modelo tiene que llevarse una cara a composiciones que nunca ha visto.
Fidelidad de producto. No una botella parecida. Esa botella. La proporción exacta del tapón, la colocación de la etiqueta, el tono de verde. La fidelidad es más estricta que la identidad: una cara tiene tolerancia, el packaging de un cliente no.
Consistencia de estilo. El conjunto se lee como un conjunto: mismo etalonaje, mismo carácter de lente, misma cualidad de luz, mismo grano. No hace falta que se repita ningún objeto; lo que se repite es el tratamiento.
Casi todos los briefs necesitan dos de estos a la vez y los piden como una sola instrucción. «Hazlo consistente» no es una petición sobre la que pueda actuar una API. «La imagen 1 es la persona, la 2 es la botella, la 3 es solo etalonaje» sí.
La separación por roles es la función de verdad
Nano Banana Pro acepta hasta 14 imágenes de referencia. Nano Banana 2 también, a casi la mitad de precio. La diferencia no es el número. Pro reparte ese presupuesto por rol:
| Rol | Presupuesto | Qué sostiene |
|---|---|---|
| Personaje | hasta 5 | Referencias de identidad de una persona o figura |
| Objeto | hasta 6 | Productos, atrezo y packaging de alta fidelidad |
| Estilo | hasta 3 | Solo etalonaje, atmósfera de luz, tratamiento |
Catorce en total, pero asignadas. La asignación es lo que convierte una imagen de referencia de sugerencia en instrucción.
Piense en qué pasa sin ella. Le entrega a un modelo catorce imágenes y una frase, y él infiere de la prosa cuál es una cara que preservar, cuál es un producto que reproducir exactamente y cuál está ahí solo por la atmósfera. A menudo lo infiere mal. El indicio es un producto que salió «al estilo de» su packaging en lugar de como su packaging, o una cara que lleva puesto el etalonaje del moodboard.
Con la separación no está pidiendo, está declarando. Cinco huecos para quién, seis para qué, tres para qué aspecto tiene. Un composite publicitario en un solo request en lugar de tres rondas de composición.
Pro está a $0.075 por request a nuestro precio del 26 de agosto de 2026, contra un precio de lista de $0.15. Una cosa más que conviene saber: 1K y 2K cuestan lo mismo en Pro. Para activos protagonistas, llévese el 2K. Es gratis.

Etiquetar las referencias en el prompt
La separación por roles hace el trabajo estructural. El prompt hace el trabajo semántico, y tiene que ser explícito de una forma que resulta casi grosera. Las referencias llegan en orden, así que nómbrelas por posición y diga para qué es cada una, incluido para qué no es. Esa última parte es donde se escapan casi todos los prompts.
Image 1 and image 2 are the same woman — preserve her face, hair length and
build exactly. Image 3 is the product: reproduce the bottle shape, cap
proportion and label artwork precisely, do not restyle it. Image 4 is colour
grading and lighting mood only — do not copy any object, pose or composition
from it.
Place the woman from images 1-2 holding the bottle from image 3, seated at a
café table by a window, three-quarter view, warm afternoon light matching the
grade in image 4.
Cuatro cosas hacen que ese prompt funcione, y ninguna es un quinto adjetivo:
- Todas las referencias están justificadas. Ninguna imagen entra sin un trabajo declarado.
- La referencia de estilo lleva una exclusión explícita. Sin ella, un moodboard le cuela sus muebles en la escena.
- Las palabras de identidad son concretas —cara, largo del pelo, complexión—, no «se parece a ella».
- La instrucción de producto dice «no lo reestilices», que es la frase que separa la fidelidad de la inspiración.
No vamos a cubrir aquí la construcción general de prompts; eso es la guía de prompting. Esto va específicamente de decirle al modelo para qué son sus referencias.
El request
El trabajo de consistencia es edición, no generación, así que va al slug edit-image con image_urls.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-pro/edit-image",
"input": {
"prompt": "Image 1 and image 2 are the same woman - preserve her face, hair length and build exactly. Image 3 is the product: reproduce the bottle shape, cap proportion and label artwork precisely, do not restyle it. Image 4 is colour grading and lighting mood only, do not copy any object or composition from it. Place the woman holding the bottle, seated at a cafe table by a window, three-quarter view, warm afternoon light.",
"image_urls": [
"https://cdn.example.com/refs/model-face-front.jpg",
"https://cdn.example.com/refs/model-face-three-quarter.jpg",
"https://cdn.example.com/refs/bottle-front.jpg",
"https://cdn.example.com/refs/grade-warm-afternoon.jpg"
],
"aspect_ratio": "4:5",
"resolution": "2K"
}
}'
Submit devuelve un job ID; hágale polling o pase webhookUrl. Pro tarda unos 30 segundos porque genera «imágenes de pensamiento» intermedias mientras compone: Google no las devuelve y nosotros no las facturamos. Fije aspect_ratio explícitamente, ya que Pro tiene por defecto 9:16. El recorrido completo de parámetros está en el tutorial de la API de Nano Banana Pro.
Dónde caen los niveles más baratos
Preferimos bajarle un nivel a venderle Pro para un trabajo que no lo necesita.
Nano Banana 2 admite las mismas 14 referencias a $0.04, sin la separación por roles. Eso está genuinamente bien para la consistencia de estilo, donde todas las referencias hacen el mismo trabajo y no hay nada que desambiguar. Seis cabeceras de blog que comparten paleta y atmósfera de luz no necesitan Pro. Necesitan una buena referencia de estilo y una plantilla de prompt congelada. Nano Banana 2 llega además a 4K, algo que Lite no toca en absoluto.
Nano Banana 2 Lite está a $0.0238 y está construido para volumen, no para fidelidad. Recurra a él cuando necesite cuatrocientas imágenes que compartan un aspecto y ninguna lleve la cara ni el packaging de un cliente. Es solo 1K, sin parámetro resolution: enviarlo es un error, no un no-op.
El Nano Banana legacy se corta en 3 imágenes de referencia, que no bastan para hacer personaje y producto en el mismo encuadre, y Google lo retira el 2 de octubre de 2026: la historia completa de ese modelo es otra página. No arranque un proyecto de consistencia ahí.
Regla aproximada: el trabajo solo de estilo va a Nano Banana 2 o a Lite. Cualquier cosa donde una cara humana concreta o un producto físico concreto tenga que sobrevivir intacto va a Pro. La diferencia de precio entre $0.04 y $0.075 deja de importar en el momento en que un cliente rechaza un lote porque la etiqueta estaba mal.
Los precios y las condiciones de los productos pueden cambiar con el tiempo; consulte los precios vigentes de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a un request estándar de API bajo demanda, porque la programación, la disponibilidad y las condiciones de procesamiento son distintas; por eso quedan excluidos de esta comparación. Se trata de una comparación acotada, no de una afirmación de que E2X sea la opción más barata del mundo en cualquier configuración.
Siembre un conjunto canónico de referencias una sola vez
El hábito que más rápido se paga a sí mismo aquí no tiene nada que ver con la API.
Construya el conjunto de referencias una vez, deliberadamente, y reutilícelo para siempre. No «las fotos que teníamos por ahí», sino un conjunto fijo, versionado y guardado del que beba cada request. Para un personaje: varios ángulos de la misma cara con luz neutra, frontal, tres cuartos, perfil, más un cuerpo entero para la complexión. Para un producto: frontal, trasera y un recorte de detalle de la etiqueta. Para el estilo: una o dos imágenes que lleven el etalonaje y nada que distraiga.
Después congélelo. Guarde las URLs en algún sitio permanente —su propio bucket, no un enlace temporal— y pase el mismo array en todos los requests durante la vida del proyecto.
Esto importa más que afinar prompts porque la deriva es acumulativa. Genere el fotograma 5 a partir del 4 y el 6 a partir del 5, y los errores pequeños se componen hasta que el fotograma 20 es otra persona. Anclar cada fotograma al mismo conjunto canónico significa que cada generación se aleja del original un paso, nunca veinte. Un abanico, no una cadena.
Un hábito relacionado: si el conjunto incluye imágenes que generó usted, conserve los ficheros originales. Las URLs de entrega de cualquier API de imagen caducan, así que descargue y guarde sus propios activos: cómo correr la generación automáticamente tiene el bucle completo.
Genere un hero y después derive las variantes
El flujo de trabajo que produce más salida utilizable por dólar no es «generar veinte imágenes». Es «generar una imagen veinte veces».
Haga una toma protagonista en Pro y déjela bien: composición, iluminación, cara, producto. Queme unos cuantos intentos; a $0.075 la exploración es barata.
Después deje de generar y empiece a editar. Vuelva a meter el hero aprobado como referencia junto a su conjunto canónico y pida el cambio que quiera: otro ángulo, otro fondo, otro recorte, la modelo mirando fuera de cámara en lugar de a cámara. Cada variante queda anclada a algo que ya pasó revisión y no a una tirada nueva de dados.
Editar le gana a regenerar por una razón fácil de pasar por alto. Una regeneración vuelve a decidirlo todo; todos los parámetros con los que estaba contento vuelven a estar en juego. Una edición conserva lo que no mencionó. Después de pasarse una tarde dejando bien una cara, volver a decidirla veinte veces es lo último que quiere.
Dos notas prácticas. Vigile el recuento de referencias al volver a meter el hero: hero más un conjunto de personaje de cinco imágenes más un producto ya son siete de catorce. Y guarde el prompt del hero aprobado junto a la imagen; una variante suele ser ese prompt con dos cláusulas cambiadas, y reescribirlo de memoria reintroduce la deriva que acaba de pagar por quitar.

La parte que no arregla ningún conjunto de referencias
Google estampa SynthID en cada imagen que producen sus modelos. Es invisible, viaja dentro del fichero, y no es un ajuste que exponga nadie porque no es un ajuste en absoluto. Eso importa aquí más que en casi cualquier otra página: los proyectos de consistencia son proyectos de cliente, y el contrato de un cliente puede llevar una cláusula sobre activos generados con IA. Resuelva esa cláusula antes de fotografiar el conjunto de referencias, no cuando ya haya veinte fotogramas aprobados en una presentación.
El trabajo de consistencia es casi siempre edición, así que los modelos image-to-image son el estante que hay que mirar primero, y el catálogo tiene el lado de vídeo por si el brief se mueve.
Preguntas frecuentes
¿Cómo mantengo el mismo personaje en varias imágenes generadas con IA?
Construya un conjunto canónico de referencias —varios ángulos de la misma cara con luz neutra, más una toma de cuerpo entero para la complexión—, guárdelo de forma permanente y pase las mismas imágenes en todos los requests. Use los huecos de personaje de Nano Banana Pro, que sostienen hasta 5 imágenes de identidad, y declare en el prompt qué imágenes son la persona. Ancle cada fotograma al conjunto original y no al fotograma anterior, o los errores se componen hasta ser otra cara para el fotograma veinte.
¿Cuántas imágenes de referencia acepta la API de Nano Banana?
Nano Banana Pro acepta 14, separadas por rol: hasta 5 imágenes de personaje, hasta 6 de objeto y hasta 3 referencias de estilo. Nano Banana 2 también acepta 14 pero sin la separación por roles. Nano Banana 2 Lite está construido para volumen y no para trabajo cargado de referencias, y el Nano Banana legacy se corta en 3.
¿Cuál es la diferencia entre consistencia de personaje y fidelidad de producto?
La consistencia de personaje significa que una persona se mantiene reconocible a lo largo de muchas imágenes —la misma cara, el mismo pelo, la misma complexión—, con tolerancia a pequeñas variaciones. La fidelidad de producto significa que el objeto se reproduce exactamente: el arte preciso de la etiqueta, la proporción del tapón y el color, sin reestilizar. Pro los maneja en huecos de referencia distintos porque necesitan distinta severidad, y el prompt debería decir qué imágenes son cuáles.
¿Debería usar Nano Banana Pro o Nano Banana 2 para imágenes consistentes?
Use Nano Banana 2 a $0.04 cuando la necesidad sea estilística: imágenes que comparten paleta, iluminación y tratamiento, sin ninguna cara ni producto concretos que preservar. Use Nano Banana Pro a $0.075 cuando una cara concreta o un producto físico concreto tengan que sobrevivir intactos, porque el presupuesto de referencias con roles separados es lo que le dice al modelo cuál es cuál. La diferencia de precio es pequeña al lado de un lote rechazado.
¿Cómo etiqueto las imágenes de referencia en un prompt de Nano Banana?
Refiérase a ellas por la posición en el orden en que las pasa en image_urls, y declare para qué es cada una. «Las imágenes 1 y 2 son la misma mujer, preserva su cara y su complexión; la imagen 3 es el producto, reprodúcelo exactamente; la imagen 4 es solo etalonaje, no copies ningún objeto ni composición de ella.» Las exclusiones importan tanto como las instrucciones, porque una referencia de estilo sin matizar le colará sus objetos y su composición en la escena.
¿Es mejor editar una imagen existente o generar una nueva?
Editar, una vez que tiene una imagen que aprueba. Una regeneración vuelve a decidir cada elemento, incluidos aquellos con los que estaba contento; una edición conserva todo lo que no mencionó. El flujo eficiente es un hero hecho con cuidado y después variantes derivadas de él a través del endpoint edit-image con sus referencias canónicas adjuntas.
¿Por qué mis imágenes generadas se alejan del personaje original?
Casi siempre porque cada imagen nueva se generó a partir de la anterior en lugar de a partir de un conjunto fijo de referencias. Eso hace los errores acumulativos: una mandíbula un poco más redonda en el fotograma 3 se convierte en la línea base del 4, y para el 20 es otra persona. Ancle cada request a las mismas imágenes canónicas guardadas para que cada salida esté a un paso del original y no a veinte.