Imágenes de IA como referencia: dónde ayudan y dónde mienten
Esta pregunta suele hacerse de mala fe desde un bando o desde el otro, y ninguna de las dos versiones nos interesa. Operamos los modelos de imagen y vendemos acceso a ellos, y aun así creemos que un artista en activo debería negarse a usarlos para más o menos la mitad de los trabajos para los que hoy se usan.
La división no es cuestión de gusto. Se reduce a una distinción: una imagen generada es muy buena siendo evocadora y poco fiable siendo correcta. Donde su referencia solo tiene que sugerir algo —una atmósfera, una relación de color, la forma en que la luz cae por una habitación a las cuatro de la tarde—, funciona, y sale barata. Donde tiene que estar bien, donde va a copiar estructura de ella, obtiene una mentira segura de sí misma y hermosa, y aprende la mentira.
Aquí está donde creemos que cae la línea, y cómo sacarle de verdad una referencia útil a la cosa.

Para qué sirven genuinamente las referencias generadas
Todas comparten una propiedad: usted toma una impresión de la imagen, no una medida.
- Estudios de iluminación. Cómo se lee una luz principal cálida desde una ventana baja contra un rebote frío en una pared blanca. El modelo ha absorbido una cantidad enorme de fotografías de exactamente esto, y conseguir doce variaciones de un mismo esquema de luz es trivial.
- Paletas de color. Saque la paleta y tire la imagen. Las imágenes generadas son inusualmente buenas en relaciones de color coherentes, porque eso es lo que premian los datos de entrenamiento.
- Miniaturas de composición. Distribución, masa, por dónde entra y sale el ojo. Un encuadre generado en bruto se juzga más rápido que un boceto en bruto.
- Moodboards. El uso más defendible de todos. Nadie está copiando nada; está fijando una sensación antes de comprometerse con una dirección.
- Atmósfera de entorno. Densidad de niebla, polvo en el aire, asfalto mojado de noche, el verde de una habitación iluminada a través de hojas. Todo impresión, nada de estructura.
- «Qué aspecto tiene esto más o menos a tres cuartos.» Útil como empujón cuando está atascado, peligroso en el momento en que empieza a calcarlo. Más sobre esto abajo.

Qué le van a enseñar mal en silencio
El modelo no sabe cómo funciona un hombro. Sabe qué aspecto tienen los hombros en las fotografías, que es un tipo de conocimiento más superficial. La mayor parte del tiempo la diferencia no se nota. Cuando se nota, se nota como una articulación doblándose en una dirección plausible en la que en realidad no puede doblarse, y si copia eso en un dibujo no ha cometido un error una vez: lo ha practicado.
Ese es el coste de verdad, y por eso somos francos con esta lista:
- Anatomía y mecánica articular. Sobre todo cualquier cosa escorzada, cualquier cosa en compresión, cualquier cosa donde un músculo esté trabajando. Es justo donde una referencia tiene que ser correcta.
- Manos y pies. Los modelos actuales fallan con ellos mucho menos que la generación de 2024, pero «mucho menos» no es «de forma fiable», y las manos son lo más escrutado del dibujo de figura.
- Perspectiva y arquitectura. Los puntos de fuga derivan, los parteluces de las ventanas dejan de alinearse a lo largo de una fachada, las contrahuellas de una escalera cambian de altura. Parece bien y no sobrevive a que se construya encima.
- Maquinaria y cómo se unen las piezas. Un motor generado, la transmisión de una bicicleta, una armadura: el modelo renderiza la apariencia del ensamblaje sin el ensamblaje.
- Anatomía animal. Los caballos en particular: articulaciones de las patas, fase del paso, transferencia de peso. Los fotógrafos se pasaron un siglo zanjando esto; no lo reaprenda de un modelo de difusión.
- Vestuario, armadura y guarnicionería de época. El modelo promedia a través de los siglos. Un espectador entendido lo detecta al instante, y a partir de ahí es lo único que recuerda.
El patrón: si hubiera ido a buscar una fotografía de una cosa real para comprobar algo, haga eso en su lugar. La imagen generada es un sustituto de una referencia que iba a resolver a tientas, no de una referencia que iba a medir.
El lado de la práctica profesional
Esto importa más de lo que la gente espera, y no es principalmente una cuestión legal.
Procedencia. Cada imagen que sale de un modelo de Google, incluidos los cuatro niveles de Nano Banana, lleva un watermark SynthID. Es invisible, lo incrusta Google aguas arriba, y ningún proveedor puede desactivarlo. Ni nosotros, ni fal.ai, ni la propia API de Google. Útil si quiere procedencia, un problema operativo si un contrato prohíbe activos con watermark. Sepa que está ahí antes de construir a su alrededor.
Qué le enseña a un cliente. Una referencia generada pertenece a su proceso, no a su entregable. Enseñar una en la fase de concepto fija la expectativa de una imagen que usted no hizo y no puede reproducir a demanda, y es una vía rápida a que le pidan «pues usa esa». Si está en un moodboard, diga qué es.
Por qué no se calca. Más allá del problema anatómico, calcar es donde la procedencia se afila. Una composición a la que llegó mirando un fotograma generado es suya. Una forma levantada línea por línea de uno tiene una ascendencia que no puede documentar. Úselo como usaría una fotografía que encontró y no puede licenciar: mire, entienda, cierre la pestaña, dibuje.
Nada de lo cual hace más pura a una foto de stock. Un atardecer de stock son también las decisiones de otra persona sobre la luz. La distinción aquí es la corrección, no la virtud.

Sacar de verdad una referencia útil
Una referencia no tiene que ser hermosa. Tiene que ser legible. Eso cambia qué modelo debería usar, y la respuesta es el barato.
Nano Banana 2 Lite cuesta $0.0238 por imagen en nuestra API según nuestra comprobación de precios del 26 de agosto de 2026. Veinte variaciones son $0.476, y nada más en nuestro desglose de precios de catálogo baja de ahí. Esa es la economía correcta para trabajo de referencia: cantidad y dispersión, no un fotograma perfecto. Pagar $0.075 por un render de Nano Banana Pro que va a mirar de reojo diez segundos y descartar es dinero prendido fuego. Guarde Pro para la salida, no para la entrada.
Los precios y las condiciones de los productos pueden cambiar con el tiempo; consulte los precios vigentes de cada proveedor antes de tomar una decisión de compra. Los precios de Google Batch o Flex no son directamente equivalentes a un request estándar de API bajo demanda, porque la programación, la disponibilidad y las condiciones de procesamiento son distintas; por eso quedan excluidos de esta comparación. Se trata de una comparación acotada, no de una afirmación de que E2X sea la opción más barata del mundo en cualquier configuración.
Cuatro hábitos le sacan más que prompts mejores.
Genere la misma escena en varios aspect ratios. El encuadre cambia lo que el modelo mete en la imagen, no solo cómo la recorta. Lite lleva catorce ratios fijos más auto, incluidos 1:4, 4:1, 1:8 y 8:1: esos extremos no existen en los otros niveles y son inesperadamente buenos para resolver una composición alta o un panel largo. Un prompt, seis ratios, seis pensamientos genuinamente distintos sobre la misma escena.
Itere la iluminación sobre un sujeto fijo con el endpoint de edición. Este es el grande. Genere un sujeto que le guste y después páselo repetidamente por el endpoint de edición de Lite cambiando solo la iluminación: sol duro desde la izquierda de cámara, cielo cubierto, una lámpara práctica cálida colocada baja, contraluz al anochecer. Eso es un sujeto bajo seis condiciones, que es lo que en realidad es un estudio de iluminación. Para una identidad que tenga que aguantar a lo largo de una serie más larga, Nano Banana 2 admite hasta 14 imágenes de referencia, cubierto en mantener personajes consistentes entre generaciones.
Escriba el prompt para la luz, no para el sujeto. «Fuente única y dura desde arriba a la izquierda de cámara, sombras profundas sin relleno, luz principal cálida contra ambiente frío» es la mitad útil del prompt. Lo que esté de pie dentro de la luz importa menos de lo que cree.
Guarde los fallos. Un fotograma con una mano mal sigue siendo una referencia de iluminación aprovechable. Tirar todo lo que tenga un error dentro es tirar casi todo lo que pagó.
Un aviso que ahorra una tarde: la URL de salida que devuelve nuestra API es temporal. Construya una biblioteca de referencias descargando los bytes, no guardando enlaces. Una carpeta de enlaces caducados no es una biblioteca.
Publicar una imagen generada en lugar de dibujar a partir de una es un trabajo más estricto, y escribimos los hábitos de inspección para eso aparte: cómo distinguir una fotografía generada de una real. El trabajo de referencia en realidad solo necesita dos endpoints, text-to-image para hacer el sujeto e image-to-image para seguir moviéndolo, los dos listados con sus parámetros en el catálogo.
Preguntas frecuentes
¿Es eficaz usar imágenes de IA como referencia artística?
Para luz, color, composición, atmósfera y ambiente de entorno, sí: son impresiones, y las imágenes generadas transportan bien las impresiones. Para anatomía, perspectiva, arquitectura, maquinaria y estructura animal, no: el modelo reproduce qué aspecto tienen esas cosas en las fotografías sin saber cómo funcionan, así que copiar su salida significa practicar sus errores. La prueba es si su referencia necesita ser evocadora o necesita ser correcta.
¿Puedo calcar sobre una imagen generada con IA?
Le desaconsejaríamos hacerlo. Dos razones: los errores anatómicos y estructurales se copian directos a su trabajo cuando calca en vez de interpretar, y una forma calcada tiene una ascendencia que no puede documentar si un cliente o un jurado pregunta después. Use un fotograma generado como usaría una fotografía sin licencia que encontró en internet: mírela, entiéndala, y después dibuje desde el entendimiento.
¿Llevan watermark las imágenes de referencia generadas con IA?
Toda salida de un modelo de imagen de Google, incluidos los cuatro niveles de Nano Banana, lleva SynthID, un marcador de procedencia invisible que aplica Google. Ningún proveedor puede desactivarlo, ya que se incrusta antes de la reventa. No afecta a la imagen visualmente y no va a interferir con usarla como referencia, pero sí significa que el fichero es identificable como generado con IA.
¿Cuál es la forma más barata de generar imágenes de referencia?
Nano Banana 2 Lite a $0.0238 por imagen en E2X, comprobado el 26 de agosto de 2026. El trabajo de referencia premia el volumen por encima del acabado, así que veinte variaciones por unos $0.48 le ganan a un render premium. No hay ninguna razón para pagar tarifas de nivel alto por algo que va a ojear y tirar.
¿Cómo genero el mismo sujeto bajo iluminaciones distintas?
Genere el sujeto una vez y después mande esa imagen a un endpoint de edición repetidamente, cambiando solo la instrucción de iluminación cada vez. Eso le da un sujeto bajo muchas condiciones en lugar de varias imágenes sin relación, que es lo que lo convierte en un estudio. Nano Banana 2 Lite se ocupa de esto a $0.0238 por pasada; Nano Banana 2 admite hasta 14 imágenes de referencia si necesita una consistencia de identidad más apretada.
¿Debería enseñarle referencias generadas a un cliente?
Manténgalas en su proceso y no en su entregable. Una imagen generada en un tablero de cara al cliente fija la expectativa de una imagen que usted no hizo y no puede reproducir a demanda, y los clientes piden «esa» de forma rutinaria una vez la han visto. Si un fotograma generado sí aparece en un moodboard, etiquételo.
¿Por qué los modelos de IA se equivocan con las manos y la anatomía?
Porque un modelo de imagen aprende la apariencia de una mano a lo largo de millones de fotografías, no la estructura que hay debajo. En la representación no hay ningún esqueleto, solo estadísticas sobre cómo tienden a colocarse los dedos unos junto a otros, así que una disposición plausible puede ser mecánicamente imposible. Eso se nota más en manos y en extremidades escorzadas, que es justo donde un artista necesita que la referencia sea exacta.