Geração de imagem consistente com a API do Nano Banana
Gerar uma boa imagem está perto de resolvido. Gerar a vigésima que ainda pertence às dezenove primeiras é onde os projetos morrem.
A lacuna não é habilidade de prompt. É que "consistência" são três problemas de engenharia diferentes vestindo uma palavra só, e a técnica que resolve um não faz nada pelos outros dois. Rodamos os modelos Nano Banana na nossa API, e esse é o request que as pessoas mais erram — não porque os modelos não consigam, mas porque as referências entram sem rótulo e o modelo fica adivinhando para que servia cada uma.

Três problemas, não um
Separe esses antes de escrever um prompt. Eles falham de formas diferentes e custam de formas diferentes.
Consistência de personagem. A mesma pessoa ao longo de vários quadros — mesmo rosto, mesmo porte e mesmo cabelo, reconhecível como um indivíduo, esteja ela sentada no quadro quatro ou andando no quadro dezenove. É um problema de identidade: o modelo tem que carregar um rosto por composições que nunca viu.
Fidelidade de produto. Não uma garrafa parecida. Aquela garrafa. Proporção exata da tampa, posição do rótulo, tom de verde. Fidelidade é mais rígida que identidade — um rosto tem tolerância, a embalagem de um cliente não tem.
Consistência de estilo. O conjunto é lido como um conjunto — mesma correção de cor, mesmo caráter de lente, mesma qualidade de luz, mesmo grão. Nenhum objeto precisa se repetir; o tratamento sim.
A maioria dos briefings precisa de dois desses ao mesmo tempo e pede eles como uma instrução só. "Deixe consistente" não é um pedido sobre o qual uma API consiga agir. "A imagem 1 é a pessoa, a imagem 2 é a garrafa, a imagem 3 é só correção de cor" é.
A divisão de papéis é o recurso de verdade
O Nano Banana Pro aceita até 14 imagens de referência. O Nano Banana 2 também, por quase metade do preço. A contagem não é a diferença. O Pro divide esse orçamento por papel:
| Papel | Orçamento | O que ele segura |
|---|---|---|
| Personagem | até 5 | Referências de identidade de uma pessoa ou figura |
| Objeto | até 6 | Produtos, adereços e embalagens em alta fidelidade |
| Estilo | até 3 | Só correção de cor, clima de iluminação, tratamento |
Quatorze no total, mas alocadas. A alocação é o que transforma uma imagem de referência de sugestão em instrução.
Pense no que acontece sem isso. Você entrega quatorze imagens e uma frase a um modelo, e ele infere pela prosa qual imagem é um rosto a preservar, qual é um produto a reproduzir exatamente, e qual está ali só pelo clima. Ele infere errado com frequência. O sinal é um produto que saiu "no estilo da" sua embalagem em vez de como a sua embalagem, ou um rosto vestindo a correção de cor do moodboard.
Com a divisão, você não está pedindo, está declarando. Cinco slots para quem, seis para o quê, três para como a coisa parece. Um composto de anúncio num único request em vez de três rodadas de composição.
O Pro sai por $0.075 por request no nosso preço de 26 de agosto de 2026, contra uma tabela de $0.15. Mais uma coisa que vale saber: 1K e 2K custam o mesmo no Pro. Para assets de destaque, pegue o 2K. É de graça.

Rotulando as referências dentro do prompt
A divisão de papéis faz o trabalho estrutural. O prompt faz o trabalho semântico, e ele tem que ser explícito de um jeito que quase parece grosseiro. As referências chegam em ordem, então nomeie elas pela posição e diga para o que cada uma serve, incluindo para o que ela não serve. Essa última parte é onde a maioria dos prompts vaza.
A imagem 1 e a imagem 2 são a mesma mulher — preserve o rosto, o comprimento
do cabelo e o porte dela exatamente. A imagem 3 é o produto: reproduza o
formato da garrafa, a proporção da tampa e a arte do rótulo com precisão, não
reestilize. A imagem 4 é só correção de cor e clima de iluminação — não copie
nenhum objeto, pose ou composição dela.
Coloque a mulher das imagens 1-2 segurando a garrafa da imagem 3, sentada a
uma mesa de café junto a uma janela, vista de três quartos, luz quente de
tarde combinando com a correção da imagem 4.
Quatro coisas fazem esse prompt funcionar, e nenhuma delas é um quinto adjetivo:
- Toda referência está contabilizada. Nenhuma imagem entra sem uma função declarada.
- A referência de estilo carrega uma exclusão explícita. Sem ela, um moodboard vaza os móveis dele para a sua cena.
- As palavras de identidade são concretas — rosto, comprimento do cabelo, porte — e não "parecida com ela".
- A instrução do produto diz "não reestilize", que é a frase que separa fidelidade de inspiração.
Não vamos cobrir construção geral de prompt aqui; isso é o guia de prompting. Este texto é especificamente sobre dizer ao modelo para que servem as suas referências.
O request
Trabalho de consistência é edição, não geração, então ele vai para o slug edit-image com image_urls.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-pro/edit-image",
"input": {
"prompt": "A imagem 1 e a imagem 2 são a mesma mulher - preserve o rosto, o comprimento do cabelo e o porte dela exatamente. A imagem 3 é o produto: reproduza o formato da garrafa, a proporção da tampa e a arte do rótulo com precisão, não reestilize. A imagem 4 é só correção de cor e clima de iluminação, não copie nenhum objeto ou composição dela. Coloque a mulher segurando a garrafa, sentada a uma mesa de café junto a uma janela, vista de três quartos, luz quente de tarde.",
"image_urls": [
"https://cdn.example.com/refs/model-face-front.jpg",
"https://cdn.example.com/refs/model-face-three-quarter.jpg",
"https://cdn.example.com/refs/bottle-front.jpg",
"https://cdn.example.com/refs/grade-warm-afternoon.jpg"
],
"aspect_ratio": "4:5",
"resolution": "2K"
}
}'
O submit devolve um job ID; faça polling dele ou passe webhookUrl. O Pro leva uns 30 segundos porque gera "imagens de pensamento" intermediárias enquanto compõe — o Google não devolve essas e nós não cobramos por elas. Defina aspect_ratio de forma explícita, já que o default do Pro é 9:16. O passo a passo completo de parâmetros está em o tutorial da API do Nano Banana Pro.
Onde os tiers mais baratos caem
Preferimos te descer um tier a te vender o Pro para um trabalho que não precisa dele.
O Nano Banana 2 aceita as mesmas 14 referências a $0.04, sem a divisão de papéis. Isso é genuinamente suficiente para consistência de estilo, em que toda referência está fazendo o mesmo trabalho e não há nada para desambiguar. Seis headers de blog compartilhando uma paleta e um clima de luz não precisam do Pro. Precisam de uma boa referência de estilo e de um template de prompt congelado. O Nano Banana 2 também chega a 4K, que o Lite não encosta de jeito nenhum.
O Nano Banana 2 Lite sai por $0.0238 e foi feito para volume, não para fidelidade. Vá nele quando você precisar de quatrocentas imagens compartilhando uma cara e nenhuma delas carrega o rosto ou a embalagem de um cliente. Ele é só 1K, sem parâmetro resolution — mandar um é erro, não um no-op.
O legado Nano Banana para em 3 imagens de referência, o que não basta para fazer personagem e produto no mesmo quadro, e o Google aposenta ele em 2 de outubro de 2026 — a história completa desse modelo é um post à parte. Não comece um projeto de consistência nele.
Regra grosseira: trabalho só de estilo vai para o Nano Banana 2 ou para o Lite. Qualquer coisa em que um rosto humano específico ou um produto físico específico tenha que sobreviver intacto vai para o Pro. A diferença de preço entre $0.04 e $0.075 para de importar no momento em que um cliente rejeita um lote porque o rótulo estava errado.
Os preços e as condições dos produtos podem mudar. Verifique o preço atual de cada provider antes de tomar uma decisão de compra. O preço do Google Batch ou Flex não é diretamente equivalente a um request de API on-demand padrão, porque as condições de agendamento, disponibilidade e processamento são diferentes; por isso ele ficou fora desta comparação. Esta é uma comparação de escopo limitado, não uma afirmação de que a E2X é a opção mais barata do mundo em qualquer configuração.
Monte um conjunto canônico de referências uma vez só
O hábito que mais rápido se paga aqui não tem nada a ver com a API.
Monte o conjunto de referências uma vez, de forma deliberada, e reutilize para sempre. Não "as fotos que estavam por aí" — um conjunto fixo, versionado e guardado do qual todo request bebe. Para um personagem: vários ângulos do mesmo rosto sob luz neutra, de frente, de três quartos, de perfil, mais um de corpo inteiro para o porte. Para um produto: frente, verso, um corte de detalhe do rótulo. Para estilo: uma ou duas imagens carregando a correção de cor e nada que distraia.
Depois congele. Guarde as URLs em algum lugar permanente — o seu próprio bucket, não um link temporário — e passe o mesmo array em todo request pela vida do projeto.
Isso importa mais que ajuste de prompt porque a deriva é cumulativa. Gere o quadro 5 a partir do quadro 4 e o quadro 6 a partir do quadro 5, e pequenos erros se acumulam até o quadro 20 ser outra pessoa. Ancorar todo quadro no mesmo conjunto canônico significa que cada geração deriva do original em um passo, nunca em vinte. Um leque, não uma corrente.
Um hábito relacionado: se o conjunto inclui imagens que você gerou, guarde os arquivos de origem. URLs de entrega de qualquer API de imagem expiram, então baixe e guarde os seus próprios assets — como rodar a geração automaticamente tem o loop completo.
Gere um destaque, depois derive as variantes
O fluxo que produz mais saída aproveitável por dólar não é "gere vinte imagens". É "gere uma imagem vinte vezes".
Faça uma foto de destaque no Pro e acerte ela — composição, iluminação, rosto, produto. Queime algumas tentativas; a $0.075 a exploração é barata.
Depois pare de gerar e comece a editar. Alimente o destaque aprovado de volta como referência junto com o seu conjunto canônico e peça a mudança que você quer: outro ângulo, outro fundo, outro corte, a modelo olhando para o lado em vez de para a câmera. Cada variante está ancorada em algo que já passou pela aprovação, não numa nova rolagem de dados.
Editar ganha de regerar por uma razão fácil de deixar passar. Uma regeração redecide tudo; todo parâmetro com o qual você estava satisfeito volta para a mesa. Uma edição segura o que você não mencionou. Depois de gastar uma tarde acertando um rosto, redecidir ele vinte vezes é a última coisa que você quer.
Duas notas práticas. Olhe a contagem de referências conforme você acrescenta o destaque de volta — destaque mais um conjunto de personagem de cinco imagens mais um produto já dão sete de quatorze. E salve o prompt do destaque aprovado ao lado da imagem; uma variante normalmente é aquele prompt com duas orações trocadas, e reescrever de memória reintroduz a deriva que você acabou de pagar para tirar.

A parte que conjunto de referência nenhum resolve
O Google carimba o SynthID em toda imagem que os modelos dele produzem. É invisível, viaja dentro do arquivo, e não é uma configuração que alguém exponha porque não é configuração nenhuma. Isso importa aqui mais que na maioria dos posts: projetos de consistência são projetos de cliente, e o contrato de um cliente pode carregar uma cláusula sobre assets gerados por IA. Resolva essa cláusula antes de fotografar o conjunto de referências, não depois de vinte quadros aprovados estarem parados num deck.
Trabalho de consistência é quase sempre edição, então os modelos image-to-image são a prateleira para olhar primeiro, e o catálogo tem o lado de vídeo se o briefing se mexer.
Perguntas frequentes
Como manter o mesmo personagem em várias imagens geradas por IA?
Monte um conjunto canônico de referências — vários ângulos do mesmo rosto sob luz neutra, mais uma foto de corpo inteiro para o porte —, guarde ele de forma permanente, e passe as mesmas imagens em todo request. Use os slots de personagem do Nano Banana Pro, que seguram até 5 imagens de identidade, e declare no prompt quais imagens são a pessoa. Ancore todo quadro no conjunto original em vez de no quadro anterior, ou os erros se acumulam num rosto diferente lá pelo vigésimo.
Quantas imagens de referência a API do Nano Banana aceita?
O Nano Banana Pro aceita 14, divididas por papel: até 5 imagens de personagem, até 6 imagens de objeto e até 3 referências de estilo. O Nano Banana 2 também aceita 14, mas sem a divisão de papéis. O Nano Banana 2 Lite foi feito para volume e não para trabalho pesado em referências, e o Nano Banana legado para em 3.
Qual a diferença entre consistência de personagem e fidelidade de produto?
Consistência de personagem quer dizer que uma pessoa continua reconhecível ao longo de várias imagens — mesmo rosto, cabelo e porte, tolerante a pequena variação. Fidelidade de produto quer dizer que o objeto se reproduz exatamente: arte do rótulo precisa, proporção da tampa e cor, sem reestilização. O Pro trata os dois em slots de referência diferentes porque eles exigem rigores diferentes, e o prompt deveria dizer quais imagens são quais.
Devo usar o Nano Banana Pro ou o Nano Banana 2 para imagens consistentes?
Use o Nano Banana 2 a $0.04 quando a necessidade é estilística — imagens compartilhando paleta, iluminação e tratamento, sem nenhum rosto ou produto específico a preservar. Use o Nano Banana Pro a $0.075 quando um rosto específico ou um produto físico tem que sobreviver intacto, porque o orçamento de referências com papéis separados é o que diz ao modelo qual é qual. A diferença de preço é pequena ao lado de um lote rejeitado.
Como rotular imagens de referência num prompt de Nano Banana?
Refira-se a elas pela posição na ordem em que você passa em image_urls, e declare para que serve cada uma. "As imagens 1 e 2 são a mesma mulher, preserve o rosto e o porte dela; a imagem 3 é o produto, reproduza ele exatamente; a imagem 4 é só correção de cor, não copie nenhum objeto ou composição dela." As exclusões importam tanto quanto as instruções, já que uma referência de estilo sem qualificação vai vazar os objetos e a composição dela para a sua cena.
É melhor editar uma imagem existente ou gerar uma nova?
Editar, depois que você tem uma imagem que aprova. Uma regeração redecide todo elemento, incluindo os que te agradavam; uma edição segura tudo que você não mencionou. O fluxo eficiente é um destaque feito com cuidado, e depois variantes derivadas dele pelo endpoint edit-image com as suas referências canônicas anexadas.
Por que as minhas imagens geradas derivam para longe do personagem original?
Quase sempre porque cada imagem nova foi gerada a partir da anterior em vez de a partir de um conjunto fixo de referências. Isso torna os erros cumulativos — um maxilar levemente mais redondo no quadro 3 vira a linha de base do quadro 4, e lá pelo quadro 20 é outra pessoa. Ancore todo request nas mesmas imagens canônicas guardadas para cada saída ficar a um passo do original, e não a vinte.