Como escrever prompts que os modelos Nano Banana seguem
A maioria dos guias de prompting é uma lista de adjetivos. Adjetivos são a parte de um prompt que menos importa.
Rodamos os quatro modelos Nano Banana atrás de uma API só, e as formas como um prompt falha são consistentes o bastante para anotar. Quarenta palavras gastas em adjetivos de qualidade e duas na luz. Um briefing de composição do tamanho de um Pro disparado contra o tier mais barato. Um pedido de edição que redescreve a cena inteira e volta como outra imagem. Nada disso é problema de modelo. São problemas de escrita, e problemas de escrita têm conserto.

Meio, sujeito, luz, enquadramento — nessa ordem
Um prompt é lido como um todo, mas as orações do começo trabalham mais que as do fim. Elas definem o espaço em que o resto da frase tem que viver. Abra com "uma mulher linda" e o modelo tem que adivinhar se está fazendo uma fotografia, uma pintura a óleo ou um render 3D, e vai adivinhar a partir do que as suas outras palavras implicarem estatisticamente. Abra com "fotografia editorial 35mm" e toda decisão seguinte já está restrita a um meio.
Então a ordem:
- Meio. A maior bifurcação da árvore. Fotografia, render isométrico, ilustração vetorial chapada, pintura em guache, macro de produto. Escolha um e nomeie ele nas primeiras quatro palavras.
- Sujeito. Não a categoria — a coisa específica. "Uma mulher numa mesa de café" é foto de banco de imagens. "Uma mulher na casa dos cinquenta, as duas mãos ao redor de uma xícara branca" é uma imagem.
- Luz. Direção, qualidade, cor. Essa frase única move o resultado mais que qualquer outra, e quase ninguém escreve ela.
- Enquadramento. Altura de câmera, distância, corte, profundidade de campo, e para onde vai o espaço vazio.
Aqui está o mesmo pedido escrito mal e depois escrito direito.
Uma mulher linda numa cafeteria, highly detailed, 8k, masterpiece,
trending on artstation, ultra realistic, professional photography, award
winning, sharp focus, bokeh
Fotografia editorial 35mm. Uma mulher na casa dos cinquenta sentada sozinha
a uma mesa de mármore de café, as duas mãos envolvendo uma xícara branca,
olhando para fora do quadro à esquerda. Sol baixo de inverno pela janela
atrás dela, contornando o cabelo e estourando a rua lá fora em branco.
Fotografada da mesa ao lado, na altura dos olhos de quem está sentado, da
cintura para cima, profundidade de campo rasa, fundo caindo para um cinza suave.
O que mudou: o meio foi para a frente, o sujeito ganhou um gesto específico, a luz ganhou direção e temperatura, e a câmera ganhou uma posição. Nada foi acrescentado sobre qualidade. O segundo prompt não é mais detalhado no sentido vago — ele é mais decidido.
E pare de escrever "highly detailed, 8k, masterpiece". Não faz nada nesses modelos. Esses tokens são carga da cultura de prompt do Stable Diffusion de 2022, onde empurravam um modelo muito menor para uma fatia específica dos dados de treino. Modelos da geração Gemini não respondem a eles, e cada um deles é orçamento que você poderia ter gasto descrevendo de onde vem a luz.

O espaço vazio é preenchido a menos que você reivindique ele
Esses modelos não deixam coisas de fora. Se você descreve uma caneca e não diz nada sobre o que a cerca, a imagem vai conter um entorno mesmo assim, e ele vai ser o que uma foto de caneca costuma conter: uma mesa de madeira, um guardanapo de linho, um raminho de alguma coisa, uma janela desfocada e, mais ou menos quarenta por cento das vezes, uma palavra impressa na caneca.
Essa é a reclamação mais comum que ouvimos, e não é um problema de qualidade. Ninguém disse para não colocar.
Uma caneca de cerâmica sobre uma mesa, foto de produto
Fotografia macro de produto de uma única caneca de grês sem esmalte, corpo
fosco cor de aveia, alça gasta pelo polegar, parada no centro exato de um
fundo infinito cinza médio. Fonte grande e suave vindo do alto à esquerda,
uma sombra gentil caindo para a direita embaixo. Nenhum texto na caneca,
nenhum logo, nenhum outro objeto, nenhuma mão, nenhum adereço, nenhum
detalhe de fundo.
A última frase dessa reescrita trabalha mais que as três primeiras juntas. Escreva as exclusões como uma lista simples no fim do prompt, no mesmo registro do resto. "Nenhum texto, nenhum logo, nenhuma pessoa, nenhuma bagunça" muitas vezes é a linha de maior valor do arquivo — e em qualquer imagem que vá ficar atrás de tipografia de verdade depois, ela não é opcional.
Isso importa mais que o normal para qualquer coisa que você planeja compor. Um fundo gerado com um raminho de alecrim inventado dentro é um fundo que você vai ter que mascarar.

Escreva para o tier que você está chamando de verdade
Os quatro modelos aceitam quantidades diferentes de prompt, e querem formatos diferentes de prompt. Os tetos não estão onde as pessoas esperam:
| Modelo | Teto de prompt | O que ele quer |
|---|---|---|
| Nano Banana 2 Lite | 32.000 caracteres | Curto, um sujeito, estrutura de orações plana |
| Nano Banana 2 | 20.000 caracteres | Comprimento médio, segura dois ou três elementos relacionados |
| Nano Banana Pro | 50.000 caracteres | Briefings longos de composição com relações espaciais |
| Nano Banana (legado) | — | Aposentado em 2 de outubro de 2026; migre em vez de ajustar |
O Nano Banana 2 tem o menor teto dos três tiers atuais, apesar de estar no meio em preço. Isso surpreende todo mundo na primeira vez.
Só que os tetos não são a restrição de verdade. O Lite é um modelo lite, e prompts longos falham nele de um jeito específico: ele guarda a primeira oração e a última e derruba o meio em silêncio. Condições aninhadas ("um cômodo com uma mesa sobre a qual há uma tigela com três peras, uma delas machucada") voltam sem as peras. Escreva frases planas para o Lite. Um sujeito, um cenário, uma fonte de luz, uma lista de exclusões.
Um render 3D isométrico de um escritório moderno de planta aberta na hora
dourada com quatorze funcionários distintos em mesas altas, uma sala de
reunião com paredes de vidro à esquerda contendo um quadro branco, figueiras-
lira em vasos nos cantos, um bar de café ao longo da parede do fundo com um
barista, dutos aparentes no teto, piso de concreto polido refletindo as
janelas, e um gato dormindo na terceira mesa a partir da frente
Render 3D isométrico de um escritório de planta aberta na hora dourada.
Fileiras de mesas altas, uma sala de reunião com paredes de vidro à esquerda,
janelas altas jogando luz quente e comprida sobre um piso de concreto polido.
Paleta contida, geometria limpa. Nenhum texto, nenhuma placa, nenhuma pessoa.
O primeiro prompt não está errado. Ele está errado para o Lite. Mande ele para o Pro e os quatorze funcionários, os dutos e o gato chegam todos. Mande para o Lite e você recebe um escritório, uma janela e uma cobrança de $0.0238.
O que é a versão útil do conselho no sentido inverso: se o seu prompt tem menos de sessenta palavras e um sujeito só, o Pro não te compra nada além de uma espera de trinta segundos e mais ou menos o triplo do custo. A maior parte do que as pessoas geram é trabalho de Lite. Preferimos te dizer isso a te vender o tier de topo para um fundo de rascunho. Para o detalhamento completo de qual tier para qual trabalho, escrevemos isso à parte na nossa comparação dos quatro Nano Banana.
Aspect ratio é uma instrução de composição, não um corte
Decida o formato antes de escrever a frase, porque o formato muda o que a frase deveria dizer. Um banner 21:9 quer um horizonte e um sujeito empurrado para fora do centro. Um story 9:16 quer uma pilha vertical e espaço acima da cabeça. Se você escreve um prompt para um quadrado e renderiza em widescreen, recebe uma composição quadrada com preenchimento dos dois lados, e vai parecer exatamente isso.
Diga a composição em voz alta dentro do prompt. "Horizonte no terço inferior, sujeito no terço direito, céu vazio pelo canto superior esquerdo para texto" é uma instrução real e esses modelos seguem bem.
E aí tem a armadilha que custa às pessoas um lote inteiro de assets. O aspect ratio default não é o mesmo entre os tiers. No Nano Banana, no Nano Banana 2 e no Nano Banana Pro o nosso default é 9:16. No Nano Banana 2 Lite é 1:1. Então uma config que nunca fixa aspect_ratio produz imagens em retrato em três modelos e quadrados no quarto, e se você trocar de tier para economizar, o formato da sua saída muda em silêncio por baixo de você.
Fixe. Sempre, em toda chamada, mesmo quando o default por acaso for o que você quer:
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-2-lite/text-to-image",
"input": {
"prompt": "Fotografia de paisagem panorâmica de uma crista de granito sob luz plana de céu encoberto, horizonte no terço inferior, a linha da crista entrando pela direita, céu pálido e vazio pelo canto superior esquerdo. Nenhum texto, nenhuma pessoa, nenhuma construção.",
"aspect_ratio": "21:9"
}
}'
Mais uma razão para conhecer o seu tier: o Lite carrega quatro aspect ratios que mais nada no nosso catálogo tem — 1:4, 4:1, 1:8 e 8:1. Esses são genuinamente úteis e genuinamente subutilizados. Uma faixa de header do site inteiro ou um bloco lateral alto renderizados em 8:1 ganham de gerar um 16:9 e cortar 80% fora, tanto na composição quanto no que você pagou pelos pixels que jogou no lixo.

Editar é outra habilidade: escreva o delta
É aqui que os escritores de prompt mais experientes regridem mais forte, porque o instinto vindo do text-to-image é descrever a imagem que você quer. Numa chamada de edição você já tem a imagem. Descrever ela de novo compete com ela.
Um prompt de edição tem duas tarefas: nomear o que muda e nomear o que não pode mudar. Nada mais pertence ali.
Uma mulher na casa dos cinquenta numa mesa de mármore de café sob luz baixa
de inverno, vestindo um casaco vermelho em vez de um azul, mesmo rosto, mesma
pose, fotografia editorial, 35mm, profundidade de campo rasa, tons quentes
Mude o casaco de azul-marinho para um vermelho-tijolo profundo. Mantenha o
peso do tecido, o formato da gola e o caimento idênticos. Todo o resto do
quadro fica inalterado: mesmo rosto, mesma expressão, mesmas mãos, mesma
xícara, mesma luz de janela, mesmo corte.
A primeira versão reespecifica o meio, a lente e o tom, e cada uma dessas reespecificações é uma instrução nova sobre a qual o modelo pode agir. É assim que você ganha um rosto sutilmente diferente. A segunda versão encosta em uma coisa e congela o resto de forma explícita.
Dois fatos mecânicos que vale saber antes de construir um pipeline de edição. As contagens de referência mudam por tier: o modelo legado aceita três imagens, o endpoint de edição do Nano Banana 2 aceita quatorze, e o do Nano Banana Pro também aceita quatorze, mas divide elas por papel — até cinco imagens de personagem para identidade, seis imagens de objeto para fidelidade de produto, três referências de estilo. Essa divisão de papéis é a razão de o Pro conseguir montar um composto de anúncio completo num request só, e é um tema inteiro por si; cobrimos isso em mantendo um personagem consistente entre gerações do Nano Banana.
Texto dentro da imagem, e quando não vale a pena
Palavras legíveis dentro de uma imagem chegaram com a geração Gemini 3. O legado gemini-2.5-flash-image não consegue — uma palavra solta às vezes sobrevive, uma frase nunca. Para qualquer coisa com tipografia de verdade dentro você quer o Nano Banana 2, e para qualquer coisa em que a tipografia é o ponto você quer o Pro, que renderiza texto estilizado e multilíngue bem o bastante para você entregar um infográfico em inglês e receber a versão em espanhol de volta com a arte intacta.
Quando você pede texto, as regras apertam:
- Coloque as palavras entre aspas, exatamente como devem aparecer.
- Diga quantas palavras são e onde elas ficam no quadro.
- Descreva as formas das letras como um estilo, não como o nome de uma fonte. "Capitulares Art Déco geométricas e altas, entreletra generosa" funciona. Nomear uma tipografia específica em geral não.
- Feche com "nenhum outro texto em lugar nenhum", ou o modelo acrescenta uma legenda plausível que você não pediu.
Um pôster de viagem vintage de Lisboa com a palavra LISBOA em letras art déco
Ilustração de pôster de viagem vintage dos anos 1930, estilo serigrafia chapada
com deslocamentos de registro visíveis. Um bonde creme subindo uma rua íngreme
em tons pastel, o estuário do Tejo atrás dele em três azuis chapados. Uma única
linha de texto: a palavra "LISBOA" em capitulares Art Déco geométricas e altas
atravessando o quarto inferior, ocre profundo sobre creme, entreletra generosa.
Nenhum outro texto em lugar nenhum da imagem.
Agora a parte impopular. A maior parte do texto dentro da imagem não deveria estar na imagem. Se as palavras algum dia vão precisar mudar, ser traduzidas, ser selecionadas, ser lidas por um leitor de tela ou ser corrigidas depois de o jurídico olhar para elas, gere a arte limpa e componha o tipo em HTML, no Figma ou no seu template engine. Assar um título nos pixels porque um modelo consegue fazer isso é uma decisão que você vai pagar na primeira revisão de texto. Peça texto renderizado quando o tipo é genuinamente parte da arte — um pôster, uma fachada pintada, a lombada de um livro numa natureza-morta — e pule isso no resto.
Isso tem um fio mais afiado para qualquer coisa em formato de dado. Um modelo que renderiza texto plausível também renderiza números plausíveis e nomes de lugar plausíveis, o que é tranquilo num pôster e catastrófico num gráfico ou num mapa. Entramos exatamente no porquê em por que os geradores de imagem de IA são tão ruins em mapas.
Templates que vale guardar
Quatro esqueletos que cobrem a maior parte do que as pessoas de fato geram. Preencha os colchetes, apague o que não se aplica, mantenha a linha de exclusão.
Sujeito limpo sobre fundo liso, para composição:
[Meio: fotografia macro de produto / natureza-morta de estúdio] de um único
[sujeito com um detalhe específico de material], centralizado num fundo
infinito [cor]. [Fonte de luz e tamanho] vindo [da direção], uma sombra
caindo [na direção]. Nenhum texto, nenhum logo, nenhum adereço, nenhuma mão,
nenhum detalhe de fundo.
Cena editorial com espaço para texto:
[Meio] de [sujeito fazendo uma coisa específica], [cenário]. [Luz: direção,
qualidade, temperatura de cor]. Fotografada de [altura e distância de câmera],
[corte], [profundidade de campo]. [Sujeito] no terço [esquerdo/direito],
[superfície ou céu] vazio atravessando [a região] para texto. Nenhum texto,
nenhum logo.
Uma edição que muda uma coisa:
Mude [elemento] de [estado atual] para [estado alvo]. Mantenha [as duas ou
três propriedades desse elemento que precisam sobreviver] idênticas. Todo o
resto do quadro fica inalterado: mesmo [liste as partes de maior risco].
Ilustração com uma única linha de tipo, tier Pro:
[Estilo e época da ilustração], [detalhe de técnica]. [Cena descrita em duas
frases]. Uma única linha de texto: a palavra "[PALAVRA]" em [descrição das
formas de letra], [cor] sobre [cor], posicionada [onde]. Nenhum outro texto
em lugar nenhum da imagem.
Quando o prompt não é o problema
Em algum momento o prompt está bom e o problema é o pipeline: retentativas, seeds, filas, guardar a saída antes de a URL expirar. Isso é outra disciplina e escrevemos sobre ela em como gerar imagens automaticamente em volume. E se a lacuna que você está tentando fechar é especificamente credibilidade fotográfica em vez de seguir instrução, o checklist para isso mora em o nosso guia do gerador de imagem de IA mais realista.
Todo modelo publica a lista exata de parâmetros dele — o conjunto completo de aspect ratios, os defaults, o que ele recusa — como uma spec legível por máquina, como o arquivo de spec do Nano Banana 2 Lite. Leia isso antes de reescrever um prompt que começou a se comportar mal depois de uma troca de modelo. Nove em cada dez vezes o prompt estava bom e um default se mexeu por baixo dele. Existe um arquivo de spec atrás de cada modelo na categoria text-to-image, e atrás de todo o resto que rodamos.
Perguntas frequentes
Como devo estruturar um prompt de Nano Banana?
Meio primeiro, depois sujeito, depois luz, depois enquadramento, depois uma lista de exclusões. Nomear o meio nas palavras de abertura restringe toda decisão seguinte, e descrever a luz de forma explícita faz mais pelo resultado que qualquer quantidade de adjetivos de qualidade. Termine com o que não pode aparecer — "nenhum texto, nenhum logo, nenhum adereço" — porque esses modelos preenchem o espaço não especificado em vez de deixar ele vazio.
Palavras de qualidade como "8k" e "masterpiece" ajudam no Nano Banana?
Não. Esses tokens vieram de modelos de difusão de pesos abertos mais antigos, onde direcionavam a saída para um subconjunto específico dos dados de treino. Modelos da geração Gemini não respondem a eles, e eles consomem orçamento de prompt que seria melhor gasto em direção de luz, posição de câmera ou exclusões.
Qual o tamanho máximo de um prompt do Nano Banana?
O Nano Banana 2 Lite aceita até 32.000 caracteres, o Nano Banana 2 até 20.000, e o Nano Banana Pro até 50.000. Esses são tetos duros, não metas. O Lite em particular tem desempenho pior em prompts longos bem antes de chegar ao limite dele, porque tende a guardar as orações de abertura e de fechamento e derrubar o meio.
Por que as minhas imagens saem no formato errado quando troco de modelo?
Porque o aspect ratio default muda por tier. Nano Banana, Nano Banana 2 e Nano Banana Pro têm default 9:16 na nossa API, enquanto o Nano Banana 2 Lite tem default 1:1. Um request que nunca define aspect_ratio vai portanto mudar de formato quando você se mover entre esses modelos. Defina isso de forma explícita em toda chamada.
Como escrever um prompt de edição para o Nano Banana?
Escreva o delta, não a cena. Nomeie a única coisa que muda, nomeie as propriedades dela que precisam sobreviver, depois declare que todo o resto fica inalterado e liste os elementos de maior risco — rosto, pose, iluminação, corte. Redescrever o meio, a lente ou o clima num prompt de edição é o que causa mudanças indesejadas em outros pontos da imagem.
Qual modelo Nano Banana consegue renderizar texto legível numa imagem?
O Nano Banana 2 e o Nano Banana Pro conseguem, porque texto legível dentro da imagem é uma capability da geração Gemini 3. O Nano Banana Pro é a escolha confiável quando a tipografia é o ponto, já que ele também dá conta de texto estilizado e multilíngue. O legado gemini-2.5-flash-image não consegue renderizar texto legível de jeito nenhum.
Eu preciso do Nano Banana Pro para o modelo seguir melhor o prompt?
Normalmente não. A vantagem do Pro é segurar um briefing longo de composição com várias relações espaciais, mais imagens de referência com papéis separados e texto confiável dentro da imagem. Se o seu prompt é um sujeito só em menos de sessenta palavras, o Nano Banana 2 Lite a $0.0238 vai seguir ele com a mesma fidelidade e devolver mais rápido.