Écrire des prompts que les modèles Nano Banana suivent vraiment
La plupart des guides de prompting sont des listes d'adjectifs. Les adjectifs sont la partie du prompt qui compte le moins.
Nous opérons les quatre modèles Nano Banana derrière une seule API, et les façons dont un prompt échoue sont assez régulières pour être écrites. Quarante mots dépensés en adjectifs de qualité et deux sur la lumière. Un brief compositionnel de longueur Pro balancé au palier le moins cher. Une demande d'édition qui redécrit toute la scène et revient en image différente. Rien de tout ça n'est un problème de modèle. Ce sont des problèmes d'écriture, et les problèmes d'écriture ont des correctifs.

Médium, sujet, lumière, cadre — dans cet ordre
Un prompt est lu comme un tout, mais les premières propositions travaillent plus que les dernières. Elles fixent l'espace dans lequel le reste de la phrase devra vivre. Ouvrez par « une belle femme » et le modèle doit deviner s'il fabrique une photographie, une huile ou un rendu 3D, et il devinera à partir de ce que vos autres mots impliquent statistiquement. Ouvrez par « photographie éditoriale au 35 mm » et chaque décision suivante est déjà contrainte à un seul médium.
Donc l'ordre :
- Le médium. Le plus gros embranchement de l'arbre. Photographie, rendu isométrique, illustration vectorielle plate, gouache, macro produit. Choisissez-en un et nommez-le dans les quatre premiers mots.
- Le sujet. Pas la catégorie — la chose précise. « Une femme à une table de café » est une photo de banque d'images. « Une femme d'une cinquantaine d'années, les deux mains autour d'une tasse blanche » est une image.
- La lumière. Direction, qualité, couleur. Cette seule phrase déplace le résultat plus que n'importe quelle autre, et presque personne ne l'écrit.
- Le cadre. Hauteur de caméra, distance, recadrage, profondeur de champ, et où va le vide.
Voici la même demande, mal écrite puis écrite correctement.
Une belle femme dans un café, très détaillé, 8k, chef-d'œuvre, tendance sur
artstation, ultra réaliste, photographie professionnelle, primé, mise au point
nette, bokeh
Photographie éditoriale au 35 mm. Une femme d'une cinquantaine d'années est
assise seule à une table de café en marbre, les deux mains refermées sur une
tasse blanche, le regard hors cadre vers la gauche. Soleil d'hiver bas
traversant la fenêtre derrière elle, ourlant ses cheveux et brûlant la rue en
blanc. Prise depuis la table voisine, à hauteur d'yeux assis, cadrage taille,
faible profondeur de champ, arrière-plan décrochant vers un gris doux.
Ce qui a changé : le médium est passé en tête, le sujet a reçu un geste précis, la lumière a reçu une direction et une température, la caméra a reçu une position. Rien n'a été ajouté sur la qualité. Le second prompt n'est pas plus détaillé au sens vague — il est plus décidé.
Et arrêtez d'écrire « très détaillé, 8k, chef-d'œuvre ». Ça ne fait rien sur ces modèles. Ces tokens sont un héritage de la culture prompt Stable Diffusion de 2022, où ils poussaient un modèle bien plus petit vers une tranche particulière de ses données d'entraînement. Les modèles de génération Gemini n'y réagissent pas, et chacun d'eux est du budget que vous auriez pu dépenser à décrire d'où vient la lumière.

L'espace vide sera rempli si vous ne le réclamez pas
Ces modèles ne laissent rien de côté. Si vous décrivez un mug sans rien dire de ce qui l'entoure, l'image contiendra quand même un entourage, et ce sera ce qu'une photo de mug contient d'habitude : une table en bois, une serviette en lin, une brindille de quelque chose, une fenêtre en flou, et à peu près quatre fois sur dix, un mot imprimé sur le mug.
C'est la plainte la plus courante qui nous remonte, et ce n'est pas un problème de qualité. Personne n'avait dit de ne pas le faire.
Un mug en céramique sur une table, photo produit
Photographie produit macro d'un seul mug en grès non émaillé, corps mat couleur
avoine, anse usée par le pouce, posé pile au centre sur un fond gris moyen sans
raccord. Grande source douce en haut à gauche, une ombre douce tombant vers le
bas à droite. Aucun texte sur le mug, aucun logo, aucun autre objet, aucune
main, aucun accessoire, aucun détail d'arrière-plan.
La dernière phrase de cette réécriture travaille plus que les trois premières réunies. Écrivez les exclusions comme une simple liste en fin de prompt, dans le même registre que le reste. « Aucun texte, aucun logo, aucune personne, aucun fouillis » est souvent la ligne la plus rentable du fichier — et sur toute image qui devra plus tard passer sous de la vraie typographie, elle n'est pas optionnelle.
Ça compte encore plus pour tout ce que vous comptez composer. Un arrière-plan généré avec une brindille de romarin inventée dedans est un arrière-plan qu'il faudra détourer.

Écrivez pour le palier que vous appelez vraiment
Les quatre modèles avalent des quantités de prompt différentes, et ils veulent des formes de prompt différentes. Les plafonds ne sont pas là où on les attend :
| Modèle | Plafond de prompt | Ce qu'il veut |
|---|---|---|
| Nano Banana 2 Lite | 32 000 caractères | Court, un seul sujet, structure de phrase à plat |
| Nano Banana 2 | 20 000 caractères | Longueur moyenne, tient deux ou trois éléments liés |
| Nano Banana Pro | 50 000 caractères | Longs briefs compositionnels avec relations spatiales |
| Nano Banana (legacy) | — | Retiré le 2 octobre 2026 ; migrez au lieu de régler |
Nano Banana 2 a le plafond le plus bas des trois paliers actuels alors qu'il est au milieu côté prix. Ça surprend tout le monde la première fois.
Les plafonds ne sont pourtant pas la vraie contrainte. Lite est un modèle lite, et les longs prompts y échouent d'une façon précise : il garde la première proposition et la dernière et laisse tomber le milieu en silence. Les conditions imbriquées (« une pièce avec une table sur laquelle repose un bol contenant trois poires, dont une abîmée ») reviennent sans la moindre poire. Écrivez des phrases à plat pour Lite. Un sujet, un décor, une source de lumière, une liste d'exclusions.
Un rendu 3D isométrique d'un bureau moderne en open space à l'heure dorée avec
quatorze employés distincts à des bureaux debout, une salle de réunion aux
cloisons vitrées à gauche contenant un tableau blanc, des ficus lyrata en pot
dans les coins, un coin café le long du mur du fond avec un barista, des gaines
apparentes au plafond, des sols en béton poli reflétant les fenêtres, et un chat
endormi sur le troisième bureau en partant de l'avant
Rendu 3D isométrique d'un bureau en open space à l'heure dorée. Rangées de
bureaux debout, salle de réunion aux cloisons vitrées à gauche, hautes fenêtres
jetant une longue lumière chaude sur un sol en béton poli. Palette sourde,
géométrie nette. Aucun texte, aucune signalétique, aucune personne.
Le premier prompt n'est pas mauvais. Il est mauvais pour Lite. Envoyez-le à Pro et les quatorze employés, les gaines et le chat arrivent tous. Envoyez-le à Lite et vous obtenez un bureau, une fenêtre, et une facture de $0.0238.
D'où la version utile du conseil dans l'autre sens : si votre prompt fait moins de soixante mots avec un seul sujet dedans, Pro ne vous achète rien à part trente secondes d'attente et environ le triple du coût. L'essentiel de ce que les gens génèrent est du travail pour Lite. Nous préférons vous le dire plutôt que vous vendre le palier haut pour un arrière-plan de bouche-trou. Pour le détail complet quel-palier-pour-quel-job, nous l'avons écrit à part dans notre comparaison des quatre Nano Banana.
L'aspect ratio est une instruction de composition, pas un recadrage
Décidez la forme avant d'écrire la phrase, parce que la forme change ce que la phrase doit dire. Une bannière 21:9 veut un horizon et un sujet décentré. Une story 9:16 veut un empilement vertical et de l'air au-dessus. Si vous écrivez un prompt pour un carré et que vous rendez en large, vous obtenez une composition carrée avec du remplissage de chaque côté, et ça se verra exactement comme ça.
Dites la composition à voix haute dans le prompt. « Horizon dans le tiers inférieur, sujet sur le tiers droit, ciel vide en haut à gauche pour le texte » est une vraie instruction, et ces modèles la suivent bien.
Et puis il y a le piège qui coûte à certains un lot d'assets entier. L'aspect ratio par défaut n'est pas le même d'un palier à l'autre. Sur Nano Banana, Nano Banana 2 et Nano Banana Pro, notre valeur par défaut est 9:16. Sur Nano Banana 2 Lite, c'est 1:1. Une config qui n'épingle jamais aspect_ratio produit donc du portrait sur trois modèles et du carré sur le quatrième, et si vous changez de palier pour économiser, la forme de votre sortie change en silence sous vos pieds.
Épinglez-la. Toujours, à chaque appel, même quand la valeur par défaut est justement celle que vous voulez :
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-2-lite/text-to-image",
"input": {
"prompt": "Photographie de paysage large, crête de granit sous une lumière plate de ciel couvert, horizon dans le tiers inférieur, la ligne de crête entrant par la droite, ciel pâle et vide en haut à gauche. Aucun texte, aucune personne, aucune construction.",
"aspect_ratio": "21:9"
}
}'
Une raison de plus de connaître votre palier : Lite porte quatre aspect ratios que rien d'autre dans notre catalogue n'a — 1:4, 4:1, 1:8 et 8:1. Ils sont vraiment utiles et vraiment sous-utilisés. Un bandeau d'en-tête pleine largeur ou un module vertical de barre latérale rendu en 8:1 bat le fait de générer du 16:9 et d'en jeter 80 % au recadrage, à la fois en composition et en ce que vous avez payé pour les pixels jetés.

L'édition est un autre métier : écrivez le delta
C'est là que les prompteurs les plus expérimentés régressent le plus fort, parce que le réflexe venu du text-to-image est de décrire l'image voulue. Dans un appel d'édition, vous avez déjà l'image. La redécrire entre en concurrence avec elle.
Un prompt d'édition a deux missions : nommer ce qui change, et nommer ce qui ne doit pas changer. Rien d'autre n'a sa place dedans.
Une femme d'une cinquantaine d'années à une table de café en marbre dans une
lumière d'hiver basse, portant un manteau rouge au lieu d'un bleu, même visage,
même pose, photographie éditoriale, 35 mm, faible profondeur de champ, tons
chauds
Changer le manteau de bleu marine à rouge brique profond. Garder identiques le
grammage du tissu, la forme du col et le tombé. Tout le reste du cadre est
inchangé : même visage, même expression, mêmes mains, même tasse, même lumière
de fenêtre, même cadrage.
La première version respécifie le médium, l'objectif et la tonalité, et chacune de ces respécifications est une instruction fraîche sur laquelle le modèle peut agir. C'est comme ça qu'on obtient un visage subtilement différent. La seconde touche une seule chose et gèle explicitement le reste.
Deux faits mécaniques à connaître avant de construire un pipeline d'édition. Le nombre de références diffère par palier : le modèle legacy prend trois images, l'endpoint edit de Nano Banana 2 en prend quatorze, et celui de Nano Banana Pro en prend quatorze aussi, mais réparties par rôle — jusqu'à cinq images de personnage pour l'identité, six images d'objet pour la fidélité produit, trois références de style. Cette répartition par rôle est la raison pour laquelle Pro assemble un composite publicitaire complet en une seule requête, et c'est un sujet à part entière ; nous le traitons dans garder un personnage cohérent d'une génération Nano Banana à l'autre.
Le texte dans l'image, et quand ne pas s'embêter
Les mots lisibles à l'intérieur d'une image sont arrivés avec la génération Gemini 3. Le gemini-2.5-flash-image legacy ne sait pas le faire — un mot isolé survit parfois, une phrase jamais. Pour tout ce qui porte de la vraie typographie, il vous faut Nano Banana 2, et pour tout ce dont la typographie est le sujet, il vous faut Pro, qui rend le texte stylisé et multilingue assez bien pour que vous lui passiez une infographie anglaise et récupériez la version espagnole avec l'illustration intacte.
Quand vous demandez du texte, les règles se resserrent :
- Mettez les mots entre guillemets, exactement tels qu'ils doivent apparaître.
- Dites combien il y a de mots et où ils se placent dans le cadre.
- Décrivez les formes de lettres comme un style, pas comme un nom de fonte. « Capitales Art déco géométriques et hautes, interlettrage généreux » fonctionne. Nommer une police précise, la plupart du temps non.
- Terminez par « aucun autre texte nulle part », sinon le modèle ajoutera un sous-titre plausible que vous n'avez pas demandé.
Une affiche de voyage vintage pour Lisbonne avec le mot LISBOA en lettres art
déco
Illustration d'affiche de voyage des années 1930, style sérigraphie plate avec
décalages de repérage visibles. Un tram crème grimpant une rue pastel en pente,
l'estuaire du Tage derrière lui en trois bleus plats. Une seule ligne de texte :
le mot « LISBOA » en capitales Art déco géométriques et hautes en travers du
quart inférieur, ocre profond sur crème, interlettrage généreux. Aucun autre
texte nulle part dans l'image.
Maintenant la partie impopulaire. La plupart des textes dans l'image ne devraient pas être dans l'image. Si les mots devront un jour changer, être traduits, être sélectionnés, être lus par un lecteur d'écran ou être corrigés après passage du juridique, générez l'illustration propre et composez le texte en HTML, dans Figma ou dans votre moteur de templates. Cuire un titre dans des pixels parce qu'un modèle sait le faire est une décision que vous paierez à la première révision de copy. Demandez du texte rendu quand la typographie fait vraiment partie de l'illustration — une affiche, une devanture peinte, un dos de livre dans une nature morte — et sautez-le sinon.
Ça a un tranchant plus net pour tout ce qui a une forme de donnée. Un modèle qui rend du texte plausible rend aussi des chiffres plausibles et des noms de lieux plausibles, ce qui va très bien sur une affiche et devient catastrophique sur un graphique ou une carte. Nous avons détaillé exactement pourquoi dans pourquoi les générateurs d'images IA sont si mauvais en cartes.
Des templates à garder
Quatre squelettes qui couvrent l'essentiel de ce que les gens génèrent vraiment. Remplissez les crochets, supprimez ce qui ne s'applique pas, gardez la ligne d'exclusions.
Sujet propre sur fond uni, pour composition :
[Médium : photographie produit macro / nature morte de studio] d'un seul [sujet
avec un détail de matière précis], centré sur un fond [couleur] sans raccord.
[Source de lumière et taille] venant de [direction], une ombre tombant vers
[direction]. Aucun texte, aucun logo, aucun accessoire, aucune main, aucun
détail d'arrière-plan.
Scène éditoriale avec espace pour le texte :
[Médium] de [sujet en train de faire une chose précise], [décor]. [Lumière :
direction, qualité, température de couleur]. Prise depuis [hauteur et distance
de caméra], [cadrage], [profondeur de champ]. [Sujet] sur le tiers
[gauche/droit], [surface ou ciel] vide en travers de [zone] pour le texte.
Aucun texte, aucun logo.
Une édition qui change une seule chose :
Changer [élément] de [état actuel] à [état visé]. Garder identiques [les deux ou
trois propriétés de cet élément qui doivent survivre]. Tout le reste du cadre
est inchangé : même [lister les parties les plus exposées].
Illustration avec une seule ligne de texte, palier Pro :
[Style et époque d'illustration], [détail de technique]. [Scène décrite en deux
phrases]. Une seule ligne de texte : le mot « [MOT] » en [description des formes
de lettres], [couleur] sur [couleur], positionné [où]. Aucun autre texte nulle
part dans l'image.
Quand le prompt n'est pas le problème
À un moment, le prompt va bien et c'est le pipeline qui pose problème : retries, seeds, mise en file, stockage de la sortie avant expiration de l'URL. C'est une autre discipline et nous l'avons écrite dans comment générer des images automatiquement à grand volume. Et si l'écart que vous cherchez à combler porte spécifiquement sur la crédibilité photographique plutôt que sur le suivi d'instructions, la checklist pour ça vit dans notre guide du générateur d'images IA le plus réaliste.
Chaque modèle publie sa liste exacte de paramètres — le jeu complet d'aspect ratios, les valeurs par défaut, ce qu'il refuse — sous forme de spec lisible par machine, comme le fichier de spec de Nano Banana 2 Lite. Lisez-la avant de réécrire un prompt qui s'est mis à mal se comporter après un changement de modèle. Neuf fois sur dix le prompt allait bien et c'est une valeur par défaut qui a bougé sous lui. Il y a un fichier de spec derrière chaque modèle de la catégorie text-to-image, et derrière tout le reste de ce que nous opérons.
Questions fréquentes
Comment structurer un prompt Nano Banana ?
Le médium d'abord, puis le sujet, puis la lumière, puis le cadrage, puis une liste d'exclusions. Nommer le médium dans les premiers mots contraint toutes les décisions qui suivent, et décrire la lumière explicitement fait plus pour le résultat que n'importe quelle quantité d'adjectifs de qualité. Terminez par ce qui ne doit pas apparaître — « aucun texte, aucun logo, aucun accessoire » — parce que ces modèles remplissent l'espace non spécifié au lieu de le laisser vide.
Les mots de qualité comme « 8k » et « chef-d'œuvre » aident-ils sur Nano Banana ?
Non. Ces tokens viennent de modèles de diffusion open-weight antérieurs, où ils orientaient la sortie vers un sous-ensemble particulier des données d'entraînement. Les modèles de génération Gemini n'y réagissent pas, et ils consomment un budget de prompt qui serait mieux dépensé sur la direction de la lumière, la position de caméra ou les exclusions.
Quelle longueur peut faire un prompt Nano Banana ?
Nano Banana 2 Lite accepte jusqu'à 32 000 caractères, Nano Banana 2 jusqu'à 20 000, et Nano Banana Pro jusqu'à 50 000. Ce sont des plafonds durs, pas des cibles. Lite en particulier se dégrade sur les longs prompts bien avant d'atteindre sa limite, parce qu'il a tendance à garder les propositions d'ouverture et de clôture et à laisser tomber le milieu.
Pourquoi mes images sortent-elles à la mauvaise forme quand je change de modèle ?
Parce que l'aspect ratio par défaut diffère selon le palier. Nano Banana, Nano Banana 2 et Nano Banana Pro sont par défaut en 9:16 sur notre API, tandis que Nano Banana 2 Lite est par défaut en 1:1. Une requête qui ne fixe jamais aspect_ratio changera donc de forme quand vous passez de l'un à l'autre. Fixez-la explicitement à chaque appel.
Comment écrire un prompt d'édition pour Nano Banana ?
Écrivez le delta, pas la scène. Nommez la seule chose qui change, nommez ses propriétés qui doivent survivre, puis déclarez que tout le reste est inchangé et listez les éléments les plus exposés — visage, pose, éclairage, cadrage. Redécrire le médium, l'objectif ou l'ambiance dans un prompt d'édition, c'est ce qui provoque les changements involontaires ailleurs dans l'image.
Quel modèle Nano Banana sait rendre du texte lisible dans une image ?
Nano Banana 2 et Nano Banana Pro le savent, parce que le texte lisible dans l'image est une capability de la génération Gemini 3. Nano Banana Pro est le choix fiable quand la typographie est le sujet, puisqu'il gère aussi le texte stylisé et multilingue. Le gemini-2.5-flash-image legacy ne sait pas rendre de texte lisible du tout.
Faut-il Nano Banana Pro pour un meilleur suivi de prompt ?
En général non. L'avantage de Pro, c'est de tenir un long brief compositionnel avec plusieurs relations spatiales, plus les images de référence séparées par rôle et un texte dans l'image fiable. Si votre prompt est un sujet unique en moins de soixante mots, Nano Banana 2 Lite à $0.0238 le suivra tout aussi fidèlement et vous le rendra plus vite.