Prompts schreiben, denen die Nano-Banana-Modelle folgen
Die meisten Prompting-Guides sind Listen von Adjektiven. Adjektive sind der Teil eines Prompts, der am wenigsten zählt.
Wir betreiben alle vier Nano-Banana-Modelle hinter einer API, und die Arten, auf die ein Prompt scheitert, sind konstant genug, um sie aufzuschreiben. Vierzig Wörter für Qualitätsadjektive und zwei fürs Licht. Ein kompositorisches Briefing in Pro-Länge, abgefeuert auf die günstigste Stufe. Ein Edit-Request, der die ganze Szene noch einmal beschreibt und als anderes Bild zurückkommt. Nichts davon sind Modellprobleme. Es sind Schreibprobleme, und Schreibprobleme lassen sich beheben.

Medium, Motiv, Licht, Bildausschnitt — in dieser Reihenfolge
Ein Prompt wird als Ganzes gelesen, aber die frühen Teilsätze leisten mehr als die späten. Sie stecken den Raum ab, in dem der Rest des Satzes leben muss. Fangen Sie mit „eine schöne Frau“ an, und das Modell muss raten, ob es ein Foto, ein Ölgemälde oder ein 3D-Render macht — und es rät aus dem, was Ihre übrigen Wörter statistisch nahelegen. Fangen Sie mit „redaktionelles 35-mm-Foto“ an, und jede folgende Entscheidung ist bereits auf ein Medium eingeschränkt.
Also die Reihenfolge:
- Medium. Die größte Verzweigung im Baum. Foto, isometrisches Render, flache Vektorillustration, Gouache-Malerei, Makro-Produktaufnahme. Wählen Sie eines und nennen Sie es in den ersten vier Wörtern.
- Motiv. Nicht die Kategorie — das konkrete Ding. „Eine Frau an einem Cafétisch“ ist ein Stockfoto. „Eine Frau Mitte fünfzig, beide Hände um eine weiße Tasse“ ist ein Bild.
- Licht. Richtung, Qualität, Farbe. Dieser eine Satz bewegt das Ergebnis mehr als jeder andere, und fast niemand schreibt ihn.
- Bildausschnitt. Kamerahöhe, Abstand, Anschnitt, Schärfentiefe und wohin der leere Raum kommt.
Hier derselbe Auftrag, einmal schlecht und einmal richtig geschrieben.
Eine schöne Frau in einem Café, sehr detailliert, 8k, Meisterwerk,
trending on artstation, ultrarealistisch, professionelle Fotografie,
preisgekrönt, gestochen scharf, Bokeh
Redaktionelles 35-mm-Foto. Eine Frau Mitte fünfzig sitzt allein an einem
Marmortisch im Café, beide Hände um eine weiße Tasse, der Blick nach links
aus dem Bild. Tiefe Wintersonne durch das Fenster hinter ihr, die ihr Haar
umrandet und die Straße draußen weiß ausbrennt. Vom Nachbartisch aus auf
Augenhöhe im Sitzen aufgenommen, Halbfigur, geringe Schärfentiefe, der
Hintergrund fällt in weiches Grau ab.
Was sich geändert hat: Das Medium ist nach vorn gerückt, das Motiv hat eine konkrete Geste bekommen, das Licht eine Richtung und eine Temperatur, die Kamera eine Position. Über Qualität wurde nichts ergänzt. Der zweite Prompt ist nicht detaillierter im vagen Sinn — er ist entschiedener.
Und hören Sie auf, „sehr detailliert, 8k, Meisterwerk“ zu schreiben. Auf diesen Modellen tut das nichts. Diese Tokens sind Frachtgut aus der Stable-Diffusion-Prompt-Kultur von 2022, wo sie ein viel kleineres Modell in eine bestimmte Ecke seiner Trainingsdaten schubsten. Modelle der Gemini-Generation reagieren nicht darauf, und jedes einzelne davon ist Budget, das Sie hätten ausgeben können, um zu beschreiben, woher das Licht kommt.

Der leere Raum wird gefüllt, wenn Sie ihn nicht beanspruchen
Diese Modelle lassen nichts weg. Wenn Sie eine Tasse beschreiben und nichts darüber sagen, was sie umgibt, enthält das Bild trotzdem eine Umgebung — und zwar die, die ein Tassenfoto üblicherweise enthält: ein Holztisch, eine Leinenserviette, ein Zweig von irgendetwas, ein weichgezeichnetes Fenster und in ungefähr vierzig Prozent der Fälle ein Wort, das auf der Tasse steht.
Das ist die mit Abstand häufigste Beschwerde, die uns erreicht, und es ist kein Qualitätsproblem. Niemand hat es verboten.
Eine Keramiktasse auf einem Tisch, Produktaufnahme
Makro-Produktfoto einer einzelnen unglasierten Steinzeugtasse, matter
haferfarbener Korpus, vom Daumen abgegriffener Henkel, exakt mittig auf
einem nahtlosen mittelgrauen Hintergrundverlauf. Große weiche Quelle von
oben links, ein sanfter Schatten fällt nach unten rechts. Kein Text auf der
Tasse, kein Logo, keine weiteren Objekte, keine Hände, keine Requisiten,
kein Hintergrunddetail.
Der letzte Satz dieser Überarbeitung leistet mehr als die ersten drei zusammen. Schreiben Sie die Ausschlüsse als schlichte Liste ans Ende des Prompts, im selben Register wie den Rest. „Kein Text, keine Logos, keine Personen, kein Krimskrams“ ist oft die wertvollste Zeile in der Datei — und bei jedem Bild, hinter dem später echte Typografie sitzen soll, ist sie nicht optional.
Für alles, was Sie zu composen planen, zählt das noch mehr. Ein generierter Hintergrund mit einem erfundenen Rosmarinzweig darin ist ein Hintergrund, den Sie maskieren müssen.

Schreiben Sie für die Stufe, die Sie tatsächlich aufrufen
Die vier Modelle nehmen unterschiedlich viel Prompt, und sie wollen unterschiedliche Formen von Prompt. Die Decken liegen nicht dort, wo man sie vermutet:
| Modell | Prompt-Decke | Was es will |
|---|---|---|
| Nano Banana 2 Lite | 32.000 Zeichen | Kurz, ein Motiv, flache Satzstruktur |
| Nano Banana 2 | 20.000 Zeichen | Mittlere Länge, hält zwei bis drei verwandte Elemente |
| Nano Banana Pro | 50.000 Zeichen | Lange kompositorische Briefings mit räumlichen Beziehungen |
| Nano Banana (legacy) | — | Endet am 2. Oktober 2026; migrieren statt tunen |
Nano Banana 2 hat die niedrigste Decke der drei aktuellen Stufen, obwohl es beim Preis in der Mitte sitzt. Das überrascht beim ersten Mal jeden.
Die Decken sind aber nicht die eigentliche Einschränkung. Lite ist ein Lite-Modell, und lange Prompts scheitern darauf auf eine bestimmte Weise: Es behält den ersten und den letzten Teilsatz und lässt die Mitte still fallen. Verschachtelte Bedingungen („ein Raum mit einem Tisch, auf dem eine Schale mit drei Birnen steht, von denen eine eine Druckstelle hat“) kommen ohne jede Birne zurück. Schreiben Sie für Lite flache Sätze. Ein Motiv, ein Ort, eine Lichtquelle, eine Ausschlussliste.
Ein isometrisches 3D-Render eines modernen Großraumbüros zur goldenen Stunde
mit vierzehn unterscheidbaren Mitarbeitenden an Stehschreibtischen, einem
verglasten Besprechungsraum links mit einem Whiteboard, Geigenfeigen in
Töpfen in den Ecken, einer Kaffeebar an der Rückwand mit einem Barista,
offenen Lüftungsrohren darüber, polierten Betonböden, in denen sich die
Fenster spiegeln, und einer schlafenden Katze auf dem dritten Schreibtisch
von vorn
Isometrisches 3D-Render eines Großraumbüros zur goldenen Stunde. Reihen von
Stehschreibtischen, links ein verglaster Besprechungsraum, hohe Fenster
werfen langes warmes Licht über einen polierten Betonboden. Gedämpfte
Palette, klare Geometrie. Kein Text, keine Beschilderung, keine Personen.
Der erste Prompt ist nicht falsch. Er ist falsch für Lite. Schicken Sie ihn an Pro, und die vierzehn Mitarbeitenden, die Lüftungsrohre und die Katze kommen alle an. Schicken Sie ihn an Lite, bekommen Sie ein Büro, ein Fenster und eine Rechnung über $0.0238.
Was in der Gegenrichtung die nützliche Version des Rats ist: Wenn Ihr Prompt unter sechzig Wörtern liegt und ein Motiv enthält, kauft Pro Ihnen nichts außer dreißig Sekunden Warten und ungefähr dem Dreifachen an Kosten. Das meiste, was Leute generieren, ist Lite-Arbeit. Uns ist lieber, Ihnen das zu sagen, als Ihnen die Spitzenstufe für einen Platzhalter-Hintergrund zu verkaufen. Die vollständige Aufschlüsselung, welche Stufe für welche Aufgabe, haben wir separat geschrieben: unser Vierer-Vergleich der Nano-Banana-Modelle.
Aspect Ratio ist eine Kompositionsanweisung, kein Zuschnitt
Entscheiden Sie die Form, bevor Sie den Satz schreiben, denn die Form verändert, was der Satz sagen sollte. Ein 21:9-Banner will einen Horizont und ein aus der Mitte gerücktes Motiv. Eine 9:16-Story will einen vertikalen Aufbau und Luft nach oben. Wenn Sie einen Prompt für ein Quadrat schreiben und ihn breit rendern, bekommen Sie eine quadratische Komposition mit Füllung an beiden Seiten, und genau so sieht es dann auch aus.
Sprechen Sie die Komposition im Prompt aus. „Horizont im unteren Drittel, Motiv im rechten Drittel, leerer Himmel über der linken oberen Hälfte für Text“ ist eine echte Anweisung, und diese Modelle folgen ihr gut.
Und dann gibt es die Falle, die Leuten einen ganzen Asset-Batch kostet. Die Default-Aspect-Ratio ist über die Stufen hinweg nicht dieselbe. Bei Nano Banana, Nano Banana 2 und Nano Banana Pro ist unser Default 9:16. Bei Nano Banana 2 Lite ist er 1:1. Eine Konfiguration, die aspect_ratio nie pinnt, produziert also auf drei Modellen Hochformat und auf dem vierten Quadrate — und wenn Sie zum Sparen die Stufe wechseln, ändert sich die Form Ihrer Ausgabe still unter Ihnen.
Pinnen Sie ihn. Immer, bei jedem Call, auch wenn der Default zufällig das ist, was Sie wollen:
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-2-lite/text-to-image",
"input": {
"prompt": "Weites Landschaftsfoto eines Granitgrats unter flachem bedecktem Licht, Horizont im unteren Drittel, die Gratlinie tritt von rechts ins Bild, leerer blasser Himmel über der linken oberen Hälfte. Kein Text, keine Personen, keine Bauwerke.",
"aspect_ratio": "21:9"
}
}'
Noch ein Grund, seine Stufe zu kennen: Lite trägt vier Aspect Ratios, die sonst nichts in unserem Katalog hat — 1:4, 4:1, 1:8 und 8:1. Die sind wirklich nützlich und werden wirklich zu wenig benutzt. Eine seitenbreite Header-Leiste oder ein hohes Sidebar-Element in 8:1 gerendert schlägt es, ein 16:9 zu erzeugen und 80 % davon wegzuschneiden — in der Komposition und in dem, was Sie für die weggeworfenen Pixel bezahlt haben.

Editieren ist ein anderes Können: Schreiben Sie das Delta
Hier fallen die erfahrensten Prompt-Schreiber am tiefsten zurück, denn der Instinkt aus text-to-image sagt: Beschreib das Bild, das du willst. In einem Edit-Call haben Sie das Bild schon. Es noch einmal zu beschreiben konkurriert damit.
Ein Edit-Prompt hat zwei Aufgaben: benennen, was sich ändert, und benennen, was nicht. Mehr gehört da nicht hinein.
Eine Frau Mitte fünfzig an einem Marmortisch im Café bei tiefem Winterlicht,
sie trägt einen roten Mantel statt eines blauen, gleiches Gesicht, gleiche
Pose, redaktionelles Foto, 35 mm, geringe Schärfentiefe, warme Töne
Ändere den Mantel von Marineblau zu tiefem Ziegelrot. Halte Stoffgewicht,
Kragenform und Fall identisch. Alles andere im Bild bleibt unverändert:
gleiches Gesicht, gleicher Ausdruck, gleiche Hände, gleiche Tasse, gleiches
Fensterlicht, gleicher Anschnitt.
Die erste Version legt Medium, Objektiv und Tonalität erneut fest, und jede dieser Neufestlegungen ist eine frische Anweisung, auf die das Modell reagieren kann. So bekommt man ein subtil anderes Gesicht. Die zweite Version fasst eine Sache an und friert den Rest ausdrücklich ein.
Zwei mechanische Fakten, die Sie kennen sollten, bevor Sie eine Editier-Pipeline bauen. Die Zahl der Referenzen unterscheidet sich nach Stufe: Das Legacy-Modell nimmt drei Bilder, der Edit-Endpoint von Nano Banana 2 nimmt vierzehn, und der von Nano Banana Pro nimmt ebenfalls vierzehn, trennt sie aber nach Rollen — bis zu fünf Charakterbilder für Identität, sechs Objektbilder für Produkttreue, drei Stilreferenzen. Diese Rollentrennung ist der Grund, warum Pro ein vollständiges Anzeigen-Composing in einem einzigen Request zusammensetzen kann, und sie ist ein eigenes Thema; wir behandeln es in eine Figur über Nano-Banana-Generierungen hinweg konsistent halten.
Text im Bild, und wann er sich nicht lohnt
Lesbare Wörter im Bild kamen mit der Gemini-3-Generation. Das Legacy-gemini-2.5-flash-image kann es nicht — ein einzelnes Wort überlebt manchmal, ein Satz nie. Für alles mit echter Typografie darin wollen Sie Nano Banana 2, und für alles, wo die Typografie der Punkt ist, wollen Sie Pro, das gestalteten und mehrsprachigen Text gut genug rendert, dass Sie ihm eine englische Infografik geben und die spanische Fassung mit intakter Grafik zurückbekommen.
Wenn Sie Text anfordern, ziehen die Regeln an:
- Setzen Sie die Wörter in Anführungszeichen, exakt so, wie sie erscheinen sollen.
- Sagen Sie, wie viele Wörter es sind und wo sie im Bild sitzen.
- Beschreiben Sie die Buchstabenformen als Stil, nicht als Schriftname. „Hohe geometrische Art-déco-Versalien, großzügige Laufweite“ funktioniert. Eine konkrete Schrift zu nennen meistens nicht.
- Schließen Sie mit „sonst nirgendwo Text“, sonst ergänzt das Modell eine plausible Unterzeile, die Sie nicht bestellt haben.
Ein Vintage-Reiseplakat für Lissabon mit dem Wort LISBOA in Art-déco-Lettern
Illustriertes Vintage-Reiseplakat der 1930er, flacher Siebdruckstil mit
sichtbaren Passerverschiebungen. Eine cremefarbene Straßenbahn erklimmt eine
steile Straße in Pastelltönen, dahinter die Tejo-Mündung in drei flachen
Blautönen. Nur eine Textzeile: das Wort „LISBOA“ in hohen geometrischen
Art-déco-Versalien über dem unteren Viertel, tiefes Ocker auf Creme,
großzügige Laufweite. Sonst nirgendwo Text im Bild.
Jetzt der unpopuläre Teil. Der meiste Text im Bild sollte nicht im Bild sein. Wenn die Wörter jemals geändert, übersetzt, markiert, von einem Screenreader gelesen oder nach dem Blick der Rechtsabteilung korrigiert werden müssen, generieren Sie die Grafik sauber und setzen die Schrift in HTML, Figma oder Ihrer Template-Engine. Eine Headline in Pixel einzubacken, weil ein Modell das kann, ist eine Entscheidung, für die Sie bei der ersten Textkorrektur zahlen. Fordern Sie gerenderten Text an, wenn die Schrift wirklich Teil der Grafik ist — ein Plakat, eine gemalte Ladenfront, ein Buchrücken im Stillleben — und lassen Sie es sonst.
Für alles Datenförmige hat das eine schärfere Kante. Ein Modell, das plausiblen Text rendert, rendert auch plausible Zahlen und plausible Ortsnamen, was auf einem Plakat in Ordnung und auf einem Diagramm oder einer Karte katastrophal ist. Warum genau, haben wir in warum KI-Bildgeneratoren so schlecht in Karten sind auseinandergenommen.
Vorlagen, die es zu behalten lohnt
Vier Skelette, die das meiste abdecken, was tatsächlich generiert wird. Klammern füllen, Unpassendes löschen, die Ausschlusszeile behalten.
Sauberes Motiv auf schlichtem Grund, fürs Composing:
[Medium: Makro-Produktfoto / Studio-Stillleben] eines einzelnen [Motiv mit
einem konkreten Materialdetail], zentriert auf einem nahtlosen Verlauf in
[Farbe]. [Lichtquelle und Größe] von [Richtung], ein Schatten fällt nach
[Richtung]. Kein Text, kein Logo, keine Requisiten, keine Hände, kein
Hintergrunddetail.
Redaktionelle Szene mit Platz für Text:
[Medium] von [Motiv, das eine konkrete Sache tut], [Ort]. [Licht: Richtung,
Qualität, Farbtemperatur]. Aufgenommen aus [Kamerahöhe und Abstand],
[Anschnitt], [Schärfentiefe]. [Motiv] im [linken/rechten] Drittel, leere
[Fläche oder Himmel] über [Bereich] für Text. Kein Text, keine Logos.
Ein Edit, der eine Sache ändert:
Ändere [Element] von [aktueller Zustand] zu [Zielzustand]. Halte [die zwei
oder drei Eigenschaften dieses Elements, die überleben müssen] identisch.
Alles andere im Bild bleibt unverändert: gleiche [Teile aufzählen, die am
meisten gefährdet sind].
Illustration mit einer Textzeile, Pro-Stufe:
[Illustrationsstil und Epoche], [technisches Detail]. [Szene in zwei Sätzen
beschrieben]. Nur eine Textzeile: das Wort „[WORT]“ in [Beschreibung der
Buchstabenformen], [Farbe] auf [Farbe], positioniert [wo]. Sonst nirgendwo
Text im Bild.
Wenn das Prompten nicht das Problem ist
Irgendwann ist der Prompt in Ordnung und die Pipeline ist das Problem: Retries, Seeds, Queueing, den Output speichern, bevor die URL abläuft. Das ist eine andere Disziplin, und wir haben sie in Bildgenerierung in Menge automatisieren aufgeschrieben. Und wenn die Lücke, die Sie schließen wollen, speziell die fotografische Glaubwürdigkeit ist und nicht das Befolgen von Anweisungen, wohnt die Checkliste dafür in unserem Leitfaden zum realistischsten KI-Bildgenerator.
Jedes Modell veröffentlicht seine exakte Parameterliste — den vollständigen Satz an Aspect Ratios, die Defaults, was es verweigert — als maschinenlesbare Spec, etwa die Spec-Datei von Nano Banana 2 Lite. Lesen Sie die, bevor Sie einen Prompt umschreiben, der nach einem Modellwechsel angefangen hat, sich danebenzubenehmen. In neun von zehn Fällen war der Prompt in Ordnung und ein Default hat sich darunter verschoben. Hinter jedem Modell in der Kategorie text-to-image steht eine Spec-Datei, und hinter allem anderen, was wir betreiben, auch.
Häufig gestellte Fragen
Wie sollte ich einen Nano-Banana-Prompt aufbauen?
Zuerst das Medium, dann das Motiv, dann das Licht, dann der Bildausschnitt, dann eine Liste der Ausschlüsse. Das Medium in den ersten Wörtern zu nennen schränkt jede folgende Entscheidung ein, und das Licht ausdrücklich zu beschreiben bringt fürs Ergebnis mehr als jede Menge Qualitätsadjektive. Schließen Sie mit dem, was nicht erscheinen darf — „kein Text, keine Logos, keine Requisiten“ — denn diese Modelle füllen unbestimmten Raum, statt ihn leer zu lassen.
Helfen Qualitätswörter wie „8k“ und „Meisterwerk“ bei Nano Banana?
Nein. Diese Tokens stammen aus früheren Open-Weight-Diffusionsmodellen, wo sie die Ausgabe in einen bestimmten Ausschnitt der Trainingsdaten lenkten. Modelle der Gemini-Generation reagieren nicht darauf, und sie verbrauchen Prompt-Budget, das bei Lichtrichtung, Kameraposition oder Ausschlüssen besser aufgehoben wäre.
Wie lang darf ein Nano-Banana-Prompt sein?
Nano Banana 2 Lite nimmt bis zu 32.000 Zeichen, Nano Banana 2 bis 20.000 und Nano Banana Pro bis 50.000. Das sind harte Decken, keine Zielwerte. Besonders Lite wird bei langen Prompts deutlich vor seinem Limit schlechter, weil es dazu neigt, den Anfangs- und den Schlussteil zu behalten und die Mitte fallen zu lassen.
Warum kommen meine Bilder in der falschen Form heraus, wenn ich das Modell wechsle?
Weil die Default-Aspect-Ratio je nach Stufe unterschiedlich ist. Nano Banana, Nano Banana 2 und Nano Banana Pro stehen auf unserer API per Default auf 9:16, Nano Banana 2 Lite dagegen auf 1:1. Ein Request, der aspect_ratio nie setzt, ändert deshalb seine Form, wenn Sie zwischen diesen Modellen wechseln. Setzen Sie ihn bei jedem Call explizit.
Wie schreibe ich einen Editier-Prompt für Nano Banana?
Schreiben Sie das Delta, nicht die Szene. Benennen Sie die eine Sache, die sich ändert, benennen Sie deren Eigenschaften, die überleben müssen, und stellen Sie dann fest, dass alles andere unverändert bleibt — mit einer Aufzählung der am stärksten gefährdeten Elemente: Gesicht, Pose, Licht, Anschnitt. Medium, Objektiv oder Stimmung in einem Edit-Prompt erneut zu beschreiben ist genau das, was unbeabsichtigte Änderungen an anderer Stelle im Bild auslöst.
Welches Nano-Banana-Modell kann lesbaren Text im Bild rendern?
Nano Banana 2 und Nano Banana Pro können es, denn lesbarer Text im Bild ist eine Capability der Gemini-3-Generation. Nano Banana Pro ist die verlässliche Wahl, wenn die Typografie der Punkt ist, weil es auch gestalteten und mehrsprachigen Text beherrscht. Das Legacy-gemini-2.5-flash-image kann lesbaren Text überhaupt nicht.
Brauche ich Nano Banana Pro, damit Prompts besser befolgt werden?
Meistens nicht. Pros Vorteil ist, ein langes kompositorisches Briefing mit mehreren räumlichen Beziehungen zu halten, dazu rollengetrennte Referenzbilder und verlässlicher Text im Bild. Wenn Ihr Prompt ein einzelnes Motiv in unter sechzig Wörtern ist, folgt Nano Banana 2 Lite zu $0.0238 ihm genauso treu und liefert schneller.