Konsistente Bildgenerierung mit der Nano-Banana-API
Ein gutes Bild zu erzeugen ist nahezu gelöst. Das zwanzigste zu erzeugen, das noch zu den ersten neunzehn gehört, ist die Stelle, an der Projekte sterben.
Die Lücke ist keine Frage des Prompt-Könnens. Sie besteht darin, dass „Konsistenz“ drei verschiedene Engineering-Probleme sind, die ein einziges Wort tragen — und die Technik, die eines löst, tut für die anderen beiden nichts. Wir betreiben die Nano-Banana-Modelle auf unserer API, und das ist der Request, den die Leute am häufigsten falsch stellen. Nicht weil die Modelle es nicht könnten, sondern weil die Referenzen unbeschriftet hineingehen und das Modell raten muss, wofür jede einzelne da war.

Drei Probleme, nicht eins
Trennen Sie die, bevor Sie einen Prompt schreiben. Sie scheitern unterschiedlich und sie kosten unterschiedlich.
Charakterkonsistenz. Dieselbe Person über viele Frames — gleiches Gesicht, gleiche Statur, gleiches Haar, als eine Person erkennbar, ob sie in Frame vier sitzt oder in Frame neunzehn geht. Ein Identitätsproblem: Das Modell muss ein Gesicht durch Kompositionen tragen, die es nie gesehen hat.
Produkttreue. Nicht eine ähnliche Flasche. Diese Flasche. Exakte Verschlussproportion, Etikettenplatzierung, Grünton. Treue ist strenger als Identität — ein Gesicht hat Toleranz, die Verpackung eines Kunden nicht.
Stilkonsistenz. Die Serie liest sich als eine Serie — gleiche Farbstimmung, gleicher Objektivcharakter, gleiche Lichtqualität, gleiches Korn. Kein Objekt muss sich wiederholen; die Behandlung muss es.
Die meisten Briefings brauchen zwei davon gleichzeitig und fragen sie als eine Anweisung ab. „Mach es konsistent“ ist kein Auftrag, auf den eine API reagieren kann. „Bild 1 ist die Person, Bild 2 ist die Flasche, Bild 3 ist ausschließlich Farbstimmung“ schon.
Die Rollentrennung ist das eigentliche Feature
Nano Banana Pro nimmt bis zu 14 Referenzbilder. Nano Banana 2 auch, zu fast dem halben Preis. Die Zahl ist nicht der Unterschied. Pro teilt dieses Budget nach Rollen auf:
| Rolle | Budget | Was sie hält |
|---|---|---|
| Charakter | bis zu 5 | Identitätsreferenzen für eine Person oder Figur |
| Objekt | bis zu 6 | Produkte, Requisiten, Verpackungen in hoher Treue |
| Stil | bis zu 3 | Ausschließlich Farbstimmung, Lichtstimmung, Behandlung |
Vierzehn insgesamt, aber zugewiesen. Die Zuweisung ist es, die aus einem Referenzbild statt eines Vorschlags eine Anweisung macht.
Denken Sie daran, was ohne sie passiert. Sie geben einem Modell vierzehn Bilder und einen Satz, und es schließt aus der Prosa, welches Bild ein zu erhaltendes Gesicht ist, welches ein exakt zu reproduzierendes Produkt und welches nur für die Stimmung dabei ist. Es schließt oft falsch. Das Verräterzeichen ist ein Produkt, das „im Stil von“ Ihrer Verpackung herauskam statt als Ihre Verpackung — oder ein Gesicht, das die Farbstimmung des Moodboards trägt.
Mit der Trennung fragen Sie nicht, Sie erklären. Fünf Slots für wer, sechs für was, drei für wie es aussieht. Ein Anzeigen-Composing in einem einzigen Request statt drei Runden Composing.
Pro kostet $0.075 pro Request zu unserem Preis vom 26. August 2026, gegen einen Listenpreis von $0.15. Noch etwas, das man wissen sollte: 1K und 2K kosten bei Pro dasselbe. Nehmen Sie für Hero-Assets die 2K. Sie sind geschenkt.

Referenzen im Prompt beschriften
Die Rollentrennung leistet die strukturelle Arbeit. Der Prompt leistet die semantische, und er muss auf eine Weise ausdrücklich sein, die sich fast unhöflich anfühlt. Referenzen kommen in Reihenfolge an, benennen Sie sie also nach Position und sagen Sie, wofür jede da ist — einschließlich dessen, wofür sie nicht da ist. An dieser letzten Stelle lecken die meisten Prompts.
Bild 1 und Bild 2 zeigen dieselbe Frau — erhalte ihr Gesicht, ihre Haarlänge
und ihre Statur exakt. Bild 3 ist das Produkt: reproduziere Flaschenform,
Verschlussproportion und Etikettengrafik präzise, gestalte sie nicht um.
Bild 4 ist ausschließlich Farbstimmung und Lichtstimmung — übernimm daraus
kein Objekt, keine Pose und keine Komposition.
Setze die Frau aus Bild 1 und 2 mit der Flasche aus Bild 3 in die Hand, an
einen Cafétisch am Fenster, Dreiviertelansicht, warmes Nachmittagslicht
passend zur Stimmung aus Bild 4.
Vier Dinge lassen diesen Prompt funktionieren, und keines davon ist ein fünftes Adjektiv:
- Jede Referenz ist verbucht. Kein Bild geht ohne genannte Aufgabe hinein.
- Die Stilreferenz trägt einen ausdrücklichen Ausschluss. Ohne ihn leckt ein Moodboard seine Möbel in Ihre Szene.
- Die Identitätswörter sind konkret — Gesicht, Haarlänge, Statur — und nicht „sieht aus wie sie“.
- Die Produktanweisung sagt „gestalte sie nicht um“, und dieser Halbsatz trennt Treue von Inspiration.
Den allgemeinen Aufbau von Prompts behandeln wir hier nicht; das ist der Prompting-Guide. Hier geht es speziell darum, dem Modell zu sagen, wofür Ihre Referenzen da sind.
Der Request
Konsistenzarbeit ist Editieren, nicht Generieren, sie geht also an den edit-image-Slug mit image_urls.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-pro/edit-image",
"input": {
"prompt": "Bild 1 und Bild 2 zeigen dieselbe Frau - erhalte ihr Gesicht, ihre Haarlänge und ihre Statur exakt. Bild 3 ist das Produkt: reproduziere Flaschenform, Verschlussproportion und Etikettengrafik präzise, gestalte sie nicht um. Bild 4 ist ausschließlich Farbstimmung und Lichtstimmung, übernimm daraus kein Objekt und keine Komposition. Setze die Frau mit der Flasche in der Hand an einen Cafétisch am Fenster, Dreiviertelansicht, warmes Nachmittagslicht.",
"image_urls": [
"https://cdn.example.com/refs/model-face-front.jpg",
"https://cdn.example.com/refs/model-face-three-quarter.jpg",
"https://cdn.example.com/refs/bottle-front.jpg",
"https://cdn.example.com/refs/grade-warm-afternoon.jpg"
],
"aspect_ratio": "4:5",
"resolution": "2K"
}
}'
Der Submit gibt eine Job-ID zurück; pollen Sie sie oder übergeben Sie webhookUrl. Pro braucht rund 30 Sekunden, weil es beim Komponieren Zwischenbilder erzeugt — Google gibt die nicht zurück und wir berechnen sie nicht. Setzen Sie aspect_ratio explizit, denn Pro steht per Default auf 9:16. Den vollständigen Durchgang durch die Parameter finden Sie im Tutorial zur Nano Banana Pro API.
Wo die günstigeren Stufen landen
Uns ist lieber, Sie eine Stufe herunterzureden, als Ihnen Pro für eine Aufgabe zu verkaufen, die es nicht braucht.
Nano Banana 2 nimmt dieselben 14 Referenzen zu $0.04, ohne die Rollentrennung. Für Stilkonsistenz ist das wirklich in Ordnung, denn dort tut jede Referenz dieselbe Arbeit und es gibt nichts zu unterscheiden. Sechs Blog-Header, die sich eine Palette und eine Lichtstimmung teilen, brauchen kein Pro. Sie brauchen eine gute Stilreferenz und ein eingefrorenes Prompt-Template. Nano Banana 2 reicht außerdem bis 4K, was Lite überhaupt nicht kann.
Nano Banana 2 Lite kostet $0.0238 und ist für Volumen gebaut, nicht für Treue. Greifen Sie danach, wenn Sie vierhundert Bilder brauchen, die einen Look teilen, und keines davon das Gesicht oder die Verpackung eines Kunden trägt. Es kann nur 1K und hat keinen resolution-Parameter — einen zu schicken ist ein Fehler, kein No-op.
Das Legacy-Nano Banana endet bei 3 Referenzbildern, was nicht reicht, um Charakter und Produkt im selben Bild zu haben, und Google schaltet es am 2. Oktober 2026 ab — die ganze Geschichte zu diesem Modell ist ein eigener Text. Fangen Sie darauf kein Konsistenzprojekt an.
Grobe Regel: Reine Stilarbeit geht an Nano Banana 2 oder Lite. Alles, wo ein bestimmtes menschliches Gesicht oder ein bestimmtes physisches Produkt unversehrt überleben muss, geht an Pro. Die Preislücke zwischen $0.04 und $0.075 hört in dem Moment auf zu zählen, in dem ein Kunde einen Batch ablehnt, weil das Etikett falsch war.
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Legen Sie einmal einen kanonischen Referenzsatz an
Die Gewohnheit, die sich hier am schnellsten bezahlt macht, hat mit der API nichts zu tun.
Bauen Sie den Referenzsatz einmal, bewusst, und benutzen Sie ihn für immer wieder. Nicht „was an Fotos gerade herumlag“ — ein fester, versionierter, gespeicherter Satz, aus dem jeder Request schöpft. Für eine Figur: mehrere Winkel desselben Gesichts bei neutralem Licht, frontal, Dreiviertel, Profil, dazu eine Ganzkörperaufnahme für die Statur. Für ein Produkt: vorn, hinten, ein Detailausschnitt des Etiketts. Für den Stil: ein oder zwei Bilder, die die Farbstimmung tragen und nichts Ablenkendes.
Und dann frieren Sie ihn ein. Legen Sie die URLs an einem dauerhaften Ort ab — Ihrem eigenen Bucket, keinem temporären Link — und übergeben Sie dasselbe Array bei jedem Request über die Lebensdauer des Projekts.
Das zählt mehr als Prompt-Tuning, denn Drift ist kumulativ. Erzeugen Sie Frame 5 aus Frame 4 und Frame 6 aus Frame 5, dann summieren sich kleine Fehler, bis Frame 20 eine andere Person ist. Jeden Frame an denselben kanonischen Satz zu hängen heißt: Jede Generierung driftet einen Schritt vom Original weg, nie zwanzig. Ein Fächer, keine Kette.
Eine verwandte Gewohnheit: Wenn der Satz Bilder enthält, die Sie generiert haben, behalten Sie die Quelldateien. Auslieferungs-URLs laufen bei jeder Bild-API ab, laden Sie Ihre Assets also herunter und speichern Sie sie selbst — wie Generierung automatisch läuft hat die vollständige Schleife.
Erzeugen Sie ein Hero-Bild und leiten Sie die Varianten daraus ab
Der Workflow, der pro Dollar die meiste brauchbare Ausgabe liefert, heißt nicht „zwanzig Bilder erzeugen“. Er heißt „ein Bild zwanzigmal erzeugen“.
Machen Sie eine Hero-Aufnahme auf Pro und bringen Sie sie ins Ziel — Komposition, Licht, Gesicht, Produkt. Verbrennen Sie ein paar Versuche; zu $0.075 ist das Erkunden billig.
Dann hören Sie auf zu generieren und fangen an zu editieren. Geben Sie das abgenommene Hero-Bild als Referenz neben Ihrem kanonischen Satz wieder hinein und fordern Sie die Änderung an, die Sie wollen: anderer Winkel, anderer Hintergrund, anderer Anschnitt, Model schaut weg statt in die Kamera. Jede Variante hängt an etwas, das die Abnahme bereits bestanden hat, statt an einem frischen Würfelwurf.
Editieren schlägt Neugenerieren aus einem Grund, den man leicht übersieht. Eine Neugenerierung entscheidet alles neu; jeder Parameter, mit dem Sie zufrieden waren, steht wieder zur Disposition. Ein Edit hält, was Sie nicht erwähnt haben. Wenn Sie einen Nachmittag damit verbracht haben, ein Gesicht richtig hinzubekommen, ist es das Letzte, was Sie wollen, es zwanzigmal neu zu entscheiden.
Zwei praktische Hinweise. Behalten Sie die Zahl der Referenzen im Auge, wenn Sie das Hero-Bild wieder dazulegen — Hero plus ein fünfteiliger Charaktersatz plus ein Produkt sind schon sieben von vierzehn. Und speichern Sie den Prompt des abgenommenen Hero-Bilds neben dem Bild; eine Variante ist meistens dieser Prompt mit zwei ausgetauschten Halbsätzen, und ihn aus dem Gedächtnis neu zu schreiben führt genau die Drift wieder ein, die Sie gerade teuer entfernt haben.

Der Teil, den kein Referenzsatz repariert
Google stempelt SynthID in jedes Bild, das seine Modelle produzieren. Es ist unsichtbar, es reist in der Datei mit, und es ist keine Einstellung, die irgendwer offenlegt — weil es überhaupt keine Einstellung ist. Hier zählt das mehr als in den meisten Texten: Konsistenzprojekte sind Kundenprojekte, und der Vertrag eines Kunden kann eine Klausel zu KI-generierten Assets tragen. Klären Sie diese Klausel, bevor Sie den Referenzsatz fotografieren, und nicht erst, wenn zwanzig abgenommene Frames in einem Deck liegen.
Konsistenzarbeit ist fast immer Editieren, die image-to-image-Modelle sind also das Regal, in das Sie zuerst schauen, und der Katalog hat die Videoseite dazu, falls sich das Briefing bewegt.
Häufig gestellte Fragen
Wie halte ich dieselbe Figur über mehrere KI-generierte Bilder?
Bauen Sie einen kanonischen Referenzsatz — mehrere Winkel desselben Gesichts bei neutralem Licht, dazu eine Ganzkörperaufnahme für die Statur —, speichern Sie ihn dauerhaft und übergeben Sie dieselben Bilder bei jedem Request. Nutzen Sie die Charakter-Slots von Nano Banana Pro, die bis zu 5 Identitätsbilder halten, und sagen Sie im Prompt, welche Bilder die Person sind. Hängen Sie jeden Frame an den ursprünglichen Satz und nicht an den vorherigen Frame, sonst summieren sich Fehler bis Frame zwanzig zu einem anderen Gesicht.
Wie viele Referenzbilder nimmt die Nano-Banana-API an?
Nano Banana Pro nimmt 14, nach Rollen getrennt: bis zu 5 Charakterbilder, bis zu 6 Objektbilder und bis zu 3 Stilreferenzen. Nano Banana 2 nimmt ebenfalls 14, aber ohne die Rollentrennung. Nano Banana 2 Lite ist eher für Volumen als für referenzlastige Arbeit gebaut, und das Legacy-Nano-Banana deckelt bei 3.
Was ist der Unterschied zwischen Charakterkonsistenz und Produkttreue?
Charakterkonsistenz heißt, dass eine Person über viele Bilder erkennbar bleibt — gleiches Gesicht, gleiches Haar, gleiche Statur, tolerant gegenüber kleinen Abweichungen. Produkttreue heißt, dass das Objekt exakt reproduziert wird: präzise Etikettengrafik, Verschlussproportion und Farbe, ohne Umgestaltung. Pro behandelt beides in verschiedenen Referenz-Slots, weil sie unterschiedliche Strenge brauchen, und der Prompt sollte sagen, welche Bilder welche sind.
Soll ich für konsistente Bilder Nano Banana Pro oder Nano Banana 2 nehmen?
Nehmen Sie Nano Banana 2 zu $0.04, wenn der Bedarf stilistisch ist — Bilder, die Palette, Licht und Behandlung teilen, ohne ein bestimmtes Gesicht oder Produkt, das erhalten bleiben muss. Nehmen Sie Nano Banana Pro zu $0.075, wenn ein bestimmtes Gesicht oder ein bestimmtes physisches Produkt unversehrt überleben muss, denn das rollengetrennte Referenzbudget ist es, das dem Modell sagt, welches welches ist. Die Preislücke ist klein neben einem abgelehnten Batch.
Wie beschrifte ich Referenzbilder in einem Nano-Banana-Prompt?
Verweisen Sie über die Position in der Reihenfolge, in der Sie sie in image_urls übergeben, und sagen Sie, wofür jedes da ist. „Bild 1 und 2 zeigen dieselbe Frau, erhalte Gesicht und Statur; Bild 3 ist das Produkt, reproduziere es exakt; Bild 4 ist ausschließlich Farbstimmung, übernimm daraus kein Objekt und keine Komposition.“ Die Ausschlüsse zählen so viel wie die Anweisungen, denn eine ungenau bestimmte Stilreferenz leckt ihre Objekte und ihre Komposition in Ihre Szene.
Ist es besser, ein bestehendes Bild zu editieren oder ein neues zu erzeugen?
Editieren, sobald Sie ein Bild haben, das Sie abnehmen. Eine Neugenerierung entscheidet jedes Element neu, auch die, mit denen Sie zufrieden waren; ein Edit hält alles, was Sie nicht erwähnt haben. Der effiziente Workflow ist ein sorgfältig gemachtes Hero-Bild und dann daraus abgeleitete Varianten über den edit-image-Endpoint, mit angehängten kanonischen Referenzen.
Warum driften meine generierten Bilder von der ursprünglichen Figur weg?
Fast immer, weil jedes neue Bild aus dem vorherigen erzeugt wurde statt aus einem festen Referenzsatz. Damit werden Fehler kumulativ — ein etwas runderes Kinn in Frame 3 wird zur Grundlage für Frame 4, und bei Frame 20 ist es eine andere Person. Hängen Sie jeden Request an dieselben gespeicherten kanonischen Bilder, damit jede Ausgabe einen Schritt vom Original entfernt ist statt zwanzig.