Loading...
Loading...
Premium-Stufe von Nano Banana auf Basis von gemini-3-pro-image: Text-zu-Bild und Bearbeitung mit lesbarem Text im Bild und Ausgabe bis 4K.
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/nano-banana-pro/text-to-image',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)Nano Banana Pro ist der Produktname, den Google gemini-3-pro-image gibt, der obersten Stufe seiner Bildfamilie. Wir betreiben ihren Generierungs-Endpoint als google/nano-banana-pro/text-to-image — hinein geht nichts außer einem Prompt — und wir berechnen $0.075 pro Bild bei 1K und 2K, 4K wird mit $0.15 abgerechnet. fal.ai verlangt für denselben Request das Doppelte.
Sie haben schon ein Bild, das Sie lieber verändern als ersetzen würden? Nano Banana Pro edit-image ist dasselbe Modell zum selben Preis, mit einem image_urls-Feld für Ihre Referenzen.
So stand unsere Zahl bei der Prüfung am 26. August 2026:
| API-Anbieter | Preis (1K/2K) | Preis (4K) | vs. E2X |
|---|---|---|---|
| E2X | $0.075 | $0.15 | — |
| fal.ai | $0.15 | $0.30 | wir sind 50 % günstiger |
| Google Gemini API | $0.134 | $0.24 | wir sind 44 % günstiger |
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
resolution ist hier unser einziger Abrechnungsfaktor. 1K und 2K kosten dieselben $0.075 — es gibt keinen Grund, in 1K zu rendern, sofern Ihnen nicht die Bandbreite wichtig ist — und 4K verdoppelt den Preis.
Aus dem Nichts zu generieren ist ein härteres Problem als zu bearbeiten. Es gibt keine Referenz, die die Komposition verankert, also muss alles, was das Modell richtig macht, aus seinem eigenen Nachdenken über Ihren Satz kommen. Drei Fähigkeiten tragen den Großteil des Gewichts.
Typografie, die standhält. Das ist der Grund, Pro-Preise zu zahlen. Das Modell rendert gestaltete, lesbare Wörter im Bild — Headlines, Preislisten, Menütafeln, Diagrammbeschriftungen, Verpackungstexte — in mehreren Sprachen und in Größen, in denen günstigere Modelle dekorative Kringel produzieren. Ein Plakat mit einem echten Slogan darauf ist ein einzelner Request, nicht ein Request plus eine Stunde im Designtool.
Google Search Grounding. Das Modell kann während des Komponierens die Live-Suche befragen. Fragen Sie nach einem bestimmten Gebäude, einer bestimmten Uniform, einem bestimmten Gericht, angerichtet, wie eine bestimmte Küche es anrichtet, und es hat einen anderen Ort als seine eigenen Priors, an dem es nachsehen kann. Das zählt bei text-to-image weit mehr als beim Bearbeiten, wo das Ausgangsfoto die Frage, wie eine Sache aussieht, bereits beantwortet.
Echtes 4K, bis 4096×4096. Kein nachträglich aufgeschraubtes Upscale. Unser resolution-Enum ist kleingeschrieben — 1k, 2k, 4k — und nur 4k ändert den Preis.
Es gibt eine vierte Sache, die Sie kennen sollten, weil sie in Ihren Latenzgraphen auftaucht statt auf Ihren Rechnungen. Das Modell denkt visuell nach, bevor es sich festlegt, und produziert unterwegs vorläufige „Thought Images“. Google gibt sie nicht zurück, und wir berechnen sie nicht. Kalkulieren Sie mit rund 30 Sekunden pro Request, dann überrascht Sie die Zahl nicht mehr.
prompt ist das einzige Pflichtfeld. Erzeugen Sie einen Key im Dashboard, halten Sie ihn hinter Ihrem eigenen Backend und posten Sie an unseren Submit-Endpoint.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-pro/text-to-image",
"input": {
"prompt": "Ein Vintage-Reiseplakat für die Färöer. Siebdruck-Anmutung, vier flache Farben, dichter Nebel über Basaltklippen. Die Worte VISIT FAROE in einer schmalen Grotesk über dem unteren Drittel.",
"aspect_ratio": "2:3",
"resolution": "2k"
}
}'
Sie bekommen eine Job-ID zurück. Pollen Sie sie, oder geben Sie uns eine webhookUrl im Submit-Body, dann benachrichtigen wir Sie:
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submit = (input) =>
fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({ model: "google/nano-banana-pro/text-to-image", input }),
}).then((r) => r.json());
const { data } = await submit({
prompt:
"Isometrische Infografik einer Kaffee-Lieferkette, sechs beschriftete Stationen, gedämpfte Erdtöne, alle Beschriftungen auf Portugiesisch und in kleiner Größe lesbar.",
aspect_ratio: "16:9",
resolution: "4k",
});
let job;
do {
await new Promise((r) => setTimeout(r, 2500));
job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
} while (job.data.status === "pending" || job.data.status === "processing");
if (job.data.status !== "completed") throw new Error(job.data.error?.message);
console.log(job.data.outputs[0].url);
Zwei Schema-Details, über die Leute stolpern. Unser Default für aspect_ratio ist 9:16, ein Request, der das Feld weglässt, kommt also im Hochformat zurück — setzen Sie es jedes Mal. Und das Enum ist breit: zehn Formate von 1:1 und 4:5 bis 21:9, was die meisten Anzeigen- und Social-Formate ohne nachträgliches Zuschneiden abdeckt. Die maschinenlesbare Spezifikation trägt die aktuelle Liste und den aktuellen Preis.
Pro ist der teuerste Generator dieser Familie, und eine Menge Arbeit braucht ihn nicht:
| Modell | Preis / Bild | Nehmen Sie es, wenn |
|---|---|---|
| Nano Banana Pro | $0.075 | Lesbarer Text im Bild, Search Grounding oder 4K |
| Nano Banana 2 | $0.04 | Qualität der aktuellen Generation zum halben Preis |
| Nano Banana 2 Lite | $0.0238 | Mengenarbeit in 1K, und Tempo zählt am meisten |
| Nano Banana (Legacy) | $0.0312 | Eine alte Integration, die Sie noch nicht umgezogen haben |
| GPT Image 2 | $0.0525 bei high / 1K | Sie wollen OpenAIs Rendering oder transparente Hintergründe |
Fangen Sie bei Nano Banana 2 an. Es kostet etwas mehr als die Hälfte von Pro, es rendert Text gut, und bei Produktaufnahmen, Thumbnails und redaktionellen Motiven werden Sie selten erkennen können, welche Stufe die Datei erzeugt hat. Steigen Sie auf Pro um, wenn die Wörter im Bild das Ergebnis sind — eine Speisekarte, eine Infografik, ein zweisprachiges Kampagnen-Asset — oder wenn ein Kunde 4096 Pixel an der langen Kante braucht.
Eine Zeile verdient einen zweiten Blick: Nano Banana 2 Lite ist günstiger als das Legacy-Nano-Banana und neuer als es. Google selbst nennt das Original sein Legacy-Modell und empfiehlt Lite als Ersatz. Wenn Sie noch den alten Slug aufrufen, liegt da Geld auf dem Tisch.
GPT Image 2 ist der eine echte Rivale bei der Typografie, und es kommt mit einem anderen Look — kühler, wörtlicher und in der Lage, einen transparenten Hintergrund zurückzugeben, was kein Gemini-Bildmodell kann. Die übrigen Optionen stehen in der Kategorie text-to-image, und alles, was wir betreiben, finden Sie auf der Seite Modellkatalog.
Zitieren Sie den String, den Sie wollen. Setzen Sie ihn in Anführungszeichen, schreiben Sie ihn exakt und sagen Sie, wo er hingehört — „die Worte ‚HALF PRICE TUESDAY‘ quer über den oberen Rand, schmale Grotesk, weiß auf rot“. Beschreiben Sie den Text, und das Modell interpretiert; zitieren Sie ihn, und das Modell transkribiert.
Setzen Sie die Typografie vor die Szene. Prompts, die mit Layout und Typografie öffnen und danach die Bildwelt drumherum beschreiben, halten ihren Text besser als Prompts, die ihn im letzten Nebensatz vergraben.
Und dann lassen Sie es arbeiten. Weil dieses Modell nachdenkt, bevor es malt, wird ein Prompt mit echten strukturellen Vorgaben — zählen Sie die Elemente, benennen Sie die Palette, legen Sie die Lesereihenfolge fest — auch tatsächlich genutzt. Vage Adjektive werden verrechnet.
Jedes Bild trägt ein SynthID-Watermark, Googles nicht wahrnehmbares Herkunftssignal. Es gibt nirgends einen Parameter, um es abzuschalten, auch hier nicht. Nachgelagerte Erkennungswerkzeuge werden es sehen — wenn also ein Vertrag Ergebnisse mit Watermark untersagt, klären Sie das zuerst.
Prüfen Sie Ihre Annahmen zum Aspect Ratio, wenn Sie eine Config von einem anderen Anbieter migrieren. Hochformat ist unser Default, nicht Quadrat, und eine Pipeline, die 1:1 unterstellt hat, produziert stillschweigend 9:16-Dateien, bis es jemand bemerkt.
Es ist gemini-3-pro-image, die Premium-Stufe von Googles Nano-Banana-Familie. Die Stufe ist für anspruchsvolle visuelle Arbeit gebaut — lesbare Typografie im Bild, durch Suche gestützte Details, Output bis 4096×4096 — und nicht für den schnellstmöglichen Durchlauf.
$0.075 pro Bild bei 1K und 2K, und $0.15 bei 4K. Das ist die Hälfte des Satzes von fal.ai und 44 % unter Googles eigener API, Stand unserer Prüfung vom 26. August 2026. Preise bewegen sich, bestätigen Sie sie also auf der Live-Modellseite, bevor Sie ein Budget darauf bauen.
Ja, und das ist der Hauptgrund, diese Stufe zu wählen. Es rendert gestaltete Headlines, Beschriftungen und Fließtext im Bild, in mehreren Sprachen, in Größen, an denen die meisten Bildmodelle scheitern. Setzen Sie den Wortlaut in Ihrem Prompt in Anführungszeichen, statt ihn zu umschreiben.
Dasselbe Modell, dieselben $0.075, ein anderer Input. Text-to-image nimmt nur einen Prompt. Edit-image nimmt zusätzlich ein image_urls-Array mit Referenzen, und das ist es, was Sie wollen, wenn ein vorhandenes Bild verändert statt neu erschaffen werden soll.
Rund 30 Sekunden. Das Modell produziert vorläufige „Thought Images“, während es über die Komposition nachdenkt — Google gibt sie nicht zurück, und wir berechnen sie nicht, aber dort geht die Zeit hin. Modelle der Flash-Stufe sind um ein Mehrfaches schneller, falls Latenz für Sie über Qualität steht.
Ja. Jeder Output enthält ein SynthID-Watermark, Googles unsichtbaren Marker für KI-generierte Inhalte. Kein Anbieter stellt eine Möglichkeit bereit, es abzuschalten, wir eingeschlossen.
Nur manchmal. Nano Banana 2 kostet $0.04 gegen $0.075 und hält sich bei den meisten fotografischen und illustrativen Arbeiten gut. Zahlen Sie für Pro, wenn das Bild Text enthält, den jemand tatsächlich lesen wird, wenn Sie durch Suche gestützte Genauigkeit brauchen oder wenn der Output 4K sein muss.
Zehn Stück: 1:1, 2:3, 3:2, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9 und 21:9. Unser Default ist 9:16, setzen Sie das Feld also explizit, sofern Sie kein Hochformat wollen.