Loading...
Loading...
OpenAIs GPT-Image-2-Familie für Text-zu-Bild-Generierung und referenzbasierte Bildbearbeitung über die OpenAI Images API.
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'openai/gpt-image-2/text-to-image',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)GPT Image 2 ist OpenAIs gpt-image-2-2026-04-21, und es ist das Modell, das wir Leuten in die Hand geben, wenn die Wörter im Bild stimmen müssen. Wir stellen es als openai/gpt-image-2/text-to-image bereit. Mit unseren Defaults — quality=high, resolution=1K — berechnen wir $0.0525 pro Bild, gegenüber $0.211 für dieselbe Konfiguration auf fal.ai.
Sie haben schon ein Bild, das Sie verändern und nicht ersetzen wollen? GPT Image 2 edit-image nimmt Referenzen und optional eine Mask entgegen — dasselbe Modell, dieselbe Preisliste.
Das ist keine pauschale Gebühr pro Bild, und nur einer der beiden Regler bewegt Ihre Rechnung.
Die Auflösung ist der eigentliche Hebel: 1K ist ×1, 2K ist ×2, 4K ist ×3.
quality ist auf jeder Stufe ein ×7-Multiplikator. low, medium, high und auto landen alle auf derselben Zahl; wer quality: "low" schickt, kauft sich also ein schlechteres Bild zum gleichen Preis. Das ist eine Eigenart darin, wie unsere Config den Parameter abbildet — wir wissen davon, und bis wir das korrigieren, gibt es keinen Grund, etwas anderes als high zu senden. Der Basispreis von $0.0075, den Sie vielleicht irgendwo zitiert sehen, gilt ausschließlich für einen Request, der überhaupt kein quality-Feld mitschickt. Er ist der Koeffizient, bei dem unsere Pricing-Engine anfängt, nicht der Preis eines fertigen Bildes.
Was tatsächlich abgerechnet wird, geprüft am 26. August 2026:
| Ausgabegröße | E2X, beliebiger quality-Wert | fal.ai (high) | vs. E2X |
|---|---|---|---|
| 1024×1024 (1K, unser Default) | $0.0525 | $0.211 | wir sind 75 % günstiger |
| 2560×1440 (2K) | $0.105 | $0.222 | wir sind 53 % günstiger |
| 3840×2160 (4K) | $0.1575 | $0.401 | wir sind 61 % günstiger |
Sehen Sie sich die Form dieser Zahlen an, bevor Sie ein Budget festlegen. fal verlangt für 2K kaum mehr als für 1K — $0.211 gegen $0.222 —, während sich unser Preis verdoppelt. Unser Vorsprung ist bei 1K am größten und schrumpft, je höher Sie steigen.
OpenAI selbst kann nicht in die Tabelle: Dort wird nach Tokens abgerechnet, es existiert also keine offizielle Zahl pro Bild, und jeder Wert, den Sie anderswo sehen, ist das Ergebnis irgendeiner fremden Überschlagsrechnung. Wir versehen unsere Zeilen mit einem Datum, weil wir sie nachprüfen.
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
Die meisten Bildmodelle machen aus Fließtext immer noch dekorative Schnörkel, die aus drei Metern Entfernung wie Buchstaben aussehen. Dieses nicht, und genau diese eine Fähigkeit ist der Grund, warum es in unserem Katalog in der teuren Klasse sitzt. Was es aushält:
Zwei Dinge kommen mit. Die Auflösung reicht bis 4K, ein echter Sprung gegenüber der 1536px-Grenze von GPT Image 1, und background: "transparent" liefert einen Freisteller ohne separaten Maskier-Durchgang — nur PNG oder WebP, denn JPEG hat keinen Alphakanal.
Das Modell läuft auf O-Series-Reasoning, plant die Komposition und prüft sich selbst, bevor es rendert. Qualität zuerst. Deshalb ist es langsamer als ein Modell der Flash-Klasse, und deshalb nennen wir hier eine ETA von 60 Sekunden, statt Ihnen drei zu versprechen.
Erstellen Sie einen Key in Ihrem Dashboard und halten Sie ihn serverseitig. prompt ist das einzige Pflichtfeld.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-image-2/text-to-image",
"input": {
"prompt": "Recruiting-Plakat für eine Bäckerei an der Küste. Die Headline lautet FLOUR & SALT in einer schmalen Grotesk. Darunter vier Zeilen Fließtext in 9pt mit den offenen Stellen. Warme Papierstruktur, eine einzige Druckfarbe.",
"aspect_ratio": "2:3",
"resolution": "2K",
"quality": "high"
}
}'
Wir geben eine Job-ID zurück. Pollen Sie darauf, oder schicken Sie eine webhookUrl und sparen Sie sich die Schleife.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "openai/gpt-image-2/text-to-image",
input: {
prompt: "Quadratischer App-Store-Screenshot. Geräte-Mockup auf mintgrüner Fläche. Unten eine Textleiste auf Japanisch und Englisch, beide vollständig lesbar.",
aspect_ratio: "1:1",
resolution: "1K",
quality: "high",
background: "transparent",
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 3000));
}
Der Status läuft pending → processing → completed oder bleibt bei failed oder cancelled stehen. Achten Sie auf die Schreibweise — die Werte für die Auflösung sind großgeschrieben: 1K, 2K, 4K. Unser Default für die Aspect Ratio ist 1:1, und das Enum reicht weit, von 21:9 bis hinunter zu 1:3. Die maschinenlesbare Spezifikation führt das aktuelle Schema und den aktuellen Preis.
Fünf Generatoren in dieser Kategorie, und GPT Image 2 ist der teure. Manchmal ist das richtig. Oft nicht.
| Modell | Preis / Bild | Nehmen Sie es, wenn |
|---|---|---|
| GPT Image 2 | $0.0525 (high/1K) | Lesbarer Text, Verpackung, 4K, Transparenz |
| Nano Banana Pro | $0.075 | Porträt-Realismus, mehrere Referenzen konsistent gehalten |
| Nano Banana 2 | $0.04 | Aktuelle Generationsqualität zum Arbeitspreis |
| Nano Banana 2 Lite | $0.0238 | Volumen, Tempo, einfache Szenen |
| Nano Banana (Legacy) | $0.0312 | Eine ältere Integration, die Sie noch nicht migriert haben |
Der Unterschied ist schmal, aber real. Wenn Schrift lesbar sein muss, kommen Sie hierher. Für Gesichter oder eine Figur, die über mehrere Referenzen hinweg gleich bleiben soll, ist Nano Banana Pro stärker, und wir nehmen Ihr Geld gerne auch dort entgegen. Für ein Hero-Bild oder eine Hintergrundplatte erledigt Nano Banana 2 die Aufgabe zu drei Vierteln unseres Preises und ist früher fertig.
Noch eines, weil wir es lieber selbst sagen, als dass Sie es herausfinden: Nano Banana 2 Lite ist günstiger und neuer als das Legacy-Modell Nano Banana. Noch auf dem alten Slug? Migrieren ist geschenktes Geld. Der Rest steht in der Kategorie text-to-image und im Modellkatalog.
Der Reasoning-Durchgang belohnt Genauigkeit und bestraft Vagheit. Zitieren Sie Ihren Text exakt und sagen Sie, wohin er gehört: „Die Headline lautet ‚FLOUR & SALT‘, zentriert, oberes Drittel“ liefert genau diese Zeichenfolge, während „ein Bäckereiplakat mit etwas Text“ plausiblen Unsinn in einer hübschen Schrift liefert. Beschreiben Sie Layout als Layout — oberes Band, linke Spalte, Fußlinie. Der Planner hält sich an ein räumliches Briefing.
Transparenz stellen Sie über background: "transparent" ein, nicht mit einem Satz. Drei Größenregeln von OpenAI, die man kennen sollte, bevor ein Request abgelehnt wird: beide Kanten Vielfache von 16, längste Kante unter 3840px, Aspect Ratio nicht breiter als 3:1.
Jedes Bild aus diesem Modell trägt zwei Provenienz-Ebenen, und keine davon ist auf irgendeiner Quality-Stufe optional.
Erstens C2PA-Metadaten, die die Ausgabe als von ChatGPT Images erzeugt ausweisen — X, Meta, LinkedIn und TikTok lesen sie und hängen beim Upload ein „Made with AI“-Label an. Zweitens ein neueres, nicht wahrnehmbares Pixel-Watermark in den Bilddaten selbst, das genau das Entfernen der Metadaten überlebt, das die Leute zuerst versuchen.
Wir können keine der beiden Ebenen entfernen, und niemand, der dieses Modell weiterverkauft, kann es auch. Wir bieten auf GPT Image 2 keine White-Label-Ausgabe an. Wenn ein Kundenvertrag KI-gekennzeichnete Assets ausschließt, klären Sie das, bevor Sie hier bauen.
Und die Budgetfalle noch einmal: quality ist kein Kostenregler. Für Entwurfsdurchläufe auf low herunterzugehen ist eine Gewohnheit von anderen Plattformen; hier verbrennt das dieselben $0.0525 und verschlechtert dabei genau das Text-Rendering, wegen dem Sie gekommen sind. Steuern Sie Ihre Ausgaben über resolution — Entwürfe in 1K, Auslieferung in 2K oder 4K.
OpenAIs Bildgenerierungsmodell, Snapshot gpt-image-2-2026-04-21, veröffentlicht am 21. April 2026 als Nachfolger von GPT Image 1.5. Es nutzt O-Series-Reasoning, um eine Komposition vor dem Rendern zu planen, und seine herausragende Fähigkeit ist korrekter Text im Bild, auch in kleinen Größen und über mehrere Sprachen hinweg.
$0.0525 pro Bild mit unseren Defaults, quality=high und resolution=1K. 2K verdoppelt das auf $0.105, 4K verdreifacht es auf $0.1575. Das waren unsere Preise bei der Prüfung am 26. August 2026.
Weil $0.0075 unser unmultiplizierter Basispreis ist und ausschließlich für einen Request gilt, der überhaupt kein quality-Feld mitschickt. Jeder quality-Wert multipliziert ihn mit sieben, und die Auflösung multipliziert obendrauf noch einmal. Rechnen Sie mit der Konfiguration, die Sie tatsächlich senden, sonst liegt Ihr Kostenmodell um den Faktor sieben daneben.
Nein. Unser Multiplikator ist ×7 für low, medium, high und auto gleichermaßen, jeder einzelne davon kostet bei 1K also $0.0525. low zu senden kostet dasselbe und liefert weniger. Die Auflösung ist der Parameter, der Ihre Rechnung tatsächlich verändert.
Bei jeder von uns geprüften Auflösung, ja. Bei 1024×1024 sind es $0.0525 bei uns gegen $0.211 dort, 75 % weniger; bei 2K $0.105 gegen $0.222, 53 % weniger; bei 4K $0.1575 gegen $0.401, 61 % weniger. OpenAI selbst rechnet pro Token statt pro Bild ab, es gibt dort also keinen offiziellen Listenpreis zum direkten Vergleich.
Ja, gleich doppelt: C2PA-Metadaten, die soziale Plattformen auslesen, um „Made with AI“-Label zu setzen, plus ein nicht wahrnehmbares Pixel-Watermark, das in die Bilddaten eingebacken ist. Beides ist auf jeder Quality-Stufe vorhanden, und kein Anbieter — wir eingeschlossen — kann es abschalten.
Nehmen Sie GPT Image 2, wenn das Bild Text enthält, den ein Mensch lesen wird: Verpackung, Infografiken, UI, Plakate. Nehmen Sie Nano Banana Pro, wenn Sie Porträt-Realismus oder eine über mehrere Referenzbilder konsistente Figur brauchen. Bei 1K kosten beide ungefähr gleich viel, entscheiden Sie also nach Stärke, nicht nach Budget.