Loading...
Loading...
OpenAIs GPT-Image-2-Familie für Text-zu-Bild-Generierung und referenzbasierte Bildbearbeitung über die OpenAI Images API.
Anmelden, um Modelle auszuführen
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'openai/gpt-image-2/edit-image',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)GPT Image 2 edit-image ist OpenAIs gpt-image-2-2026-04-21, gerichtet auf Bilder, die Ihnen schon gehören: Retusche, Composing, maskiertes Inpainting, Outpainting und das Umschreiben der Schrift, die in einem Layout steckt. Wir betreiben es als openai/gpt-image-2/edit-image und berechnen $0.0525 pro Ausgabebild bei resolution=1K, unserem Default. Der entsprechende Request in der hohen Stufe kostet auf fal.ai $0.211.
Kein Quellbild zur Hand? Dann wollen Sie GPT Image 2 text-to-image — dasselbe Modell, dieselbe Preisliste, nur Prompt.
Unsere Preisbildung ist multiplikativ, und einer der beiden Multiplikatoren ist eine Falle. quality wirkt bei jedem Wert ×7 — low, medium und high werden identisch abgerechnet, eine niedrigere Stufe kostet Sie also Bildqualität und spart nichts. Das ist eine Eigenart darin, wie unsere Config den Parameter abbildet, und wir verstecken sie nicht in einer Fußnote. Senden Sie high.
resolution ist der Multiplikator, der Geld bewegt: ×1 bei 1K, ×2 bei 2K, ×3 bei 4K. Die Zahl $0.0075, die als „GPT-Image-2-Preis“ kursiert, ist unser Basispreis vor den Multiplikatoren, erreichbar nur durch einen Request, der überhaupt keinen quality-Wert schickt — und quality ist auf diesem Endpoint Pflicht, Sie kommen hier also nicht einmal versehentlich dorthin. Preise mit Stand 26. August 2026:
| Ausgabegröße | E2X, beliebiger quality-Wert | fal.ai (high) | vs. E2X |
|---|---|---|---|
| 1024×1024 (1K, unser Default) | $0.0525 | $0.211 | wir sind 75 % günstiger |
| 2560×1440 (2K) | $0.105 | $0.222 | wir sind 53 % günstiger |
| 3840×2160 (4K) | $0.1575 | $0.401 | wir sind 61 % günstiger |
Lesen Sie die Spalten gegeneinander. fals Preis bewegt sich zwischen 1K und 2K kaum, unserer verdoppelt sich, ein Abstand, der bei 1K riesig aussieht, ist bei 2K also ungefähr halbiert. In jeder von uns geprüften Stufe immer noch zu unseren Gunsten. Kalkulieren Sie mit der Stufe, die Sie am Ende wirklich ausliefern.
OpenAI kann in dieser Tabelle gar nicht auftauchen. Dort wird dieses Modell nach Tokens gemessen ($5.00/1M text input, $8.00/1M image input, $30.00/1M image output; Batch zum halben Satz), ein „Preis pro Edit“ existiert also erst, wenn man eine Bildgröße und eine Promptlänge annimmt. Wir berechnen pro Request.
Preise und Produktbedingungen können sich ändern. Prüfen Sie vor einer Kaufentscheidung die aktuellen Preise des jeweiligen Anbieters. Die Batch- oder Flex-Preise von Google sind einem standardmäßigen On-Demand-API-Request nicht direkt gleichwertig, da Zeitplanung, Verfügbarkeit und Verarbeitungsbedingungen abweichen; sie sind deshalb von diesem Vergleich ausgenommen. Dies ist ein Vergleich mit klar umrissenem Rahmen und keine Behauptung, dass E2X in jeder Konfiguration die weltweit günstigste Option ist.
OpenAI hat den Parameter input_fidelity in dieser Generation entfernt. Jedes Quellbild, das Sie anhängen, wird jetzt in hoher Fidelity verarbeitet, ohne günstigere Einstellung als Rückfallebene — jedes Mal mehr Input-Tokens pro Anhang. Der Markt zeigt es: Auf fal.ai läuft der Edit-Endpoint in der niedrigen Stufe etwa zum doppelten Text-to-Image-Preis. Gehen Sie nicht davon aus, dass eine Edit-Pipeline und eine Pipeline, die von Null generiert, darunter dasselbe kosten.
Text innerhalb vorhandener Artworks umschreiben. Der stärkste Grund, ein Bild hierher zu bringen statt zu einem Google-Modell. Geben Sie ihm eine fertige englische Infografik und bitten Sie um die deutsche Fassung — die Schrift kommt lesbar zurück und das Layout bleibt, wo es war. Dasselbe gilt für Produktetiketten, Verpackungstexte, Menütafeln, UI-Screenshots.
Composings aus vielen Quellen. Bis zu 16 Referenzbilder pro Request und bis zu 10 zurückgegebene Ausgaben — Varianten zur Auswahl, ohne für jede einen eigenen Umlauf.
Maskiertes Inpainting. Hängen Sie eine Mask mit Alphakanal an, und der weiße Bereich markiert, was das Modell verändern darf. Die Mask ist optional; ohne sie steckt Ihr Prompt den Rahmen des Edits ab. OpenAIs eigene Formulierung zitiert man besser, als sie zu paraphrasieren: Das „Modell nutzt die Mask als Orientierung, folgt ihrer exakten Form aber möglicherweise nicht mit vollständiger Präzision.“ Ein starker Hinweis, kein Beschneidungspfad. Outpainting funktioniert genauso.
Transparenz. background: "transparent" gibt einen Alphakanal zurück — PNG oder WebP, niemals JPEG.
Die Größenregeln gelten auch für die Eingaben: längste Kante bis 3840px, beide Kanten Vielfache von 16, Aspect Ratio nicht breiter als 3:1, Gesamtpixel zwischen 655.360 und 8.294.400.
Drei Felder sind hier Pflicht: prompt, image_urls und quality.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-image-2/edit-image",
"input": {
"prompt": "Ersetze die Headline auf der Verpackung durch \"CAFÉ NOIR — GRAND CRU\" in derselben Schrift und Schriftstärke. Illustration, Barcode und Hintergrund bleiben unangetastet.",
"image_urls": ["https://example.com/coffee-box.png"],
"aspect_ratio": "4:5",
"resolution": "2K",
"quality": "high"
}
}'
Sie bekommen eine Job-ID zurück. Pollen Sie darauf, oder registrieren Sie eine webhookUrl und lassen Sie uns bei Ihnen anklopfen.
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "openai/gpt-image-2/edit-image",
input: {
prompt: "Setze die Uhr aus Bild 1 auf die Marmoroberfläche aus Bild 2. Übernimm die Lichtrichtung von Bild 2. Die Gravur auf dem Zifferblatt muss lesbar bleiben.",
image_urls: [
"https://example.com/watch-cutout.png",
"https://example.com/marble-scene.jpg",
],
aspect_ratio: "1:1",
resolution: "1K",
quality: "high",
},
}),
}).then((r) => r.json());
const { jobId } = submitted.data;
for (;;) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
job.data.outputs.forEach((o) => console.log(o.url));
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Edit failed");
}
await new Promise((r) => setTimeout(r, 3000));
}
Jobs laufen pending → processing → completed oder bleiben bei failed oder cancelled stehen. Die Werte für die Auflösung sind großgeschrieben — 1K, 2K, 4K —, und unser Default für die Aspect Ratio ist 1:1. Das Modell plant und prüft sich selbst, bevor es rendert, deshalb nennen wir eine ETA von 60 Sekunden statt eines Versprechens aus der Flash-Klasse. Schema und Preis stehen in der maschinenlesbaren Spezifikation.
Fünf Editoren, eine Entscheidung, und sie hängt daran, ob Buchstaben eine Rolle spielen.
| Modell | Preis / Bild | Nehmen Sie es, wenn |
|---|---|---|
| GPT Image 2 edit | $0.0525 (high/1K) | Textumschreibungen, maskiertes Inpainting, Transparenz, 4K |
| Nano Banana Pro | $0.075 | Gesichter, Figurenkonsistenz, rollenbasierte Referenzen |
| Nano Banana 2 | $0.04 | Der Allzweck-Default für die meisten Edits |
| Nano Banana 2 Lite | $0.0238 | Hintergrundwechsel und Farbänderungen, in Menge |
| Nano Banana (Legacy) | $0.0312 | Nur, wenn Sie noch nicht davon weg migriert sind |
Klare Antwort: Wenn Ihr Edit keine Schrift anfasst, sind Sie hier vermutlich falsch. Nano Banana 2 erledigt die gewöhnliche Retusche — ein Objekt entfernen, einen Hintergrund tauschen, die Farbstimmung wärmer ziehen — für weniger Geld und schneller. Ein Porträt bearbeiten oder eine Person über mehrere Referenzen hinweg wiedererkennbar halten? Dafür ist Nano Banana Pro trotz des höheren Preises das bessere Werkzeug.
Kommen Sie hierher für das, was die Google-Familie weniger gut kann: Text in einem bestehenden Design umschreiben, maskengeführtes Inpainting, transparente Ausgabe. Der Rest steht in der Kategorie image-to-image und in unserem Modellkatalog.
Beschreiben Sie die Differenz, nicht das Ziel. Ein Prompt, der die ganze Szene noch einmal beschreibt, konkurriert mit der Quelle, und Sie bekommen eine abdriftende Neugenerierung statt eines Edits. Benennen Sie, was sich ändert, und dann, was überleben muss: „Ausschnitt, Schatten und Position des Etiketts bleiben identisch“ verdient seinen Platz im Prompt.
Wenn mehrere Bilder hineingehen, kennzeichnen Sie sie über ihren Index: Bild 1 ist das Motiv, Bild 2 die Umgebung, Bild 3 nur die Farbreferenz. Nichts anderes sagt dem Modell, welcher Anhang als Palette gedacht war.
Bei Textänderungen setzen Sie die exakte Ersatzzeichenfolge in Anführungszeichen und sagen, was mit der alten passiert. Eine Umschreibung lädt zur Neuinterpretation ein, und Neuinterpretation auf einem Produktetikett ist ein Nachdruck. Lassen Sie innerhalb einer Mask ein paar Pixel Rand um alles Kostbare — die Grenze ist eine Empfehlung, kein Beschnitt.
Auf jeder Ausgabe landen zwei Watermark-Ebenen, auf jeder Quality-Stufe, und diesen Teil schwächen wir nicht ab. C2PA-Provenienz-Metadaten weisen die Datei als von ChatGPT Images erzeugt aus — X, Meta, LinkedIn und TikTok parsen sie und setzen automatisch eine „Made with AI“-Kennzeichnung. Darunter sitzt ein nicht wahrnehmbares Watermark auf Pixelebene in den Bilddaten, das nicht mit den Metadaten verschwindet.
Keine der beiden Ebenen hat einen Ausschalter, weder für uns noch für irgendeinen anderen Reseller. Wir können auf diesem Modell keine White-Label-Ausgabe zusagen. Sie bearbeiten Kunden-Assets unter einem Vertrag, der KI-gekennzeichnetes Material untersagt? Führen Sie dieses Gespräch jetzt.
Eine Kostennotiz, weil der Instinkt hier in die Irre führt: Günstige Entwurfsdurchläufe kommen nicht aus quality. Zwanzig low-Iterationen kosten exakt so viel wie zwanzig high-Iterationen. Für eine günstige Review-Schleife entwerfen Sie in 1K und heben 2K oder 4K für die Fassung auf, die ausgeliefert wird.
$0.0525 pro Ausgabebild mit unseren Defaults quality=high und resolution=1K. 2K kommt auf $0.105 und 4K auf $0.1575, weil die Auflösung mit zwei und mit drei multipliziert. Die Quality-Stufe verändert keine dieser Zahlen. Werte aus unserer Prüfung vom 26. August 2026.
Bis zu 16, gemäß der dokumentierten Oberfläche von OpenAI, und ein Request kann bis zu 10 Ausgaben zurückgeben. Mehr Anhänge bedeuten mehr Input-Tokens, ein Composing aus 16 Referenzen ist also nicht dieselbe Arbeitslast wie eine Retusche an einem einzelnen Bild.
low quality günstiger als einer mit high?Nein. Unser Multiplikator ist ×7, welchen Wert Sie auch senden, low, medium und high kosten bei 1K also alle $0.0525. Das Feld ist hier Pflicht, und keine Einstellung davon senkt Ihre Kosten. Steuern Sie Ihre Ausgaben über resolution.
Weil input_fidelity entfernt wurde: Jedes angehängte Bild wird in hoher Fidelity verarbeitet, ohne günstigere Option, ein Edit verbrennt also mehr Input-Tokens als ein reiner Prompt-Request. Das zeigt sich quer über den Markt — der Edit-Endpoint von fal.ai läuft in der niedrigen Stufe etwa zum doppelten Text-to-Image-Preis.
Ja, und das ist der Hauptgrund, dieses Modell einer Google-Alternative vorzuziehen. Zitieren Sie die exakte Ersatzzeichenfolge und sagen Sie, was mit dem Original geschehen soll. Mehrsprachige Austausche funktionieren ebenfalls, CJK eingeschlossen, ohne das Layout drumherum neu zu zeichnen.
Ja. Jede Ausgabe trägt C2PA-Metadaten, die Plattformen auslesen, um „Made with AI“-Label zu setzen, plus ein nicht wahrnehmbares Pixel-Watermark in den Bilddaten. Beides gilt auf jeder Quality-Stufe, und kein Anbieter kann es abschalten.
Wenn sich der Edit um einen Menschen dreht — Porträt-Realismus und Figurenkonsistenz über Referenzen hinweg sind die Stärken von Googles Pro-Stufe. Für routinemäßige Hintergrund- und Farbarbeit reicht Nano Banana 2 für $0.04; unser Textvorsprung bringt Ihnen dort nichts.