Loading...
Loading...
OpenAI का GPT Image 2 परिवार, जो OpenAI Images API के ज़रिए टेक्स्ट-से-इमेज जनरेशन और रेफ़रेंस-आधारित एडिटिंग देता है।
मॉडल चलाने के लिए साइन इन करें
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'openai/gpt-image-2/edit-image',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)GPT Image 2 edit-image यानी OpenAI का gpt-image-2-2026-04-21, आपकी पहले से मौजूद इमेज पर तैनात: रीटचिंग, कंपोज़िटिंग, mask वाला inpainting, outpainting, और किसी लेआउट में बेक हो चुके टाइप को दोबारा लिखना। हम इसे openai/gpt-image-2/edit-image के रूप में चलाते हैं और अपने डिफ़ॉल्ट resolution=1K पर प्रति आउटपुट इमेज $0.0525 लेते हैं। fal.ai पर इसी high-tier request की कीमत $0.211 बैठती है।
काम शुरू करने के लिए कोई source इमेज ही नहीं है? तब आपको GPT Image 2 text-to-image चाहिए — वही मॉडल, वही रेट कार्ड, सिर्फ़ prompt।
हमारी प्राइसिंग multiplicative है, और दो multipliers में से एक सीधा-सीधा जाल है। quality हर वैल्यू पर ×7 लगाता है — low, medium और high, तीनों की बिलिंग एक जैसी होती है, यानी नीचे वाला tier आपसे इमेज क्वालिटी छीनता है और बचाता कुछ नहीं। यह हमारे config में उस पैरामीटर की मैपिंग की एक quirk है, और हम इसे किसी footnote में छिपा नहीं रहे। high भेजिए।
resolution वह multiplier है जो पैसा हिलाता है: 1K पर ×1, 2K पर ×2, 4K पर ×3। "GPT Image 2 pricing" के नाम से जो $0.0075 का आँकड़ा घूम रहा है, वह हमारा pre-multiplier बेस रेट है, और वहाँ सिर्फ़ वही request पहुँच सकती है जो quality की कोई वैल्यू भेजे ही नहीं — जबकि इस endpoint पर quality ज़रूरी है, इसलिए ग़लती से भी आप वहाँ नहीं पहुँचेंगे। रेट 26 अगस्त 2026 की जाँच के मुताबिक़:
| आउटपुट साइज़ | E2X, कोई भी quality वैल्यू | fal.ai (high) | बनाम E2X |
|---|---|---|---|
| 1024×1024 (1K, हमारा डिफ़ॉल्ट) | $0.0525 | $0.211 | हम 75% कम |
| 2560×1440 (2K) | $0.105 | $0.222 | हम 53% कम |
| 3840×2160 (4K) | $0.1575 | $0.401 | हम 61% कम |
कॉलम एक-दूसरे के सामने रखकर पढ़िए। fal की कीमत 1K से 2K के बीच मुश्किल से हिलती है, जबकि हमारी दोगुनी हो जाती है — तो जो फ़ासला 1K पर बहुत बड़ा दिखता है, 2K तक लगभग आधा रह जाता है। फिर भी हमने जितने tiers जाँचे, हर एक पर पलड़ा हमारा भारी रहा। बजट उसी tier पर बनाइए जिसे आप असल में ship करेंगे।
OpenAI उस टेबल में आ ही नहीं सकता। वह इस मॉडल को tokens में मीटर करता है ($5.00/1M text input, $8.00/1M image input, $30.00/1M image output; Batch आधी दर पर), इसलिए "प्रति एडिट कीमत" जैसी कोई चीज़ तभी बनती है जब आप एक इमेज साइज़ और एक prompt की लंबाई मान लें। हम प्रति request चार्ज करते हैं।
कीमतें और प्रोडक्ट की शर्तें समय के साथ बदल सकती हैं; खरीद का फ़ैसला लेने से पहले हर provider की मौजूदा कीमत जाँच लें। Google Batch या Flex प्राइसिंग किसी स्टैंडर्ड on-demand API request के सीधे बराबर नहीं है, क्योंकि उसमें scheduling, उपलब्धता और प्रोसेसिंग की शर्तें अलग होती हैं; इसलिए उसे इस तुलना में शामिल नहीं किया गया है। यह एक सीमित दायरे की तुलना है — यह दावा नहीं किया जा रहा कि E2X हर कॉन्फ़िगरेशन में दुनिया का सबसे सस्ता विकल्प है।
OpenAI ने इस जनरेशन में input_fidelity पैरामीटर हटा दिया। अब आप जो भी source इमेज अटैच करते हैं वह high fidelity पर प्रोसेस होती है, और गिरने के लिए कोई सस्ता सेटिंग बचा ही नहीं — हर अटैचमेंट पर ज़्यादा input tokens, हर बार। बाज़ार यही दिखाता है: fal.ai पर low tier में edit endpoint text-to-image रेट से क़रीब दोगुना चलता है। यह मत मान लीजिए कि एक edit pipeline और एक generate-from-scratch pipeline की अंदरूनी लागत एक जैसी है।
मौजूदा आर्टवर्क के भीतर का टेक्स्ट दोबारा लिखना। किसी इमेज को Google के मॉडल के बजाय यहाँ लाने की सबसे मज़बूत वजह यही है। इसे एक तैयार अंग्रेज़ी infographic दीजिए, जर्मन वर्ज़न माँगिए — टाइप पढ़ने लायक़ लौटता है और लेआउट अपनी जगह टिका रहता है। प्रोडक्ट लेबल, पैकेजिंग कॉपी, मेन्यू बोर्ड, UI स्क्रीनशॉट — सब पर यही बात लागू है।
कई sources से composites। प्रति request 16 तक reference इमेज, और 10 तक outputs वापस — हर वेरिएशन के लिए अलग राउंड ट्रिप किए बिना चुनने की गुंजाइश।
Masked inpainting. एक alpha-channel mask अटैच कीजिए; सफ़ेद हिस्सा तय करता है कि मॉडल क्या बदल सकता है। Mask वैकल्पिक है; उसके बिना आपका prompt ही एडिट का दायरा तय करता है। OpenAI के अपने शब्दों को paraphrase करने के बजाय हूबहू उद्धृत करना बेहतर है: मॉडल "mask को guidance की तरह इस्तेमाल करता है, लेकिन हो सकता है कि वह उसके ठीक आकार का पूरी सटीकता के साथ पालन न करे।" यह एक मज़बूत इशारा है, clipping path नहीं। Outpainting भी इसी तरह चलता है।
Transparency. background: "transparent" एक alpha channel लौटाता है — PNG या WebP, JPEG कभी नहीं।
साइज़ के नियम inputs पर भी लागू होते हैं: सबसे लंबा किनारा 3840px तक, दोनों किनारे 16 के गुणज, aspect ratio 3:1 से ज़्यादा चौड़ा नहीं, और कुल pixels 655,360 से 8,294,400 के बीच।
यहाँ तीन fields ज़रूरी हैं: prompt, image_urls, और quality।
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-image-2/edit-image",
"input": {
"prompt": "पैकेजिंग पर लिखी headline को उसी typeface और weight में \"CAFÉ NOIR — GRAND CRU\" से बदल दीजिए। इलस्ट्रेशन, barcode और background को बिल्कुल न छेड़िए।",
"image_urls": ["https://example.com/coffee-box.png"],
"aspect_ratio": "4:5",
"resolution": "2K",
"quality": "high"
}
}'
जवाब में एक job ID मिलती है। उसे poll कीजिए, या एक webhookUrl रजिस्टर कर दीजिए और हमें आपको कॉल करने दीजिए।
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "openai/gpt-image-2/edit-image",
input: {
prompt: "इमेज 1 की घड़ी को इमेज 2 की मार्बल सतह पर composite कीजिए। इमेज 2 की लाइटिंग की दिशा से मैच कराइए। डायल की engraving पढ़ने लायक़ बनी रहे।",
image_urls: [
"https://example.com/watch-cutout.png",
"https://example.com/marble-scene.jpg",
],
aspect_ratio: "1:1",
resolution: "1K",
quality: "high",
},
}),
}).then((r) => r.json());
const { jobId } = submitted.data;
for (;;) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
job.data.outputs.forEach((o) => console.log(o.url));
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Edit failed");
}
await new Promise((r) => setTimeout(r, 3000));
}
Jobs pending → processing → completed की तरफ़ बढ़ती हैं, या failed या cancelled पर रुक जाती हैं। Resolution की वैल्यू uppercase हैं — 1K, 2K, 4K — और हमारा aspect ratio डिफ़ॉल्ट 1:1 है। मॉडल रेंडर करने से पहले प्लान करता है और ख़ुद को जाँचता है, इसलिए हम किसी flash-tier वादे के बजाय 60 सेकंड का ETA प्रकाशित करते हैं। Schema और कीमत machine-readable spec में रहती है।
पाँच editors, एक फ़ैसला — और सब कुछ इस पर टिका है कि अक्षर मायने रखते हैं या नहीं।
| मॉडल | कीमत / इमेज | कब चुनें |
|---|---|---|
| GPT Image 2 edit | $0.0525 (high/1K) | टेक्स्ट रीराइट, masked inpainting, transparency, 4K |
| Nano Banana Pro | $0.075 | चेहरे, character consistency, role-typed references |
| Nano Banana 2 | $0.04 | ज़्यादातर एडिट के लिए सामान्य डिफ़ॉल्ट |
| Nano Banana 2 Lite | $0.0238 | Background बदलना और रंग बदलना, बड़े volume पर |
| Nano Banana (legacy) | $0.0312 | सिर्फ़ तब, जब आपने अब तक इससे migrate न किया हो |
सीधा जवाब: अगर आपका एडिट टाइप को छूता ही नहीं, तो शायद आपको यहाँ होना ही नहीं चाहिए। Nano Banana 2 आम रीटच — कोई ऑब्जेक्ट हटाना, background बदलना, ग्रेड को गर्म करना — कम कीमत में और ज़्यादा तेज़ी से कर देता है। पोर्ट्रेट एडिट कर रहे हैं, या references के आर-पार एक ही व्यक्ति को पहचानने लायक़ रखना है? तब ज़्यादा कीमत के बावजूद Nano Banana Pro बेहतर औज़ार है।
यहाँ उसके लिए आइए जो Google परिवार उतनी अच्छी तरह नहीं करता: किसी मौजूदा डिज़ाइन के भीतर की कॉपी दोबारा लिखना, mask के दायरे में inpainting, transparent output। बाक़ी सब image-to-image कैटेगरी और हमारे मॉडल कैटलॉग में मिलेगा।
डेल्टा बताइए, मंज़िल नहीं। जो prompt पूरे सीन को दोबारा बयान करता है वह source से मुक़ाबला करने लगता है, और आपको एडिट के बजाय एक भटकता हुआ regeneration मिलता है। पहले बताइए क्या बदलेगा, फिर क्या बचा रहना चाहिए: "क्रॉप, शैडो और लेबल की जगह बिल्कुल वैसी ही रखिए" — यह वाक्य अपनी जगह कमाता है।
जब कई इमेज भेजी जा रही हों, उन्हें index से लेबल कीजिए: इमेज 1 subject है, इमेज 2 माहौल, इमेज 3 सिर्फ़ ग्रेडिंग reference। इसके अलावा और कुछ भी मॉडल को नहीं बताता कि कौन-सा अटैचमेंट palette माना गया था।
टेक्स्ट एडिट के लिए, बदली जाने वाली सटीक string उद्धरण चिह्नों में चिपकाइए और साथ में बताइए कि पुरानी का क्या होगा। Paraphrase दोबारा-व्याख्या को न्योता देता है, और प्रोडक्ट लेबल पर दोबारा-व्याख्या का मतलब है दोबारा प्रिंट। Mask के भीतर, किसी भी कीमती चीज़ के चारों ओर कुछ pixels का margin छोड़िए — सीमा guidance है, clip नहीं।
हर आउटपुट पर, हर quality tier पर, watermark की दो परतें उतरती हैं — और इस हिस्से को हम नरम नहीं करेंगे। C2PA provenance मेटाडेटा फ़ाइल को ChatGPT Images से जनरेट हुआ बताता है; X, Meta, LinkedIn और TikTok इसे पढ़कर अपने आप "Made with AI" लेबल लगा देते हैं। उसके नीचे इमेज डेटा के भीतर pixel-स्तर का एक अदृश्य watermark बैठा है, जो मेटाडेटा हट जाने पर भी नहीं जाता।
किसी भी परत का कोई off switch नहीं है — न हमारे लिए, न किसी दूसरे reseller के लिए। हम इस मॉडल पर white-label output का वादा नहीं कर सकते। ऐसे कॉन्ट्रैक्ट के तहत क्लाइंट के assets एडिट कर रहे हैं जो AI-लेबल वाली सामग्री की मनाही करता है? वह बातचीत अभी कर लीजिए।
लागत पर एक नोट, क्योंकि यहाँ सहज अनुमान उल्टा पड़ता है: सस्ते draft passes quality से नहीं आते। बीस low iterations की बिलिंग ठीक उतनी ही है जितनी बीस high की। सस्ते review loop के लिए 1K पर draft कीजिए और 2K या 4K उस वर्ज़न के लिए बचाकर रखिए जो असल में ship होगा।
हमारे डिफ़ॉल्ट quality=high और resolution=1K पर प्रति आउटपुट इमेज $0.0525। 2K पर यह $0.105 और 4K पर $0.1575 हो जाता है, क्योंकि resolution दो और तीन से गुणा करता है। Quality tier इनमें से किसी आँकड़े को नहीं बदलता। ये आँकड़े 26 अगस्त 2026 की हमारी जाँच के हैं।
OpenAI की दस्तावेज़ी सीमा के मुताबिक़ 16 तक, और एक request अधिकतम 10 outputs लौटा सकती है। ज़्यादा अटैचमेंट का मतलब है ज़्यादा input tokens, इसलिए 16 references वाला composite किसी single-image रीटच जितना काम नहीं है।
low quality वाला एडिट high से सस्ता पड़ता है?नहीं। आप कोई भी वैल्यू भेजें, हमारा multiplier ×7 ही रहता है, इसलिए low, medium और high — तीनों 1K पर $0.0525 बिल करते हैं। यह field यहाँ ज़रूरी है, और इसकी कोई सेटिंग आपकी लागत घटाती नहीं। खर्च नियंत्रित करने के लिए resolution इस्तेमाल कीजिए।
क्योंकि input_fidelity हटा दिया गया: हर अटैच की गई इमेज high fidelity पर प्रोसेस होती है और कोई सस्ता विकल्प है ही नहीं, इसलिए एक एडिट सिर्फ़-prompt वाली request से ज़्यादा input tokens जलाता है। यह पूरे बाज़ार में दिखता है — fal.ai का edit endpoint low tier पर उसके text-to-image रेट का क़रीब दोगुना है।
हाँ, और किसी Google विकल्प के बजाय इस मॉडल को चुनने की मुख्य वजह यही है। बदली जाने वाली सटीक string उद्धरण चिह्नों में दीजिए और बताइए कि मूल का क्या होना चाहिए। बहुभाषी बदलाव भी चलते हैं, CJK समेत, और लेआउट दोबारा बनाने की ज़रूरत नहीं पड़ती।
हाँ। हर आउटपुट पर C2PA मेटाडेटा रहता है जिसे पढ़कर प्लेटफ़ॉर्म "Made with AI" लेबल लगाते हैं, और साथ में इमेज डेटा के भीतर एक अदृश्य pixel watermark भी। दोनों हर quality tier पर लागू होते हैं और किसी भी provider के पास इन्हें बंद करने का रास्ता नहीं है।
जब एडिट का केंद्र कोई व्यक्ति हो — पोर्ट्रेट का यथार्थ और references के आर-पार character consistency, यही वे जगहें हैं जहाँ Google का Pro tier मज़बूत है। रोज़मर्रा के background और रंग वाले काम के लिए $0.04 पर Nano Banana 2 काफ़ी है; वहाँ हमारी टेक्स्ट वाली बढ़त आपके किसी काम की नहीं।