ऐसे prompt कैसे लिखें जिन्हें Nano Banana मॉडल सचमुच मानें
ज़्यादातर prompting गाइड विशेषणों की सूचियाँ हैं। prompt में सबसे कम मायने विशेषण ही रखते हैं।
हम चारों Nano Banana मॉडल एक ही API के पीछे चलाते हैं, और prompt जिन तरीक़ों से फ़ेल होते हैं वे इतने एक जैसे हैं कि लिखे जा सकते हैं। चालीस शब्द क्वालिटी वाले विशेषणों पर और दो रोशनी पर। Pro जितनी लंबी compositional brief सबसे सस्ते टियर पर दाग़ दी गई। एक ऐसा edit request जो पूरा दृश्य दोबारा बयान करता है और एक अलग तस्वीर बनकर लौटता है। इनमें से कोई मॉडल की समस्या नहीं है। ये लिखने की समस्याएँ हैं, और लिखने की समस्याओं का इलाज होता है।

माध्यम, विषय, रोशनी, फ़्रेम — इसी क्रम में
prompt पूरा एक साथ पढ़ा जाता है, लेकिन शुरू के clauses बाद वालों से ज़्यादा काम करते हैं। वे उस जगह की हद तय करते हैं जिसमें बाक़ी वाक्य को रहना है। "एक सुंदर औरत" से शुरू कीजिए और मॉडल को अंदाज़ा लगाना पड़ेगा कि वह तस्वीर बना रहा है, तैलचित्र, या 3D render — और वह आपके बाक़ी शब्दों के सांख्यिकीय इशारे से अंदाज़ा लगाएगा। "35mm editorial photograph" से शुरू कीजिए और उसके बाद का हर फ़ैसला पहले से एक माध्यम में बँध जाता है।
तो क्रम:
- माध्यम। पेड़ का सबसे बड़ा दोराहा। Photograph, isometric render, flat vector illustration, gouache painting, macro product shot। एक चुनिए और पहले चार शब्दों में उसका नाम लीजिए।
- विषय। श्रेणी नहीं — वह ख़ास चीज़। "कैफ़े की मेज़ पर एक औरत" स्टॉक फ़ोटो है। "पचास के दशक की एक औरत, दोनों हाथ सफ़ेद कप के इर्द-गिर्द" तस्वीर है।
- रोशनी। दिशा, गुणवत्ता, रंग। यह एक वाक्य नतीजे को बाक़ी किसी भी चीज़ से ज़्यादा हिलाता है, और इसे लगभग कोई नहीं लिखता।
- फ़्रेम। कैमरे की ऊँचाई, दूरी, crop, depth of field, और ख़ाली जगह कहाँ जाएगी।
यह रही वही माँग, पहले ख़राब लिखी हुई और फिर ढंग से लिखी हुई।
कॉफ़ी शॉप में एक सुंदर औरत, बेहद डिटेल्ड, 8k, masterpiece,
trending on artstation, ultra realistic, professional photography, award
winning, sharp focus, bokeh
35mm editorial photograph. पचास के दशक की एक औरत संगमरमर की कैफ़े मेज़ पर
अकेली बैठी है, दोनों हाथ एक सफ़ेद कप के इर्द-गिर्द लिपटे, नज़र फ़्रेम से बाहर
बाईं तरफ़। उसके पीछे की खिड़की से आती नीची सर्दियों की धूप, उसके बालों के
किनारों को छूती और बाहर की सड़क को सफ़ेद में उड़ाती हुई। बग़ल की मेज़ से,
बैठी हुई आँख की ऊँचाई से, कमर तक का फ़्रेम, shallow depth of field,
background नरम धूसर में घटता हुआ।
क्या बदला: माध्यम आगे आ गया, विषय को एक ख़ास भंगिमा मिली, रोशनी को दिशा और तापमान मिला, और कैमरे को जगह। क्वालिटी के बारे में कुछ नहीं जोड़ा गया। दूसरा prompt धुँधले अर्थ में ज़्यादा डिटेल्ड नहीं है — वह ज़्यादा तय किया हुआ है।
और "highly detailed, 8k, masterpiece" लिखना बंद कीजिए। इन मॉडलों पर इससे कुछ नहीं होता। ये tokens 2022 की Stable Diffusion prompt संस्कृति का माल हैं, जहाँ ये एक कहीं छोटे मॉडल को उसके training data के एक ख़ास टुकड़े की तरफ़ ठेलते थे। Gemini पीढ़ी के मॉडल इन पर प्रतिक्रिया नहीं देते, और इनमें से हर एक वह बजट है जो आप यह बताने पर ख़र्च कर सकते थे कि रोशनी कहाँ से आ रही है।

ख़ाली जगह भर दी जाती है, जब तक आप उस पर दावा न करें
ये मॉडल चीज़ें छोड़ते नहीं। अगर आप एक मग का वर्णन करते हैं और उसके इर्द-गिर्द के बारे में कुछ नहीं कहते, तब भी इमेज में इर्द-गिर्द कुछ होगा — और वह वही होगा जो आम तौर पर मग की तस्वीर में होता है: लकड़ी की मेज़, लिनन का नैपकिन, किसी चीज़ की टहनी, धुँधली खिड़की, और मोटे तौर पर चालीस फ़ीसदी बार मग पर छपा हुआ एक शब्द।
हम सबसे ज़्यादा यही शिकायत सुनते हैं, और यह क्वालिटी की दिक़्क़त नहीं है। किसी ने मना ही नहीं किया था।
मेज़ पर एक सिरेमिक मग, product shot
बिना glaze किए हुए stoneware के एक अकेले मग का macro product photograph,
मैट oatmeal बदन, अँगूठे से घिसा हुआ हैंडल, एक seamless मध्यम-धूसर sweep के
ठीक बीचोंबीच खड़ा। ऊपर बाईं तरफ़ से बड़ा नरम स्रोत, एक हल्की परछाईं नीचे
दाईं तरफ़ गिरती हुई। मग पर कोई टेक्स्ट नहीं, कोई logo नहीं, कोई दूसरी चीज़
नहीं, कोई हाथ नहीं, कोई props नहीं, background में कोई डिटेल नहीं।
इस दोबारा लिखे prompt का आख़िरी वाक्य पहले तीनों से ज़्यादा काम कर रहा है। मनाही की बातें prompt के आख़िर में एक सादी सूची की तरह लिखिए, बाक़ी हिस्से जैसी ही भाषा में। "कोई टेक्स्ट नहीं, कोई logo नहीं, कोई इंसान नहीं, कोई बिखराव नहीं" अक्सर फ़ाइल की सबसे क़ीमती लाइन होती है — और जिस इमेज पर बाद में असली typography बैठेगी, उस पर यह वैकल्पिक नहीं है।
जिसे आप composite करने वाले हैं, उसके लिए यह और भी ज़्यादा मायने रखता है। जिस जनरेट किए background में मॉडल ने अपनी तरफ़ से rosemary की टहनी बो दी है, वह ऐसा background है जिसे आपको mask करना पड़ेगा।

जिस टियर को आप सचमुच कॉल कर रहे हैं, उसके लिए लिखिए
चारों मॉडल अलग-अलग मात्रा में prompt लेते हैं, और उन्हें prompt की अलग शक्लें चाहिए। छतें वहाँ नहीं हैं जहाँ लोग उम्मीद करते हैं:
| मॉडल | prompt की छत | उसे क्या चाहिए |
|---|---|---|
| Nano Banana 2 Lite | 32,000 अक्षर | छोटा, एक विषय, सपाट clause संरचना |
| Nano Banana 2 | 20,000 अक्षर | मध्यम लंबाई, दो-तीन जुड़े हुए तत्व थाम लेता है |
| Nano Banana Pro | 50,000 अक्षर | स्थानिक रिश्तों वाली लंबी compositional briefs |
| Nano Banana (legacy) | — | 2 अक्टूबर 2026 को रिटायर; tune करने के बजाय माइग्रेट कीजिए |
कीमत में बीच में बैठने के बावजूद मौजूदा तीनों टियरों में सबसे नीची छत Nano Banana 2 की है। पहली बार यह सबको चौंकाता है।
हालाँकि असली अड़चन छतें नहीं हैं। Lite एक lite मॉडल है, और लंबे prompt उस पर एक ख़ास तरीक़े से फ़ेल होते हैं: वह पहला clause और आख़िरी clause रखता है और बीच वाला चुपचाप गिरा देता है। घोंसले जैसी शर्तें ("एक कमरा जिसमें एक मेज़ है जिस पर एक कटोरा रखा है जिसमें तीन नाशपाती हैं, जिनमें से एक कुचली हुई है") नाशपातियों के बिना ही वापस आती हैं। Lite के लिए सपाट वाक्य लिखिए। एक विषय, एक जगह, रोशनी का एक स्रोत, मनाही की एक सूची।
golden hour में एक आधुनिक open-plan दफ़्तर का isometric 3D render, जिसमें
standing desks पर चौदह अलग-अलग कर्मचारी हों, बाईं तरफ़ शीशे की दीवारों
वाला meeting room जिसमें whiteboard हो, कोनों में गमलों में fiddle-leaf fig,
पिछली दीवार के साथ एक coffee bar और एक barista, ऊपर खुली हुई ductwork,
खिड़कियों का अक्स लौटाते चमकाए हुए कंक्रीट फ़र्श, और सामने से तीसरी डेस्क पर
सोई हुई एक बिल्ली
golden hour में एक open-plan दफ़्तर का isometric 3D render। standing desks की
क़तारें, बाईं तरफ़ शीशे की दीवारों वाला meeting room, ऊँची खिड़कियाँ जो
चमकाए हुए कंक्रीट फ़र्श पर लंबी गरम रोशनी फेंकती हैं। दबा हुआ palette, साफ़
ज्यामिति। कोई टेक्स्ट नहीं, कोई साइनबोर्ड नहीं, कोई इंसान नहीं।
पहला prompt ग़लत नहीं है। वह Lite के लिए ग़लत है। उसे Pro पर भेजिए और चौदह कर्मचारी, ductwork और बिल्ली, सब आ जाते हैं। Lite पर भेजिए और आपको एक दफ़्तर, एक खिड़की और $0.0238 का बिल मिलता है।
और यही सलाह उलटी दिशा में इस तरह काम की होती है: अगर आपका prompt साठ शब्दों से कम का है और उसमें एक ही विषय है, तो Pro आपको तीस सेकंड के इंतज़ार और क़रीब तिगुनी लागत के अलावा कुछ नहीं ख़रीदकर देता। लोग जो कुछ बनाते हैं उसका ज़्यादातर हिस्सा Lite का काम है। हम आपको यह बताना पसंद करेंगे, बजाय किसी placeholder background के लिए आपको सबसे ऊपरी टियर बेचने के। कौन-सा टियर किस काम के लिए, इसका पूरा ब्यौरा हमने अलग से लिखा है: चार Nano Banana मॉडलों की तुलना।
Aspect ratio एक composition निर्देश है, crop नहीं
वाक्य लिखने से पहले शक्ल तय कीजिए, क्योंकि शक्ल बदल देती है कि वाक्य को कहना क्या चाहिए। 21:9 के banner को एक क्षितिज चाहिए और बीच से हटा हुआ विषय। 9:16 की story को खड़ी चढ़ाई चाहिए और सिर के ऊपर जगह। अगर आप वर्ग के लिए prompt लिखकर उसे चौड़ा render करेंगे, तो आपको दोनों तरफ़ padding वाली वर्गाकार composition मिलेगी, और वह ठीक वैसी ही दिखेगी।
composition को prompt में साफ़-साफ़ बोलिए। "क्षितिज निचले तिहाई में, विषय दाएँ तिहाई पर, copy के लिए ऊपर बाईं तरफ़ ख़ाली आसमान" एक असली निर्देश है और ये मॉडल इसे अच्छी तरह मानते हैं।
फिर वह जाल है जो लोगों का पूरा asset batch खा जाता है। डिफ़ॉल्ट aspect ratio हर टियर पर एक जैसा नहीं है। Nano Banana, Nano Banana 2 और Nano Banana Pro पर हमारा डिफ़ॉल्ट 9:16 है। Nano Banana 2 Lite पर वह 1:1 है। यानी जो config कभी aspect_ratio pin नहीं करती, वह तीन मॉडलों पर portrait इमेज बनाती है और चौथे पर वर्ग — और अगर आप पैसे बचाने के लिए टियर बदलते हैं, तो आपके output की शक्ल आपके नीचे से चुपचाप बदल जाती है।
इसे pin कीजिए। हमेशा, हर कॉल पर, तब भी जब डिफ़ॉल्ट संयोग से वही हो जो आप चाहते हैं:
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-2-lite/text-to-image",
"input": {
"prompt": "सपाट बादलों वाली रोशनी में ग्रेनाइट की एक धार का चौड़ा landscape photograph, क्षितिज निचले तिहाई में, धार की रेखा दाईं तरफ़ से भीतर आती हुई, ऊपर बाईं तरफ़ ख़ाली पीला आसमान। कोई टेक्स्ट नहीं, कोई इंसान नहीं, कोई इमारत नहीं।",
"aspect_ratio": "21:9"
}
}'
अपना टियर जानने की एक और वजह: Lite चार ऐसे aspect ratios ढोता है जो हमारे कैटलॉग में और किसी के पास नहीं — 1:4, 4:1, 1:8 और 8:1। ये सचमुच काम के हैं और सचमुच कम इस्तेमाल होते हैं। साइट भर का header rail या कोई ऊँची sidebar इकाई 8:1 पर render करना 16:9 बनाकर उसका 80% काट देने से बेहतर है — composition में भी, और उन pixels की कीमत के लिहाज़ से भी जो आपने फेंक दिए।

एडिटिंग अलग हुनर है: delta लिखिए
सबसे तजुर्बेकार prompt लिखने वाले यहीं सबसे ज़्यादा पीछे लुढ़कते हैं, क्योंकि text-to-image की आदत यह है कि आप जो तस्वीर चाहते हैं उसका वर्णन करें। edit कॉल में तस्वीर आपके पास पहले से है। उसे दोबारा बयान करना उसी से मुक़ाबला करता है।
edit prompt के दो काम हैं: बताना कि क्या बदलेगा, और बताना कि क्या नहीं। उसमें और कुछ नहीं आता।
कम सर्दियों की रोशनी में संगमरमर की कैफ़े मेज़ पर पचास के दशक की एक औरत,
नीले की जगह लाल कोट पहने, वही चेहरा, वही मुद्रा, editorial photograph,
35mm, shallow depth of field, गरम रंगत
कोट को navy से गहरे ईंट-लाल में बदलिए। कपड़े का वज़न, कॉलर की शक्ल और
गिरावट बिलकुल वैसी ही रखिए। फ़्रेम में बाक़ी सब अपरिवर्तित है: वही चेहरा,
वही भाव, वही हाथ, वही कप, वही खिड़की की रोशनी, वही crop।
पहला संस्करण माध्यम, lens और रंगत, तीनों दोबारा तय करता है, और इनमें से हर दोबारा-तय एक नया निर्देश है जिस पर मॉडल अमल कर सकता है। हल्का-सा अलग चेहरा इसी तरह मिलता है। दूसरा संस्करण एक चीज़ को छूता है और बाक़ी को साफ़-साफ़ जमा देता है।
एडिटिंग pipeline बनाने से पहले दो यांत्रिक तथ्य जान लेना ठीक रहेगा। reference की गिनती टियर से बदलती है: legacy मॉडल तीन इमेज लेता है, Nano Banana 2 का edit endpoint चौदह, और Nano Banana Pro का भी चौदह, पर वह उन्हें रोल के हिसाब से बाँटता है — पहचान के लिए पाँच तक कैरेक्टर इमेज, प्रोडक्ट की fidelity के लिए छह ऑब्जेक्ट इमेज, तीन स्टाइल references। यही रोल-बँटवारा वजह है कि Pro एक ही request में पूरा ad composite जोड़ लेता है, और यह अपने आप में एक पूरा विषय है; उसे हम Nano Banana generations भर में कैरेक्टर को एक जैसा रखना में देखते हैं।
इमेज के भीतर टेक्स्ट, और कब न उलझें
इमेज के भीतर पढ़ने लायक़ शब्द Gemini 3 पीढ़ी के साथ आए। legacy gemini-2.5-flash-image यह नहीं कर सकता — कभी-कभी एक शब्द बच जाता है, वाक्य कभी नहीं। जिसमें असली typography हो, उसके लिए आपको Nano Banana 2 चाहिए, और जहाँ typography ही असल बात हो वहाँ Pro — जो styled और बहुभाषी टेक्स्ट इतनी अच्छी तरह render करता है कि आप उसे अंग्रेज़ी infographic थमाकर उसका स्पैनिश संस्करण artwork सलामत रखते हुए वापस पा सकते हैं।
और जब आप टेक्स्ट माँगते हैं, तो नियम कस जाते हैं:
- शब्दों को उद्धरण चिह्नों में रखिए, ठीक वैसे ही जैसे उन्हें दिखना चाहिए।
- बताइए कि कितने शब्द हैं और वे फ़्रेम में कहाँ बैठेंगे।
- अक्षरों की शक्ल को font के नाम से नहीं, एक शैली की तरह बताइए। "ऊँचे ज्यामितीय Art Deco capitals, खुला letter-spacing" काम करता है। किसी ख़ास typeface का नाम लेना ज़्यादातर नहीं करता।
- आख़िर में "और कहीं कोई टेक्स्ट नहीं" लिखिए, वरना मॉडल एक भरोसेमंद-सी subtitle जोड़ देगा जो आपने माँगी ही नहीं थी।
Lisbon के लिए एक vintage travel poster, जिस पर art deco अक्षरों में शब्द LISBOA हो
1930 के दशक का vintage travel poster illustration, flat screen-print शैली में
दिखते हुए registration offsets के साथ। एक क्रीम रंग की ट्राम खड़ी pastel सड़क पर
चढ़ती हुई, उसके पीछे Tagus का मुहाना तीन सपाट नीलों में। टेक्स्ट सिर्फ़ एक
पंक्ति: निचले चौथाई हिस्से में ऊँचे ज्यामितीय Art Deco capitals में शब्द
"LISBOA", क्रीम पर गहरा गेरुआ, खुला letter-spacing। इमेज में और कहीं कोई
टेक्स्ट नहीं।
अब वह हिस्सा जो लोगों को पसंद नहीं आता। ज़्यादातर in-image टेक्स्ट को इमेज में होना ही नहीं चाहिए। अगर शब्दों को कभी बदलना पड़ सकता है, अनुवाद होना पड़ सकता है, चुना जाना पड़ सकता है, स्क्रीन रीडर से पढ़ा जाना पड़ सकता है, या लीगल के देखने के बाद सुधारा जाना पड़ सकता है — तो artwork साफ़ बनवाइए और टाइप HTML, Figma या अपने टेम्पलेट इंजन में बिठाइए। मॉडल कर सकता है इसलिए headline को pixels में पका देना एक ऐसा फ़ैसला है जिसकी कीमत आप कॉपी के पहले संशोधन पर चुकाएँगे। render किया हुआ टेक्स्ट तब माँगिए जब टाइप सचमुच artwork का हिस्सा हो — कोई पोस्टर, कोई पेंट की हुई दुकान का बोर्ड, किसी still life में किताब की जिल्द — और बाक़ी हर बार छोड़ दीजिए।
डेटा जैसी हर चीज़ पर इसकी धार और तेज़ है। जो मॉडल भरोसेमंद-सा टेक्स्ट render करता है, वह भरोसेमंद-से नंबर और भरोसेमंद-से जगहों के नाम भी render करता है — जो पोस्टर पर ठीक है और किसी चार्ट या नक़्शे पर तबाही। ठीक ऐसा क्यों है, यह हमने AI इमेज जनरेटर नक़्शों में इतने बुरे क्यों हैं में खोला है।
रखने लायक़ टेम्पलेट
चार ढाँचे, जो लोगों के बनाए ज़्यादातर काम को समेट लेते हैं। कोष्ठक भरिए, जो लागू न हो उसे हटाइए, मनाही वाली लाइन रखिए।
सादे ground पर साफ़ विषय, compositing के लिए:
[माध्यम: macro product photograph / studio still life] — एक अकेले [विषय,
एक ख़ास material डिटेल के साथ] का, seamless [रंग] sweep के बीचोंबीच।
[दिशा] से [रोशनी का स्रोत और आकार], एक परछाईं [दिशा] गिरती हुई।
कोई टेक्स्ट नहीं, कोई logo नहीं, कोई props नहीं, कोई हाथ नहीं, background
में कोई डिटेल नहीं।
copy के लिए जगह छोड़ता editorial दृश्य:
[माध्यम] — [विषय, एक ख़ास काम करते हुए], [जगह]। [रोशनी: दिशा, गुणवत्ता,
रंग तापमान]। [कैमरे की ऊँचाई और दूरी] से शॉट, [crop], [depth of field]।
[विषय] [बाएँ/दाएँ] तिहाई पर, copy के लिए [क्षेत्र] में ख़ाली [सतह या आसमान]।
कोई टेक्स्ट नहीं, कोई logo नहीं।
एक चीज़ बदलने वाला edit:
[तत्व] को [मौजूदा हालत] से [लक्ष्य हालत] में बदलिए। [उस तत्व के वे दो-तीन
गुण जिन्हें बचना चाहिए] बिलकुल वैसे ही रखिए। फ़्रेम में बाक़ी सब अपरिवर्तित
है: वही [सबसे ज़्यादा ख़तरे में पड़े हिस्से गिनाइए]।
टाइप की एक ही पंक्ति वाला illustration, Pro टियर:
[illustration शैली और युग], [तकनीक की डिटेल]। [दृश्य, दो वाक्यों में]।
टेक्स्ट सिर्फ़ एक पंक्ति: [अक्षरों की शक्ल का वर्णन] में शब्द "[शब्द]",
[रंग] पर [रंग], [जगह] पर बैठा हुआ। इमेज में और कहीं कोई टेक्स्ट नहीं।
जब दिक़्क़त prompt की नहीं होती
किसी मोड़ पर prompt ठीक होता है और दिक़्क़त pipeline की होती है: retries, seeds, queueing, URL की मियाद ख़त्म होने से पहले output स्टोर करना। वह अलग अनुशासन है और उसे हमने वॉल्यूम पर इमेज ऑटो-जनरेट करना में लिखा है। और अगर आप जो फ़ासला पाटना चाहते हैं वह निर्देश मानने का नहीं, ख़ास तौर पर फ़ोटोग्राफ़िक विश्वसनीयता का है, तो उसकी जाँच सूची सबसे यथार्थवादी AI इमेज जनरेटर पर हमारी गाइड में है।
हर मॉडल अपनी सटीक पैरामीटर सूची — पूरा aspect ratio सेट, डिफ़ॉल्ट, और वह क्या मना करता है — एक मशीन-पठनीय spec के रूप में छापता है, जैसे Nano Banana 2 Lite की spec फ़ाइल। मॉडल बदलने के बाद बिगड़ा हुआ prompt दोबारा लिखने से पहले वही पढ़िए। दस में से नौ बार prompt ठीक था और उसके नीचे से कोई डिफ़ॉल्ट खिसक गया था। text-to-image कैटेगरी के हर मॉडल के पीछे, और हम जो कुछ और चलाते हैं उसके पीछे भी, एक spec फ़ाइल है।
अक्सर पूछे जाने वाले सवाल
Nano Banana prompt की संरचना कैसी होनी चाहिए?
पहले माध्यम, फिर विषय, फिर रोशनी, फिर framing, फिर मनाही की सूची। शुरुआती शब्दों में माध्यम का नाम लेना उसके बाद के हर फ़ैसले को बाँध देता है, और रोशनी को साफ़-साफ़ बताना नतीजे के लिए किसी भी मात्रा के क्वालिटी-विशेषणों से ज़्यादा करता है। आख़िर में लिखिए कि क्या नहीं दिखना चाहिए — "कोई टेक्स्ट नहीं, कोई logo नहीं, कोई props नहीं" — क्योंकि ये मॉडल बिना बताई जगह को ख़ाली छोड़ने के बजाय भर देते हैं।
क्या "8k" और "masterpiece" जैसे क्वालिटी शब्द Nano Banana पर मदद करते हैं?
नहीं। ये tokens पहले के open-weight diffusion मॉडलों से आए हैं, जहाँ ये output को training data के एक ख़ास हिस्से की तरफ़ मोड़ते थे। Gemini पीढ़ी के मॉडल इन पर प्रतिक्रिया नहीं देते, और ये वह prompt बजट खा जाते हैं जो रोशनी की दिशा, कैमरे की जगह या मनाही पर बेहतर ख़र्च होता।
Nano Banana prompt कितना लंबा हो सकता है?
Nano Banana 2 Lite 32,000 अक्षर तक लेता है, Nano Banana 2 20,000 तक, और Nano Banana Pro 50,000 तक। ये पक्की छतें हैं, लक्ष्य नहीं। ख़ासकर Lite अपनी सीमा तक पहुँचने से काफ़ी पहले ही लंबे prompt पर बुरा प्रदर्शन करने लगता है, क्योंकि उसका झुकाव शुरू और आख़िर के clauses रखने और बीच वाला गिरा देने का है।
मॉडल बदलते ही मेरी इमेज ग़लत शक्ल में क्यों आती हैं?
क्योंकि डिफ़ॉल्ट aspect ratio हर टियर पर अलग है। हमारे API पर Nano Banana, Nano Banana 2 और Nano Banana Pro का डिफ़ॉल्ट 9:16 है, जबकि Nano Banana 2 Lite का 1:1। इसलिए जो request कभी aspect_ratio सेट नहीं करती, वह इन मॉडलों के बीच आवाजाही पर शक्ल बदल लेती है। इसे हर कॉल पर साफ़-साफ़ सेट कीजिए।
Nano Banana के लिए एडिटिंग prompt कैसे लिखूँ?
दृश्य नहीं, delta लिखिए। जो एक चीज़ बदलनी है उसका नाम लीजिए, उसके वे गुण गिनाइए जिन्हें बचना चाहिए, फिर कहिए कि बाक़ी सब अपरिवर्तित है और सबसे ज़्यादा ख़तरे वाले हिस्से गिनाइए — चेहरा, मुद्रा, रोशनी, crop। edit prompt में माध्यम, lens या मिज़ाज दोबारा बताना ही वह चीज़ है जो इमेज में कहीं और अनचाहे बदलाव कराती है।
कौन-सा Nano Banana मॉडल इमेज में पढ़ने लायक़ टेक्स्ट बना सकता है?
Nano Banana 2 और Nano Banana Pro बना सकते हैं, क्योंकि पढ़ने लायक़ in-image टेक्स्ट Gemini 3 पीढ़ी की capability है। जहाँ typography ही असल बात हो, वहाँ भरोसेमंद विकल्प Nano Banana Pro है, क्योंकि वह styled और बहुभाषी टेक्स्ट भी सँभालता है। legacy gemini-2.5-flash-image पढ़ने लायक़ टेक्स्ट बना ही नहीं सकता।
क्या बेहतर prompt पालन के लिए मुझे Nano Banana Pro चाहिए?
आमतौर पर नहीं। Pro की बढ़त कई स्थानिक रिश्तों वाली लंबी compositional brief थामने में है, साथ में रोल-अलग reference इमेज और भरोसेमंद in-image टेक्स्ट। अगर आपका prompt साठ शब्दों से कम में एक ही विषय है, तो $0.0238 वाला Nano Banana 2 Lite उसे उतनी ही ईमानदारी से मानेगा और ज़्यादा तेज़ी से लौटाएगा।