怎么写 Nano Banana 真的会照办的 prompt
大多数 prompt 指南是一串形容词。形容词恰恰是一条 prompt 里最不要紧的部分。
四个 Nano Banana 模型我们都放在同一个 API 后面跑,而一条 prompt 失败的方式一致到可以写下来。四十个词花在质量形容词上,两个词留给光线。一份 Pro 长度的构图 brief 打给了最便宜的那一档。一条编辑请求把整个场景重新描述了一遍,回来的是另一张画。这些都不是模型的问题。是写作的问题,而写作的问题有解。

媒介、主体、光、画框——按这个顺序
一条 prompt 是被整体读取的,但靠前的从句比靠后的干更多活。它们划定了句子其余部分必须待着的那个空间。开头写「一个美丽的女人」,模型就得猜它到底是在做一张照片、一幅油画,还是一个 3D 渲染,而它会照着您其余的词在统计上暗示的东西去猜。开头写「35mm 杂志摄影」,接下来的每一个决定就已经被约束在一种媒介里了。
所以顺序是:
- 媒介。 树上最大的那个分叉。照片、等距渲染、扁平矢量插画、水粉画、微距产品照。挑一个,在前四个词里点名。
- 主体。 不是类别——是那个具体的东西。「一个女人坐在咖啡馆桌边」是一张图库照。「一位五十多岁的女人,双手捧着一只白杯子」是一张画面。
- 光。 方向、质地、颜色。这一句话对结果的推动超过其他任何一句,而几乎没有人写它。
- 画框。 机位高度、距离、裁切、景深,以及空白留在哪里。
下面是同一个需求,先写坏,再写对。
一个美丽的女人在咖啡店里,细节极其丰富,8k,杰作,
artstation 热门,超写实,专业摄影,获奖作品,
锐利对焦,散景
35mm 杂志摄影。一位五十多岁的女人独自坐在一张大理石咖啡馆
桌边,双手捧着一只白杯子,目光望向画面左侧之外。冬日低角度阳光
从她身后的窗户进来,勾出发丝的轮廓,把窗外的街道打成一片白。
从邻桌以坐姿视线高度拍摄,半身,浅景深,背景衰减为柔和的灰。
变了什么:媒介挪到了最前面,主体拿到了一个具体动作,光拿到了方向和色温,相机拿到了位置。关于质量,一个字都没加。第二条 prompt 不是在含糊意义上更「详细」——它更有决断。
还有,别再写「细节极其丰富、8k、杰作」了。在这些模型上它什么都不做。那些 token 是 2022 年 Stable Diffusion prompt 文化留下的货,当年它们能把一个小得多的模型往训练数据里某一小块上推一推。Gemini 一代的模型对它们没有反应,而它们每一个都是您本可以拿去描述光从哪来的预算。

您不认领的空白,会被填满
这些模型不会把东西留空。如果您描述了一只马克杯,却对它周围什么都不说,画面里仍然会有一圈周围,而那会是马克杯照片通常会有的东西:一张木桌、一块亚麻餐巾、一小枝什么植物、一扇虚焦的窗,以及大约四成的概率,杯子上印着一个词。
这是我们听到最多的抱怨,而它不是质量问题。是没有人说过不要。
桌上一只陶瓷马克杯,产品照
一只未上釉的炻器马克杯的微距产品照,哑光燕麦色杯体,
手柄被拇指磨出痕迹,端端正正立在无缝的中灰色背景纸中央。
一只大柔光源来自左上方,一道柔和的阴影落向右下。
杯子上无文字,无 logo,无其他物体,无手,无道具,背景无细节。
那次重写的最后一句,干的活比前三句加起来还多。把排除项写成 prompt 结尾的一份朴素清单,语气和其余部分保持一致。「无文字,无 logo,无人物,无杂物」常常是整个文件里价值最高的一行——而对任何之后要压上真实排版的图像来说,它不是可选项。
对任何您打算做合成的东西,这一点尤其要紧。一张背景里凭空长出一枝迷迭香,就是一张您得去抠的背景。

照着您真正在调用的那一档来写
四个模型吃得下的 prompt 长度不同,而且它们想要的 prompt 形状也不同。上限的位置不在人们以为的地方:
| 模型 | prompt 上限 | 它想要什么 |
|---|---|---|
| Nano Banana 2 Lite | 32,000 字符 | 短、单一主体、扁平的从句结构 |
| Nano Banana 2 | 20,000 字符 | 中等长度,撑得住两三个相关元素 |
| Nano Banana Pro | 50,000 字符 | 带空间关系的长构图 brief |
| Nano Banana(legacy) | —— | 2026 年 10 月 2 日退役;迁移,别调优 |
Nano Banana 2 明明价格居中,上限却是当代三档里最低的。第一次看到这件事,每个人都意外。
不过上限并不是真正的约束。Lite 是个 lite 模型,长 prompt 在它上面以一种特定的方式失败:它会留住第一个从句和最后一个从句,然后悄悄丢掉中间。嵌套条件(「一个房间,里面有张桌子,桌上放着一只碗,碗里有三只梨,其中一只有磕伤」)回来时梨会完全不见。给 Lite 写扁平的句子。一个主体、一个场景、一个光源、一份排除清单。
一间现代开放式办公室在黄金时刻的等距 3D 渲染,
十四位各不相同的员工站在升降桌前,左侧一间玻璃墙会议室里有一块白板,
角落里摆着盆栽琴叶榕,后墙沿线是一个咖啡吧和一位咖啡师,
头顶是裸露的风管,抛光水泥地面映着窗户,
前数第三张桌上睡着一只猫
一间开放式办公室在黄金时刻的等距 3D 渲染。一排排升降桌,
左侧一间玻璃墙会议室,高窗把长长的暖光投在抛光水泥地面上。
低饱和配色,干净的几何结构。
无文字,无标识,无人物。
第一条 prompt 不是错的。它是对 Lite 而言错了。把它发给 Pro,十四位员工、风管和那只猫都会到齐。把它发给 Lite,您会拿到一间办公室、一扇窗,和一张 $0.0238 的账单。
反过来说,这条建议还有个有用的版本:如果您的 prompt 不到六十个词、里面只有一个主体,那 Pro 除了三十秒的等待和大约三倍的花费之外,什么都不会多给您。人们生成的大部分东西都是 Lite 的活儿。比起为一张占位背景把顶级档卖给您,我们宁愿把这话说出来。完整的「哪一档配哪种活儿」拆解,我们单独写在了四个 Nano Banana 的横向对比里。
Aspect ratio 是一条构图指令,不是一次裁切
在写句子之前先定形状,因为形状会改变这句话该说什么。一张 21:9 的横幅想要一条地平线和一个推离中心的主体。一张 9:16 的竖版故事想要一个垂直的堆叠和头顶留白。如果您照着方形写 prompt 却渲染成宽幅,您会拿到一个方形构图外加两边的留白,而它看起来就正是那样。
把构图在 prompt 里直接说出来。「地平线在下三分之一处,主体在右三分之一处,左上方留出大片空天用来放文案」是一条真实的指令,而这些模型照办得不错。
然后是那个会让人赔上一整批素材的坑。各档的默认 aspect ratio 并不相同。 在 Nano Banana、Nano Banana 2 和 Nano Banana Pro 上,我们的默认值是 9:16。在 Nano Banana 2 Lite 上是 1:1。所以一份从不钉死 aspect_ratio 的配置,会在三个模型上产出竖版、在第四个上产出方图,而如果您为了省钱换档,输出的形状会在您脚下悄悄变掉。
把它钉死。永远钉死,每一次调用都钉,哪怕默认值恰好就是您想要的:
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-2-lite/text-to-image",
"input": {
"prompt": "平淡阴天光线下一道花岗岩山脊的宽幅风景照,地平线在下三分之一处,脊线从右侧切入,左上方是大片空白的淡色天空。无文字,无人物,无建筑。",
"aspect_ratio": "21:9"
}
}'
还有一个该知道自己在用哪一档的理由:Lite 带着四种我们目录里别处都没有的 aspect ratio——1:4、4:1、1:8 和 8:1。它们是真的有用,也是真的没被用起来。一条全站页头长条或者一个高瘦的侧栏单元,按 8:1 渲染胜过生成一张 16:9 再裁掉它的 80%,无论是在构图上,还是在您为那些扔掉的像素付了多少钱上。

编辑是另一门手艺:写增量
这是最有经验的 prompt 写手退步最厉害的地方,因为文生图养成的本能就是去描述您想要的那张画。而在一次编辑调用里,那张画您已经有了。再描述一遍,等于跟它抢。
一条编辑 prompt 有两件事要做:点名什么在变,以及点名什么绝不能变。别的都不该待在里面。
一位五十多岁的女人在低角度冬日光线下坐在大理石咖啡馆桌边,
穿一件红色而不是蓝色的外套,同一张脸,同一个姿势,杂志摄影,
35mm,浅景深,暖调
把外套从藏青改成深砖红。织物的厚重感、领型和垂坠感保持
完全一致。画面里其余一切不变:同一张脸、同样的表情、同样的手、
同一只杯子、同样的窗光、同样的裁切。
第一个版本把媒介、镜头和色调都重新指定了一遍,而这每一次重新指定,都是模型可能去执行的一条新指令。脸会微妙地变掉,就是这么来的。第二个版本只碰一样东西,并且明确冻住了其余部分。
在搭编辑流水线之前,有两个机械层面的事实值得知道。参考图数量按档而异:legacy 模型接三张,Nano Banana 2 的 edit endpoint 接十四张,Nano Banana Pro 的也接十四张,但按角色分开——最多五张角色图管身份,六张物体图管产品还原,三张风格参考。正是那套角色分离,让 Pro 能在一次 request 里拼出一整张广告合成图,而这本身是一个完整的话题;我们在让一个角色在 Nano Banana 的多次生成里保持一致里讲了它。
图内文字,以及什么时候别费这个劲
图像里可读的文字是随 Gemini 3 这一代到来的。legacy 的 gemini-2.5-flash-image 做不到——单个词有时候能活下来,一整句从来不行。任何带真实排版的东西您想要 Nano Banana 2,而任何以排版本身为重点的东西您想要 Pro,它把带样式的和多语言的文字渲染得足够好,好到您可以递给它一张英文信息图,拿回一份底下图表原封不动的西班牙语版本。
当您真的要文字时,规则会收紧:
- 把那些词放进引号里,一字不差地照着该出现的样子写。
- 说清楚一共有几个词,以及它们落在画面的什么位置。
- 把字形描述成一种风格,而不是一个字体名。「高瘦的几何感 Art Deco 大写字母,字距宽松」有用。点名某个具体字体,大多没用。
- 用「画面里别处不得有任何其他文字」收尾,否则模型会加上一句您没要过的、看起来很合理的副标题。
一张里斯本的复古旅行海报,LISBOA 这个词用 art deco 字体
1930 年代复古旅行海报插画,扁平丝网印风格,带可见的套印错位。
一辆奶油色电车爬上一条陡峭的粉彩色街道,身后是分作三块平涂蓝色的
特茹河口。只有一行文字:单词 "LISBOA",用高瘦的几何感 Art Deco
大写字母横跨画面下四分之一,米底深赭色,字距宽松。画面里
别处不得有任何其他文字。
现在说不受欢迎的那部分。大多数图内文字不该在图里。如果那些词以后需要改动、需要被翻译、需要被选中、需要被读屏软件读出来,或者需要在法务看过之后被修正,那就干净地生成画面,再在 HTML、Figma 或者您的模板引擎里排字。仅仅因为模型能做,就把一句标题烤进像素里,是一个您会在第一次文案修订时付出代价的决定。当排版真的是画面的一部分时才要求渲染文字——一张海报、一面手绘的店铺招牌、一幅静物里的书脊——其余时候跳过它。
对任何数据形状的东西,这一条更锋利。一个能渲染看起来合理的文字的模型,也会渲染看起来合理的数字和看起来合理的地名,这在海报上没问题,在图表或地图上则是灾难。我们在为什么 AI 图像生成器画不好地图里讲清楚了原因。
值得留着的模板
四副骨架,覆盖了人们真正会生成的大部分东西。填好方括号,删掉不适用的,留住那行排除项。
干净背景上的单一主体,供合成用:
[媒介:微距产品照 / 棚拍静物] 一件 [主体,带一处具体的材质细节],
居中置于无缝的 [颜色] 背景纸上。
[光源与尺寸] 来自 [方向],一道阴影落向 [方向]。
无文字,无 logo,无道具,无手,背景无细节。
带文案留白的杂志式场景:
[媒介],[主体正在做一件具体的事],[场景]。[光:方向、
质地、色温]。从 [机位高度与距离] 拍摄,
[裁切],[景深]。[主体] 位于 [左/右] 三分之一处,[区域] 留出
空白的 [台面或天空] 用来放文案。无文字,无 logo。
只改一样东西的编辑:
把 [元素] 从 [当前状态] 改成 [目标状态]。保持 [该元素中必须
存活下来的那两三项属性] 完全一致。画面里其余一切不变:
同样的 [列出最容易出事的那几处]。
带单行文字的插画,Pro 档:
[插画风格与年代],[技法细节]。[用两句话描述的场景]。
只有一行文字:单词 "[WORD]",用 [字形描述],
[颜色] 底上的 [颜色],位置在 [哪里]。画面里
别处不得有任何其他文字。
当问题不出在 prompt 上
到了某个时候,prompt 是好的,出问题的是流水线:重试、seed、排队、在 URL 过期之前把输出存下来。那是另一门功夫,我们写在了如何大批量自动生成图像里。而如果您想补上的那道差距具体是摄影上的可信度,而不是指令遵循,那份检查清单在我们那篇最真实的 AI 图像生成器指南里。
每个模型都以机器可读的规格公布自己确切的参数清单——完整的 aspect ratio 集合、默认值、它拒绝什么——比如 Nano Banana 2 Lite 的规格文件。在您去重写一条换模型之后开始不听话的 prompt 之前,先读它。十次里有九次,prompt 本来是好的,是一个默认值在它脚下挪动了。text-to-image 分类里每一个模型背后都有一份规格文件,我们跑的其他一切背后也有。
常见问题
我该怎么组织一条 Nano Banana prompt?
媒介在先,然后是主体,然后是光,然后是取景,最后是一份排除清单。在开头几个词里点名媒介,会约束住随后的每一个决定,而明确描述光线对结果的作用,超过任何数量的质量形容词。用「什么不得出现」收尾——「无文字,无 logo,无道具」——因为这些模型会去填满未指定的空间,而不是把它留空。
「8k」「杰作」这类质量词在 Nano Banana 上有用吗?
没用。那些 token 来自更早的开放权重扩散模型,在那里它们能把输出引向训练数据的某个特定子集。Gemini 一代的模型对它们没有反应,而它们占掉的 prompt 预算,本可以更好地花在光的方向、机位或者排除项上。
一条 Nano Banana prompt 能有多长?
Nano Banana 2 Lite 最多接受 32,000 字符,Nano Banana 2 最多 20,000,Nano Banana Pro 最多 50,000。那些是硬上限,不是目标。尤其是 Lite,远在触到上限之前,长 prompt 上的表现就已经变差了,因为它倾向于留住开头和结尾的从句而丢掉中间。
为什么我换模型之后图的形状不对了?
因为默认 aspect ratio 按档而异。在我们的 API 上,Nano Banana、Nano Banana 2 和 Nano Banana Pro 默认 9:16,而 Nano Banana 2 Lite 默认 1:1。所以一个从不设置 aspect_ratio 的 request,在这些模型之间移动时形状就会变。请在每一次调用上显式设置它。
我该怎么给 Nano Banana 写编辑 prompt?
写增量,不是写场景。点名那一样在变的东西,点名它身上必须存活下来的属性,然后声明其余一切不变,并列出最容易出事的那几处——脸、姿势、光线、裁切。在编辑 prompt 里重新描述媒介、镜头或氛围,正是图像别处出现意外改动的原因。
哪个 Nano Banana 模型能在图里渲染可读的文字?
Nano Banana 2 和 Nano Banana Pro 可以,因为可读的图内文字是 Gemini 3 这一代的能力。当排版就是重点时,Nano Banana Pro 是可靠的选择,因为它还能处理带样式的和多语言的文字。legacy 的 gemini-2.5-flash-image 完全渲染不出可读文字。
我需要 Nano Banana Pro 来换取更好的指令遵循吗?
通常不需要。Pro 的优势在于撑住一份带好几层空间关系的长构图 brief,加上按角色分离的参考图和可靠的图内文字。如果您的 prompt 只是一个主体、不到六十个词,$0.0238 的 Nano Banana 2 Lite 会同样忠实地照办,而且回得更快。