返回模型列表

Nano Banana Pro

基于 gemini-3-pro-image 的 Nano Banana 高阶版本,支持文本生成图像与编辑,画面内文字清晰可读,最高可输出 4K。

图像编辑起$0.075文本生成图像起$0.075
定价起价 $0.075/次请求
延迟平均约 30 秒
分辨率1K/2K/4K
最适合text to image

参数

预估费用

此模型可为您节省 50%
每 request 基础成本$0.15
折扣-50%
您的总计$0.075
每次请求可节省 $0.075

登录以运行模型

Output Preview

Ready

No output yet

Run the model to see generated results.

示例输出

API 示例— 当前参数

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/nano-banana-pro/text-to-image',
  'input': {}
}
)

获取任务— 轮询获取结果

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)
探索替代方案

相关模型

探索适用于 文本生成图像 的其他 AI 模型

查看所有模型

E2X 上的 Nano Banana Pro Text-to-Image API

Nano Banana Pro 是 Google 给 gemini-3-pro-image 起的产品名,是其图像家族的最高一档。我们把它的生成 endpoint 运行在 google/nano-banana-pro/text-to-image 上——输入只有一个 prompt——在 1K 和 2K 下每张收费 $0.075,4K 按 $0.15 计费。同样一次 request,fal.ai 要收两倍的钱。

已经有图片,宁愿改而不是重画?Nano Banana Pro edit-image 是同一个模型、同样的价格,只是多了一个放参考图的 image_urls 字段。

2026 年 8 月 26 日 核查时我们的数字所处的位置:

API 提供商价格(1K/2K)价格(4K)与 E2X 相比
E2X$0.075$0.15—
fal.ai$0.15$0.30我们低 50%
Google Gemini API$0.134$0.24我们低 44%

价格与产品条款可能随时间变化;在做出采购决定前,请核对各家提供商的当前价格。Google 的 Batch 或 Flex 价格在调度、可用容量和处理条件上均有所不同,因此与标准的按需 API request 并不直接等价,已从本对比中排除。这是一次限定范围的对比,并非声称 E2X 在任何配置下都是全球最便宜的选择。

在这里,resolution 是我们唯一的计费因子。1K 和 2K 同为 $0.075 —— 除非带宽对您很要紧,否则没有理由渲染 1K —— 而 4K 翻倍。

Pro 档从零起步时能做什么

从无到有的生成,是比编辑更难的问题。没有参考图来锚定构图,所以模型做对的每一件事,都得从它对您那句话的推理中长出来。有三项 capability 撑起了大部分重量。

站得住的排版。 这就是为 Pro 价格买单的理由。这个模型能在画面内渲染有样式、可阅读的文字——标题、价目表、菜单牌、图表标签、包装文案——跨多种语言,而且是在更便宜的模型只能产出装饰性鬼画符的字号上。一张带真实标语的海报,就是一次 request,而不是一次 request 加上一小时的设计软件。

Google Search grounding。 模型在构图时可以查询实时搜索。让它画一栋特定的建筑、一套特定的制服、一道按某个菜系惯例摆盘的特定菜品,它就有了除自身先验之外可以查阅的地方。这在 text-to-image 里比在编辑里重要得多,因为在编辑中,源照片早就把「这东西长什么样」这个问题定下来了。

真正的 4K,最高 4096×4096。 不是事后外挂的放大。我们的 resolution 枚举是小写的——1k、2k、4k——而且只有 4k 会改变价格。

还有第四件值得知道的事,因为它出现在您的延迟曲线里,而不是账单上。这个模型在落定之前会做视觉推理,过程中会产出中间的「thought image」。Google 不会把它们返回,而我们不对此计费。按每次 request 大约 30 秒来预算,这个数字就不再意外了。

API request:从 prompt 到成片

prompt 是唯一的必填字段。在控制台铸一把 key,把它藏在您自己的后端后面,然后向我们的 submit endpoint 发起请求。

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/nano-banana-pro/text-to-image",
    "input": {
      "prompt": "一张法罗群岛的复古旅行海报。丝网印刷质感,四种平涂色,玄武岩悬崖上覆盖着浓雾。VISIT FAROE 这几个字以窄体无衬线排在底部三分之一处。",
      "aspect_ratio": "2:3",
      "resolution": "2k"
    }
  }'

您会拿回一个 job ID。可以对它做 polling,也可以在 submit 的 body 里给我们一个 webhookUrl,改由我们通知您:

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submit = (input) =>
  fetch("https://api.e2x.ai/v1/jobs/submit", {
    method: "POST",
    headers,
    body: JSON.stringify({ model: "google/nano-banana-pro/text-to-image", input }),
  }).then((r) => r.json());

const { data } = await submit({
  prompt:
    "咖啡供应链的等距信息图,六个带标注的阶段,低饱和大地色系,所有标注均为葡萄牙语且在小尺寸下清晰可读。",
  aspect_ratio: "16:9",
  resolution: "4k",
});

let job;
do {
  await new Promise((r) => setTimeout(r, 2500));
  job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
    .then((r) => r.json());
} while (job.data.status === "pending" || job.data.status === "processing");

if (job.data.status !== "completed") throw new Error(job.data.error?.message);
console.log(job.data.outputs[0].url);

有两处 schema 细节常常绊倒人。我们的 aspect_ratio 默认值是 9:16,所以省略这个字段的 request 回来时是竖版——请每次都设置它。而且枚举范围很宽:从 1:1、4:5 到 21:9 共十种比例,覆盖了大多数广告和社交格式,事后无需再裁。机器可读规格里有当前的清单和当前的价格。

在我们的 text-to-image 模型之间做选择

Pro 是这个家族里最贵的生成器,而大量工作并不需要它:

模型每张价格什么时候选它
Nano Banana Pro$0.075可读的图内文字、搜索 grounding,或 4K
Nano Banana 2$0.04半价即可获得的当代画质
Nano Banana 2 Lite$0.02381K 下的大批量工作,而且速度最要紧
Nano Banana(legacy)$0.0312一套您还没搬走的旧集成
GPT Image 2high / 1K 下 $0.0525您想要 OpenAI 的渲染,或者透明背景

从 Nano Banana 2 开始。它的价格略高于 Pro 的一半,文字渲染得不错,而对产品图、缩略图和编辑类图像来说,您很少能分辨出文件出自哪一档。当图像里的文字本身就是交付物时——一份菜单、一张信息图、一件双语战役素材——或者当客户需要长边 4096 像素时,再往上换 Pro。

有一行值得再看一眼:Nano Banana 2 Lite 比 legacy 版 Nano Banana 更便宜,也比它更新。 Google 自己把初代称作其 legacy 模型,并推荐用 Lite 来替代。如果您还在调用那个旧 slug,那就是摆在桌上没捡的钱。

GPT Image 2 是排版上唯一真正的对手,而它带来的是另一种观感——更冷静、更写实,并且能返回透明背景,这一点没有任何 Gemini 图像模型做得到。其余选项在 text-to-image 分类里,我们运行的全部模型都在模型目录页面上。

让画面里的文字准确落地

把您想要的字符串加上引号。用引号括起来,一字不差地拼写出来,并说明它放在哪里——「顶部横排 'HALF PRICE TUESDAY' 几个字,窄体无衬线,红底白字」。描述文字,模型会去演绎;引用文字,模型会去誊写。

先定字,再定景。以版式和排版开头、随后再描述周围图像的 prompt,比把文字埋在最后一个从句里的 prompt 更能守住文案。

然后就让它去干活。因为这个模型是先推理后落笔,所以一条带有真实结构约束的 prompt——数清元素个数、点名配色、固定阅读顺序——会被真正用上。含糊的形容词只会被平均掉。

交付之前

每一张图像都带有 SynthID watermark,这是 Google 的不可感知来源信号。任何地方都没有参数可以关掉它,包括这里。下游的检测工具能看到它,所以如果某份合同禁止带 watermark 的交付物,请先把这件事处理掉。

如果您是从别家提供商迁移配置过来的,请核对您对 aspect ratio 的假设。我们的默认是竖版,不是方形,而一条假定 1:1 的流水线会一直悄悄产出 9:16 的文件,直到有人发现为止。

常见问题

Nano Banana Pro 对应的是哪个 Google 模型?

是 gemini-3-pro-image,Google Nano Banana 家族的高端档位。这一档是为要求苛刻的视觉工作而造的——可读的图内排版、有搜索 grounding 支撑的细节、最高 4096×4096 的输出——而不是为了最快的周转速度。

在 E2X 上 Nano Banana Pro text-to-image 多少钱?

1K 和 2K 下每张 $0.075,4K 为 $0.15。按我们 2026 年 8 月 26 日的核查,这是 fal.ai 价格的一半,比 Google 自家 API 低 44%。价格会变动,所以在据此编制预算之前,请到实时模型页面确认。

它能生成带可读文字的图像吗?

能,而且这正是选择这一档的主要理由。它能在图像内部渲染有样式的标题、标注和正文,支持多种语言,而且是在大多数图像模型都会失败的字号上。请在 prompt 里给措辞加引号,而不是转述它。

text-to-image 和 edit-image 这两个 endpoint 有什么区别?

同一个模型,同样的 $0.075,输入不同。Text-to-image 只接受一个 prompt。Edit-image 额外接受一个装参考图的 image_urls 数组,当一张已有图片需要被修改而不是重造时,您要的就是它。

一次生成需要多久?

大约 30 秒。模型在推敲构图时会产出中间的「thought image」——Google 不会返回它们,我们也不为它们计费,但时间正是花在那里。如果对您来说延迟比质量更重要,flash 档的模型要快上数倍。

Nano Banana Pro 的图像带 watermark 吗?

带。每一张输出都包含 SynthID watermark,这是 Google 用于 AI 生成内容的隐形标记。没有任何提供商暴露禁用它的办法,我们也一样。

相比 Nano Banana 2,Nano Banana Pro 值得吗?

只在某些时候值得。Nano Banana 2 是 $0.04 对 $0.075,在大多数摄影类和插画类工作上表现都很好。当图像里包含真的会有人去读的文案、当您需要有搜索 grounding 支撑的准确性,或者当输出必须是 4K 时,再为 Pro 付费。

支持哪些 aspect ratio?

十种:1:1、2:3、3:2、3:4、4:3、4:5、5:4、9:16、16:9 和 21:9。我们的默认值是 9:16,所以除非您想要竖版输出,否则请显式设置这个字段。