最真实的 AI 图像生成器,以及怎么验
没有人会在第一眼就识破一张生成的照片。他们是在第二眼识破的,大约在四秒钟之后,画面里有什么东西开始对不上账,而他们又一时说不出是什么。
那四秒的缝隙就是全部问题所在,而且它已经基本不再是一个模型问题了。我们把 Google 和 OpenAI 的图像模型放在同一个 API 后面跑,2026 年 8 月的诚实现状是:我们卖的每一档都能递给您一张扛得住一眼的图。哪怕最便宜的那一档。把一张有说服力的图和一张一看就是合成的图分开的,主要是您要了什么,以及您有没有认真看拿回来的东西。
所以「哪个是最真实的 AI 图像生成器」这个问题,有用的答案分三部分,而模型名字是其中最不重要的一部分。先是检查这一关,然后是 prompt 习惯,最后才是模型。

真实感从模型里搬了出来,搬进了 prompt
两年前,挑一个「照片级」的模型是有意义的。顶级档和廉价档之间的差距在缩略图尺寸上就看得见:蜡一样的皮肤、糊掉的细节、不属于任何相机的颜色。那个差距在画面主体上基本已经合拢,搬到角落里去了。Nano Banana 2 Lite,我们 $0.0238 的最便宜一档,能渲染出一个可信的主体。它输给更重的档位的地方在次要细节上——主体后面的那些物件、这个世界的小字——而不在您点名要的那个东西上。
这意味着如今各个模型的失败模式是一致的,而且可以列成清单。这是好消息。一份检查清单比一条模型推荐活得久,而模型每几个月就换一批。
七点检查流程
每一张图交付之前都跑一遍。顺序熟了之后不到一分钟。
| 检查项 | 合成图会怎样 |
|---|---|
| 皮肤 | 均匀、无毛孔、完美对称、没有一根碎发 |
| 光线 | 阴影指向不止一个方向 |
| 磨损 | 表面没有灰尘、划痕、指纹或岁月痕迹 |
| 对称 | 成对的东西彼此匹配得太精确 |
| 末端 | 手、牙齿、耳朵、首饰卡扣 |
| 背景 | 一放大就不再是物体的物体 |
| 光学 | 任何真实镜头都产生不出的景深 |
其中有四项,一行表格装不下。
皮肤是任何人最先读到的东西,也是模型最后才做对的东西。 真实的皮肤有毛孔、有斑、某处有一根破裂的毛细血管,而且一张脸的两侧对不上。生成的皮肤会倾向于一个均匀、微微发蜡的表面,衰减柔和而统一——像是给一个从来没被拍过的人做了重度的频率分离修图。把脸颊放大到 100%。如果那里完全没有纹理,没人能说出问题在哪,但每个人都会感觉到。
光是假图暴露得最快的地方,也是最容易做的检查。 挑出最亮的高光,顺着它暗示的方向追过去,然后看画面里每一道阴影,问它们是否彼此同意。真实场景通常有一个主光源加上反弹光。生成的场景常常是每个物体各自从它最好看的方向拿到一团柔光,于是那些阴影会悄悄互相矛盾。也请检查阴影的边缘和光源是否一致——一个硬朗的太阳,不会在一个物体上打出柔边阴影,在下一个物体上打出硬边的。
背景物体是模型省力气最便宜的地方。 注意力预算都给了主体。三米之外的一个书脊,会变成一个像书脊的形状,放到 100% 就化成抽象。这一项容易漏掉,因为您的眼睛本来就不该往那儿看——而这恰恰是艺术指导会往那儿看的原因。放大四个角,别放大中间。
景深是几乎没人做的那项检查。 真实镜头会产生一个焦平面:某个距离上的东西是锐的,锐度在它前后以物理上一致的方式衰减。生成的散景常常像滤镜一样贴上去——主体处处都锐,包括那只本该柔掉的耳朵,而背后的虚化是一片均匀的糊,里面没有距离。看那些失焦的高光点。真的会呈现出光圈的形状。假的就只是虚化。
手和牙齿留在清单上,因为它们在人像里仍然是最可靠的破绽,尽管当代模型在这两项上翻车的频率远低于 2024 年那批模型。磨损和对称查得更快:真实的物件是被用过的,而真实的成对之物从不完全相同。

为缺陷写 prompt,别为光鲜写
一旦您知道失败长什么样,就可以点名要它们缺席。大多数人能做的最大一处改进,是别再描述一张漂亮的图,开始描述一张由某个具体的人、用某套具体的器材、在某种具体条件下拍下来的照片。
四个习惯完成了大部分工作。
点名一支镜头和一款胶片。 不是因为模型在模拟光学——它没有——而是因为在训练数据里,那些词是和真正具备那些属性的图像绑在一起的。「用 35mm 镜头 f/2 拍摄,Portra 400」把输出往真实摄影的样子上拉的力度,远超过「照片级、8k、超写实」永远能做到的程度。后面那几个词绑着的是渲染图和概念设定稿,而那正是您想逃开的样子。
指定一个光源和一个时刻。 含糊的打光就是阴影互相矛盾的来源。给模型一个方向和一种质地,它通常会照办。
明确要求不完美。 模型默认干净,因为在大多数图注里,「好照片」的意思就是干净。您得去推翻它。
描述那个房间,不只是那个主体。 一张照片是发生在某个地方的。点名那个台面、后面那面墙、画面边上的杂物,就给了光一个可以落下的地方,还没等背景问题发生就修掉了一半。
实际的差别是这样。大多数人写的那个版本:
一张厨房里女人的照片级人像,光线优美,
细节极其丰富,8k,专业摄影
以及能拿到一张照片的那个版本:
一位五十多岁的女人倚在厨房台面上的杂志式人像,
用 50mm 镜头 f/2 拍摄于 Portra 400。单一硬光源来自
相机左侧的一扇窗,傍晚时分,无补光。可见的皮肤纹理与
毛孔,面部略有不对称,几缕翘起的碎发。磨损的复合板台面上
有水渍圈和一只缺口的马克杯。轻微的镜头暗角,略带颗粒。
第二个更长、读起来更无聊,出来的结果好得多。这笔交换就是全部的手艺。
产品和静物的活儿套用同一套逻辑,只是换了名词:
黄铜水龙头架在一只刮花的搪瓷水槽上的微距产品照,
85mm 微距 f/4,单只柔光箱位于相机右上方,一道利落的阴影。
底座处有水垢,金属上有指纹,出水口横着一道细如发丝的划痕。
浅焦在水龙头之后迅速衰减。
如果您想要 prompt 里针对具体模型的那一面——参数行为、参考图的处理方式、Google 那几档对结构如何响应——那是另一篇:我们的 Nano Banana prompt 指南。

用哪个模型,以及老实说为什么
不做排名,因为排名暗示只有一个赢家,而真正的答案取决于谁会看这张图、看多久。
Nano Banana Pro 的 2K,用在任何会被人细看的东西上。 主视觉、首屏图、要送印或者要给会放大看的客户的东西。Pro 在交出一帧之前会经过若干中间推敲,这就是它要花大约 30 秒而不是两秒的原因,也是它的背景物体比我们目录里任何其他档位都更撑得住的原因。实用的细节:在 Pro 上 1K 和 2K 同价,都是 $0.075。没有理由去要 1K。4K 翻一倍。
Nano Banana 2 用在其余 90% 的活儿上。 $0.04,最高 4K,最多 14 张参考图,需要的话还有可读的图内文字。对一张信息流图片、一幅博客插图、一个缩略图来说,它和 Pro 的差别活不过您的 CMS 施加的那道压缩。
GPT Image 2 用在文件的形状比光的形状更要紧的时候。 它是我们目录里唯一能一次调用返回透明背景的模型,而且它带着十五种 aspect ratio,包括 Google 那几档做不了的真正 3:1 和 1:3 全景。1K 是 $0.0525。要为它能输出什么而去找它,而不是因为它更照片级。在那条轴上,它既没有明显领先,也没有明显落后。
还有一档我们会劝您别用:如果这张图最终会以 800 像素宽活在信息流里,那就用 Nano Banana 2 Lite,把钱花在多跑几次上。十次 Lite 生成加一次认真的挑选,胜过一次因为贵所以留下的 Pro 生成。在那个尺寸上,真实感是一个挑选问题。
价格与产品条款可能随时间变化;在做出采购决定前,请核对各家提供商的当前价格。Google 的 Batch 或 Flex 价格在调度、可用容量和处理条件上均有所不同,因此与标准的按需 API request 并不直接等价,已从本对比中排除。这是一次限定范围的对比,并非声称 E2X 在任何配置下都是全球最便宜的选择。
有一个约束是没有任何模型能让您绕开的:Google 会在它的图像模型返回的一切东西里嵌入一个不可见的 SynthID 标记,而下游没有任何人能把它关掉。
想要跨整个目录、按活儿逐一拆解,而不只是照片级这一小块,请看图像生成该用哪个 AI。如果您生成图片是为了照着画而不是为了发表,规则会变很多:把 AI 图像当作绘画参考。
这些把您带到哪里
挑那个能过您显示尺寸这一关的最便宜档位。描述一台相机和一个房间,而不是一个形容词。然后在任何东西交付之前跑完那七项检查,因为发现错误的那个人不会是您团队里的。
Aspect ratio、分辨率上限和参考图数量限制都写在每个模型页面上,归在 text-to-image 下。如果您宁愿对比而不是阅读,目录把它们并排放在了一起。
常见问题
2026 年最真实的 AI 图像生成器是哪个?
对会被人凑近检查的图像来说,Nano Banana Pro(gemini-3-pro-image)撑得最好,主要因为它经过若干中间推敲来构图,能让次要的背景细节保持连贯。对大多数要发表的作品来说,一旦图像为网页缩放过,它和 Nano Banana 2 的差别就消失了。在正常显示尺寸上,真实感如今更取决于 prompt 有多具体,而不是选了哪个模型。
我怎么判断一张图是不是 AI 生成的?
先查光:把最亮的高光追溯到一个光源,再确认画面里每一道阴影都同意它。然后放大到 100% 看皮肤(找毛孔和不对称)、看背景物体(它们常常化成只是像物体的形状),还有失焦的高光点(真散景会呈现光圈的形状,假散景是均匀的糊)。在人像里,手和牙齿依然是有用的破绽。
哪些 prompt 用词真的能提升照片感?
点名真实的摄影器材和条件,而不是形容词:一个焦距、一档光圈、一款胶片、一个有名有姓的单一光源和一个时刻。然后明确要求不完美——可见的皮肤纹理、轻微的不对称、表面的灰尘和磨损、轻微的镜头暗角和颗粒。像「超写实」和「8k」这样的词会把输出往渲染图和概念设定稿上拉,那正好是您想要的反面。
花更多钱能拿到更真实的图吗?
比人们以为的要少见。$0.075 的 Nano Banana Pro 买到的是背景和次要细节更好的连贯性,这对大尺寸或印刷输出有意义。在信息流的尺寸上,$0.0238 的 Nano Banana 2 Lite 通常分辨不出来,而把那笔差价花在多跑几次生成和更严格的挑选上,胜过一次昂贵的尝试。
落地页的主视觉该用哪个模型?
Nano Banana Pro 的 2K。在那一档上 1K 和 2K 按同样的 $0.075 计费,所以要 1K 等于白白让出分辨率。只有素材要送印时才用 4K,因为 4K 会把价格翻倍到 $0.15。
生成的照片带 watermark 吗?
如果是 Google 模型做的,带。每一个 Nano Banana 档位都嵌入 SynthID,它是机器可检测的,而不是您能在画面里看见的东西。Google 在文件到达转售方之前就打上了它,所以下游没有任何提供商能提供一个不带它的版本。请在集成之前,而不是之后,读一遍您客户合同里关于带 watermark 交付物的条款。
哪个模型能给透明背景?
GPT Image 2 是 E2X 目录里唯一带 background 参数、接受 transparent、opaque 或 auto 的模型,所以它能一次调用就返回一张抠好的 PNG。Google 的那些模型在任何档位都不暴露透明度。一次 1K 的 GPT Image 2 request 花费 $0.0525。