Gemini Omni 1.1 Flash 的 4K 是放大出来的。在我们这里它仍然便宜 41%
我们本来打算跑一个显而易见的测试,它却在第一步就塌了——而那反倒成了更有意思的结果。
计划很普通:一条 prompt,一个固定的 seed,两个分辨率,然后把两张静帧都按一比一像素打开,看看最高那一档加了什么。回来的却是两部不同的片子。同样的 prompt 文本,同样的 seed——在 720p 那一条里躺在画面左下方的黄铜放大镜,到了 4K 那一条里跑到画面右侧,而且更靠后。颜料碗的摆法不一样,数量也更多——720p 那一条在五秒半处画面里有七只装着颜料的碗,而 4K 那一条是五只。亚麻布从后面卷着的一卷,变成在右侧大幅摊开。
这一点值得明说,因为 prompt 方面的建议都假定了相反的情况:**一个 seed 在同一个分辨率内可以复现一个镜头,跨分辨率则不行。**换一档,您就是重新下单拍了一条新的,而不是把手上那条印大一点。任何打算用一个 seed 便宜地打草稿、再贵着收尾的人,都该把这句话读两遍。
所以这个比较只能建立在一个交付出来的文件上。取一帧 4K,把它缩到 1920 乘 1080,再放回 3840 乘 2160。一份 1080p 母版本来能承载的一切都能扛过这趟来回;比 1080p 所能表达的更细的东西则扛不过去。拿 round trip 跟 native 比,差出来的就是最高那一档在 1080p 之上真正交付的东西。
对照组比测量本身更要紧,因为 H.264 的颗粒正好就住在被测量的那个频段里。所以测试跑在两类区域上:可能存在真实细节的有纹理区域,以及根本存不住细节的失焦平坦区域。平坦区域给出的就是噪声底。
| 512 乘 512 的图块 | 它是什么 | native 对 round-trip,高频能量 |
|---|---|---|
| 有纹理 | 亚麻布的织纹 | 3.62 倍 |
| 平坦 | 失焦的台面 | 1.10 倍 |
| 平坦 | 失焦的背景 | 1.15 倍 |
有纹理区域的这份盈余明显高出噪声底,所以交付出来的 4K 确实携带了 1080p 装不下的真实结构——不只是颗粒。但也要读一下它的大小:大约是噪声底的三倍,对着九倍的像素。而且既然压缩噪声会把测量结果往「找到细节」的方向偏,那就把它当成一个上限,而不是一个估计值。
手工放置的三个图块作为依据太薄,所以我们又把同样的 512 像素窗口以 128 像素为步长在整帧上滑了一遍,再按每个图块实际含有多少纹理把结果分开。最平坦的十三个落在 1.08 倍到 1.35 倍之间;纹理最重的十一个落在 2.86 倍到 3.86 倍之间。这个差距是这一帧的性质,不是我们把框放在哪里的性质。


同一帧的同一块 512 像素区域——第 96 帧,也就是第四秒,位置在像素 (2944, 1152)——所以两者之间的差别,就是最高那一档相对一份 1080p 母版所加的全部东西。第二张是一次 round trip,不是一次 1080p 渲染——我们不会给它贴那个标签。
如果您觉得这两张几乎一模一样,那是正确的读法,而不是这张插图没做好。它们最多相差 255 级里的 9 级,平均只差 0.82,PSNR 是 47.1 dB。这也不是一个挑软柿子的例子:那个图块是整帧里纹理最重的 512 像素方块。高频带上 3.62 倍的比值是个真实的结果,但它是一个从来就不大的量的三倍——这段素材从头到尾都是软的。最高那一档在这里加上的,是频谱分得开、而肉眼多半分不开的东西。
给想重复这个测试的人一条方法上的说明:高频能量(high-frequency energy)指的是径向平均 power spectrum 中高于 1080p Nyquist 极限的那一部分所占的比例,对 4K 帧上的一个 512 像素图块来说就是半径 bin 128 以上。round trip 用的是 ffmpeg -vf "scale=1920:1080,scale=3840:2160",默认双三次,在裁出图块之前作用于整帧。
Laplacian variance,也就是平常拿来快速代替锐度的那个指标,是更钝的工具:它把有纹理的图块放在 1.70 倍,把两块平坦的放在 1.36 倍和 1.07 倍,而频谱这个指标给出的是 3.62 倍对 1.10 倍和 1.15 倍。它确实把它们分开了,但差距小到可以被质疑,因为它把压缩噪声和细节一起算了进去。
对这个文件做两项健全性检查,因为一个顶档是很容易伪造的。ffprobe 报告的是货真价实的 3840 乘 2160,文件码率是 25,583,339 bit/s——是同一条 prompt 的 720p 版本的 8.84 倍,对着 9.00 的像素比。没有人拿一条饿着的流塞进 UHD 的壳子里给您。而它测出来正好是 24 fps,8.000 秒里 192 帧:这个数字流传在第三方的 schema 文档里,而不是 Google 公布的任何东西,在这里由我们自己的输出确认了。
所以诚实的答案,不是您通常听到的那两个里的任何一个。最高那一档既不是一份改了标签的 1080p 文件,也不是四倍的画面。九倍的像素买到的,更接近三倍的结构——正因如此,它到底要花多少钱,才值得仔细问一问。

那个括号里的「upscaled」在干什么
Google 的模型参考把这个词原样加在最高的两档上:"1080p output (upscaled)"(放大输出)和 "4K output (upscaled)"(放大输出)。生成发生在某个更低的内部 raster 上,结果在出来的路上被重新缩放,所以最高那一档所携带的任何结构,都是这次缩放放进去的,而不是渲染器解算出来的。Google 没有公布那个内部分辨率,所以任何给您报一个放大倍数的人,其实也不知道。
有两个后果。您没法在结账的时候把一条拍坏的素材买回来,因为毛病出在缩放的上游,而一个愿意凭空造出看似合理纹理的 upscaler,不会造出对的那一种。但**「自己在本地放大就好了」这个说法也比听上去更弱**:模型的缩放跑在交付编码之前,您的跑在之后,跑在一个量化已经烤进去的文件上。
五种活儿:尺寸本身就是交付物
诚实的披露往往会顺手埋掉这一点:细节是想要一个大 raster 的一个理由,而且不是生产里最常见的那个。
**一份点名了 raster 尺寸的交付规格。**广播机构和代理公司是把要求写成尺寸的,而自动 QC 读的是文件头。一份 1920 乘 1080 的文件对着一个 UHD 规格,在人看到它之前就已经不合格了。那一头没有人在测调制传递——他们测的是文件。
**一份存档母版。**把您生成过的最大版本留着:模型会被弃用,而正如上面那个 seed 的结果所示,您没法重跑那条 prompt 再把那段片子拿回来。交付物是从母版往下做的,从来不是往上做。
**重新构图和画面推进的余量。**这是最强的实用理由,而且它就是算术。Omni 只提供两种宽高比,再没有别的,16:9 和 9:16,所以任何方形或 4:5 的东西都是裁出来的。从一帧 1080p 里裁一个居中的 9:16,宽度是 608 像素——一条 1080 宽的竖版交付,意味着要把一个已经压缩过的文件再放大一次。同样这一刀从 UHD 上裁下来是 1215 宽,您是在往规格里缩。画面推进也一样:在 UHD 上做一次 1.5× 的重新构图,交到您手上的仍然是 native 的 1920 乘 1080,而一个 1080p 的源只剩下 1280 乘 720。
**大幅面显示。**在一面 LED 墙或者一块 DOOH 屏上,像素间距决定了您要交出去的文件,而一个被拉伸到铺满的 1080p 源是肉眼可见地发虚的,这在浏览器里的嵌入播放中从来不会发生。
**合成与视觉特效的 plate。**跟踪器和抠像器是在像素上工作的,四倍多的像素能让一次平面解算更稳,哪怕这些像素来自一次放大而不是一块传感器。而且您是按交付规格收尾的,所以 plate 必须一开始就在那儿。
这五条没有一条是关于画面更好看。这五条全都是关于文件对接下来要发生的事情来说,尺寸是对的。

另外三种:您付的是一次缩放的钱
**竖版社交媒体。**每一个主要平台在上传时都会重新编码,而且大多数把长边的上限压得远低于 UHD——您在为那些在 ingest 阶段就被扔掉的像素付顶档的价钱,观众根本还没看到这条帖子。
**网页嵌入。**一段放在文章栏里的片子,播放宽度大概是 800 像素。一个 UHD 源在生成时花您的钱,在交付时花您的 Largest Contentful Paint,是一种少见的双重损失。
**内部审片轮次。**认可一个运镜是一次关于形状和运动的判断,往下两档做,只花一小部分钱。
价格这一节,才是真正的论点
下面是每一家公开了可调用每秒价格的提供商在最高那一档上的价钱,2026 年 8 月 29 日读到。
对着 Google 自己的价格,这是低百分之四十一——远远是四档里最大的一个差距。往下一档,1080p 上这个差距收窄到百分之十一,0.135 美元对 0.1520 美元,再往下场面已经接近到不值得为它写一段。
Replicate 缺席是有理由的,这个理由值得说出来而不是糊过去:它上架了这个模型,却在任何分辨率下都没有公布每秒价格。我们找过一个 4K 的数字,没有任何东西可以引用。
差距为什么在顶端拉大,不是利润行为,而是那道阶梯的形状,而两道形状都是公开的。把每一家按它自己的 720p 一秒做归一化,两者在三档上是一致的:草稿档是三分之一,中间是一倍,1080p 是一倍半。第四档才是它们分开的地方——Google 收它 720p 一秒的三倍,我们收我们的两倍。那百分之四十一里的每一块钱,都出自这一步。

按您真会下单的长度算出来:
| 活儿 | E2X 4K(美元) | Google 4K(美元) |
|---|---|---|
| 四秒的插入镜头 | 0.72 | —— |
| 八秒的主镜头 | 1.44 | 2.43 |
| 十秒,单次生成的上限 | 1.80 | 3.04 |
| 四十秒的序列(一次生成加三次延伸) | 7.20 | 12.16 |
如果您在给一场投放报价,请记住最后那一行。一段四十秒的 UHD 序列,不管您用哪一家,都是四个分开计费的活儿,而两列在一条序列上就差了将近五美元——这还没算上您会扔掉的那些条,每一条都把差距再乘一遍。
两列买到的是同样的权重,同样的原生音频,每一帧里同样的 SynthID 水印。那百分之四十一里没有任何一部分是拿质量换来的——而它也不宣称这就是做视频总体上最便宜的办法,通常并不是。
上到 4K 之后,prompt 里要改什么
几乎什么都不改,而这个「几乎」正是有意思的地方。
分辨率是一个 API 参数,往文本里写「4K」并不会选中那一档。细节形容词是写给错误的那个阶段的:放大跑在生成之后,而且从来不读您的 prompt。它确实会凭空造出采样,上面的测量已经说明了这一点——只是不会朝任何您的词语所指的方向去造。
真正能到达渲染器的是光学和光线,而光线原来是一身兼两职。一个掠射的光源会造出高对比的边缘,而高对比的边缘正是能扛过一次放大的东西,不管 upscaler 是把它们保住了还是重建了。为纹理而打光,是最接近于「为这一档而写 prompt」的做法。
下面是同一份 brief 的两种写法。先看人们在追分辨率时会写成的样子:
4K ultra detailed cinematic shot of a museum conservation bench, 8K,
hyper realistic, insanely sharp, maximum detail, best quality, intricate
textures, razor sharp focus, highly detailed surfaces, photorealistic
masterpiece, professional cinematography, award winning, unreal engine
render, ray tracing, ultra HD, crisp edges, no blur, extreme detail on
every surface, cinematic lighting, beautiful composition, trending.
读一读它到底指示了什么。它从来没有禁止分镜切换,所以模型可以自由地搭一个小叙事——这是它有文档记载的默认行为。它没有摆放任何一盏灯,没有点名镜头,没有设定相机速度,而「unreal engine」指向的是一次游戏渲染而不是一张照片。二十二个形容词,没有一个是渲染器能照着做的指令。
而我们真正跑过的那条 prompt——就是它生成了下面这段片子、上面那些裁切图,以及本文里的每一个数字:
Slow lateral pan, 50mm lens on a motorized slider, moving right to left
at a steady crawl across a museum conservation bench. The frame passes
over an unrolled length of raw linen, a brass magnifier resting on its
side, and a scatter of dry pigment powder in small glass dishes - ochre,
ultramarine, deep charcoal - then settles on the corner of an oil
painting where fine craquelure spiders across the varnish. Hard
low-angle tungsten light from the left rakes over every surface so the
linen weave, the dust and the cracked glaze all read as texture. Focus
stays locked on the bench plane throughout and nothing moves except the
camera. Sound: the faint whir of the slider motor and a room's worth of
quiet.
4K 上的八秒,所以是 1.44 美元。注意活儿是在哪儿干成的:一个硬的低角度光源掠过工作台,让织纹、灰尘和龟裂纹全都读成纹理。那一句话干的事比二十二个形容词都多,也正是因为它,那趟 round trip 才有东西可找。
一条生产上的提醒。这条 prompt 第一次提交被拒了,报的是 It seems there was an issue with the input you provided,改了两个词之后重试就过了——去掉一个相机行话,换掉一种颜料的名字。在长 prompt 上,一个词就能让请求失败,而报错不会告诉您是哪一个。
最高那一档仍然帮不上您的地方
有四条限制专门围着 4K 的活儿。宽高比仍然是 16:9 或 9:16,所以方形和 4:5 的交付物不管您付哪一档的钱,都得从一次裁切里出来。每一帧都带着 SynthID 水印,任何地方都没有开关。没有一个 native 4K 模式可以升上去,也没有任何对 upscaler 的控制。而一次生成仍然最多十秒,所以一份更长的 UHD 母版是一条延伸链,链上每一环失败现在要花 1.80 美元,而不是 1.35 美元。
还有对整篇文章的收尾保留意见:这一切都不能让 Omni 成为拍一段 4K 片子的正确模型。Veo 3.1 Fast 用同一把 key 跑,每秒一美分。对于一个后面没有任何东西依赖它的单个镜头,不管 4K 那个价格看起来多好,十八倍的溢价都是说不过去的。
便宜地打草稿,大尺寸地交付
便宜地迭代,再把一条胜出的提上去:在 360p 上跑十遍加一次收尾是 1.728 美元,对着在 1080p 上跑十遍的 5.40 美元。那篇讲四十秒的文章把这笔账算得更完整。
UHD 加的是一条保留意见,而不是一个步骤。尽管去用每秒 0.0297 美元打草稿,但上面那个 seed 的结果意味着,胜出的那一条是一份指引,不是一次预览——您交付的那一条会是另外一条。让交付规格来挑这一档,而不是让您打草稿时用的那一档来挑。
逐能力的数字在机器可读的规格里;模型在文生视频页面上。价格会变——在花钱之前,请到各家自己的页面上核对。本文覆盖的是 2026 年 8 月 29 日公开了可调用每秒 4K 价格的那些提供商。
常见问题
Gemini Omni 1.1 Flash 是原生渲染 4K 的吗?
不是。Google 的模型参考把它列为*"4K output (upscaled)"*:生成发生在一个更低的内部 raster 上,画面在交付之前被放大,而那个内部分辨率没有公布。不过,对着一次经过 1080p 的 round trip 来量,这个文件确实握着 1080p 装不下的真实结构——在有纹理的区域里大约是噪声底的三倍,对着九倍的像素。一份真实的盈余,但完全谈不上九倍的画面。
在 Gemini Omni 1.1 Flash 上,4K 要花多少钱?
在 E2X 上是每秒 0.18 美元——四秒 0.72 美元,八秒 1.44 美元,十秒也就是单次生成的最大长度是 1.80 美元。直连 Google 是每秒 0.3041 美元,从它公布的 token 数算出来。fal.ai 挂的是 0.30 美元,Runware 0.32 美元,WaveSpeed 0.39 美元。Replicate 在任何分辨率下都没有公布每秒价格。
为什么各家提供商之间的价格差在 4K 上最大?
因为最高那一档上的倍率不同,而不是基础价不同。把 720p 当作 1×,Google 的阶梯是 0.33、1、1.5 和 3;我们的是 0.33、1、1.5 和 2。两者在下面三档上一致,在第四档上分开:Google 为这次放大翻三倍,我们翻两倍。整整那百分之四十一,就是这一步。
什么时候值得付 4K 的价钱?
当尺寸本身就是要求的时候:一份点名了 UHD raster 尺寸、并且由自动 QC 检查的交付规格;一份用来往下裁出未来交付物的存档母版;重新构图的余量,因为 Omni 只输出 16:9 和 9:16;大幅面或 DOOH 显示,那里屏幕的像素间距决定了源文件;以及合成用的 plate,它需要像素数量,而且必须按规格收尾。
什么时候我应该避免用 4K 渲染?
竖版社交媒体,平台会在 ingest 时重新编码,并且把长边的上限压得远低于 UHD;播放宽度只有几百像素的网页嵌入,那里的体积不只花钱,还花掉页面性能;还有内部审批轮次,那是关于形状和运动的判断,您可以在草稿档上做,只花一小部分成本。
在 prompt 里写「4K」或者「ultra detailed」会让输出变好吗?
不会。分辨率是一个 API 参数,prompt 文本选不中它。细节形容词是写给错误的那个阶段的:放大跑在生成之后,而且从来不读 prompt。它确实会加进结构——我们量过——但您写的任何东西都左右不了它加什么。镜头选择、光线方向和相机运动会改变缩放之前被渲染出来的东西,那才是 prompt 里的词配得上它们位置的地方。
我能把一段 4K 的 Omni 片子裁成竖版而不损失画质吗?
通常可以,而且这是这一档最强的实用理由。从 UHD 上裁一个居中的 9:16 是 1215 像素宽,所以一条 1080 宽的竖版交付是一次缩小。同样这一刀从 1080p 上裁下来是 608 宽,而且必须从一个已经压缩过的文件上再放大一次。画面推进也跟着走:在 UHD 上做一次 1.5× 的重新构图,剩下的仍然是 native 的 1920 乘 1080。
同一个 seed 在不同的分辨率下会给出同一个镜头吗?
不会,而且这让我们意外。一条 prompt 配一个固定的 seed,在 720p 上渲染一次,再在 4K 上渲染一次,回来的是两个不同的镜头——物件跑到了工作台的另一边,颜料碗的数量不一样、摆法也不一样,相机高度也不一样。请把 seed 的确定性只当作在同一个分辨率内有效,也不要计划先便宜地敲定一个镜头、再把那个一模一样的镜头重渲成更大的。