返回博客

Gemini Omni 1.1 Flash 的四十秒长镜头,是四张分开的账单

E2X Team··13 分钟阅读
gemini-omnigooglevideo-generationpricingapi

这一周每一条标题里的数字都是四十。Google 新视频模型的四十秒场景——听上去像是您敲一个 prompt,就能拿回四十秒。

拿不回。对 gemini-omni-1.1-flash 的一次调用返回的是三到十秒。四十秒是您把那段片子再延伸三次之后达到的总长——一共四个活儿,每一个都单独计费。没有人撒谎——Google 自己的公告把这些续接说得很清楚——但这个数字从那句话出发之后走了很远的路,到很多人手里时已经变成了一次生成的数字。

这就是我们自己在掏卡之前会想看到的那份简报:四十秒要花多少钱,360p 那一档是干什么用的,以及埋在文档里的那些约束——其中一条把欧洲开发者彻底挡在了那个头条功能之外。

四块黄铜场记板在深色石板上首尾相接地排成一排,每一块都稍微错开一点,接缝清晰可见

四十秒是四个活儿,也是四张账单

视频模型按输出的每一秒计费,而延伸没有折扣——一次续接的价钱等于一次全新生成的价钱,所以四十秒算下来就是四段十秒的片子。每一档都是这样:

分辨率在 E2X 上(美元)直连 Google(美元)
360p1.191.35
720p3.604.06
1080p5.406.08
4K7.2012.16

四乘以十秒,按各自的每秒价格算。我们这边的数字来自线上目录;如果这篇文章过时了,模型页面上有当前的数字。

Google 那一列值得说几句,因为这些价格出乎意料地难找。有两个官方页面带着完整的阶梯,而文本搜索一个也抓不到。在发布公告里,价格是躺在一张图片里的——人眼看得见,Ctrl-F 看不见。在 Cloud 定价页上,它们以「每秒多少 token」的形式出现,对着一个每百万 17.50 美元的计价器,所以在您动手乘之前,它们根本不像价格。而您会第一个打开的那个页面,也就是 API 定价文档,四档里只给了一档:720p 的*「有效价格约为每秒 0.10 美元」*。

两者是一致的,只是有个四舍五入的褶皱——公告给的是齐整的 0.03 / 0.10 / 0.15 / 0.30 美元,而按 token 算出来的每一个都略高一点。计费跟着 token 走,所以上面那一列也跟着 token 走;发布解读里有逐档的推算过程。

四十秒的 1080p 是五块四,Google 那边是六块出头。而这还是在您一条备选都没拍之前的标价——您会拍的,因为漂移正是在最后一次延伸上现形的。把您留下的那一版,加上扔掉的两版一起做预算,一段做完的四十秒序列就是十六美元,不是五美元。

360p 那一行以前是我们输掉的一行,直到不久前我们还在这里这么写。它变了:我们的草稿档现在是每秒 0.0297 美元,对着 Google 的 0.0338 美元,低百分之十二。别从中读出太多东西。fal 在 0.03 美元——差距一个百分点,是被打扮成胜利的统计噪声,也是那种有人改一下倍率就会翻过来的东西。下面那套草稿工作流,不管您从谁那里买都成立;它从来就不依赖于这个价格是我们的。

1.1 真正的升级是记忆,不是长度

长度以前大致也够得着。让它真正可用的,是模型在续接时看到的东西。

六月的预览版读的是它所要延伸的那段片子的最后一秒。一秒告诉您画面里有什么,却几乎不告诉您当时正在发生什么,所以延伸会漂。跟拍镜头不再跟拍。一件夹克的颜色挪了一档。灯光在每一个接缝上重新搭了一遍。

Gemini Omni 1.1 Flash 读的是最多十秒的前序画面。十秒足够知道推轨还在走、主光是从哪一侧来的、那件大衣大概是什么颜色——这才是一段四段式的序列如今能撑住的原因。如果有人告诉您 1.1 的头条功能是长度,那他说反了。长度是算术。记忆才是模型。

1080p 和 4K 是放大出来的,不是渲染出来的

Google 文档里的一个括号,改变了您该为什么付钱。模型参考里的原话是:"1080p output (upscaled)""4K output (upscaled)"。模型是在这些分辨率之下渲染,然后放大上去的。阶梯的顶端不是更多的细节——它是一个更大的文件,装着同样的信息。

这就给上面那一行 4K 换了个颜色。从 Google 那里花十二美元出头,买四十秒放大出来的输出。如果客户的规格要求 4K 尺寸,那就付。但如果您选 4K 是因为以为它看起来更好,那您正好是在用 Google 720p 价格的三倍,买一次自己拿 ffmpeg 就能跑的缩放。

在 360p 上打草稿,在 720p 上收尾

这是真正省钱的那一段,而没有人把它写进标题。

在我们这里,360p 每秒 0.0297 美元——一段四秒的草稿是十二美分,对着 720p 的 0.36 美元和 1080p 的 0.54 美元。Google 还声称 360p 最多快 60%,这是厂商的数字而不是我们测出来的,不过方向显然没错。

现在来算账。假设一个镜头要试十次,动作才对——对任何带着特定运镜的东西来说,这个次数是现实的。

  • 直接在 1080p 上跑十遍 → 5.40 美元
  • 在 360p 上跑十遍 → 1.19 美元,再把胜出的那一条在 1080p 上重渲一次 → 1.73 美元

省下百分之六十八,代价是最后多生成一次。也要老实说清楚 360p 那一遍能告诉您什么:构图、运镜、模型有没有自作主张剪进您从没要过的镜头。细腻的质感它判断不了——分辨率不够,扛不住。

下面是同一个 prompt 在这两档上的结果,同一个 seed,各四秒。先看草稿:

然后是同一个 prompt、同一个 seed 的 720p 渲染:

两段都是深色石板上的一只黄铜秒表,镜头从左侧推进,暖色主光斜掠过金属。两段共用的 prompt,原封不动:

Editorial slow-motion macro shot of a brass mechanical stopwatch resting on a dark slate table, its second hand sweeping forward in a single continuous shot with no scene cuts. Camera performs a slow dolly in from the left, shallow depth of field, one warm amber key light raking across the metal, cool blue rim light behind. Fine dust drifts through the beam. Clean dark background, no text, no logos, no people. Sound design: a soft mechanical tick and low room tone, nothing else.

(prompt 保留英文:这个模型只针对英文做过评测。)

十二美分对三十六美分。草稿告诉了我们推轨看得出来、模型也守住了一个镜头——在下决心之前我们需要知道的全部。把您的循环放在那一档上跑。

延伸只能往前走

场景延伸是往后追加的,而这条限制的形状决定了您怎么规划一段序列。您没法往一段片子的中间插东西。您没法向前延伸去搭一个引子。没有「保留结尾,重建前四秒」这回事——这项能力只朝一个方向走。如果第三个镜头错了,它下游的一切都跟着一起进垃圾桶。

所以把力气花在前面。第一次生成为下游的一切定下运镜语言、色调和灯光,而它是您唯一能便宜地返工的那一段。到第三次延伸时,您已经陷进四个活儿里,回不去了。

延伸还有一件事不会做。给它一段有人说话的视频,要求换一段新对白,它会拒绝——Google 限制了对语音的修改。发布时的报道把这解读为一次刻意的负责任发布保留,而不是一个缺失的功能;那个说法是记者的,但限制本身写在文档里。别拿这个模型去做配音产品。

欧洲的开发者,这一行请读两遍

文档里埋着的一句话:在欧洲经济区、瑞士和英国,对上传的视频进行编辑和延伸是不可用的。

这不是一条软性限制。那个头条功能——拿一段素材,把它接下去——在欧洲的大部分地方不能用。文生视频和图生视频照常能跑。但如果您的计划是做一个延伸用户上传片段的工具,而那些用户坐在柏林或曼彻斯特,那这个计划就死了,而公告里从头到尾没提过。

在您写下第一行对接代码之前,先拿它对一下您的部署地区。这是本文里最贵的一条——贵在发现得晚。

那些并不存在的旋钮

从文本模型那边过来,您会习惯性地去够一些这里根本没有的参数。Google 的文档把整个采样接口都标成了不支持:没有 temperature,没有 top_p,没有系统指令,没有停止序列,没有反向 prompt。一个都没有。

您唯一的控制面就是 prompt 本身,而第三方文档把上限定在 40,000 个字符——绳子给得挺长,不过这个数字我们没有在 Google 自己的参考里找到。您平常用采样参数做的每一件事,在这里都得写成英文。至于那段英文怎么写得好,我们在单独一篇讲 prompt 语法的文章里讲过,包括标签结构和分镜切换的问题,这里就不重复了。

一条提醒。这个模型的第三方 schema 文档把 temperaturetop_p 列为可接受的字段,而 Google 的参考说它们不受支持。我们不会告诉您哪一边是对的——我们要说的是这两边对不上。别只凭一份 schema 清单就围着这些参数做设计;先测一测它们到底有没有产生任何变化。

关不掉的声音,离不开的英文

每一段片子都会原生地生成音频,而且没有关闭开关。没有参数,没有 flag,没有静音模式。您可以引导它——一句 Sound design: 确实管用——但您没法拒绝它。对于博客里的嵌入播放来说,这意味着在播放器里静音,上面那两段片子就是这么做的。

您同样没法把音频作为参考传进去,没法事后编辑生成出来的音频,也没法在延伸时保留您上传的那段视频的原声。这三件事都是合理的期待。一件也不支持。

语言支持比宣传口径要窄:英文是唯一被完整支持的语言。日文和其他语言在文档里被写成未评测——这是一种谨慎的说法,意思是结果不可预期。如果您的 prompt 或对白不是英文,那就为意外留出预算。

在设计输入流水线之前,先弄清楚参考素材的上限。视频参考:最多三段,每段三秒,而且 Google 提醒说一次给好几段可能让效果变差——把三当成天花板,不是目标。宽高比是 16:9 或 9:16,这也是 Google 给的。与它们并排被引用的另外两个数字则不是:24 fps 的帧率,以及参考生视频图片的一到七张这个范围,两者都出自第三方的 schema 文档。每一帧都带着 SynthID 水印,而我们没有找到任何一家提供商为它开了开关。

花钱之前,先做这几件事

四项检查,按顺序来。第一项干掉的对接项目,比其余三项加起来还多。

  1. **确认您的地区。**如果您在欧洲经济区、瑞士或英国,而您的产品要延伸上传的视频,那就到此为止。这个模型没法替您干这个活儿。
  2. **给序列算价,不是给单段片子算价。**先乘以延伸的次数,再乘以您实际会跑的条数。四十秒的 1080p 在我们这里最好的情况是 5.40 美元,把重跑算进去,现实里是它的三倍。
  3. 问问您到底需不需要 Omni。在我们这里,Veo 3.1 Fast的一秒是一美分,而 Omni 在 720p 上是九美分。一个镜头,不续接,不做帧插值,也没有谁需要在两段片子之后还长得一样——那么这个倍数就是把钱点着烧。
  4. **把您的迭代循环建在草稿档上。**在 360p 上迭代,把胜出的那一条提上去。百分之六十八不是一个四舍五入的误差。

Omni 对得起这个倍数的地方,正好就是 1.1 那些功能所指的方向:把一个镜头接下去、在首帧和末帧之间做插值让一张静图动起来,或者把一个主体带过多个剪辑点。出了这个范围,它就是一种昂贵的买单段片子的方式。

其他角度就在隔壁:发布当天到底上了什么榜单说了什么、又没说什么——这一周流传的竞技场排名属于上一代模型——以及一份逐平台的价格拆解。schema 和实时价格都在目录里。

价格和产品条款会变化。做购买决定之前,请核对各家提供商的当前定价。

常见问题

Gemini Omni 1.1 Flash 真的能做出四十秒的视频吗?

能,但不是一次调用做出来的。一次生成返回 3 到 10 秒。四十秒是您把一段已有的片子再延伸三次之后累计到的总长——一共四个活儿——而每一次延伸都按与全新生成相同的每秒价格单独计费。在 E2X 上,一段 1080p 的四十秒序列是 5.40 美元,直连 Google 是 6.08 美元。

一段四十秒的 Gemini Omni 序列要多少钱?

用 40 秒乘以您那个分辨率的每秒价格;延伸没有折扣。在 E2X 上,360p 是 1.19 美元,720p 是 3.60 美元,1080p 是 5.40 美元,4K 是 7.20 美元。直连 Google,按它公布的每秒 token 数推算,同样的长度是 1.35、4.06、6.08 和 12.16 美元。把扔掉的那些条数加进去,预期是标价的两到三倍。

Gemini Omni 1.1 Flash 的 4K 输出是真正的 4K 吗?

不是。Google 的文档把 1080p 和 4K 这两档都标注为*「放大」*——模型在更低的分辨率上渲染,再把结果放大上去。文件有 4K 的尺寸;画面并不携带 4K 的细节。除非交付规格要求这个尺寸,否则最高那一档的价钱买到的是一次缩放,而不是更多的信息。

我能在欧盟使用 Gemini Omni 1.1 Flash 吗?

部分可以。文生视频和图生视频能用,但在欧洲经济区、瑞士和英国,对上传的视频进行编辑或延伸是不可用的。既然延伸正是那个头条能力,这就挡住了任何围绕「续接用户提供的素材」建起来的欧洲产品。对接之前,请拿它核对您的部署地区。

Gemini Omni 1.1 Flash 支持 temperature 或反向 prompt 吗?

Google 的参考把整个采样接口标成不支持——没有 temperature、top_p、系统指令、停止序列或反向 prompt。prompt 文本是您唯一的控制手段,第三方 schema 文档把上限定在 40,000 个字符。同样是这些第三方文档,把 temperature 和 top_p 列为可接受的字段,跟 Google 的说法矛盾,所以在依赖它们之前先测一测。

我能关掉 Gemini Omni 输出里的音频吗?

不能。模型默认给每一段片子都做进一条声轨,没有任何参数能把它关掉。prompt 里的声音设计指令可以引导您拿到什么,但您没法拒绝它,没法传入音频参考,没法编辑结果,也没法在延伸时保留您上传的那段视频的原声。想要静音播放,就在播放器里静音。

Gemini Omni 能向前延伸视频,或者编辑一场戏的中间部分吗?

不能。延伸只往片子的结尾追加——没有向前延伸去搭引子,也没有往序列中间插入。请据此规划:第一次生成为它之后的一切定下运镜和灯光语言,而早期的一个错误会让建在它之上的每一次延伸全部作废。

相比 Veo 3.1 Fast,Gemini Omni 1.1 Flash 值得吗?

只有当您需要 Omni 多出来的那些东西时才值得。在 E2X 上,Veo 3.1 Fast 是每秒 0.01 美元,而 Omni 在 720p 上是 0.09 美元。对于一段不做延伸、不需要首尾帧控制、也不需要跨镜头连续性的单段片子,Veo 赢得很轻松。Omni 对得起它溢价的地方,是多镜头序列和由参考驱动的连续性工作。