Gemini Omni 1.1 Flash 今天发布了。新闻点在编辑,不在生成
Google 今天让 gemini-omni-1.1-flash 正式可用。把功能清单读一遍,有一件事很扎眼:里面几乎没有一项是关于把一段八秒的片子做得更好的。
场景延伸能读取十秒的上下文,而不是一秒。您可以把一张首帧和一张末帧交给模型,让它去搭中间那一段。参考片段能把一个角色带过多个镜头。这些都是连续性功能。它们是当一段片子本身不是交付物、而只是交付物的一块时,您会需要的东西;而把它们放在一起发布,比任何质量宣称都更清楚地表明了方向。

真正新增的是什么
这里的前代是 Gemini Omni Flash——gemini-omni-flash-preview,自 2026 年 6 月 30 日起进入 API 预览。请留意命名,因为网上已经在传错了:并不存在一个叫「Omni Flash 1.0」的产品。Google 自己写的字符串是「Gemini Omni 1.1 Flash」,而它取代的那个东西就叫 Gemini Omni Flash。
| 能力 | Gemini Omni Flash(预览) | Gemini Omni 1.1 Flash |
|---|---|---|
| 场景延伸的上下文 | 片子的最后一秒 | 最多 10 秒的前序画面 |
| 延伸后的总长度 | —— | 40 秒,由 3–10s 的续接拼成 |
| 首尾帧 | —— | 两张都给,模型生成中间部分 |
| 参考片段 | —— | 最多 3 段,每段 3 秒 |
| 分辨率 | 720p | 360p、720p、1080p 和 4K(上面两档是升采样的) |
| 单次生成时长 | 3–10 秒 | 3–10 秒 |
延伸这一项的变化值得读两遍。一个只看得到自己所要续接的那段画面最后一帧的模型,根本不知道相机原本在做什么,所以延伸会漂——光变了,一件外套换了颜色,本来正往左推的移动车停住了。十秒的上下文,足够把一次运镜和一套布光带过接口。Google 把这些续接描述为 3–10 秒的片段、总计最多 40 秒,所以这不是一个固定的块大小;您是在拼进长度可变的片段。
另外还有一个 360p 模式,Google 说它最快能快 60%,成本是 720p 的三分之一。这个数字出自发布博客而不是 API 参考文档,所以请把它当成厂商宣称、而不是实测数值——不过它的大致形状显然是对的,而一个便宜的草稿档,恰恰正是迭代式视频工作一直缺的东西。
直接从 Google 那里买要多少钱
视频输出按每百万 token 17.50 美元计费,Google 的定价脚注替您换算好了:720p 视频每秒 5,792 个 token,「有效价格约为每秒 0.10 美元」。输入是每百万 1.50 美元。视频输出没有免费额度。
其余分辨率也是公布了的,只是离那条脚注很远,所以几乎没人引用。Google 的发布公告里那张价格表是以图片形式嵌进去的,而它的 Cloud 定价页把精确版本写成了一句话:Omni 的计费是 360p 每秒 1,931 个 token,720p 5,792 个,1080p 8,688 个,4K 17,376 个。按每百万 17.50 美元算,也就是每秒 0.0338 美元、0.1014 美元、0.1520 美元和 0.3041 美元。要看的是形状,不是数字——相对 720p,这些 token 数正好是三分之一、一倍、一倍半和三倍。从 720p 到 4K,这道阶梯翻了三倍,当您想直接用满分辨率跑第一版时,这一点值得记住。
每秒一毛钱这件事,值得停下来想一会儿。一段四十秒的序列,用 720p 的延伸拼起来,光是输出就大约四美元,这还没算您生成任何一条备选。视频的定价不是图像的定价,而那些在每张图不到一分钱时行得通的迭代习惯,在这里会把账户掏空。
今天可以在哪里调用它
- Gemini API(
generativelanguage.googleapis.com)—— GA - Google AI Studio —— GA
- Gemini Enterprise Agent Platform —— 面向企业 API 接入
- Google Flow —— 面向 AI Plus、Pro 和 Ultra 订阅用户
- Gemini app —— 场景延伸,面向 Plus、Pro 和 Ultra
不包括 Vertex AI。它的发布说明里完全没提到 Omni,而 Google 的公告把企业用户指向了 Agent Platform。如果您在别处读到相反的说法,那个页面是在猜。
这一切底下还压着一个带日期的条目:预览端点 gemini-omni-flash-preview 计划于 2026 年 9 月 30 日下线。您在夏天基于这个预览版搭的任何东西,大约还有一个月的缓冲期。

规格,集中在一处
单次生成的输出为 3 到 10 秒,24 FPS,16:9 或 9:16——只有这两种画幅比例,所以方图和竖版电影感的构图都没有。音频是与画面一起原生生成的,而您不能上传一段音频参考来引导它。任何您提供来做编辑或延伸的视频,都必须是 10 秒或更短。
每一帧都带着 SynthID,Google 那个不可见的来源水印。它对观看者不可察觉,也不能被任何服务商关掉,这一点只有在您有一份禁止交付带水印素材的合同时才要紧。
Google 在模型卡里对哪些东西还不行也说得很坦白:
「在整个编辑过程中保持完全一致、生成带复杂运动的场景,或者渲染完全准确的文字,仍然是一项挑战。」
把这句话跟功能清单并排读,是一处有用的张力。头条式的新增项都是一致性功能;而模型卡说一致性仍然是最难的部分。两件事都是真的,而一篇只引用前半句的发布文章,是在向您推销东西。
有一项能力是被刻意压住的。模型可以改动录制下来的语音,而 Google 选择不发布它:
「Gemini Omni Flash 有能力改变人的语音。目前我们正在限制这项能力,并努力更好地理解如何安全、负责任地把它带给我们的用户。」
还有区域性的限制:在欧洲经济区、瑞士和英国,您不能上传或编辑含有未成年人或某些可识别人物的图像。
这在 E2X 上意味着什么
我们说过不会给它定日期。结果第二天它就上线了。Gemini Omni 1.1 Flash 已于 2026 年 8 月 28 日在 E2X 上线,四项能力全部可以调用,端点形态跟目录里其他所有模型一样。
一个价格覆盖全部四项:720p 下文生视频、图生视频、首尾帧生视频和参考生视频都是每秒 0.09 美元,2026 年 8 月 28 日核对。时长有 4、6、8 和 10 秒,分辨率 360p、720p、1080p 或 4K——草稿档每秒 0.0297 美元,4K 每秒 0.18 美元。中间那两项在这里是新的:上一代在这个平台上只出过文生视频和参考生视频,所以让一张静图动起来、以及在首帧和末帧之间做插值,对这个家族来说都是头一回。
把它放到 Google 自己的每秒价格旁边,两者的差别说到底是倍率的差别。一路往上,Google 是 0.0338、0.1014、0.1520 和 0.3041 美元;我们是 0.0297、0.09、0.135 和 0.18 美元。两道阶梯起步的形状是一样的——360p 是 720p 价格的三分之一,1080p 是它的一倍半——然后在顶端分道扬镳:Google 翻三倍,我们翻两倍。这让我们在每一档上都低于 Google:360p 上大约百分之十二,720p 和 1080p 上百分之十一,4K 上百分之四十一。这个价格另外买到的,是一个统一的 API 接口,以及一套凭证通吃我们目录里的每一个模型,这是有价值的,但它不等于宣称我们在任何配置下都最便宜。
真正便宜的选项就在它旁边,而大多数读者应该先看它。Veo 3.1 Fast 文生视频是每秒 0.01 美元——是 Omni 1.1 Flash 的九分之一。它也是本文里唯一一个不用犹豫的数字:Google 自己的表格里,Veo 3.1 Fast 在 720p 下是每秒 0.10 美元,也就是说同一个模型在我们这里的价钱,是在那边的十分之一。对于一个不做编辑、不做延伸、不需要角色连续性的纯文生视频镜头来说,相对它的那九倍溢价买到的东西非常有限。我们宁愿您花掉一美元而不是九美元,然后再回来。
Omni 真正对得起这个差价的地方,正是 1.1 的那些功能所指的方向:续接、首尾帧控制,以及把一个主体带过多个镜头。如果您的工作是一次一段片子,那 Veo 3.1 Fast 是更好的选择,而且它同样覆盖图生视频、参考生视频和首尾帧这类活儿。
价格和产品条款都可能变化。在做采购决定之前,请核对各家服务商当前的定价。这是一次限定范围的比较,不是在宣称 E2X 在每一种配置下都是最便宜的选项。
这一周该做什么
如果您原本在用预览端点,把 9 月 30 日这个日期放进日历,然后迁移。如果您是第一次挑视频模型,就从每秒一分钱的 Veo 3.1 Fast 开始,只有当某项活儿真的需要连续性时再往上走。而如果您想比对 schema 而不是读散文,每个模型都发布了一份机器可读的规格——Omni 1.1 Flash 的那一份列出了每一个参数、约束和当前价格。
常见问题
Gemini Omni 1.1 Flash 是什么?
Gemini Omni 1.1 Flash 是 Google 的视频生成与编辑模型,于 2026 年 8 月 27 日以 API id gemini-omni-1.1-flash 正式可用。它生成 3 到 10 秒、24 FPS、带原生音频的片子,并加入了前代所没有的编辑功能:场景延伸至 40 秒、首尾帧插值,以及用于角色一致性的参考片段。
Gemini Omni 1.1 Flash 是什么时候发布的?
2026 年 8 月 27 日,作为一个正式可用的模型而不是预览版。Google 的 API 更新日志把它记为*「Gemini Omni Flash 正式可用(GA):已发布 gemini-omni-1.1-flash」*。更早的预览模型 gemini-omni-flash-preview 自 2026 年 6 月 30 日起可用,并计划于 2026 年 9 月 30 日下线。
有 Omni Flash 1.0 吗?
没有。Google 从来没有发布过一个叫 Omni Flash 1.0 的产品。在 Gemini Omni 1.1 Flash 之前的那个模型叫 Gemini Omni Flash,API id 是 gemini-omni-flash-preview,它是一个预览版本。那些描述「Omni Flash 1.0」的页面,是在编造一个并不存在的版本号。
Gemini Omni 1.1 Flash 要多少钱?
直接调用 Google 时,视频输出按每百万 token 17.50 美元计费,输入是每百万 1.50 美元,视频没有免费额度。Google 的 Cloud 定价页给出了每个分辨率下一秒钟的 token 成本——360p 是 1,931 个,720p 5,792 个,1080p 8,688 个,4K 17,376 个——折算下来是每秒 0.0338、0.1014、0.1520 和 0.3041 美元。在 E2X 上同样这几档是 0.0297、0.09、0.135 和 0.18 美元,也就是说默认的八秒 720p 片子是 0.72 美元。
一段 Gemini Omni 1.1 Flash 视频最长能有多长?
单次生成产出 3 到 10 秒。用场景延伸,您可以搭到总共 40 秒,在已有的片子上追加 3 到 10 秒的续接。任何您作为输入提供来做编辑或延伸的视频,本身必须是 10 秒或更短。
我能在 Vertex AI 上用 Gemini Omni 1.1 Flash 吗?
截至 2026 年 8 月 27 日不能。Vertex AI 的发布说明里完全没提到 Omni 系列。Google 的公告把企业 API 用户指向 Gemini Enterprise Agent Platform,而这个模型同时也可以通过 Gemini API、AI Studio、Flow 和 Gemini app 使用。
Gemini Omni 1.1 Flash 在 E2X 上能用吗?
能用——自 2026 年 8 月 28 日起,四项能力全部可用:文生视频、图生视频、首尾帧生视频和参考生视频。720p 是每秒 0.09 美元,360p 是 0.0297 美元,1080p 是 0.135 美元,4K 是 0.18 美元,时长有 4、6、8 和 10 秒。这在每一档上都低于 Google 自己的每秒价格——360p 上大约百分之十二,720p 和 1080p 上百分之十一,4K 上百分之四十一。音频是原生生成的,关不掉。对于没有编辑或连续性要求的单段片子,每秒 0.01 美元的 Veo 3.1 Fast 通常仍然性价比更好。