Gemini Omni 1.1 Flash 真的是第一吗?榜单是怎么说的
您今天读到的每一篇「Google 的新视频模型是第一」,引用的都是另一个模型的排名。
Gemini Omni 1.1 Flash 昨天正式可用。Artificial Analysis——那些文章大多指向的那个榜单——并不追踪它:文生视频没有,图生视频没有,视频编辑也没有。被引用的那些名次属于 Gemini Omni Flash,也就是六月的预览模型,而且其中大部分属于某一个榜单的某一个特定视图。
这不构成看轻这个模型的理由。它构成的是一个去看看到底测了什么的理由,而那比头条有意思得多。

1.1 真正被排过名的地方
只有一处:arena.ai,它在 2026 年 8 月 27 日、也就是模型发布当天,把 gemini-omni-1.1-flash 加进了它的两个榜单。读取时间是 8 月 28 日:
| 榜单 | 名次 | Elo | 票数 |
|---|---|---|---|
| arena.ai 文生视频 | 第 1 | 1515 ±16 | 1,762 |
| arena.ai 图生视频 | 第 2 | 1488 ±11 | 3,720 |
所以是的——确实有一个榜单上 Gemini Omni 1.1 Flash 排在第一。现在说头条略去的那部分。那个榜单上的第二名是 Gemini Omni Flash,1512 ±10,基于 19,830 票。三个 Elo 分,置信区间完全重叠,而样本量大约只有十分之一。
那是一次统计意义上的平局,不是一次胜利。1,762 票上三分的差距,稳稳落在噪声之内,而这个数字会随着票数积累而变动。如果下个月您看到有人引用它说「Omni 1.1 是最强的文生视频模型」,请查一下那个人有没有看过区间。
然后是缺席的部分。1.1 没有被加进任何视频编辑榜单,arena.ai 上没有,别处也没有——而编辑正是 Google 围绕它做这次发布的那项能力。
Artificial Analysis 数字里的音频陷阱
Artificial Analysis 把每个视频榜单都发布两份——带音频和不带音频。引用这些数字的人几乎没有谁说明自己指的是哪一份,而这两份分歧很大。
下面是 Gemini Omni Flash 在这两个视图里的表现,读取时间 2026 年 8 月 28 日:
| 榜单 | 不带音频 | 带音频 |
|---|---|---|
| 文生视频 | 第 1 —— 1,322 | 第 2 —— 1,237,落后于 1,240 的 Wan 3.0 |
| 图生视频 | 第 1 —— 1,365 | 第 4 —— 1,179 |
图生视频那一行才是值得停下来看的。第一名会因为您打开的是哪个视图而变成第四名,而一篇说「图生视频第一」却不点名是哪个视图的文章,不是在报道一个结果,它是在挑一个。
两个视图都是正当的。音频是这些模型如今产出的真实一部分,而一个画面强、声音弱的模型,在一个计入声音的榜单上确实应该排得更低。但第一名和第四名之间的落差,恰恰是那种会在头条里消失的细节。
编辑榜单,把日期标清楚
有一个流传的说法是,Gemini Omni Flash 在视频编辑上以第一名登场,后来被 MiniMax H3 挤到第二。那曾经是真的。它已经有一阵子不真了。
- 2026 年 7 月下旬 —— 已经是第 2,1,122 分,落后于 1,130 分的 MiniMax H3
- 2026 年 8 月 6 日 —— 第 2,1,123 对 1,132
- 2026 年 8 月 28 日 —— 第 3,1,124 分,Wan 3.0 以 1,189 分居首,MiniMax H3 以 1,128 分第二
阿里巴巴的 Wan 3.0 现在领跑 Artificial Analysis 三个榜单中的两个,这是整个话题里被报道得最少的一个事实。在 arena.ai 的视频编辑榜上,Gemini Omni Flash 排第四,落在两个 Seedance 变体和 MiniMax H3 之后——而它在那里的分数在这段时间里其实是上升的,从 1,347 到 1,358。它没有变差。它是被超过了。
这就是这个市场诚实的样子。四家实验室在互换位置,谁领先取决于您打开的是哪个榜单、哪个视图,而没有谁通吃全部。

Google 自己宣称了什么
什么都没有。Google 的公告、模型卡和 API 文档里,没有出现任何一个 Elo、benchmark 或榜单名次。这次发布是一份功能清单加一个价格。
我们认为这值得当作一个信号来读,而不是一处遗漏。一家手里有决定性 benchmark 结果的实验室,通常会拿它开头。Google 拿来开头的是场景延伸、帧控制和一个更便宜的草稿档——如果您模型的优势在工作流而不在正面对决,您强调的正是这些东西。Google 确实公布的那一个数字是价格,而这次发布究竟改变了什么我们另外写了一篇。
另外,截至今天,也没有任何独立的、把 1.1 和它前代做正面对比的测试。您能找到的每一篇文章都是那份公告的改写。任何告诉您 1.1 好了多少的人,都没有量过,因为目前还没有任何东西可以拿来量它。
那么今天到底该跑什么
榜单在悄悄告诉您的部分是这个:登顶的那个模型不是新的那个。它是前代。在 2026 年 8 月 28 日之前,这确实是一道实打实的限制,因为 1.1 当时在我们这里还调用不了。现在可以了,于是问题就从「您能跑什么」变成了「您该跑什么」。
Omni Flash,也就是上面引用的每一个不带音频第一名背后的那个模型,仍然跑在我们的 API 上。但 Gemini Omni 1.1 Flash 自 2026 年 8 月 28 日起就能在我们这里调用了,720p 下每秒 0.09 美元,而支持它的理由本来也不会是一个排名。理由是那些旧模型根本做不到的事:图生视频和首尾帧生视频,这两项在 E2X 上都是这个家族的新东西;参考生视频最多能吃七张参考图;一个每秒 0.0297 美元的 360p 草稿档;以及能跑到十秒的片子。它们之间到底变了什么,见那篇发布解读。
现在说那道让人不舒服的算术题。Veo 3.1 Fast每秒一美分,是 Omni 1.1 Flash 的九分之一,而且它显然是更弱的模型,一旦把音频计入,它大约排在第九。
不过要看比值,别看名次。九倍的钱,对上几十个 Elo 分,而这是在一个整个前十总共只跨越约 120 分的尺度上。一个八秒的镜头,差别是八美分和七十二美分,而中间那六十四美分能在便宜那一档上多买八次尝试。大多数镜头不需要最好的模型。它们需要的是再试三次。
当一项活儿需要连续性时,这份溢价就不再是可选的了:一个必须在镜头之间存活下来的角色、一个指定的开场帧和结束帧、一段之后还要被延伸的片子。在那里,更弱的模型不会优雅地退化,它就是直接失败。Veo 3.1 Fast 仍然能应付其中不少——图生视频、参考生视频、首尾帧——所以让一次真正的失败、而不是一份榜单,来成为推动您往上走的那个东西。
价格和产品条款都可能变化。在做采购决定之前,请核对各家服务商当前的定价。这是一次限定范围的比较,不是在宣称 E2X 在每一种配置下都是最便宜的选项。
怎么读视频榜单才不会被坑
四个习惯,而且在这些具体数字过期很久之后它们依然管用:
- 看模型字符串,别看营销名。 「Gemini Omni Flash」和「Gemini Omni 1.1 Flash」是不同的产品,而本周发表的几乎每一篇文章,都在用前一个名字指后一个模型。
- 问是哪个视图。 带不带音频,会把上面某个榜单上的第一名变成第四名。
- 读票数和区间。 1,762 票上三分的领先,是一次被打扮成结果的抛硬币。
- 看那条榜单数据的日期,不是文章的日期。 一篇昨天发表的文章可能引用的是七月的快照,而这个话题里被转发最多的两个说法,正是这样。
按活儿从文生视频或参考生视频里挑,或者去读机器可读的规格——Omni 1.1 Flash 发布了一份,包含每一个参数和当前价格。完整阵容都在我们的目录里。
常见问题
Gemini Omni 1.1 Flash 是视频榜单上的第一吗?
在一个榜单上是,差距很小而且是暂时的。它在 arena.ai 的文生视频竞技场上以 1515 ±16 排第一,但只领先它自己的前代三个 Elo 分,票数是 1,762 对 19,830,置信区间还相互重叠——这是一次统计意义上的平局。它在 arena.ai 图生视频上排第二,而在 Artificial Analysis 的榜单上根本没有出现。
Artificial Analysis 给 Gemini Omni 1.1 Flash 排名了吗?
没有。截至 2026 年 8 月 28 日,Gemini Omni 1.1 Flash 没有出现在 Artificial Analysis 三个视频榜单中的任何一个上。所有正在流传的、关于「Omni Flash」的 Artificial Analysis 数字,指的都是更早的 Gemini Omni Flash 预览模型,它发布于 2026 年 6 月。
为什么不同网站给同一个模型的排名不一样?
主要是因为 Artificial Analysis 把每个榜单都发布两份,带音频和不带音频,而大多数文章不说自己用的是哪一份。Gemini Omni Flash 在不带音频的图生视频上是第一,在带音频的上是第四。榜单选择、日期,以及带不带音频这个问题,几乎能解释您会遇到的每一处矛盾。
Gemini Omni Flash 在视频编辑上还是第一吗?
不是。它以榜首登场,在七月下旬和八月初排在 MiniMax H3 之后位居第二,而截至 2026 年 8 月 28 日排第三,Wan 3.0 居首。它的分数并没有下降——反而略有上升,在 arena.ai 上从 1,347 到 1,358——但其他模型提升得更快。
Google 为 Gemini Omni 1.1 Flash 公布过任何 benchmark 结果吗?
没有。Google 的公告博客、API 文档和 DeepMind 模型卡里,都没有关于这个模型的任何 Elo、benchmark 或榜单宣称。发布材料只涵盖功能、可用性和定价。
现在哪个视频模型最好?
没有单一答案,而这正是对这些榜单诚实的读法。阿里巴巴的 Wan 3.0 领跑 Artificial Analysis 三个榜单中的两个,MiniMax H3 领跑 arena.ai 的图生视频,字节跳动的 Seedance 2.5 领跑它的视频编辑榜,而 Gemini Omni Flash 在不带音频的视图里领跑那两个 Artificial Analysis 榜单。按您手上的活儿来挑,别按头条挑。
相比更便宜的模型,Gemini Omni 1.1 Flash 值这个价吗?
对于没有编辑、也没有连续性要求的单段片子,通常不值。截至 2026 年 8 月 28 日,在我们的 API 上 Veo 3.1 Fast 是每秒 0.01 美元,而 Gemini Omni 1.1 Flash 是 0.09 美元——九倍的差距,换来的是几十个 Elo 分的差别。这份溢价对得起的地方在参考一致性、首尾帧控制和场景延伸,在那些活儿上,一个更弱的模型不只是看起来更差,而是完不成任务。