Loading...
Loading...
Gemini Omni 1.1 Flash generates video from a text prompt, a single image, a start and end frame, or up to seven reference images. Clips run 4 to 10 seconds at resolutions from 360p to 4K.
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/text-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)按时长和分辨率估算每次生成的成本。您只需为实际运行的部分付费。
Omni 1.1 Flash 于 2026年8月27日在 Google 正式发布——它属于 Gemini 家族,不是 Veo。我们把它那条只吃 prompt 的 capability 运行为 google/omni-1.1-flash/text-to-video,按成片每一秒计费:720p 下 $0.09,这是在 $0.15 标价上常年打 40% 折扣之后的价格。默认的 8 秒是 $0.72。一条 prompt 就是全部 payload。
这里动了一个数字,而且是往上动的。前一代的 Gemini Omni Flash text-to-video 在本平台按每秒 $0.0825 计费,本页是 $0.09。贵了百分之九,这话由我们说出来,好过您从账单上倒推。这百分之九买到的并不是更好的一秒画面。它买到的是旧模型连解像度 enum 里都没有的 $0.0297 草稿档、能拉到十秒的片长,以及前一代在 E2X 上从未上线过的两项 capability。其余的都写在关于 1.1 发布的说明里。
接下来这句话是跟我们自己的账单过不去的。Veo 3.1 Fast text-to-video 就跑在这同一个平台上,每秒 $0.01——本页价格的九分之一。只要一段片子,从一句话生成,后面没有任何东西依赖它?那就去那边。这里的溢价买到的是 10 秒、4K、一档便宜的草稿模式,以及彼此属于同一组的镜头。这四样您一样都用不上,那就等于什么都没买到。
素材不同,endpoint 就不同:一张静帧要成为第一帧,去 image-to-video;首尾两端已定、中间留空,去 start-end-frame-to-video;一张要反复出现的面孔,去 reference-to-video。
下面每一个数字,都是在 2026年8月28日从各家自己的 1.1 版本页面上读到的:
| 在哪里调用 | 720p,每秒 | 8 秒 | 与我们的费率相比 |
|---|---|---|---|
| E2X | $0.09 | $0.72 | —— |
| fal.ai | $0.10 | $0.80 | 我们低 10% |
| Runware | $0.10 | $0.80 | 我们低 10% |
| Google Gemini API | $0.1014 | $0.81 | 我们低 11% |
| Wavespeed AI | $0.13 | $1.04 | 我们低 31% |
Google 那一行是它自己算出来的,而且就印在它自己的价格页上:每百万输出 token $17.50,一秒 720p 折合 5,792 个 token,得出 $0.1014——这也是那里的脚注最后落在*「每秒约 $0.10」*上的原因。每一行都含声音,所以这是同口径的比较。这个模型根本没有音频开关,对白与环境底噪跟画面一起生成,名单上也没有谁把它们单独计价。Google 把每一档解像度的同一费率都以 token 数公布出来了:360p 每秒 1,931 个 token,720p 5,792,1080p 8,688,4K 17,376,四档都含音频。所以下面这张阶梯一路到顶都是同口径的比较。
您尽管来核我们的价,但请看清版本号。fal.ai 挂着两个页面:一个不带版本的 google/gemini-omni-flash 页,给的是旧的 preview 权重、每秒接近 $0.125;另一个 v1.1 页是 $0.10。我们这边是 v1.1。Wavespeed 则要反过来当心——$0.13 只在它的 text-to-video 变体上得到确认,所以它其余的数字我们没往表里放。
720p 那档费率不是有意思的那一半。这才是:
| 分辨率 | E2X | fal.ai | Runware | Wavespeed | |
|---|---|---|---|---|---|
| 360p | $0.0297 | $0.0338 | $0.03 | $0.036 | $0.039 |
| 720p | $0.09 | $0.1014 | $0.10 | $0.10 | $0.13 |
| 1080p | $0.135 | $0.1520 | $0.15 | $0.16 | $0.195 |
| 4K | $0.18 | $0.3041 | $0.30 | $0.32 | $0.39 |
我们从 720p 到 4K 的倍数是 2×。Google 的正好是 3×——它自己的 token 数从 5,792 涨到 17,376。在最底下,两条阶梯形状相同:往 360p 的那一步,两边都是 0.33×。越往上两者越分开,到了 4K,Google 把 720p 的费率翻了三倍,我们只翻一倍。四档我们都低于 Google,原因就在这里:360p 低十二个百分点,720p 和 1080p 低十一个百分点,4K 低四十一个百分点。Runware 也值得一看:720p 与 Google 持平,到 1080p 是 $0.16、4K 是 $0.32,两档都高过 Google 自己的费率。 如果您要核对,有一点要说明:Google 发布时的表格把这几个数取整成了 $0.03、$0.10、$0.15、$0.30。上面的数字来自它自己按解像度给出的 token 数,账单也是照这个算的。
价格与产品条款可能随时间变化;在做出采购决定前,请核对各家提供商的当前价格。Google 的 Batch 或 Flex 价格在调度、可用容量和处理条件上均有所不同,因此与标准的按需 API request 并不直接等价,已从本对比中排除。这是一次限定范围的对比,并非声称 E2X 在任何配置下都是全球最便宜的选择。
掏空账户的从来不是某一次生成,而是反复重来:第七次跟第一次一样贵。
360p 的 4 秒是 $0.1188,同样 4 秒在 720p 是 $0.36。六次便宜的草稿加上一次默认长度的正式渲染是 $1.07,而七次全价跑下来是 $2.52。Google 还称 360p 最多快 60%——那是它的数字,不是我们的。
| 时长 | 360p 草稿 | 720p 正片 |
|---|---|---|
| 4 秒 | $0.1188 | $0.36 |
| 6 秒 | $0.1782 | $0.54 |
| 8 秒(默认) | $0.2376 | $0.72 |
| 10 秒 | $0.297 | $0.90 |
10 秒的 4K,按每秒 $0.18 算是 $1.80——这是本页面上最大的一张单。
在控制台生成一把 key,别让它落到客户端上,然后把 job 提交出去。prompt 是唯一必填的字段。
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/text-to-video",
"input": {
"prompt": "一名女焊工放下面罩,火花把蓝光甩在堆叠的钢材上。缓慢向左横移。电弧的噼啪声,画外一台风扇。",
"resolution": "360p",
"duration": "6",
"seed": 20260828
}
}'
这是一次草稿:360p 的 6 秒,$0.1782。把 resolution 换成 720p,它就变成 $0.54。
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/text-to-video",
input: { prompt: "夜里,雨点砸在公交候车亭上。", duration: "4" },
}),
}).then((r) => r.json());
for (let attempt = 0; attempt < 360; attempt++) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
const { status } = job.data;
if (status === "completed") { await archive(job.data.outputs[0].url); break; }
if (status === "failed" || status === "cancelled") throw new Error(status);
await new Promise((r) => setTimeout(r, 5000));
}
每个 job 请按 4 分钟预留时间,或者传一个 webhookUrl。有两个坑:duration 和 resolution 是以字符串传的,要写 "10" 而不是 10;返回的 URL 会过期,所以读到它的当下就把文件复制到一个永久的地方去。每一个字段都在机器可读规格里。
从便宜的开始:
| 模型 | 什么时候选它 | 8 秒,720p |
|---|---|---|
| Veo 3.1 Fast text-to-video | 单独成立的一段片子 | $0.08 |
| Omni 1.1 Flash text-to-video | 要 10 秒、要 4K,或者要一轮 360p 草稿 | $0.72 |
| Omni 1.1 Flash start-end-frame | 首尾两端都已经存在 | $0.72 |
| Omni 1.1 Flash reference-to-video | 同一个主体要跨多段片子出现 | $0.72 |
| Omni Flash text-to-video | 别选;Google 将于 2026年9月30日下线它 | $0.66 |
请把第一行和第二行对着读。一段没人会拿去跟别的镜头对剪的片子,贵九倍是很贵的;溢价买的是连续性。其余所有把 prompt 变成画面的东西都在 text-to-video 下面;我们运行的全部模型就在一页里。
输出是固定的:24 fps,3 到 10 秒,16:9 或 9:16。10 这个数很要紧,因为 Veo 到 8 秒就停了。模型卡点了三种失效方式:
「在编辑全程保持完全一致、生成包含复杂运动的场景,或渲染完全准确的文字,仍然是一项挑战。」
画面上的文字最容易让人栽跟头:让它写一块店铺招牌,那些字形一细看就散了。人群、水和手,是运动那一类。
SynthID 会隐形地标记每一帧,谁也剥不掉。英语是 Google 唯一评测过的 prompt 语言,而 Google 已于 2026年4月22日把 Vertex AI 并入 Gemini Enterprise Agent Platform,面向企业客户的这个模型就挂在那里。
模型手里只有您的文字和一个 seed;您没说的每一处,都变成它自己的决定。只描述一个镜头,绝不要描述一段序列——8 秒里塞三个节拍,换来的是一次糟糕的剪辑或者一团糊。
把摄影机定下来。 「固定机位全景」「缓慢向左横移」「手持跟拍」。没说清楚的摄影机会自己飘。
把光定下来。 钠灯路灯、阴天的下午、一盏画内实用光源。布光决定了一个画面是刻意安排的,还是渲出来的。
把声音定下来。 音频您反正是付了钱的,不管您有没有计划过,所以请点名环境音和任何一句台词——否则模型会自己编一层底噪,跟您的剪辑对着干。
然后把 seed 固定住,一次只改一个从句。我们的 Gemini Omni prompt 指南讲得更细。
720p 输出每秒 $0.09——默认 8 秒是 $0.72,10 秒的上限是 $0.90。这是 $0.15 标价打 40% 折之后的价格,核查日期为 2026年8月28日。其他档位:360p $0.0297,1080p $0.135,4K $0.18,均含音频。
四档全都便宜。Google 按输出 token 给视频计费——每百万 token $17.50,每秒 360p 1,931 个 token、720p 5,792、1080p 8,688、4K 17,376——折合每秒 $0.0338,往上依次是 $0.1014、$0.1520、$0.3041,四档都含音频。发布时的表格把它们取整成 $0.03、$0.10、$0.15、$0.30,而账单是按未取整的数字算的。相比之下,我们在 360p 上便宜约十二个百分点,720p 和 1080p 上便宜十一个百分点,在 4K 上便宜四十一个百分点。两条阶梯往 360p 走的都是同样的 0.33×;区别在顶端——Google 把 720p 的费率翻三倍,我们只翻一倍。
不便宜,反而更贵。Omni Flash text-to-video 在我们这里是每秒 $0.0825,本页是 $0.09,所以八秒在那边是 $0.66,在这边是 $0.72,相差百分之九。旧模型没有 360p 档,在 E2X 上也从未上线 image-to-video 或 start-end-frame-to-video,差价就花在这些地方。直接调用 Google 是另一个问题:它公布的费率折合 720p 每秒 $0.1014,所以本页和那个旧页面都落在它下面。 这个差价不是产品本身更贵:三者挂的都是同一个 $0.15 的标价,不同的只是常设折扣——这边 40%,旧页面是 45% 和 50%。
几乎总是 Veo 3.1 Fast——同一套 API 上每秒 $0.01,8 秒是 $0.08 而不是 $0.72。等到片子必须做到 10 秒、需要 4K,或者必须跟其他素材对得上时,再回来。
用来迭代。360p 的 4 秒是 $0.1188,720p 是 $0.36,所以那些您会扔掉的镜头,只花留下来那一条的一个零头。
3 到 10 秒,24 fps。duration 枚举暴露 4、6、8 和 10,都是字符串。更长的片段来自多次调用——1.1 那些连续性能力,存在的意义就是让这件事撑得住。
包含,本页每一个对比的每一行都包含。这里根本没有音频开关,对白与环境声跟画面一起生成,名单上也没有哪家把它们单独计价。
通常是因为那压根是另一个模型。fal.ai 那个不带版本号的 google/gemini-omni-flash 页面,标的是已弃用的 preview 权重,每秒接近 $0.125;它的 v1.1 页面写的是 $0.10,而我们表里用的是 v1.1。请先看版本,再看日期。