关于文本生成视频模型

文本生成视频把一段文字提示词变成一小段动态画面。输入只有描述本身,所以模型必须自行构思主体、镜头运动以及随时间展开的动作。这让它成为目录中最开放的一种能力,也是提示词的具体措辞对结果影响最大的一种。

好的提示词会像导演那样描述这个镜头:主体、动作、运镜、场景和光线。片段本身就设计得很短,因此请为每次生成规划单一节拍,再把几段剪在一起,而不要指望一条提示词撑起一整场戏。视频任务的耗时也明显长于图像任务,单次请求成本更高,这正是先用便宜的图像模型把画面风格定下来、再把胜出的描述搬过来的好理由。

E2X 目前用两个 Google 模型服务这一分类:Veo 3.1 Fast 和 Omni Flash。它们的调用方式和这里的其他模型一样:向 jobs 接口提交模型 slug 和输入对象,取回 job ID,然后轮询直到片段生成完成。计费按次请求从预付余额扣减,调用之前每个模型的目录条目上都会显示价格。

常见问题

生成的片段有多长?

很短。这些模型生成的是单镜头片段而非完整场景,因此更长的序列需要通过生成多段片段再剪辑在一起来实现。

为什么视频请求比图像请求耗时更久?

视频生成需要渲染大量彼此之间必须保持连贯的帧,任务耗时自然更长。提交之后请轮询 job ID,而不要一直挂着一个请求等待。

我可以用一张起始图片代替提示词吗?

可以,但要换一个分类。图像转视频让单帧动起来,首尾帧生成视频则在两帧之间做插值。

生成一段片段要花多少钱?

每段片段一次请求,按你所选模型标注的单次请求价格从预付余额中扣减。