Loading...
Loading...
文本生成视频把一段文字提示词变成一小段动态画面。输入只有描述本身,所以模型必须自行构思主体、镜头运动以及随时间展开的动作。这让它成为目录中最开放的一种能力,也是提示词的具体措辞对结果影响最大的一种。
好的提示词会像导演那样描述这个镜头:主体、动作、运镜、场景和光线。片段本身就设计得很短,因此请为每次生成规划单一节拍,再把几段剪在一起,而不要指望一条提示词撑起一整场戏。视频任务的耗时也明显长于图像任务,单次请求成本更高,这正是先用便宜的图像模型把画面风格定下来、再把胜出的描述搬过来的好理由。
E2X 目前用两个 Google 模型服务这一分类:Veo 3.1 Fast 和 Omni Flash。它们的调用方式和这里的其他模型一样:向 jobs 接口提交模型 slug 和输入对象,取回 job ID,然后轮询直到片段生成完成。计费按次请求从预付余额扣减,调用之前每个模型的目录条目上都会显示价格。
很短。这些模型生成的是单镜头片段而非完整场景,因此更长的序列需要通过生成多段片段再剪辑在一起来实现。
视频生成需要渲染大量彼此之间必须保持连贯的帧,任务耗时自然更长。提交之后请轮询 job ID,而不要一直挂着一个请求等待。
可以,但要换一个分类。图像转视频让单帧动起来,首尾帧生成视频则在两帧之间做插值。
每段片段一次请求,按你所选模型标注的单次请求价格从预付余额中扣减。