モデル一覧へ戻る

Veo 3.1 Fast

より高速で低コストな Veo 3.1 のプラン。テキスト・画像・参照画像からの動画生成と、開始・終了フレーム間のトランジションに対応します。

料金$0.01/リクエストから
レイテンシ平均約240秒
解像度720P/1080P/4K
最適な用途video, google, high-fidelity

パラメーター

推定コスト

このモデルで90%お得です
secondあたりの基本料金$0.10
割引-90%
合計金額$0.01
リクエストごとに$0.09お得です

モデルを実行するにはサインインしてください

Output Preview

Ready

No output yet

Run the model to see generated results.

サンプル出力

APIの例— 現在のパラメータ

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/veo-3.1-fast/text-to-video',
  'input': {}
}
)

ジョブを取得— 結果をポーリング

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

料金の詳細

再生時間と解像度ごとの生成あたりの推定コストです。実行した分だけお支払いいただきます。

所要時間
720P
1080P
4K
4
$0.40
$0.40
$0.60
6
$0.60
$0.60
$0.90
8
$0.80
$0.80
$1.20
代替モデルを探索

関連モデル

テキストから動画向けの他のAIモデルを探索

すべてのモデルを見る

E2X の Veo 3.1 Fast Text-to-Video API

Veo 3.1 Fast は Google が速度に最適化した Veo 3.1 です。解像度も、4/6/8 秒という尺も、常時オンのネイティブ音声も同じで、より速く仕上がり、より安い価格が付いています。当社では google/veo-3.1-fast/text-to-video として公開しており、出力の秒単位 で課金しています。1 秒あたり $0.01、音声トラックがオンのときは ×1.5。音声付き 8 秒の 720p クリップで $0.12 です。アップロードは不要で、入力は prompt だけです。

代わりに、手元の静止画に命を吹き込みたいのでしょうか。それなら Veo 3.1 Fast image-to-video です。同じモデルで、開始フレームを 1 枚渡します。同じ顔と同じジャケットを、複数のショットにわたって保ちたいのでしょうか。それは Veo 3.1 Fast reference-to-video です。

8 秒のクリップが、各社でいくらになるか

このモデルを本格的に提供しているところは、当社を含め、すべて秒単位で課金しています。したがって唯一誠実な比較は、構成を固定したものです。以下は 720p・音声オンで、2026年8月26日 に確認したものです。

API プロバイダー課金方式料率(720p、音声オン)8 秒クリップ当社との比較
E2X(現行)秒単位$0.01/秒 ×1.5 音声$0.12—
Google Gemini API秒単位$0.10/秒$0.80当社の 6.7 倍
fal.ai秒単位$0.15/秒$1.20当社の 10 倍
Replicate秒単位$0.15/秒$1.20当社の 10 倍
E2X 定価(割引前)秒単位$0.10/秒 ×1.5$1.20当社の割引前料率

最後の行を fal.ai と Replicate に並べて読んでください。当社の 8 秒クリップの定価は $1.20 で、両社の課金額とまったく同じです。 現在お支払いいただく額はその 10 分の 1 で、同一の request に対して Google 自身の API より 6.7 倍安いままです。

予算を組む際にひとつだけ注意点があります。720p → 1080p は fal.ai と Replicate では無料ですが、Google は秒あたりの料金を上げます。当社側でも解像度は乗数になるため、1080p のパイプラインを確定する前に、このモデルの llms.txt から最新の数字を取得してください。

価格および製品条件は変更される場合があります。購入を判断する前に、各プロバイダーの最新価格をご確認ください。Google の Batch または Flex 価格は、スケジューリング・空き状況・処理条件が異なるため、標準的なオンデマンド API request と直接同等ではなく、この比較には含めていません。これは特定の条件に絞った比較であり、E2X があらゆる構成において世界最安であると主張するものではありません。

目玉は音声トラックです

大半の text-to-video モデルは無音の MP4 を渡してきて、音はあなたに任せます。Veo 3.1 Fast は違います。Google の API は音声をネイティブに生成し、そちらでは音声を切ることができません。同期した台詞、フォーリー、部屋の空気感が映像と一緒に生成され、フレームに固定されます。Google 自身がドキュメントに載せている例の prompt にも、話し言葉の台詞が含まれています。

これは 1 回の呼び出しの価値を変えます。「魚屋がクレートを叩きつけるように置き、入荷したてだ、5 分前だよ と叫ぶ」と書けば、正しいフレームで叩きつける音と叫び声が返ってきます。後から音を付けなければならないパントマイムではありません。SNS 用の短尺やアニマティクスでは、ポストプロダクションの工程がまるごとひとつ消えます。

選べるのは次の項目です。

  • 尺:4 秒、6 秒、8 秒。 当社の 3 つの Veo 3.1 Fast endpoint のうち、この選択が本当に開かれているのはここだけです。音声付き 4 秒の 720p クリップは $0.06、6 秒は $0.09 です。
  • 解像度:720p(当社のデフォルト)、1080p、4k、いずれも 24fps。1080p と 4k は 8 秒のみです。これは当社ではなく Google 側の制約です。
  • aspect ratio:16:9(デフォルト)または 9:16。 正方形も 4:5 もありません。
  • has_sound。デフォルトは true で、これが ×1.5 の乗数を動かします。

1 本のクリップの上限は 8 秒です。シーケンスにするには複数回の呼び出しが必要です。

API request:prompt を送り、MP4 を受け取る

ダッシュボードで API key を作成し、サーバー側で保持したうえで job を送信してください。必須項目は prompt だけです。

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/veo-3.1-fast/text-to-video",
    "input": {
      "prompt": "夜、雨に濡れた大阪の路地を進む手持ちのショット。ラーメン屋の店主が暖簾を持ち上げると湯気があふれ出し、通りかかった自転車の男に声をかける:「今夜最後の一杯だよ!」水たまりにネオンの反射が揺れる。",
      "aspect_ratio": "16:9",
      "resolution": "720p",
      "duration": "8",
      "has_sound": "true"
    }
  }'

当社から job ID を返します。polling してもよいですし、しなくても構いません。

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/veo-3.1-fast/text-to-video",
    input: {
      prompt:
        "航海日誌を書く灯台守へのゆっくりとしたプッシュイン。風がガラスを揺らす。彼女がつぶやく:「三夜目、まだ信号はない。」4 秒ごとに灯りが彼女の顔をなでていく。",
      aspect_ratio: "9:16",
      resolution: "720p",
      duration: "6",
      has_sound: "true",
      seed: 41205,
    },
  }),
}).then((r) => r.json());

const jobId = submitted.data.jobId;

while (true) {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") {
    console.log(job.data.outputs[0].url);
    break;
  }
  if (job.data.status === "failed") {
    throw new Error(job.data.error?.message || "Generation failed");
  }
  await new Promise((r) => setTimeout(r, 5000));
}

ステータスは pending → processing → completed と進むか、failed / cancelled で終わります。代わりに webhookUrl を送っていただければ、当社から通知します。1 job あたり約 4 分を見込んでください。Google は下限 11 秒、ピーク時の上限 6 分を公表しているので、上限のほうを前提に設計してください。

schema の罠がひとつ。duration と resolution は 文字列 です。8 ではなく "8" です。

当社の Veo 3.1 Fast の各 endpoint の選び分け

同じ重み、同じ秒単価、玄関が 3 つ。決め手になるのは、すでにお持ちの入力です。

Endpoint8 秒クリップ、720p + 音声こんなときに
Veo 3.1 Fast text-to-video$0.12手元にあるのは言葉だけ。しかも 4 秒や 6 秒が欲しい
Veo 3.1 Fast image-to-video$0.12静止画が 1 枚あり、それを最初のフレームにしたい
Veo 3.1 Fast reference-to-video$0.12人物、商品、場所を複数ショットで同一に保つ必要がある

価格では決着がつかないので、ブリーフに従ってください。クライアントがすでにキービジュアルを承認しているなら、それを開始フレームとして送るほうが、文章で描き直すより優れています。6 本のクリップがひとつのキャンペーンに見えなければならないなら、参照画像を最大 3 枚積み込んでください — ただし reference-to-video は例外なく 8 秒に固定されることをご承知おきください。この endpoint は短い尺を残しているので、ストーリーボードをラフな動きで埋めるには最も安い方法です。当社が運用しているその他は text-to-video カテゴリとモデルカタログ全体にあります。

音を活かす prompt

prompt は、サウンドミックスが付いたショットリストとして扱ってください。形容詞より効くものが 4 つあります。

カメラの動きを名指しする。 「固定のワイド」「ゆっくりとしたダリーイン」「手持ちのフォロー」 — モデルはこれらを尊重します。曖昧なフレーミングは、漂うような、意思の感じられない動きになります。

台詞は引用符で書く。 短い行を、1 本につき 1〜2 つ。8 秒は長くありません。意図を言い換えた表現(「彼が励ますようなことを言う」)は、もごもごした埋め草を生みます。

環境音を頼む。 トタン屋根に当たる雨、冷蔵庫のうなり、遠くの車の音。指定しなければモデルが勝手にベッドトラックを作り出しますし、それが編集に合うとは限りません。

光が何をしているかを述べる。 曇りの正午、ナトリウム灯の街灯、実在の照明ひとつ。Fast ティアのクリップが意図的なものに見えるか、ただのレンダリングに見えるかを決めるのは照明です。

英語は完全にサポートされています。それ以外の言語について Google はここで評価を行っていません。話させたい言語で台詞を書いてください。ただし英語以外ではばらつきが大きくなることを想定してください。

リリース前に確認すべきこと

48 時間以内にダウンロードしてください。 Google がファイルを保持するのは 2 日間 です。生成から 2 日以内に動画をダウンロードする必要がある、というのが同社の表現です。outputs[0].url を読む同じ job の中で、すべての出力をご自身のバケットへコピーしてください。CDN のリンクはアーカイブではありません。

すべてのフレームに SynthID が入ります。 Google の知覚できない watermark はすべての Veo 出力に適用され、同社の検証プラットフォームで確認できます。当社を含め、誰にもこれを切ることはできません。

人物に関する地域規則。 EU、英国、スイス、MENA では、personGeneration は allow_adult に制限されます。

よくある質問

E2X で Veo 3.1 Fast の text-to-video はいくらかかりますか?

秒単位での課金です。出力 1 秒あたり $0.01 で、音声を有効にすると 1.5 倍になります。音声付き 8 秒の 720p クリップは $0.12、6 秒は $0.09、4 秒は $0.06 です。720p を超える解像度には、それぞれの乗数が付きます。

このモデルについて E2X は本当に fal.ai の 10 分の 1 なのですか?

当社が確認した構成と日付 — 8 秒、720p、音声オン、2026年8月26日 — では、はい。当社の $0.12 に対して先方は $1.20 です。当社自身の割引前の定価も同じ $1.20 です。この差は割引であって、別の製品ではありません。

音声をオフにできますか?

当社の schema は has_sound を公開しており、デフォルトは true です。Google 自身の Gemini API にはオフのスイッチがそもそもないため、音声はこのモデルの一部として捉えていただくのが最も適切です。当社の image-to-video endpoint でも同様です。×1.5 の価格乗数の理由でもあります。

生成される 1 本のクリップは最長どれくらいですか?

1 回の呼び出しで 8 秒です。この endpoint では 4 秒や 6 秒も指定できますが、1080p と 4k はフルの 8 秒が必要です。それより長いシーケンスは、複数の job をご自身でつなぎ合わせるか、reference-to-video でルックを保つことを意味します。

どの aspect ratio と解像度に対応していますか?

16:9 と 9:16 のみで、24fps、720p・1080p・4k です。当社のデフォルトは 16:9 と 720p です。正方形や 4:5 の選択肢はないため、必要な場合はポストでクロップしてください。

動画に watermark は入りますか?

はい。すべての Veo 出力に、Google の知覚できない来歴マーカーである SynthID が入り、同社のプラットフォームで検証できます。これを無効化するパラメーターを公開しているプロバイダーはありません。

生成にはどれくらい時間がかかりますか?

当社では 1 job あたり約 4 分を見込んでいます。Google は最短 11 秒、ピーク時の最長 6 分を公表しているので、大量処理では詰まった polling ループではなく webhook をお使いください。