モデル一覧へ戻る

Omni Flash

テキストプロンプトや参照画像から動画クリップを生成する Google の動画モデルファミリー。短時間での書き出しに最適化されています。

参照から動画から$0.075テキストから動画から$0.075
料金$0.075/リクエストから
レイテンシ平均約240秒
解像度4K/720P/1080P
最適な用途video, google, high-fidelity

パラメーター

0/7 件

推定コスト

このモデルで50%お得です
secondあたりの基本料金$0.15
割引-50%
合計金額$0.075
リクエストごとに$0.075お得です

モデルを実行するにはサインインしてください

Output Preview

Ready

No output yet

Run the model to see generated results.

サンプル出力

APIの例— 現在のパラメータ

generate.py
import requests

result = requests.post(
    'https://api.e2x.ai/v1/jobs/submit',
    headers={
        'Authorization': f'Bearer {API_KEY}',
        'Content-Type': 'application/json'
    },
    json={
  'model': 'google/omni-flash/reference-to-video',
  'input': {}
}
)

ジョブを取得— 結果をポーリング

get_job.py
import time

job_id = result.json()['jobId']

while True:
    response = requests.get(
        f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
        headers={'Authorization': f'Bearer {'{API_KEY}'}'}
    )
    data = response.json()['data']

    if data['status'] == 'completed':
        print('Done!', data['outputs'][0]['url'])
        break
    elif data['status'] == 'failed':
        raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")

    time.sleep(2)

料金の詳細

再生時間と解像度ごとの生成あたりの推定コストです。実行した分だけお支払いいただきます。

所要時間
4K
720P
1080P
4
$1.20
$0.60
$0.90
6
$1.80
$0.90
$1.35
8
$2.40
$1.20
$1.80
10
$3.00
$1.50
$2.25
代替モデルを探索

関連モデル

参照から動画向けの他のAIモデルを探索

すべてのモデルを見る

E2X の Gemini Omni Flash Reference-to-Video API

Omni Flash は Google の gemini-omni-flash-preview です。Veo ではなく Gemini ファミリーの動画モデルであり、DeepMind 自身の売り文句は一文で済みます。「Gemini Omni は Nano Banana の動画版だと考えてください。」当社ではその reference-to-video の capability を google/omni-flash/reference-to-video として運用しており、完成した 720p 動画 1 秒ごとに $0.10 を課金しています。したがってデフォルトの 8 秒クリップは、音声込みで $0.80 です。

単位にご注意ください。ここでクリップを定額で売っているところはないため、比較する数字はすべて、レンダリングしようとしている長さで掛ける必要があります。

台本はあるものの、ショットに持ち込む画像がないのでしょうか。それなら Veo 3.1 Fast text-to-video が使うべき endpoint です。prompt だけから始められますし、当社のプラットフォームでは劇的に安く済みます。その点については、後ほど正直にご説明します。

このモデルを呼べる他の場所に対する当社の位置は、2026年8月26日に確認した時点で次のとおりです。

API プロバイダー1 秒あたり(720p)8 秒クリップE2X との比較
E2X$0.10$0.80—
fal.ai$0.13$1.04当社が 23% 低価格
Atlas Cloud$0.135$1.08当社が 26% 低価格
Runware$0.10$0.80同額
Google Gemini API$0.10$0.80同額

価格および製品条件は変更される場合があります。購入を判断する前に、各プロバイダーの最新価格をご確認ください。Google の Batch または Flex 価格は、スケジューリング・空き状況・処理条件が異なるため、標準的なオンデマンド API request と直接同等ではなく、この比較には含めていません。これは特定の条件に絞った比較であり、E2X があらゆる構成において世界最安であると主張するものではありません。

これを取り繕うつもりはありません。このモデルについて当社は Google の料率を下回るのではなく同額に合わせており、節約が実際に生じるのは fal.ai と Atlas に対してだけです。参照画像はほとんど数字に表れません。Google は画像 1 枚を 2,040 token として数えるため、3 枚でも 1 セント程度です。請求を動かすのは duration のフィールドです。

参照画像が実際に何を買っているのか

この endpoint の眼目は連続性です。被写体 — 人物、商品、セット、ルック — をモデルに渡し、それが撮影されたことのないシーンを描写しても、被写体はその旅を生き延びます。

参照画像は 1 枚ではなく複数添付できます。 Google が公開している例は最大 6 枚まで及びます。公式な上限は文書化されておらず、第三者の数字も互いに矛盾しているため、当社としては数字を印刷しません。数枚を前提に設計し、ご自身で上限をテストしてください。

音声は映像と一緒に生成されるもので、後付けではありません。 動作に同期し、同じ prompt から操作できます。トタン屋根に当たる雨と低い部屋の空気感を頼めば、そのとおりに返ってきます。後から編集できる独立した音声トラックはありません。

上限は 10 秒です。 当社の duration enum は 4、6、8、10 を公開しています。Google のモデルは 3 秒から 10 秒で動作し、10 秒が厳格な上限です。extension の endpoint も、補間もありません。それより長いものは、ご自身のエディターでのつなぎ合わせ作業になりますし、カット間の連続性はあなたの問題になります。

720p、24 fps、以上です。 当社の resolution フィールドには 1080p と 4k の値があり、Google もより高い解像度を近日提供として掲載していますが、現時点でこのモデルが返すのは 720p です。デフォルトのままにしてください。ここで 1080p を宣伝しているプロバイダーのページは、Google 自身のドキュメントより先走っています。

標準的なクリップで、処理時間は約 45 秒を見込んでください。eachlabs による実測の p50 であり、公式な数字ではないため、これを前提に計画するのは構いませんが、約束はしないでください。

API request:参照画像を送り、クリップを受け取る

必須フィールドは image_urls と prompt の 2 つです。ダッシュボードから API key を生成し、ご自身で管理するサーバー上に置いたうえで job を送信してください。

curl -X POST https://api.e2x.ai/v1/jobs/submit \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "google/omni-flash/reference-to-video",
    "input": {
      "prompt": "画像 1 のスニーカーが濡れたアスファルトの上にあり、その背後をバスが走り去っていく。ゆっくりとしたプッシュイン。環境音として車の往来と小雨、音楽はなし。",
      "image_urls": [
        "https://example.com/sneaker-front.jpg",
        "https://example.com/sneaker-side.jpg"
      ],
      "duration": "8",
      "aspect_ratio": "16:9",
      "resolution": "720p"
    }
  }'

response には job ID が入っています。動画は数分かかるため、polling はゆっくり行ってください。あるいは polling を省き、submit の body に webhookUrl を渡してください。

const headers = {
  Authorization: `Bearer ${process.env.E2X_API_KEY}`,
  "Content-Type": "application/json",
};

const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
  method: "POST",
  headers,
  body: JSON.stringify({
    model: "google/omni-flash/reference-to-video",
    input: {
      prompt:
        "参照画像の女性が夜市を歩き、ネオンの看板が彼女のジャケットに反射する。手持ち。人混みのざわめきと、遠くで何かを揚げる音。",
      image_urls: ["https://example.com/talent.jpg"],
      duration: "10",
      aspect_ratio: "9:16",
    },
  }),
}).then((r) => r.json());

const poll = async (id, attempt = 0) => {
  const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
    .then((r) => r.json());

  if (job.data.status === "completed") return job.data.outputs[0].url;
  if (job.data.status === "failed") throw new Error(job.data.error?.message);
  if (attempt > 90) throw new Error("Timed out waiting for the render");

  await new Promise((r) => setTimeout(r, 5000));
  return poll(id, attempt + 1);
};

const videoUrl = await poll(data.jobId);

ステータスは pending → processing → completed と進むか、failed または cancelled で終わります。プログラムから読みたい場合は、最新の schema と価格が機械可読な仕様にあります。

当社の動画モデルの選び分け

重要な比較であり、このページにとって都合のよい内容ではありません。

モデル当社価格(8 秒、720p、音声)こんなときに
Omni Flash reference-to-video$0.80複数の参照画像を一貫させたい、または 10 秒のクリップが必要
Veo 3.1 Fast reference-to-video$0.12参照画像は 3 枚まで、8 秒、そして請求を安く抑えたい
Veo 3.1 Fast image-to-video$0.12動かしたい静止画が 1 枚ある
Veo 3.1 Fast text-to-video$0.12素材がまったくない

当社のプラットフォームでは、Veo 3.1 Fast は Omni Flash のごく一部の費用で済みます。 しかも 1080p と 4K に到達しますが、Omni Flash は現時点でそれができません。Google 自身の定価では、720p において両者は同じ 1 秒 $0.10 に並びます。差を開けているのは当社の割引です。ですから、まず Veo Fast から始めてください。3 枚という参照画像の上限が障害になっているとき、あと 2 秒が必要なとき、あるいは「動画版 Nano Banana」という位置づけの背後にある動画編集の挙動が欲しいときに、ここへ戻ってきてください。さらに多くの選択肢は reference-to-video カテゴリにあり、モデルカタログ全体は 1 ページにまとまっています。

Google が公表している制約

Public Preview であるということは、粗い部分が隠されずに文書化されているということです。構築の前にお読みください。

  • 最長 3 秒の動画参照は API schema としては受け付けられますが、Google 自身の言葉によれば「モデルによって正しく処理されません」。動画参照は機能しないものとして扱い、静止画を送ってください。また、複数の動画をまたぐ参照や推論はまったくサポートされていません。
  • アップロードした動画の編集は EEA、スイス、英国では利用できません。ユーザーやインフラがそこにある場合、このモデルの魅力の半分は選択肢から外れます。
  • 完全にサポートされているのは英語だけです。他の prompt 言語は評価されていません。
  • 複数シーンにわたる長い物語を 1 回の生成で作ろうとすると失敗します。このモデルがレンダリングするのは 1 つの連続したショットです。3 つを順に頼めば、返ってくるのは混乱です。

映像と音を同時に prompt する

物語ではなく、ショットを書いてください。被写体ひとつ、カメラの動きひとつ、照明の条件ひとつ。そのうえで、それがどう聞こえるかを述べてください。音声は同じ prompt から出てくるものであり、無音は声に出して選ぶ選択肢です。

複数の画像を入れるときは、添付にラベルを付けてください。「画像 1 はボトル、画像 2 はラベルの寄り」。どの参照画像が主役なのかをモデルに伝える手段は、ほかにありません。カメラの言葉は平易に保ってください。「ゆっくりとしたプッシュイン」「固定」「手持ちのフォロー」は、撮影技法を書き連ねた段落に勝ります。

リリース前に

すべてのクリップに SynthID watermark が入り — 視聴者には見えず、プログラムからは検出可能です — さらに C2PA のコンテンツクレデンシャルがデフォルトで付与されます。当社を含め、このモデルを運用するどのプロバイダーも、これらを切ることはできません。クライアントとの契約でラベル付きの AI アセットが禁じられている場合は、統合の前に解決してください。

完了ハンドラーの中で、出力をご自身のストレージへ再ホストしてください。結果の URL は恒久的なアドレスではありませんし、取得できない動画は、二度お金を払う動画です。

よくある質問

Gemini Omni Flash とは何ですか?

Google の gemini-omni-flash-preview で、Veo ファミリーではなく Gemini ファミリーの動画生成・編集モデルです。DeepMind はこれを「Nano Banana の動画版」と表現しており、力点は参照を一貫して保つことと既存の映像を編集することにあります。一方 Veo はゼロからのシネマティックな生成を狙っています。現在 Public Preview です。

E2X で 8 秒の Omni Flash 動画はいくらかかりますか?

$0.80 です。720p 出力 1 秒あたり $0.10 を課金するため、請求を左右するのは長さです。4 秒のクリップは $0.40、上限の 10 秒は $1.00 になります。これは 2026年8月26日 の確認時点での当社の料率です。

Omni Flash は参照画像を何枚受け付けますか?

1 枚より多く受け付け、Google が文書化している例は最大 6 枚まで及びます。ただし公式な上限は公表されていません。Google 以外の情報源はそれぞれ異なる上限を挙げており、互いに矛盾しているため、当社としては検証できない数字を繰り返すことはしません。特定の枚数を前提に設計する前に、ご自身の payload でテストしてください。

Omni Flash は 1080p や 4K の動画を生成できますか?

現時点ではできません。出力は 720p、24 fps で、Google はより高い解像度を近日提供として掲載しています。今すぐ 1080p や 4K が必要であれば、Veo 3.1 Fast が両方に到達します。

Omni Flash と Veo 3.1 Fast のどちらを使うべきですか?

大半の仕事では Veo 3.1 Fast です。当社のプラットフォームでは音声付き 8 秒クリップがここでの $0.80 に対して $0.12 で済み、しかも 4K まで対応します。参照画像が 3 枚を超えて必要なとき、10 秒の尺が必要なとき、あるいはその動画編集の挙動が欲しいときに Omni Flash を選んでください。

生成された動画に音は入りますか?

はい。ネイティブに、画面上の動作と同期した形で入ります。同じ prompt から演出できます。環境音や効果音を名指ししたり、音楽を頼んだりしてください。音声を API から後で編集することはできないため、変更は再レンダリングを意味します。

Omni Flash の動画に watermark は入りますか?

はい。すべての出力に、視聴者には見えず検出ツールには読める SynthID watermark が入り、さらに C2PA のコンテンツクレデンシャルがデフォルトでオンになっています。どちらかを無効化するパラメーターを公開しているプロバイダーはありません。

このモデルでアップロードした動画を編集できますか?

EEA、スイス、英国の外でのみ可能です。Google はこれらの地域でアップロード動画の編集を制限しています。reference-to-video の生成自体は影響を受けません。なお、動画の 参照 は schema としては受け付けられるものの正しく処理されないため、画像を送ってください。