Loading...
Loading...
テキストプロンプトや参照画像から動画クリップを生成する Google の動画モデルファミリー。短時間での書き出しに最適化されています。
0/7 件
モデルを実行するにはサインインしてください
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)再生時間と解像度ごとの生成あたりの推定コストです。実行した分だけお支払いいただきます。
Omni Flash は Google の gemini-omni-flash-preview です。Veo ではなく Gemini ファミリーの動画モデルであり、DeepMind 自身の売り文句は一文で済みます。「Gemini Omni は Nano Banana の動画版だと考えてください。」当社ではその reference-to-video の capability を google/omni-flash/reference-to-video として運用しており、完成した 720p 動画 1 秒ごとに $0.10 を課金しています。したがってデフォルトの 8 秒クリップは、音声込みで $0.80 です。
単位にご注意ください。ここでクリップを定額で売っているところはないため、比較する数字はすべて、レンダリングしようとしている長さで掛ける必要があります。
台本はあるものの、ショットに持ち込む画像がないのでしょうか。それなら Veo 3.1 Fast text-to-video が使うべき endpoint です。prompt だけから始められますし、当社のプラットフォームでは劇的に安く済みます。その点については、後ほど正直にご説明します。
このモデルを呼べる他の場所に対する当社の位置は、2026年8月26日に確認した時点で次のとおりです。
| API プロバイダー | 1 秒あたり(720p) | 8 秒クリップ | E2X との比較 |
|---|---|---|---|
| E2X | $0.10 | $0.80 | — |
| fal.ai | $0.13 | $1.04 | 当社が 23% 低価格 |
| Atlas Cloud | $0.135 | $1.08 | 当社が 26% 低価格 |
| Runware | $0.10 | $0.80 | 同額 |
| Google Gemini API | $0.10 | $0.80 | 同額 |
価格および製品条件は変更される場合があります。購入を判断する前に、各プロバイダーの最新価格をご確認ください。Google の Batch または Flex 価格は、スケジューリング・空き状況・処理条件が異なるため、標準的なオンデマンド API request と直接同等ではなく、この比較には含めていません。これは特定の条件に絞った比較であり、E2X があらゆる構成において世界最安であると主張するものではありません。
これを取り繕うつもりはありません。このモデルについて当社は Google の料率を下回るのではなく同額に合わせており、節約が実際に生じるのは fal.ai と Atlas に対してだけです。参照画像はほとんど数字に表れません。Google は画像 1 枚を 2,040 token として数えるため、3 枚でも 1 セント程度です。請求を動かすのは duration のフィールドです。
この endpoint の眼目は連続性です。被写体 — 人物、商品、セット、ルック — をモデルに渡し、それが撮影されたことのないシーンを描写しても、被写体はその旅を生き延びます。
参照画像は 1 枚ではなく複数添付できます。 Google が公開している例は最大 6 枚まで及びます。公式な上限は文書化されておらず、第三者の数字も互いに矛盾しているため、当社としては数字を印刷しません。数枚を前提に設計し、ご自身で上限をテストしてください。
音声は映像と一緒に生成されるもので、後付けではありません。 動作に同期し、同じ prompt から操作できます。トタン屋根に当たる雨と低い部屋の空気感を頼めば、そのとおりに返ってきます。後から編集できる独立した音声トラックはありません。
上限は 10 秒です。 当社の duration enum は 4、6、8、10 を公開しています。Google のモデルは 3 秒から 10 秒で動作し、10 秒が厳格な上限です。extension の endpoint も、補間もありません。それより長いものは、ご自身のエディターでのつなぎ合わせ作業になりますし、カット間の連続性はあなたの問題になります。
720p、24 fps、以上です。 当社の resolution フィールドには 1080p と 4k の値があり、Google もより高い解像度を近日提供として掲載していますが、現時点でこのモデルが返すのは 720p です。デフォルトのままにしてください。ここで 1080p を宣伝しているプロバイダーのページは、Google 自身のドキュメントより先走っています。
標準的なクリップで、処理時間は約 45 秒を見込んでください。eachlabs による実測の p50 であり、公式な数字ではないため、これを前提に計画するのは構いませんが、約束はしないでください。
必須フィールドは image_urls と prompt の 2 つです。ダッシュボードから API key を生成し、ご自身で管理するサーバー上に置いたうえで job を送信してください。
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-flash/reference-to-video",
"input": {
"prompt": "画像 1 のスニーカーが濡れたアスファルトの上にあり、その背後をバスが走り去っていく。ゆっくりとしたプッシュイン。環境音として車の往来と小雨、音楽はなし。",
"image_urls": [
"https://example.com/sneaker-front.jpg",
"https://example.com/sneaker-side.jpg"
],
"duration": "8",
"aspect_ratio": "16:9",
"resolution": "720p"
}
}'
response には job ID が入っています。動画は数分かかるため、polling はゆっくり行ってください。あるいは polling を省き、submit の body に webhookUrl を渡してください。
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-flash/reference-to-video",
input: {
prompt:
"参照画像の女性が夜市を歩き、ネオンの看板が彼女のジャケットに反射する。手持ち。人混みのざわめきと、遠くで何かを揚げる音。",
image_urls: ["https://example.com/talent.jpg"],
duration: "10",
aspect_ratio: "9:16",
},
}),
}).then((r) => r.json());
const poll = async (id, attempt = 0) => {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${id}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") return job.data.outputs[0].url;
if (job.data.status === "failed") throw new Error(job.data.error?.message);
if (attempt > 90) throw new Error("Timed out waiting for the render");
await new Promise((r) => setTimeout(r, 5000));
return poll(id, attempt + 1);
};
const videoUrl = await poll(data.jobId);
ステータスは pending → processing → completed と進むか、failed または cancelled で終わります。プログラムから読みたい場合は、最新の schema と価格が機械可読な仕様にあります。
重要な比較であり、このページにとって都合のよい内容ではありません。
| モデル | 当社価格(8 秒、720p、音声) | こんなときに |
|---|---|---|
| Omni Flash reference-to-video | $0.80 | 複数の参照画像を一貫させたい、または 10 秒のクリップが必要 |
| Veo 3.1 Fast reference-to-video | $0.12 | 参照画像は 3 枚まで、8 秒、そして請求を安く抑えたい |
| Veo 3.1 Fast image-to-video | $0.12 | 動かしたい静止画が 1 枚ある |
| Veo 3.1 Fast text-to-video | $0.12 | 素材がまったくない |
当社のプラットフォームでは、Veo 3.1 Fast は Omni Flash のごく一部の費用で済みます。 しかも 1080p と 4K に到達しますが、Omni Flash は現時点でそれができません。Google 自身の定価では、720p において両者は同じ 1 秒 $0.10 に並びます。差を開けているのは当社の割引です。ですから、まず Veo Fast から始めてください。3 枚という参照画像の上限が障害になっているとき、あと 2 秒が必要なとき、あるいは「動画版 Nano Banana」という位置づけの背後にある動画編集の挙動が欲しいときに、ここへ戻ってきてください。さらに多くの選択肢は reference-to-video カテゴリにあり、モデルカタログ全体は 1 ページにまとまっています。
Public Preview であるということは、粗い部分が隠されずに文書化されているということです。構築の前にお読みください。
物語ではなく、ショットを書いてください。被写体ひとつ、カメラの動きひとつ、照明の条件ひとつ。そのうえで、それがどう聞こえるかを述べてください。音声は同じ prompt から出てくるものであり、無音は声に出して選ぶ選択肢です。
複数の画像を入れるときは、添付にラベルを付けてください。「画像 1 はボトル、画像 2 はラベルの寄り」。どの参照画像が主役なのかをモデルに伝える手段は、ほかにありません。カメラの言葉は平易に保ってください。「ゆっくりとしたプッシュイン」「固定」「手持ちのフォロー」は、撮影技法を書き連ねた段落に勝ります。
すべてのクリップに SynthID watermark が入り — 視聴者には見えず、プログラムからは検出可能です — さらに C2PA のコンテンツクレデンシャルがデフォルトで付与されます。当社を含め、このモデルを運用するどのプロバイダーも、これらを切ることはできません。クライアントとの契約でラベル付きの AI アセットが禁じられている場合は、統合の前に解決してください。
完了ハンドラーの中で、出力をご自身のストレージへ再ホストしてください。結果の URL は恒久的なアドレスではありませんし、取得できない動画は、二度お金を払う動画です。
Google の gemini-omni-flash-preview で、Veo ファミリーではなく Gemini ファミリーの動画生成・編集モデルです。DeepMind はこれを「Nano Banana の動画版」と表現しており、力点は参照を一貫して保つことと既存の映像を編集することにあります。一方 Veo はゼロからのシネマティックな生成を狙っています。現在 Public Preview です。
$0.80 です。720p 出力 1 秒あたり $0.10 を課金するため、請求を左右するのは長さです。4 秒のクリップは $0.40、上限の 10 秒は $1.00 になります。これは 2026年8月26日 の確認時点での当社の料率です。
1 枚より多く受け付け、Google が文書化している例は最大 6 枚まで及びます。ただし公式な上限は公表されていません。Google 以外の情報源はそれぞれ異なる上限を挙げており、互いに矛盾しているため、当社としては検証できない数字を繰り返すことはしません。特定の枚数を前提に設計する前に、ご自身の payload でテストしてください。
現時点ではできません。出力は 720p、24 fps で、Google はより高い解像度を近日提供として掲載しています。今すぐ 1080p や 4K が必要であれば、Veo 3.1 Fast が両方に到達します。
大半の仕事では Veo 3.1 Fast です。当社のプラットフォームでは音声付き 8 秒クリップがここでの $0.80 に対して $0.12 で済み、しかも 4K まで対応します。参照画像が 3 枚を超えて必要なとき、10 秒の尺が必要なとき、あるいはその動画編集の挙動が欲しいときに Omni Flash を選んでください。
はい。ネイティブに、画面上の動作と同期した形で入ります。同じ prompt から演出できます。環境音や効果音を名指ししたり、音楽を頼んだりしてください。音声を API から後で編集することはできないため、変更は再レンダリングを意味します。
はい。すべての出力に、視聴者には見えず検出ツールには読める SynthID watermark が入り、さらに C2PA のコンテンツクレデンシャルがデフォルトでオンになっています。どちらかを無効化するパラメーターを公開しているプロバイダーはありません。
EEA、スイス、英国の外でのみ可能です。Google はこれらの地域でアップロード動画の編集を制限しています。reference-to-video の生成自体は影響を受けません。なお、動画の 参照 は schema としては受け付けられるものの正しく処理されないため、画像を送ってください。