Loading...
Loading...
Generate video from up to seven reference images with Gemini Omni 1.1 Flash. The reference images carry character and style consistency into the result.
0/7 件
モデルを実行するにはサインインしてください
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)再生時間と解像度ごとの生成あたりの推定コストです。実行した分だけお支払いいただきます。
キャンペーンがクリップ 1 本で済むことはありません。あるのはショットリストです。11 行あって、どの行にも同じ配達バッグが映っていて、6 行目あたりでバッグが灰色に転ぶ午後を買い直す予算はありません。reference-to-video は、そのバッグを同じバッグのまま保ちます。当社はこれを google/omni-1.1-flash/reference-to-video として運用し、720p 出力 1 秒あたり $0.09 を課金します。デフォルトの 8 秒クリップは音声込みで $0.72 です。
仕事をしているフィールドは image_urls です。配列で、当社の schema では minItems: 1、maxItems: 7。この上限があるからこのページが存在します。7 つの枠があれば、あなたが渡さなかった角度をモデルが勝手に作り出さなくなるだけの見え方を、被写体について与えられます。
素材が違えば入口も違います。静止画が 1 枚だけなら Omni 1.1 Flash image-to-video、ショットの両端があって間が空いているなら start-end-frame-to-video、素材のないブリーフだけなら、価格表をひととおり載せた Omni 1.1 Flash text-to-video です。
当社の料率、2026年8月28日にライブカタログから読み取ったものです。
| クリップの尺 | 720p の価格 |
|---|---|
| 4 秒 | $0.36 |
| 6 秒 | $0.54 |
| 8 秒(デフォルト) | $0.72 |
| 10 秒 | $0.90 |
定価は 1 秒 $0.15、常時 40% の割引で $0.09 になります。解像度はそこから掛け算で、360p が $0.0297、4K が $0.18。したがって 4K の 10 秒レンダリングは $1.80 です。そして、組み方を決める数字がひとつ。参照画像を 1 枚添えても 7 枚添えても、上の表は 1 セントも動きません。計算式は duration と resolution だけです。参照画像は重さのない荷物です。
価格および製品条件は変更される場合があります。購入を判断する前に、各プロバイダーの最新価格をご確認ください。Google の Batch または Flex 価格は、スケジューリング・空き状況・処理条件が異なるため、標準的なオンデマンド API request と直接同等ではなく、この比較には含めていません。これは特定の条件に絞った比較であり、E2X があらゆる構成において世界最安であると主張するものではありません。
API は配列の URL をすべて取得するため、当社の worker が素の HTTPS で到達できる場所に置く必要があります。公開バケット、期限切れでない署名付きリンク。ログインの向こう側は不可です。
7 という数字は検証される最大値であって、ドキュメントに書かれた一文ではありません。8 つ目を送れば、GPU に触れる前に request が却下されます。制限のように聞こえますが、予算だと考えてください。7 枠を使い切るに値するセットとは、斜め 45 度、真横、後ろ、ブランドを担うディテール 1 点、クリップが実際に画角に収める距離のもの 1 点、ニュートラルな光のもの 1 点、という構成です。同じヒーローアングルを重ねれば枠の無駄になります。渡さなかった角度は推測されます。
これが前世代からの変化です。当社の Gemini Omni Flash reference-to-video の endpoint は同じ発想を 1 秒 $0.075 で動かしていますが、文書化された上限はまったくありません。Google が一度も公表しなかったため、当社としても裏づけのない数字を印刷することは控えました。2 割安いのはあちらで、その理由も見えています。検証済みの 7 枠という上限がなく、支払う前に参照セットを試せる 360p 段もありません。Google はそのモデルを 2026年9月30日 に終了します。まだそちらを向いている pipeline があるなら、移行は slug の差し替えだけ、秒単価は 2 割上がり、着地先はここです。
配列は一度だけ組んでください。7 つの URL をショットリストの隣に保存し、どの job にも同一の配列を送ります。固定項が参照セット、変数が prompt です。
この逆転がワークフローそのものです。被写体は参照画像が担っているので、それぞれの prompt はそれがどう見えるかを書くのをやめ、それに何が起こるかを書きはじめます。カメラ、何が動くか、光、音。prompt は短くなり、クリップは揃うようになります。ふつう予想されるトレードオフとは逆です。同じショットの言い回しを 2 つ比べるときは seed を固定してください。効いたのが書き直しなのかサイコロなのかが分かります。
1 job あたり 240 秒を見込み、リストは並列に流してください。そのうえで、Google のモデルカードが認めていることを基準に置いておいてください。
「編集全体を通じて完全な一貫性を保つこと、複雑な動きを含むシーンを生成すること、あるいは完全に正確なテキストを描画することは、依然として課題として残っています。」
7 枚の参照画像はぶれを狭めます。なくしはしません。
必須フィールドは 2 つ、prompt と image_urls です。key はサーバー側に置き、job を送信してください。
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/reference-to-video",
"input": {
"prompt": "画像 1 は折りたたんだ自転車、画像 2 はヒンジ、画像 3 は乗り手。夜明けの石畳の中庭。乗り手がそれを広げ、フレームをかちりと固定する。固定のワイド。鳥の声、遠くの路面電車。",
"image_urls": [
"https://example.com/bike-folded.jpg",
"https://example.com/bike-hinge.jpg",
"https://example.com/rider.jpg"
],
"duration": "8",
"aspect_ratio": "16:9"
}
}'
data.jobId が返ってきます。レンダリングには数分かかるので、polling はゆっくり行ってください。あるいは webhookUrl を渡して polling を省いてください。
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
// 配列は 1 つ、どの prompt でも使い回す。
const image_urls = [
"https://example.com/fox-puppet-front.jpg",
"https://example.com/fox-puppet-muzzle.jpg",
"https://example.com/fox-puppet-profile.jpg",
];
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/reference-to-video",
input: {
prompt:
"画像 1 はキツネのパペット。フレーム左から身を乗り出し、首をかしげる。ゆっくりとドリーイン。紙の擦れる音、静かな部屋鳴り。",
image_urls,
duration: "10",
aspect_ratio: "9:16",
resolution: "1080p",
seed: 70413,
},
}),
}).then((r) => r.json());
const { jobId } = submitted.data;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") { console.log(job.data.outputs[0].url); break; }
if (job.data.status === "failed") throw new Error(job.data.error?.message);
await new Promise((r) => setTimeout(r, 5000));
}
ステータスは pending → processing → completed と進むか、failed / cancelled に落ち着きます。罠がひとつ。duration と resolution は文字列です。10 ではなく "10"。schema と価格は機械可読な仕様にあります。
Veo 3.1 Fast reference-to-video は、この同じプラットフォーム上で 1 秒 $0.01 です。9 分の 1。8 秒はあちらが $0.08、こちらが $0.72 で、表の下に埋めて隠すつもりはありません。
ですからまずの答えは Veo です。ショットリストに必要なのが参照画像 3 枚、8 秒、720p なら、ほかを呼ぶのは何もないものに金を払うことです。
これを覆すものが 4 つあります。Veo が受け付ける枚数より多くの参照画像が要るとき。あちらは 3 枚で止まり、当社は 7 枚です。被写体を覆うのと、つまみ食いするのとの差です。10 秒が要るとき。Veo は出しません。4K が要るとき。あるいは 360p の段を使いたいとき。そこでは下書き 20 本が完成品 1 本より安く済み、勝ったものは同じ配列と seed から再レンダリングできます。その 4 つの外なら、安いほうへ行ってください。ほかは reference-to-video カテゴリに、残りはモデルカタログにあります。
参照画像は実在するもの、ときには実在する人物のアップロードです。 Google は、英国、スイス、欧州経済領域のユーザーについて、未成年者や識別可能な一部の個人が写った画像のアップロードを拒否します。ここではそれは脚注ではなくキャスティングの制約です。深夜 2 時の失敗した job ではなく、ブリーフに書いてください。
全フレームに SynthID が入ります。 Google の不可視な watermark はすべての出力に載り、当社を含めどのプロバイダーも切れません。ラベル付きの AI アセットを禁じる契約があるなら、統合の前に片付けてください。
音は言葉から生まれます。 音声は映像と一緒に生成され、同じ prompt から操作します。has_sound の切り替えも、音声の参照アップロードもありません。
結果の URL は期限切れになります。 outputs[0].url を読むハンドラーの中で、出力を自分のストレージへ複製してください。作り直すキャンペーンは、二度払ったキャンペーンです。
完全にサポートされている prompt 言語は英語だけで、このモデルは、2026年4月に Google が Vertex AI に代えて用意した Gemini Enterprise Agent Platform に掲載されています。背景は当社のリリース解説にあります。
画像を 7 枚添えれば、何が存在するかはモデルに伝わります。どれが主役かは伝わりません。それは文章でやります。画像 1 はやかん、画像 2 はホーローの蓋、画像 3 は台所。番号を振って、1 行目に、どんな演出より先に置いてください。
そこから先は、被写体の描写をやめてください。すでに添えたものの色や形を prompt が指定し直せば、それは自分の参照画像と論争していることになり、モデルは差を取って中間に着地します。言葉は、配列が持てないものに使ってください。カメラ、動きひとつ、光、環境音です。どの prompt も一続きのショット 1 つに保つこと。3 場面の物語を頼めば、返ってくるのは滲みです。ショットの語彙については当社の Gemini Omni prompting ガイドがさらに踏み込んでいます。
7 枚です。しかもこの上限は推測ではなく公表されています。image_urls は minItems: 1 と maxItems: 7 で検証されるため、8 つ目の要素は送信時に失敗します。前世代には文書化された上限がありませんでした。実務上いちばん大きな違いです。
いいえ。当社は完成した動画 1 秒ごとに、解像度で掛け算して課金します。参照画像の枚数はその計算に入りません。1 枚でも 7 枚でも、8 秒 720p のクリップは $0.72 です。動くつまみは尺と解像度だけです。
prompt の中で番号を振ってください。どの画像が商品で、どれがディテールで、どれが環境か。そのうえで動作を描写します。あなたの文章が役割を割り当てるまで、image_urls はただの並びです。
それが想定された形です。配列は一度保存し、どの prompt にもそのまま送って、変えるのは演出だけにしてください。seed を固定しておけば、クリップ同士がつながる程度には照明が安定します。
1 秒 $0.01 という時点で、ほとんどの場合そうです。Veo 3.1 Fast は同等の request を 9 分の 1 でこなします。こちらへ移るのは、参照画像 3 枚では被写体を覆いきれないとき、カットに 10 秒が要るとき、納品物が 4K のとき、あるいは 360p の下書きループを回したいときです。
360p、720p、1080p、4K のいずれか、16:9 または 9:16 で、4 秒、6 秒、8 秒、10 秒、常に 24 fps です。上位 2 つの解像度はネイティブなレンダリングではなくアップスケールなので、鮮鋭さはご自身の映像で判断してください。
Google はその日に gemini-omni-flash-preview を提供終了し、その重みを動かしているプロバイダーはどこも同じ日に止まります。job の向き先をここへ変えてください。request の形は同じで、参照画像の上限は文書化されています。旧 reference-to-video のページは移行の参照用として残します。