Loading...
Loading...
Generate smooth video transitions between two key frames with Gemini Omni 1.1 Flash. Provide a start frame, an end frame and a text prompt to guide the in-between motion.
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/omni-1.1-flash/start-end-frame-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)再生時間と解像度ごとの生成あたりの推定コストです。実行した分だけお支払いいただきます。
Gemini Omni 1.1 Flash は Google の gemini-omni-1.1-flash で、2026年8月27日 から GA、Veo ではなく Gemini ファミリーのモデルです。当社はその 2 フレームの capability を google/omni-1.1-flash/start-end-frame-to-video として運用しており、課金は出力 1 秒ごと。720p で $0.09 です。定価 $0.15 に常時 40% の割引がかかった額で、デフォルトの 8 秒クリップは $0.72 になります。
入力は 3 つ。開始フレーム、終了フレーム、prompt です。1 枚目の画像が 1 コマ目、2 枚目が最終コマになり、その間はすべて創作されます。これはクリップの依頼ではなく橋の依頼であり、橋の価値は両岸の価値で決まります。
これも新顔です。ひとつ前の Omni Flash 世代にはこの capability がありませんでした。当社の 1.1 リリース解説で述べた主張の、いちばん素朴な裏づけです。品質のリリースではなく、連続性のリリースなのです。
当社の料率、2026年8月28日 時点の確認です。
| 尺 | 360p | 720p | 1080p | 4K |
|---|---|---|---|---|
| 4 秒 | $0.1188 | $0.36 | $0.54 | $0.72 |
| 6 秒 | $0.1782 | $0.54 | $0.81 | $1.08 |
| 8 秒(デフォルト) | $0.2376 | $0.72 | $1.08 | $1.44 |
| 10 秒 | $0.297 | $0.90 | $1.35 | $1.80 |
1080p と 4K はアップスケールであり、ネイティブではありません。
トゥイーニングという捉え方は間違いです。トゥイーニングのツールはピクセル A をピクセル B へ混ぜていきます。このモデルは両方の画像を読み、その間でシーンを運んだであろう出来事は何かを判断し、それをレンダリングします。音声込みで、しかも同じ prompt からネイティブに生成されます。has_sound のフィールドも、ミュートのスイッチもありません。
24 fps なら 4 秒の橋は 96 コマで、そのうち 2 コマはあなたが渡したものです。残る 94 コマは物理についての主張であり、その主張が通るかどうかに関わらず提出されます。画角は 16:9 か 9:16。1 job あたり 4 分を見込んでください。
そのペアを決めるのは 3 つの問いです。同じ被写体か。 似ているではなく、同じか。同じ光か。 キーライトの方向、色温度、コントラスト。カメラがその移動を実際にできたか。 オペレーターが従えるような一文で言えないなら、モデルにも言えません。
答えが「いいえ」でも、エラーにはなりません。モデルは隙間を取り繕います。型は 4 つです。
使えないクリップも、使えるクリップと同じ額を取ります。
1 秒 $0.0297 なら 360p の 4 秒テストは $0.1188、8 秒 720p の本番は $0.72 で 5 倍です。360p は顔を判断するには小さすぎますが、真ん中を判断するには十分です。カットはどの解像度でもカットです。モーフはモーフです。Google はこの段が最大 60% 速く走るとも言っていますが、これはローンチ記事の言い回しであって、API リファレンスの数字ではありません。
おかげで絵コンテの作業を、反復できる値段でこなせます。1 拍につきキーフレーム 2 枚、ショットリストを 4 秒・360p で通し、アニマティックとして再生する。12 拍でおよそ $1.73 です。失敗はほとんどの場合フレームのペアの問題で、prompt を 5 回書き直すより 1 枚のコンテを描き直すほうが直ります。生き残ったものだけをレンダリングしてください。Veo 3.1 Fast start-end-frame-to-video には下書き用の段がそもそもありません。
duration は 4、6、8、10 を文字列として受け取ります。1 秒あたりの額は同じなので、予算のつまみのように見えます。実際は演出のつまみです。
同じ 2 枚のフレームでも、4 秒と 10 秒では別のショットになります。4 秒は移動を強います。カメラは腹をくくり、創作の余地はほとんどありません。10 秒は埋めなければならず、モデルは自前の埋め草を見つけます。漂い、間を持たせる止め、2 つ目の仕草。この勝手な芝居が、ここでいちばん予測しづらい出力です。
尺は距離に合わせてください。30 度離れただけの商品カット 2 枚を 10 秒に引き伸ばせば、買えるのは這うような動きと死んだ間だけです。10 秒は Omni の上限であり、実際の強みでもあります。Veo は 8 秒で止まります。
key を生成し、サーバー側に保持し、job を送信してください。prompt、start_frame_url、end_frame_url が必須で、画像は当社が両方とも取得するため、それぞれの URL は認証なしの request に応答する必要があります。
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/omni-1.1-flash/start-end-frame-to-video",
"input": {
"prompt": "蒸気が溜まっていくにつれ、カメラがエスプレッソマシンの周りを右へ弧を描く。グラインダーの唸り、カフェのざわめき。",
"start_frame_url": "https://example.com/07a-left.jpg",
"end_frame_url": "https://example.com/07b-right.jpg",
"duration": "6",
"resolution": "360p"
}
}'
job id を polling するか、webhookUrl を渡してください。
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const { data } = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/omni-1.1-flash/start-end-frame-to-video",
input: {
prompt: "屋上の手すりから中庭のテーブルまで、ゆっくりとクレーンダウン。一続きの移動で。",
start_frame_url: "https://example.com/12a-roof.jpg",
end_frame_url: "https://example.com/12b-courtyard.jpg",
duration: "10",
resolution: "720p",
},
}),
}).then((r) => r.json());
let url = null;
while (!url) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${data.jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") url = job.data.outputs[0].url;
else if (["failed", "cancelled"].includes(job.data.status))
throw new Error(job.data.error?.message ?? job.data.status);
else await new Promise((r) => setTimeout(r, 5000));
}
ステータスは pending、processing、completed と進むか、failed / cancelled に着地します。schema の罠が 2 つ。duration と resolution は文字列であること。そしてフィールド名は start_frame_url と end_frame_url であって、ほかで使う単数形の image_url ではないことです。実際の値は機械可読な仕様にあります。
Veo 3.1 Fast は同じ仕事を 9 分の 1 の金額でこなします。
| endpoint | 8 秒、720p | こんなときに |
|---|---|---|
| Veo 3.1 Fast start-end-frame-to-video | $0.08 | フレームがつながっていて、8 秒で足りる |
| Omni 1.1 Flash start-end-frame-to-video | $0.72 | 10 秒、4K、または下書きパスが要る |
| Omni 1.1 Flash image-to-video | $0.72 | ショットの片端しか決まっていない |
| Omni 1.1 Flash reference-to-video | $0.72 | 被写体が多数のショットにまたがって同一であるべき |
| Omni 1.1 Flash text-to-video | $0.72 | 元になるフレームがまったくない |
価格および製品条件は変更される場合があります。購入を判断する前に、各プロバイダーの最新価格をご確認ください。Google の Batch または Flex 価格は、スケジューリング・空き状況・処理条件が異なるため、標準的なオンデマンド API request と直接同等ではなく、この比較には含めていません。これは特定の条件に絞った比較であり、E2X があらゆる構成において世界最安であると主張するものではありません。
まず Veo から始めてください。8 秒の壁が邪魔になったとき、納品物が 4K のとき、あるいは下書きパスが費用以上に節約になるときに、ここへ戻ってきてください。残りは image-to-video と text-to-video の下にありますし、モデルカタログ全体は 1 ページです。
風景ではなく、移動を書いてください。両端はモデルがすでに見ています。その 2 つをつなぐ動きを名指しし(「右へ弧を描く」「クレーンダウン」「奥の窓へラックフォーカス」)、次にそれがどう聞こえるべきかを述べてください。音声はその同じ一行から書き起こされます。どちらのフレームも示唆していない出来事は要求しないこと。カメラの語彙は当社の Omni prompting ガイドにもっとあります。評価済みの prompt 言語は英語だけです。
クライアントに見せる前に 3 つ。全フレームに Google の不可視な来歴マーカー SynthID が入り、どのプロバイダーも剥がせません。Google のモデルカードは率直で、*「編集全体を通じて完全な一貫性を保つこと、複雑な動きを含むシーンを生成すること、あるいは完全に正確なテキストを描画することは、依然として課題として残っています」*と書いています。フレーム間の隔たりが大きいほど、まさにその複雑な動きを要求することになります。EEA、スイス、英国では、未成年者や識別可能な一部の人物が写った画像をアップロードできません。入力側の制限です。結果の URL は一時的なものなので、完了ハンドラーの中で自分の側へ保存してください。
720p 出力 1 秒につき $0.09 を課金するので、8 秒のクリップは $0.72、上限の 10 秒は $0.90 です。定価 $0.15 に対して 40% 引き。解像度がこれに掛かるため、360p の 4 秒の下書きは $0.1188、4K の 10 秒のレンダリングは $1.80 になります。2026年8月28日 に確認しました。
同じ被写体、同じ照明の組み方、そして指定した時間内に物理的に片方からもう片方へ到達できるカメラの動きです。同じ撮影で数分違いに撮った静止画 2 枚なら、ほぼ確実にうまくいきます。条件の違う場面で撮ったフレームは、その差を画面上で解決することをモデルに強います。
エラーにはなりません。隙間を隠したクリップが返ってきます。隠し方は 4 通り。勝手なカット、ありえない幾何を通るモーフ、露出の跳ね、無から浮かび上がる人影です。どれも良いレンダリングと同じだけ請求されます。だからこそ $0.1188 の下書きが元を取るのです。
多くの場合はまず Veo 3.1 Fast です。開始と終了のフレームを、当社の $0.09 に対して 1 秒 $0.01 で扱うので、8 秒は $0.72 ではなく $0.08 になります。Omni がその差を取り返すのは 3 か所。10 秒という尺、4K 出力、そして 360p のテスト用の段です。
1 回の呼び出しにつき 3 秒から 10 秒です。duration の enum は 4、6、8、10 を持ち、いずれも文字列です。10 秒が厳格な上限で、それより長いものは複数の job からつなぎ合わせます。
はい。どちらもサーバー側から取得するため、job が終わるまで認証なしの request に応答しなければなりません。有効期限の短い署名付き URL、非公開バケット、localhost のアドレス、data URI は失敗します。
はい。全フレームに Google の知覚できない来歴シグナル SynthID が刻まれます。視聴者には見えず、同社のツールで検証できます。無効化できるプロバイダーはありません。ラベル付きの AI アセットを禁じる契約があるなら、クライアントと先に片付けてください。