Loading...
Loading...
より高速で低コストな Veo 3.1 のプラン。テキスト・画像・参照画像からの動画生成と、開始・終了フレーム間のトランジションに対応します。
No output yet
Run the model to see generated results.
import requests
result = requests.post(
'https://api.e2x.ai/v1/jobs/submit',
headers={
'Authorization': f'Bearer {API_KEY}',
'Content-Type': 'application/json'
},
json={
'model': 'google/veo-3.1-fast/reference-to-video',
'input': {}
}
)import time
job_id = result.json()['jobId']
while True:
response = requests.get(
f'https://api.e2x.ai/v1/jobs/{'{job_id}'}',
headers={'Authorization': f'Bearer {'{API_KEY}'}'}
)
data = response.json()['data']
if data['status'] == 'completed':
print('Done!', data['outputs'][0]['url'])
break
elif data['status'] == 'failed':
raise Exception(f"Job failed: {'{'}data['error']['message']{'}'}")
time.sleep(2)再生時間と解像度ごとの生成あたりの推定コストです。実行した分だけお支払いいただきます。
同じ顔、同じジャケット、同じ店構えを、クリップ一式にわたって保たなければならないときに使う endpoint がこれです。当社では Google の Veo 3.1 Fast を google/veo-3.1-fast/reference-to-video として運用しており、最大 3 枚の参照画像 からなる image_urls 配列を受け取り、秒単位 で課金します。1 秒あたり $0.01、音声オンで ×1.5。ここでのクリップはすべて 8 秒なので、音声付きの 720p なら 1 クリップ $0.12 です。
画像は 1 枚で足り、しかも短いクリップのほうが好都合でしょうか。Veo 3.1 Fast image-to-video をお使いください。開始フレーム 1 枚をアニメーション化し、4 秒や 6 秒も選べます。アップロードするものが何もないのでしょうか。Veo 3.1 Fast text-to-video は prompt だけで動きます。
このモデルでは秒単位の計測が共通です。Google も、fal.ai も、Replicate も、そして当社もそうしています。reference-to-video は 8 秒に固定されているため、意味を持つ構成は下の表だけです。数字は 2026年8月26日 に確認したもので、720p・音声付きです。
| API プロバイダー | 課金方式 | 料率(720p、音声オン) | 8 秒クリップ | 当社との比較 |
|---|---|---|---|---|
| E2X(現行) | 秒単位 | $0.01/秒 ×1.5 音声 | $0.12 | — |
| Google Gemini API | 秒単位 | $0.10/秒 | $0.80 | 当社の 6.7 倍 |
| fal.ai | 秒単位 | $0.15/秒 | $1.20 | 当社の 10 倍 |
| Replicate | 秒単位 | $0.15/秒 | $1.20 | 当社の 10 倍 |
| E2X 定価(割引前) | 秒単位 | $0.10/秒 ×1.5 | $1.20 | 当社の割引前料率 |
最下行を 2 つのマーケットプレイスに並べて読んでください。当社の定価は 8 秒クリップで $1.20 — fal.ai と Replicate が課金しているのとまさに同じ額です。 現在お支払いいただくのはその 10 分の 1 で、それでも Google 自身の API より 6.7 倍下に着地します。この差は同一モデルに対する現に有効な割引であって、機能を削ったティアではありません。
1080p は意図的に値付けしてください。fal.ai と Replicate は 720p → 1080p の一段を追加費用なしで含めていますが、Google は秒あたりの料率を上げます。当社側でも解像度は乗数です。最新の数字はこのモデルの llms.txt にあります。
価格および製品条件は変更される場合があります。購入を判断する前に、各プロバイダーの最新価格をご確認ください。Google の Batch または Flex 価格は、スケジューリング・空き状況・処理条件が異なるため、標準的なオンデマンド API request と直接同等ではなく、この比較には含めていません。これは特定の条件に絞った比較であり、E2X があらゆる構成において世界最安であると主張するものではありません。
Google の制限は明確です。「コンテンツを導くために最大 3 枚の参照画像を使用してください」とあり、同社の schema では「スタイルおよびコンテンツの参照として使用される最大 3 枚の画像」と説明されています。3 枚です。4 枚目はモデルが受け付ける範囲の外です。
この予算は選択を迫りますし、そこがこの endpoint の面白いところです。3 つの枠を、絶対にドリフトしてはならないものに費やすわけです。キャンペーン撮影ではたいてい、出演者のクリーンなポートレート 1 枚、衣装が分かる全身のショット 1 枚、ロケーションの写真 1 枚となります。すると、セット内のすべてのクリップが同じ人物、同じ服、同じ場所で返ってきます。変えるのは prompt だけです。
商品の仕事では分け方が変わります。対象物のアングル 2 枚と、ブランドのカラー処理が分かるフレーム 1 枚。原理は同じです。参照画像が同一性を担い、prompt が動作を担います。
これは image-to-video の仕事ではありません。あちらでは、あなたの画像が 1 フレーム目 そのもの です。こちらでは参照画像はガイダンスであり、冒頭のフレームはそこから生成されます。承認済みの特定の静止画から始まるクリップが必要でしょうか。それはもう一方の endpoint です。
Google の規則にはこうあります。尺は「extension、参照画像、あるいは 1080p および 4k 解像度を使用する場合は '8' でなければならない」。参照画像はそのリストに入っているため、他の 2 つの endpoint が提供する 4 秒と 6 秒の選択肢は、ここには存在しません。当社の schema には引き続き duration の enum が表示されますが、この capability で有効な値は "8" だけです。
それを前提に予算を組んでください。6 本のクリップからなるシーケンスは 48 秒の出力です。当社では $0.72、fal.ai や Replicate では $7.20 になります。
必須フィールドは prompt と image_urls です。
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/veo-3.1-fast/reference-to-video",
"input": {
"prompt": "画像 1 の女性が、画像 2 のコートを着て、画像 3 のロビーに入り、雨を払い落とす。彼女は顔を上げて言う:「待っていてくれたのね。」暖かいタングステンの光、大理石の反響。",
"image_urls": [
"https://example.com/talent-portrait.jpg",
"https://example.com/wardrobe-coat.jpg",
"https://example.com/lobby-set.jpg"
],
"aspect_ratio": "16:9",
"resolution": "720p",
"duration": "8",
"has_sound": "true"
}
}'
送信すると job ID が返ります。polling するか、webhook を登録してください。
const headers = {
Authorization: `Bearer ${process.env.E2X_API_KEY}`,
"Content-Type": "application/json",
};
const submitted = await fetch("https://api.e2x.ai/v1/jobs/submit", {
method: "POST",
headers,
body: JSON.stringify({
model: "google/veo-3.1-fast/reference-to-video",
input: {
prompt:
"画像 1 のマスコットが画像 2 のカウンターに飛び乗り、カップを倒して固まる。きゅっきゅっという足音、陶器のカチンという音、そして静寂。",
image_urls: [
"https://example.com/mascot-turnaround.png",
"https://example.com/kitchen-set.jpg",
],
aspect_ratio: "9:16",
resolution: "720p",
duration: "8",
has_sound: "true",
seed: 60411,
},
}),
}).then((r) => r.json());
const jobId = submitted.data.jobId;
while (true) {
const job = await fetch(`https://api.e2x.ai/v1/jobs/${jobId}`, { headers })
.then((r) => r.json());
if (job.data.status === "completed") {
console.log(job.data.outputs[0].url);
break;
}
if (job.data.status === "failed") {
throw new Error(job.data.error?.message || "Generation failed");
}
await new Promise((r) => setTimeout(r, 5000));
}
ステータスは pending → processing → completed と進むか、failed / cancelled で終わります。1 job あたり約 4 分を見込んでください。Google の公式な範囲は下限 11 秒、ピーク時で 6 分です。生成同士に韻を踏ませたい場合は、セット全体で同じ seed を使い回してください。
重みは同一、秒単価も同一です。入力の形が endpoint を選びます。
| Endpoint | 尺の選択肢 | 8 秒クリップ、720p + 音声 | こんなときに |
|---|---|---|---|
| Veo 3.1 Fast reference-to-video | 8 秒のみ | $0.12 | 最大 3 枚の画像で、顔・衣装・場所を複数クリップにわたり固定 |
| Veo 3.1 Fast image-to-video | 4 / 6 / 8 秒 | $0.12 | 静止画 1 枚を文字どおり最初のフレームにしたい |
| Veo 3.1 Fast text-to-video | 4 / 6 / 8 秒 | $0.12 | prompt のみ、アップロードするものがない |
| Omni Flash reference-to-video | — | $0.80(デフォルト構成) | 別のファミリー。Veo のルックが求めるものでないとき |
当社としては、支出は少ないほうがよいと考えています。画像 1 枚で用が足りるなら、image-to-video は同じ価格で、しかも 4 秒と 6 秒のクリップを解放します。4 秒版は $0.06 で、ここで支払う固定 8 秒の半額です。複数クリップにわたる一貫性が実際の要件であるときに、この endpoint へ来てください。それこそが、他の endpoint にできない唯一のことだからです。カテゴリの残りは reference-to-video の下にあり、それ以外はすべてモデルカタログにあります。
モデルが受け取るのは、ラベルのない配列です。2 番目の枠が 2 人目のキャラクターではなく衣装だったことを示すものは、payload の中に何もありません。だから prompt の中で述べてください。
番号付けは有効です。「画像 1 の女性」「画像 2 のコート」「画像 3 のロビー」。数語で、混線した出力を生む曖昧さの大半が消えます。
さらに習慣が 3 つ。
参照画像には仕事をひとつだけ与える。 人物と商品と部屋が同時に写り込んだ賑やかな写真は、あなたが何を重視していたのかをモデルに推測させます。きつめにトリミングしてください。
同一性を言葉でも繰り返す。 「同じショートのシルバーヘア、同じ丸眼鏡」と書けば、参照画像が示すものを補強できます。安上がりな保険です。
台詞を書き出す。 Google は音声をネイティブに生成し、同社の API にオフのスイッチはありません。つまりどちらにせよ音は発生します — 発話、効果音、環境音。台詞を引用すれば、正しいフレームに乗ります。
Google は英語を完全にサポートしており、このモデルについて他の言語は評価していません。したがって指示文は英語で書いてください。引用する台詞は、シーンに必要な言語で構いません。
ダウンロードまで 2 日。 生成された動画に対する Google の保持期間は 2 日間です — 「生成から 2 日以内に動画をダウンロードする必要があります」。1 週間かけて 20 本のクリップを作るキャンペーンであれば、これは脚注ではなくアーキテクチャ上の判断事項です。job が完了した瞬間に outputs[0].url をご自身のストレージへコピーしてください。
すべての出力に SynthID。 Google の知覚できない watermark はすべての Veo 動画に適用され、同社のプラットフォームで検証可能です。これを無効化できるプロバイダーはありません。
人物生成には地域制限があります。 EU、英国、スイス、MENA では、personGeneration は allow_adult に制限されます。
参照画像セットをバージョン管理してください。 一貫性は、毎回バイト単位で同一の参照画像を送ることに依存します。batch の途中で再書き出しされたポートレートに差し替われば、それは映ります。
出力 1 秒あたり $0.01 を課金し、音声オンで ×1.5 になります。この endpoint は 8 秒に固定されているため、音声付きの 720p クリップは $0.12 です。より高い解像度にはそれぞれの乗数が付きます。1080p の batch を計画する前に、最新のモデルページをご確認ください。
最大 3 枚です。Google のドキュメントは、コンテンツを導くために最大 3 枚の参照画像を使用してよいと述べており、同社の schema ではそれらをスタイルおよびコンテンツの参照として説明しています。それより少なくても構いませんし、2 枚はよくある構成です。
参照画像が関わる場合、Google は 8 秒を必須としているためです。1080p や 4k に適用されるのと同じ規則です。4 秒や 6 秒が必要でしょうか。代わりに image-to-video か text-to-video の endpoint をお使いください。同じモデル、同じ秒単価です。
image-to-video は画像 1 枚を文字どおりの冒頭フレームにします。reference-to-video は最大 3 枚の画像を、同一性・衣装・スタイル・ロケーションのガイダンスとして受け取り、それらと整合する冒頭フレームを生成します。特定の 1 フレーム目より、複数クリップにわたる一貫性のほうが重要なときに参照画像をお使いください。
はい。Google は台詞、効果音、環境音をネイティブに生成し、同社自身の API にそれを無効化する手段はありません。当社は has_sound をデフォルト true で公開しており、その設定が ×1.5 の価格乗数を適用します。
すべての Veo 出力に、AI 生成コンテンツ向けの Google の知覚できないマーカーである SynthID が入り、同社のプラットフォームで検証できます。当社を含め、どのプロバイダーもこれを切ることはできません。
当社では約 4 分を見込んでいます。Google は最短 11 秒、ピーク時の最長 6 分を公表しているので、クリップ一式を作る場合は polling ループを開き続けるのではなく webhookUrl をお使いください。