Nano Banana API で一貫した画像を生成する
良い画像を 1 枚生成することは、ほぼ解決済みです。プロジェクトが死ぬのは、先の 19 枚と揃っている 20 枚目を生成するところです。
その隔たりは prompt の腕前ではありません。「一貫性」がひとつの語をまとった 3 つの別々の工学的問題であり、ひとつを直す技法が残り 2 つには何もしない、ということなのです。当社は Nano Banana を API で運用しており、これは最も多く取り違えられる依頼です。モデルにできないからではなく、参照画像がラベルなしで入り、それぞれが何のためのものかをモデルが推測するはめになるからです。

問題はひとつではなく 3 つ
prompt を書く前に、これらを分けてください。壊れ方も違えば、費用も違います。
キャラクターの一貫性。 多数のフレームにわたる同じ人物。同じ顔、体格、髪であり、4 枚目で座っていようと 19 枚目で歩いていようと、ひとりの個人として認識できること。これは同一性の問題です。モデルは、見たことのない構図をまたいで顔を運ばなければなりません。
商品の忠実性。 似たボトルではなく、そのボトル。キャップの正確な比率、ラベルの配置、緑の色味。忠実性は同一性より厳しい。顔には許容幅がありますが、クライアントのパッケージにはありません。
スタイルの一貫性。 連作がひとつの連作として読めること。同じカラーグレーディング、同じレンズの性格、同じ光の質、同じ粒状感。繰り返される必要のある物体はなく、繰り返されるのは扱い方です。
大半のブリーフはこのうち 2 つを同時に必要とし、それをひとつの指示として依頼してきます。「一貫させて」は API が実行できる依頼ではありません。「画像 1 が人物、画像 2 が商品、画像 3 はカラーグレーディングのみ」は実行できます。
本当の機能は役割の分離
Nano Banana Pro は参照画像を最大 14 枚受け取ります。Nano Banana 2 も、ほぼ半額で同じだけ受け取ります。差は枚数ではありません。Pro はその枠を役割で分けます。
| 役割 | 枠 | 保持するもの |
|---|---|---|
| キャラクター | 最大 5 | 人物や人型の同一性の参照 |
| 物体 | 最大 6 | 高忠実度の商品、小道具、パッケージ |
| スタイル | 最大 3 | カラーグレーディング、光の雰囲気、扱い方のみ |
合計 14 枚、ただし割り当て済み。参照画像を示唆から指示へ変えるのは、この割り当てです。
それがない場合に何が起きるかを考えてみてください。モデルに 14 枚の絵と 1 文を渡すと、モデルは文章から、どれが保つべき顔で、どれが正確に再現すべき商品で、どれが雰囲気のためだけにあるのかを推論します。しばしば誤って推論します。その兆候は、あなたのパッケージとしてではなく、パッケージ「風」に出てきた商品であり、ムードボードのグレーディングをまとった顔です。
役割分離があれば、あなたは依頼しているのではなく宣言しています。誰かに 5 枠、何かに 6 枠、どう見えるかに 3 枠。合成を 3 巡するのではなく、1 回の request で広告の合成が 1 枚できます。
Pro は 2026年8月26日 時点の当社価格で 1 request $0.075、定価 $0.15 に対しての金額です。もうひとつ知っておく価値のあること。Pro では 1K と 2K が同額です。ヒーローのアセットには 2K を取ってください。無料です。

prompt の中で参照画像にラベルを付ける
役割分離は構造の仕事をします。prompt は意味の仕事をし、ほとんど無礼に感じられるほど明示的でなければなりません。参照画像は順番に届くので、位置で名指しし、それぞれが何のためのものかを、そして何のためのものではないかを言ってください。多くの prompt が漏らすのは、その最後の部分です。
画像 1 と画像 2 は同一の女性。顔、髪の長さ、体格を正確に保つこと。
画像 3 は商品。ボトルの形状、キャップの比率、ラベルのアートワークを厳密に再現し、
スタイルを作り変えないこと。画像 4 はカラーグレーディングと光の雰囲気のみ。
そこから物体、ポーズ、構図を一切写さないこと。
画像 1〜2 の女性が画像 3 のボトルを持ち、窓際のカフェのテーブルに座っている構図。
斜め 45 度から、画像 4 のグレーディングに合わせた暖かい午後の光。
この prompt を機能させているものは 4 つあり、どれも 5 つ目の形容詞ではありません。
- すべての参照画像に説明が付いている。仕事を明示されないまま入る画像がひとつもない。
- スタイル参照に明示的な除外が付いている。それがないと、ムードボードは自分の家具をあなたの場面へ漏らします。
- 同一性の語が具体的になっている。「彼女に似ている」ではなく、顔、髪の長さ、体格。
- 商品の指示に「スタイルを作り変えないこと」がある。忠実性と着想を分けるのは、この一句です。
ここでは prompt の一般的な組み立ては扱いません。それはprompt ガイドです。この記事は、参照画像が何のためのものかをモデルに伝えることに特化しています。
request
一貫性の仕事は生成ではなく編集なので、image_urls を添えて edit-image の slug へ送ります。
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-pro/edit-image",
"input": {
"prompt": "画像 1 と画像 2 は同一の女性。顔、髪の長さ、体格を正確に保つこと。画像 3 は商品。ボトルの形状、キャップの比率、ラベルのアートワークを厳密に再現し、スタイルを作り変えないこと。画像 4 はカラーグレーディングと光の雰囲気のみ。そこから物体や構図を一切写さないこと。女性がボトルを持ち、窓際のカフェのテーブルに座っている構図。斜め 45 度から、暖かい午後の光。",
"image_urls": [
"https://cdn.example.com/refs/model-face-front.jpg",
"https://cdn.example.com/refs/model-face-three-quarter.jpg",
"https://cdn.example.com/refs/bottle-front.jpg",
"https://cdn.example.com/refs/grade-warm-afternoon.jpg"
],
"aspect_ratio": "4:5",
"resolution": "2K"
}
}'
submit は job ID を返します。polling するか webhookUrl を渡してください。Pro は構成の途中で中間的な「思考の画像」を生成するため、およそ 30 秒かかります。Google はそれらを返しませんし、当社もそのぶんを課金しません。Pro の既定は 9:16 なので、aspect_ratio は明示的に設定してください。パラメーターの完全な解説は Nano Banana Pro API チュートリアルにあります。
安いティアはどこに収まるか
必要としない仕事に Pro を売るより、当社はひとつ下のティアをご案内します。
Nano Banana 2 は同じ 14 枚の参照画像を $0.04 で受け取りますが、役割分離はありません。スタイルの一貫性であれば、それで十分です。そこではすべての参照画像が同じ仕事をしていて、曖昧さを解くべきものがないからです。パレットと光の雰囲気を共有するブログのヘッダー 6 枚に Pro は要りません。必要なのは良いスタイル参照 1 枚と、凍結された prompt テンプレートです。Nano Banana 2 は 4K にも届き、そこは Lite がまったく触れられない領域です。
Nano Banana 2 Lite は $0.0238 で、忠実性ではなく量のために作られています。質感を共有する画像が 400 枚必要で、そのどれもクライアントの顔やパッケージを載せていないときに手を伸ばしてください。1K のみで resolution パラメーターはなく、送ると無視されるのではなくエラーになります。
レガシーの Nano Banana は参照画像 3 枚が上限で、同じ画面でキャラクターと商品の両方をこなすには足りません。しかも Google が 2026年10月2日 に廃止します。そのモデルの全体像は別の記事です。一貫性のプロジェクトをここから始めないでください。
おおまかな規則。スタイルだけの仕事は Nano Banana 2 か Lite へ。特定の人間の顔や特定の実在する商品が無傷で残らなければならないものは Pro へ。$0.04 と $0.075 の差は、ラベルが違うという理由でクライアントが batch を差し戻した瞬間に、どうでもよくなります。
価格および製品条件は変更される場合があります。購入を判断する前に、各プロバイダーの最新価格をご確認ください。Google の Batch または Flex 価格は、スケジューリング・空き状況・処理条件が異なるため、標準的なオンデマンド API request と直接同等ではなく、この比較には含めていません。これは特定の条件に絞った比較であり、E2X があらゆる構成において世界最安であると主張するものではありません。
正典となる参照セットを、一度だけ用意する
ここで最も早く元を取る習慣は、API とは何の関係もありません。
参照セットを一度、意図をもって作り、以後ずっと使い回すことです。「手元にあった写真」ではなく、固定され、版が管理され、保存された、すべての request が引く集合です。キャラクターなら、中立的な光のもとで同じ顔を複数の角度から。正面、斜め 45 度、横顔、加えて体格のための全身 1 枚。商品なら、正面、背面、ラベルの寄り 1 枚。スタイルなら、グレーディングを担い、気を散らすもののない画像を 1〜2 枚。
そして凍結してください。URL は恒久的な場所に保存し — 一時的なリンクではなく自分のバケットに — プロジェクトの生涯を通じて同じ配列をすべての request で渡してください。
これが prompt の調整より効くのは、ずれが累積するからです。4 枚目から 5 枚目を、5 枚目から 6 枚目を生成すれば、小さな誤差が積み上がり、20 枚目には別人になります。すべてのフレームを同じ正典のセットへ錨で留めれば、各生成が原本からずれるのは 1 歩ぶんであって、20 歩ぶんではありません。鎖ではなく扇です。
関連する習慣をひとつ。セットに自分で生成した画像を含めるなら、元ファイルを取っておいてください。どの画像 API でも配信 URL は失効しますので、自分のアセットはダウンロードして保存を。生成を自動で回す方法にループの全体があります。
ヒーローを 1 枚作り、そこからバリエーションを導く
1 ドルあたり最も使える出力を生むワークフローは、「20 枚生成する」ではありません。「1 枚の画像を 20 回にわたって生成する」です。
Pro でヒーローカットを 1 枚作り、それを仕上げてください。構図、ライティング、顔、商品。何回か試行を燃やして構いません。$0.075 なら探索は安い。
それから生成をやめ、編集を始めてください。承認されたヒーローを正典のセットと並べて参照画像として戻し、欲しい変更を頼みます。別の角度、別の背景、別の切り取り、カメラ目線ではなく視線を外した表情。どのバリエーションも、新しいサイコロの目ではなく、すでに審査を通ったものへ錨で留められます。
編集が再生成に勝つ理由は、見落とされやすい。再生成はすべてを決め直します。満足していたパラメーターまで、また賭けの対象に戻ります。編集は、あなたが言及しなかったものを保持します。顔を仕上げるのに午後をひとつ費やしたのなら、それを 20 回決め直すことこそ最も避けたいはずです。
実務上の注記を 2 つ。ヒーローを戻すときは参照画像の枚数に気をつけてください。ヒーロー 1 枚に、5 枚のキャラクターセットに、商品 1 枚で、14 枚のうちすでに 7 枚です。そして承認されたヒーローの prompt を画像の隣に保存してください。バリエーションはたいていその prompt の節を 2 つ差し替えたもので、記憶から書き直せば、いま金を払って取り除いたばかりのずれをまた持ち込むことになります。

どんな参照セットでも直せない部分
Google は自社モデルが生み出すすべての画像に SynthID を刻みます。目には見えず、ファイルの内側を旅し、そして誰も公開していない設定です。設定ではまったくないからです。これは他の記事以上にここで効きます。一貫性のプロジェクトはクライアントのプロジェクトであり、クライアントの契約には AI 生成アセットに関する条項があるかもしれません。承認済みのフレームが 20 枚デッキに並んだ後ではなく、参照セットを撮る前にその条項を決着させてください。
一貫性の仕事はほぼ常に編集ですので、まず眺めるべき棚は image-to-image のモデルです。ブリーフが動いたときのために、カタログには動画側もあります。
よくある質問
複数の AI 生成画像で同じキャラクターを保つにはどうすればよいですか?
正典となる参照セットを作ってください。中立的な光のもとで同じ顔を複数の角度から、加えて体格のための全身 1 枚。それを恒久的に保存し、すべての request へ同じ画像を渡します。Nano Banana Pro のキャラクター枠を使い、そこは同一性の画像を最大 5 枚保持します。そして prompt でどの画像がその人物かを述べてください。各フレームは直前のフレームではなく元のセットへ錨で留めてください。さもないと誤差が積み上がり、20 枚目には別の顔になります。
Nano Banana API は参照画像を何枚受け取りますか?
Nano Banana Pro は 14 枚を役割で分けて受け取ります。キャラクター画像を最大 5 枚、物体画像を最大 6 枚、スタイル参照を最大 3 枚。Nano Banana 2 も 14 枚を受け取りますが、役割分離はありません。Nano Banana 2 Lite は参照画像を多用する仕事ではなく量のために作られており、レガシーの Nano Banana は 3 枚が上限です。
キャラクターの一貫性と商品の忠実性の違いは何ですか?
キャラクターの一貫性とは、多数の画像を通してひとりの人物が認識可能であり続けることです。同じ顔、髪、体格で、小さなばらつきは許容されます。商品の忠実性とは、その物体が正確に再現されることです。厳密なラベルのアートワーク、キャップの比率、色、そしてスタイルの作り変えなし。求められる厳しさが違うため、Pro はそれらを別々の参照枠で扱いますし、prompt はどの画像がどちらかを述べるべきです。
一貫した画像には Nano Banana Pro と Nano Banana 2 のどちらを使うべきですか?
必要がスタイル上のもの — パレットとライティングと扱い方を共有する画像で、保つべき特定の顔も商品もない — であれば $0.04 の Nano Banana 2 を。特定の顔や実在の商品が無傷で残らなければならないときは $0.075 の Nano Banana Pro を。どちらがどれかをモデルに伝えるのが、役割の分かれた参照枠だからです。差し戻された batch に比べれば、価格差は小さなものです。
Nano Banana の prompt で参照画像にラベルを付けるにはどうしますか?
image_urls に渡した順の位置で参照し、それぞれが何のためのものかを述べてください。「画像 1 と 2 は同一の女性、顔と体格を保つこと。画像 3 は商品、正確に再現すること。画像 4 はカラーグレーディングのみ、そこから物体や構図を一切写さないこと。」除外は指示と同じだけ重要です。条件の付かないスタイル参照は、自分の物体と構図をあなたの場面へ漏らすからです。
既存の画像を編集するのと、新しく生成するのでは、どちらが良いですか?
承認できる画像が手に入った後は、編集です。再生成はすべての要素を決め直します。満足していたものまで含めて。編集は、言及しなかったものすべてを保持します。効率の良いワークフローは、丁寧に作ったヒーロー 1 枚と、正典の参照画像を添えた edit-image endpoint 経由でそこから導いたバリエーションです。
生成した画像が元のキャラクターからずれていくのはなぜですか?
ほぼ必ず、新しい画像が固定の参照セットではなく直前の画像から生成されているからです。それが誤差を累積させます。3 枚目のわずかに丸い顎が 4 枚目の基準になり、20 枚目には別人になります。すべての request を同じ保存済みの正典画像へ錨で留め、それぞれの出力が原本から 20 歩ではなく 1 歩の距離にあるようにしてください。