Gemini Omni 1.1 Flash が効かせるカメラの言葉と、無視する言葉
Google の映像 prompt に関する資料を長く読んでいると、数段落を隔てて置かれた 2 つの文に行き当たります。ひとつはカメラの動きの一覧 — dolly、truck、pedestal、crane、whip pan、arc — を、まるでメニューから注文できるかのように公開しています。もうひとつはこう警告します。「一部の高度なカメラアングルは公式にはサポートされていません。結果と信頼性は、prompt 全体と個々のユースケースによって変わることがあります」
どちらも本当のことで、その 2 つの隙間から、期待外れのクリップのほとんどが生まれます。名指しされた動きは、モデルがおそらく汲んでくれる要求であって、必ず実行される parameter ではありません。gemini-omni-1.1-flash にカメラの姿勢を指定するフィールドはありません。リグもレンズもなく、あるのはあなたの他の言葉と競い合う言葉だけです。この記事は、それらの言葉のうちどれが場所代に見合うのかを、Google がドキュメント化しているもの、Runway が報告しているもの、そしてスキーマが露出しているものから組み立てたものです。

そのまま削り落とせる言葉
引き算から始めましょう。費用はかからず、prompt の場所が空きます。Runway のカメラ prompt のリファレンスは、AI 映像の prompt で最もよく使われる 2 語について率直です。「『Cinematic』と『4k』は、何の仕事もしていないので外します。どちらもカメラのふるまいを変えませんし、この 2 語が占める prompt の場所は、動きに使ったほうが良いのです」
これは Google ではなく彼らのツールについての主張ですが、理屈はそのまま通ります。「Cinematic」は印象を describe しているのであって、視点ではありません。どこに立つのか、どれだけ離れるのか、何をシャープに保つのか、どちらへ動くのか、そのどれも言っていないのです。後ろに積まれた荷物 — masterpiece、award-winning、8k、ultra detailed — も同じで、これらは画像モデルの prompt 文化から受け継いだものです。あの文化では、まったく異なる訓練分布に対して、これらのトークンが品質の呪文として働いていました。
肯定形も同じくらい単純です。「dynamic cinematic camera」と頼む代わりに、具体的な動きを名指ししてください。これらのモデルは 「カメラの指示を、装飾ではなく空間的な演出として」 扱うからです。そこには「cinematic」が害になるとは書かれていません。書かれているのは、その語がもっと良いものを押しのけるということであり、数十語の prompt では、押しのけることこそが勝負のすべてです。
Google の一覧と、どこまで信じるか
ドキュメント化された語彙は、prompt のスレッドに出回っているどんな用語よりも当てになります。
| 分類 | Google が名指ししているもの |
|---|---|
| 動き | static · pan · tilt · dolly (in, out) · truck (left, right) · pedestal (up, down) · zoom · crane · aerial または drone · handheld · whip pan · arc |
| アングルとスケール | eye-level · low · high · bird's-eye · Dutch · point-of-view · over-the-shoulder · extreme close-up · close-up · medium · full · wide または establishing |
| 光学 | wide-angle · telephoto · deep および shallow depth of field · lens flare · rack focus · fisheye · dolly zoom |
注意を払う価値のある点が 2 つあります。Google は zoom と dolly を意図的に分けています。モデルがこの 2 つをぼかしてしまうからです。zoom は焦点距離の変更であり、「これは dolly とは異なります。カメラ自体は動かないからです」。被写体に対して背景を膨らませたいのなら、dolly を頼んでください。ジオメトリはそのままに画面を締めたいのなら、zoom を頼んでください。「zoom in slowly as the camera pushes forward」と書けば、あなたは両方を注文したことになります。dolly zoom であり、それはまず意図されたものではありません。
第二に、広く Google のものとされている用語が、Google のページには載っていません。oner、push in、natural smartphone zoom は Google のドキュメントを引用しているガイドに出てきますが、当社はそれらをそこに見つけられませんでした。ドキュメント化されていないことは禁止を意味しませんが、あなたが自分ででっち上げた言い回し以上の権威はありません。ドキュメント化された構文の全体は当社の prompt ガイドにあります。
1 クリップにつき動きはひとつ
Runway のリファレンスで最も鋭い発見は、どの動詞が効くかではなく、いくつ書くかです。
「動詞を積み重ねる (不安定)。『Orbit the subject and crane up and push in.』段階に分けて記述する (安定)。『The camera arcs around the seated figure, then rises above the table to reveal the empty chairs surrounding her.』」
それに続く助言は、動詞を積み上げるのではなく、各段階で画面を満たすものを記述することであり、それでも複合的な動きが失敗するなら 「ひとつの動きまで戻し、2 拍目はそれ自体を別のクリップとして生成する」 ことです。
Omni はここに機械的な事情を上乗せします。Google 自身のドキュメントによれば、このモデルはそうしないように言われない限り、既定でいくつかのショットを作ります。同時に 3 つの動きを頼めば、あなたはモデルに逃げ道を渡したことになります。カットです。2 秒 orbit、カット、2 秒 crane、カット、残りは push in。すべての指示が汲まれ、あなたが望んだものは何も残りません。1 つの節による対処 — 「In a single continuous shot」 または 「No scene cuts」 — が、あなたの曖昧さをモデルが編集で解決してしまうのを止めます。
ひとつのシーンを 2 回生成し、カメラの節だけを変えたものです。
720p で片側 4 秒、1 本あたり 36 セントです。被写体、部屋、光、そして音の一文は同一で、違うのは冒頭の文だけ。固定されたフレームと、ゆっくりした dolly in の対比です。カメラの節は prompt のなかで最も効き目の大きい文であり、そして最も多くの人が最後に書く文です。
焦点距離は光学ではなく演出
レンズは存在しません。これははっきり書いておく価値があります。頭のなかのモデルが大事だからです。「85mm」と書いても、モデルは画角を計算しているわけではありません。訓練データのなかでそのラベルの付いたものすべてに手を伸ばしているのであり、写真は百万枚単位でそのラベルを背負っています。返ってくるのは、その数字に貼りついた見え方です。圧縮された背景、柔らかい場から切り抜かれた被写体、平坦になった距離感。短いレンズなら、引き伸ばされたパース、画面のなかのより広い空間、曲がる縁です。
だからこそ焦点距離は、使える言葉のなかで最も効率の良いもののひとつになります。フレーミングと感触を、4 文字で同時に動かすのです。出回っている指針は一貫しています。広い文脈にはおよそ 24mm、ドキュメンタリー的な感触には 35mm、中立的な語りには 50mm、圧縮された親密な仕事には 85mm。これらを、文字どおりの光学の約束ではなく、視覚的な演出として読んでください。

そこから 2 つの習慣が出てきます。数字を形容詞のままにせず、仕事を与えてください。「35mm」だけならただのトークンですが、「35mm, the workshop visible behind her throughout」は、その広いレンズが何のためなのかを言っており、その節は数字が無視されても生き残ります。Google がドキュメント化している光学の用語 — shallow depth of field、deep focus、rack focus、telephoto — も、平易な言葉で同じ仕事をします。そして焦点距離を、それと矛盾する指示と組み合わせてはいけません。「85mm wide establishing shot of the valley」は、圧縮と広がりを同時に要求しています。
フレーミングは指定できるもののなかで最も当てになる
カメラの言葉を、どれだけ確実に着地するかで並べ替えると、ひとつのパターンが現れます。静的な性質は時間的な性質に勝つ、というものです。
ショットスケール — extreme close-up から wide establishing まで — は、1 枚のフレームの性質です。アングルもそうですし、two-shot や over-the-shoulder のジオメトリもそうです。モデルは最初にレンダリングするフレームでそのどれもを満たし、あとは保つことができます。
dolly in は、1 フレーム目に対する 96 フレーム目についての主張であり、そのあいだのすべてのフレームを生き延びなければなりません。しかもカメラがどこにあるかを明示的に表現しない処理のなかでです。研究文献が埋めようとしているのはまさにこの隙間で、映像 diffusion におけるカメラ制御の参照研究である CameraCtrl は、既存のモデルは 「より深い物語のニュアンスを表現する映画的言語としてのカメラ姿勢の制御を欠いている」 と述べるところから始まり、テキストだけでは足りなかったために姿勢を条件づけるモジュールを追加しています。当社の知るかぎり、そのチャンネルを露出している商用の映像 API はひとつもありません。
そこから、覚えておく価値のある階層が出てきます。フレーミングとアングル。自由に指定してよく、従うことを期待できます。名指しした動きひとつ。たいていの場合は期待できます。動きが 2 つ、あるいは速度と停止位置まで指定した動き。何テイクか覚悟するか、拍を分けてください。

書き換える前と後
カメラの prompt がたいてい書かれるやり方で書いた prompt です。ここにある言葉はどれも、当社が使ったことのあるものです。
Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.
実行に移せるものを数えてください。ひとつのテイクではすべてを保てない、3 つの積み重なった動詞。ショットスケールも、焦点距離も、ショット数の指示もありません。つまりドキュメント化された複数ショットの既定が自由に発火でき、しかも競合する動きが 3 つ卓上にあるのですから、カットが最も抵抗の少ない道になります。
同じショットを、モデルが実行に移せることだけを言うように書き直したものです。
In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.
変更は 4 つ、重みの順に並べます。ショット数の節が最初に来るので、曖昧さを編集で答えることができなくなります。3 つの動きがひとつに畳まれ、始まりと終わりのフレーミングが名指しされています。Runway が勧める段階的な記述を、ひと続きの移動として書いたものです。焦点距離は、その帰結を伴って登場します。そして音は自分の文を与えられており、これは音声を別立てで記述せよという Google の指針に沿ったもので、否定は末尾の短い節になっています。書き直したほうが平板で、読んでいて退屈です。それはたいてい、prompt が気分を describe するのをやめてショットを describe し始めた印です。
prompt のなかでカメラはどこに置くか
順序については答えがないだろうと予想していました。答えはあります。Omni のページではなく、Google の Veo 向けの指針にです。そこにある公式は cinematography、subject、action、context、style and ambiance という並びで、ショットに誰がいるかを名指しする前にカメラが来ます。その要素が 「トーンと感情を伝えるための最も強力な道具」 だからです。Omni 自身のドキュメントは要素を別の順に並べ、カメラは一覧の中ほどに置いています。つまり Google は 2 つの順序を公開しており、当社は統制された比較を行っていません。
カメラで始めることは、Omni のもうひとつのドキュメント化されたふるまいと接触しても生き残ります。ショット数の指示は、モデルが物語を組み立て始める前に着地しなければならないからです。それはまた prompt を監査可能にもします。最初の文が視点を describe していないなら、あなたはショットを演出していないのです。
スキーマが与えてくれないもの
構造的な限界が 2 つあり、どちらも言い回しを磨いても直りません。
ひとつめは再現性です。Google の API ドキュメントは 「システム指示、temperature、top_p、停止シーケンス、そしてネガティブ prompt には対応していません」 と述べ、代わりに否定を prompt のなかに書くよう指示しています。締め上げるサンプラーはありません。残っているのは seed で、これはこのモデルについて当社のスキーマにある任意の整数であり、制御面はそれで全部です。
これは prompt のなかの何よりも、カメラの仕事にとって重要です。少し違って返ってきた照明は、同じショットの別のグレードです。しかし pan として返ってきた dolly は、別のショットです。ですからテイクをまたいで動きを保つとは、seed を固定して他を何も変えないことを意味し、そして 1 語でも編集すれば、それは新しくサンプリングし直すことを意味します。うまくいった seed は資産として扱い、prompt の隣に書き留めておいてください。
ふたつめの限界は、カメラの速度に語彙がないことです。「Slow dolly in」が制御面です。単位もなく、時間の長さもなく、push を 5 秒目までに終えてそこで保て、と言う手段もありません。タイムコードの構文が少しだけ助けになり — Omni は角かっこの範囲を受け付けます — prompt でカメラに 4 秒の位置で落ち着くよう頼むことはできます。実際にそうするかどうかは別の話です。
シャッター角度とモーションブラーも同じ欄に座っています。どちらも Google のドキュメント化された語彙には現れません。フレームレートは惜しいところで、24 fps は Omni のページにタイミングの実例のなかでだけ出てきます。「12 frames at 24fps」 であって、prompt のレバーとしてではありません。タイムコードについて考えるには有用ですが、書き込んで舵を取れると期待するものではありません。
カメラの実験にかかる費用 — 効いてくるティアで
カメラの仕事は、prompt のなかで一発では決められない部分です。制約するための parameter がないまま、時間をまたいだふるまいを頼んでいるのですから、生成し、見て、直し、また生成することになります。効いてくる数字は、1 テイクの値段です。
4K では 8 秒のテイクが当社で $1.44、Google を直接呼ぶと $2.43 です。動きをものにするのに 6 テイク — 具体的な移動を含むものなら控えめな見積もりです — なら $8.64 対 $14.60 です。この差は 41% で、4 つの解像度のなかで大差をつけて最大であり、4K の行だけが議論に値する理由でもあります。他所を見ると、4K の 1 秒は fal で $0.30、Runware で $0.32、WaveSpeed で $0.39、当社では $0.18 です。Replicate はこのモデルを 1 秒あたりの料金なしで掲載しています。
とはいえ支出を減らす方法は、より安い 4K の 1 秒ではなく、カメラの動きを 4K でテストするのをやめることです。360p のティアで 8 秒の下書きを 10 本作れば $2.38 で、カメラが頼んだとおりに動いたかどうかを見るには 360p で十分です。動きはどの解像度でも読み取れ、だからこそテストが安く済みます。下書き 10 本に 4K の本番 1 本を足して $3.82、対して 4K で 10 テイク回せば $14.40 です。
上ふたつの段はネイティブのレンダリングではなくアップスケールで、Google のモデルリファレンスはそれらを 「1080p output (upscaled)」、「4K output (upscaled)」 と表記しています。ですから 4K のテイクが買うのは納品用の寸法であって、あなたが検分しているショットの追加のディテールではありません。40 秒のシーンについての記事で、それでも払う価値がどこにあるかを扱っています。
価格と製品の条件は変わることがあります。購入の判断をする前に、各プロバイダーの現在の価格を確認してください。
短い版
まずショット数を言い、次に動きをひとつ、そしてそれが始まり終わるフレーミングを言ってください。焦点距離には、そこにある理由を与えてください。音声は自分の文に置いてください。映像が人にどう感じさせるべきかを describe する言葉はすべて削り、その場所をカメラがどこにあるかに使ってください。
1.1 で何が出荷されたかはローンチの記事にあり、プロバイダーの価格監査は同一の重みがページによって違う値段になる理由を説明しています。parameter と現在の料金は text-to-video のモデルページにあります。何にも依存しない単発の動きであれば、まず 1 秒 1 セントの Veo 3.1 Fast で見積もってください。カメラの語彙は Google が両方のモデル向けに公開しているガイドから来ているので、練習はそのまま移せます。
よくある質問
Gemini Omni 1.1 Flash はどのカメラの動きの用語を理解しますか?
Google は動きの語彙 — static、pan と tilt、dolly・truck・pedestal の対、zoom、crane、drone または aerial、handheld、whip pan、arc — に加えて、アングル、ショットスケール、光学の用語を名指ししています。同時に、一部の高度なカメラアングルは公式にはサポートされておらず、信頼性は prompt によって変わるとも警告しています。ですから名指しされた動きは、parameter ではなく要求として読んでください。
映像の prompt に「cinematic」と書くと何か効果はありますか?
それだけでは、たいしてありません。Runway のカメラ prompt のリファレンスは「cinematic」と「4k」の両方を削ぎ落としており、その根拠は、どちらもカメラのふるまいを変えず、その場所は動きを名指しするのに使ったほうが良いというものです。この語は視点ではなく印象を describe しているので、モデルに実行できるものを何も与えません。「masterpiece」や「8k」、その他の画像 prompt 由来の荷物も同じです。
35mm や 85mm といった焦点距離の数字は出力を変えますか?
見え方は動きます。訓練データのなかの写真がメタデータに焦点距離を持っており、その数字がスタイルの手がかりとして読まれるからです。長いレンズは背景を圧縮して被写体を分離する傾向があり、短いレンズはパースを引き伸ばして部屋をより多く取り込みます。文字どおりの光学ではなく視覚的な演出として扱い、帰結と結びつけてください。
Omni の prompt でカメラの指示はどこに置くべきですか?
Google の Veo の prompt ガイドは cinematography を先頭に置き、subject、action、context、style より前に来させたうえで、それをトーンを伝えるための最も強力な要素と呼んでいます。Omni 自身のドキュメントはカメラの用語を一覧の中ほどに置いています。どちらも Google です。カメラで始めることには実務上の利点がひとつあります。ショット数の指示はカメラについての決定であり、モデルが物語を組み立て始める前に登録される必要がある、ということです。
Gemini Omni 1.1 Flash で同じカメラの動きを 2 回得られますか?
seed を使い回す場合だけです。Google のドキュメントは temperature、top_p、システム指示、停止シーケンス、ネガティブ prompt には対応していないと述べており、残るのは seed — 当社のスキーマにある任意の整数 — だけが再現性の制御になります。prompt の語をひとつ変えれば新しくサンプリングし直すことになるので、気に入った動きを生んだ seed は、それがうまくいったその瞬間に記録してください。
ひとつの動きを頼んだのに、ショットの途中でカットが入るのはなぜですか?
複数のショットが既定だからです。Google は、そうしないように言われない限り Omni はいくつかのショットを試み、あなたの prompt から物語を組み立てるとドキュメント化しています。ですから 2 つ 3 つの動きを積んだ prompt は、それぞれを別のカットで満たす口実をモデルに与えます。ドキュメント化された対処は、途切れないひとつのシーンを求める節であり、名指しした動きをひとつまで戻すことで動機そのものが消えます。
Gemini Omni の prompt でシャッター速度やフレームレートを指定できますか?
Google のドキュメント化されたカメラの語彙に、シャッター角度やモーションブラーを扱うものはありません。それらの用語が汲まれるとは当社としては主張しません。フレームレートも prompt のレバーではありません。24 fps は Google の Omni のページにタイミングの例のなかで — 「12 frames at 24fps」として — 出てくるだけで、設定できる仕様としてではありません。フレームレートはポストで扱ってください。
4K でカメラの prompt をテストするといくらかかりますか?
8 秒の 4K のテイクは E2X で $1.44、Google を直接呼ぶと $2.43 なので、6 テイクで $14.60 ではなく $8.64 になります。差は 41% で、4 つの解像度のなかで最も広いものです。もっとも 4K でのテストはたいてい無駄です。動きは 360p でも読み取れ、そこでは 8 秒の下書き 10 本で合計 $2.38、4K の本番を 1 本足しても一連で $3.82 に収まります。