Назад к блогу

Слова про камеру, на которые Gemini Omni 1.1 Flash реагирует, и те, что игнорирует

E2X Team··15 мин чтения
gemini-omniprompt-engineeringcinematographytext-to-videovideo-generation

Почитайте материалы Google по prompt для видео достаточно долго — и наткнётесь на два предложения, разнесённые на пару абзацев. Одно публикует список движений камеры — dolly, truck, pedestal, crane, whip pan, arc — так, будто вы заказываете по меню. Другое предупреждает, что «Некоторые продвинутые ракурсы камеры официально не поддерживаются. Результаты и надёжность могут различаться в зависимости от prompt в целом и от вашего конкретного сценария».

И то и другое верно, а разрыв между ними — источник большинства разочаровывающих клипов. Названное движение — это запрос, который модель, скорее всего, уважит, а не параметр, который она обязана исполнить. У gemini-omni-1.1-flash нет поля позиции камеры — ни штатива, ни объектива, только слова, конкурирующие с другими вашими словами. Этот пост о том, какие из этих слов отрабатывают своё место, и собран он из того, что документирует Google, что сообщает Runway и что выставляет схема.

Пять старых кинообъективов-фиксов стоят вертикально на чёрном бархате в полутёмной прокатной конторе, выстроенные от самого короткого к самому длинному, латунные кольца фокусировки ловят единственный жёсткий боковой свет слева

Слова, которые вылетают сразу

Начните с вычитания — оно ничего не стоит и освобождает место в prompt. Справочник Runway по prompt для камеры прямолинеен насчёт двух самых частых слов в prompt для ИИ-видео: «"Cinematic" и "4k" вылетают, потому что не делают никакой работы. Ни одно из них не меняет того, что делает камера, а место в prompt, которое они занимают, лучше потратить на движение».

Это утверждение про их инструменты, не про инструменты Google, но рассуждение переносится. «Cinematic» описывает впечатление, а не точку зрения: оно не говорит, где встать, на каком расстоянии, что держать резким и в какую сторону ехать. То же самое с прицепным грузом — masterpiece, award-winning, 8k, ultra detailed, — унаследованным из культуры prompt для моделей изображений, где эти токены работали как заклинания качества против совсем другого распределения обучающих данных.

Положительная форма столь же проста: назовите конкретное движение вместо просьбы про «dynamic cinematic camera», потому что эти модели трактуют «инструкции камере как пространственное указание, а не как украшение». Нигде не сказано, что «cinematic» вредит. Сказано, что это слово вытесняет нечто лучшее, а в prompt из нескольких десятков слов вытеснение — это вся игра.

Список Google и мера доверия к нему

Задокументированный словарь превосходит всё, что ходит по веткам с советами по prompt:

КатегорияЧто называет Google
Движениеstatic · pan · tilt · dolly (in, out) · truck (left, right) · pedestal (up, down) · zoom · crane · aerial или drone · handheld · whip pan · arc
Ракурс и крупностьeye-level · low · high · bird's-eye · Dutch · point-of-view · over-the-shoulder · extreme close-up · close-up · medium · full · wide или establishing
Оптикаwide-angle · telephoto · малая и большая глубина резкости · lens flare · rack focus · fisheye · dolly zoom

Две детали стоят внимания. Google намеренно разделяет zoom и dolly, потому что модели их путают: zoom — это изменение фокусного расстояния, и «Это отличается от dolly, поскольку сама камера не движется». Хотите, чтобы фон разросся относительно объекта? Просите dolly. Хотите, чтобы кадр поджался при неизменной геометрии? Просите zoom. Напишите «zoom in slowly as the camera pushes forward» — и вы заказали оба сразу: dolly zoom, а это почти никогда не то, что имелось в виду.

Второе: термины, которые широко приписывают Google, на его страницах отсутствуют. Oner, push in и natural smartphone zoom встречаются в руководствах, ссылающихся на документацию Google; у самого Google мы их не нашли. Незадокументированное не значит запрещённое, но авторитета в них не больше, чем в фразе, придуманной вами. Полный задокументированный синтаксис — в нашем руководстве по prompt.

Одно движение на клип

Самая острая находка в справочнике Runway — не то, какие глаголы работают, а сколько их.

«Нагромождённые глаголы (ненадёжно): "Orbit the subject and crane up and push in." Поэтапное описание (надёжно): "The camera arcs around the seated figure, then rises above the table to reveal the empty chairs surrounding her."»

Далее следует совет описывать, что заполняет кадр на каждой стадии, вместо нагромождения глаголов, а если составное движение всё равно не выходит — «вернуться к одному движению и сгенерировать второй такт отдельным клипом».

Omni добавляет этому механическое основание, из документации самого Google: модель по умолчанию выдаёт несколько планов, если не сказано иначе. Попросите три одновременных движения — и вы вручили ей путь к отступлению: склейку. Два секунды orbit, склейка, два секунды crane, склейка, push in на остаток. Каждая инструкция уважена, ничего из желаемого нет. Исправление в одну фразу — «In a single continuous shot» или «No scene cuts» — не даёт модели разрешить вашу неоднозначность монтажом.

Одна сцена, сгенерированная дважды, менялась только фраза про камеру:

По четыре секунды на сторону в 720p, по тридцать шесть центов каждая. Объект, комната, свет и звуковая линия идентичны; различается только первое предложение — зафиксированный кадр против медленного наезда тележкой. Фраза про камеру — предложение с наибольшим рычагом во всём prompt, и именно его большинство пишет последним.

Фокусное расстояние — это указание, а не оптика

Объектива нет. Стоит сказать прямо, потому что важна ментальная модель. Напишите «85mm» — и модель не считает угол поля зрения; она тянется ко всему в обучающих данных, что подписано так, а фотографий с такой подписью миллионы. Возвращается облик, привязанный к числу: сжатый фон, объект, вырезанный из мягкого поля, сплющенные расстояния. На коротком объективе — растянутая перспектива, больше пространства в кадре, гнутые края.

Что делает фокусное расстояние одним из самых эффективных доступных слов: четыре символа двигают кадрирование и ощущение разом. Ходящие по рукам рекомендации согласованы — примерно 24mm для широкого контекста, 35mm для документального ощущения, 50mm для нейтрального повествования, 85mm для сжатой камерной работы, — и читать их надо как визуальное указание, а не как обещание буквальной оптики.

Пять полированных латунных телескопических трубок возрастающей длины стоят вертикально в ряд на голом бетонном полу, самая короткая — слева

Отсюда две привычки. Дайте числу работу, а не оставляйте его прилагательным: «35mm» в одиночку — это токен, тогда как «35mm, the workshop visible behind her throughout» говорит, зачем нужен широкий объектив, и эта фраза переживёт даже игнорирование числа. Задокументированные Google оптические термины — малая глубина резкости, deep focus, rack focus, telephoto — делают ту же работу простыми словами. И никогда не ставьте фокусное расстояние рядом с противоречащей инструкцией: «85mm wide establishing shot of the valley» просит сжатие и простор одновременно.

Кадрирование — самое надёжное, что можно задать

Отсортируйте язык камеры по тому, насколько надёжно он ложится, и проступает закономерность: статические свойства сильнее временных.

Крупность плана — от extreme close-up до wide establishing — свойство одного кадра. Как и ракурс, как и геометрия двойного плана или over-the-shoulder. Модель может удовлетворить любое из них в первом же отрисованном кадре, а дальше просто держать.

Dolly in — это утверждение про первый кадр в сравнении с девяносто шестым, и оно должно пережить каждый кадр между ними в процессе, где нет явного представления о том, где находится камера. Именно этот разрыв и закрывает исследовательская литература: CameraCtrl, опорная работа по управлению камерой в видеодиффузии, открывается замечанием, что существующим моделям «не хватает управления позой камеры, которая служит кинематографическим языком для выражения более глубоких нарративных нюансов», а затем добавляет модуль обусловливания по позе, потому что одного текста не хватило. Ни один известный нам продакшн-API для видео этот канал не выставляет.

Отсюда иерархия, которую стоит запомнить. Кадрирование и ракурс: задавайте свободно, ждите исполнения. Одно названное движение: ждите исполнения в большинстве случаев. Два движения или движение с заданной скоростью и точкой остановки: закладывайте несколько дублей или делите такт.

Рука держит на вытянутой руке чёрный картонный визир режиссёра на фоне расфокусированного прибрежного пейзажа в сумерках

До и после

Prompt, написанный так, как пишут большинство prompt про камеру. Каждое слово в нём — из тех, что мы сами использовали.

Cinematic 4k video of a silversmith working at her bench in a workshop.
Dynamic camera movement, the camera orbits her and pushes in and cranes
up over the bench. Epic atmospheric lighting, ultra detailed, shallow
depth of field, professional colour grade, film look, masterpiece,
award winning cinematography, highly detailed hands and face,
beautiful composition, 8k resolution, moody and dramatic.

Посчитайте, что здесь исполнимо. Три нагромождённых глагола, которые не могут удержаться в одном дубле. Ни крупности, ни фокусного расстояния, ни инструкции про число планов — так что задокументированный мультиплановый дефолт волен сработать, а при трёх конкурирующих движениях на столе склейка становится путём наименьшего сопротивления.

Тот же план, переписанный так, чтобы говорить только то, на что модель может отреагировать:

In a single continuous shot, no scene cuts. Slow dolly in on a silversmith
at her bench, starting on a medium shot and ending tight on her hands. She
turns a thin silver bracelet against a small torch flame, then taps the
seam twice with a jeweller's hammer. 50mm lens, shallow depth of field, the
far wall of the workshop falling out of focus as the camera closes in.
Eye-level, camera slightly to her right. Sound design: the hiss of the
torch, two light metallic taps, a radio playing faintly in another room.
No dialogue. No music.

Четыре изменения, по убыванию веса. Фраза про число планов идёт первой, чтобы на неоднозначность нельзя было ответить монтажом. Три движения схлопываются в одно, названы открывающее и закрывающее кадрирование — то самое поэтапное описание, которое рекомендует Runway, записанное как один проезд. Фокусное расстояние приходит с прикреплённым следствием. А звук получает собственные предложения, по рекомендации Google описывать аудио отдельно, с негативами короткими фразами в конце. Переписанная версия проще и скучнее для чтения — обычно это признак того, что prompt перестал описывать настроение и начал описывать план.

Где место камеры в prompt

Порядок — вопрос, для которого мы не ожидали найти ответ. Ответ есть, и он в рекомендациях Google по Veo, а не на странице Omni: формула там идёт как cinematography, subject, action, context, style and ambiance — камера первой, до того как вы назовёте, кто в кадре, — потому что этот элемент «самый мощный инструмент для передачи тона и эмоции». Собственная документация Omni перечисляет элементы иначе, с камерой в середине списка, так что Google публикует два порядка, а контролируемого сравнения мы не проводили.

Но вести с камеры действительно переживает контакт с другим задокументированным поведением Omni, поскольку инструкция про число планов должна лечь до того, как модель начнёт строить нарратив. Это делает prompt и проверяемым: если первое предложение не описывает точку зрения, то вы не поставили план.

Чего схема вам не даст

Два структурных ограничения, ни одно из которых не лечится лучшими формулировками.

Первое — повторяемость. Документация API Google указывает, что «System instructions, temperature, top_p, stop sequences, and negative prompts are not supported», и предлагает вписывать негативы в сам prompt. Никакого сэмплера, который можно подтянуть. Остаётся seed, необязательное целое в нашей схеме для этой модели, — и это вся поверхность управления.

Для работы с камерой это важнее, чем для чего-либо ещё в prompt. Свет, вернувшийся чуть другим, — это другая цветокоррекция того же плана; dolly, вернувшийся как pan, — это другой план. Удерживать движение стабильным между дублями поэтому значит зафиксировать seed и не менять больше ничего, а правка одного слова означает новую выборку. Считайте рабочий seed активом и записывайте его рядом с prompt.

Второе ограничение — у скорости камеры нет словаря. «Slow dolly in» — это и есть вся поверхность управления: ни единицы измерения, ни длительности, ни способа сказать, что наезд должен закончиться к пятой секунде и замереть. Синтаксис таймкодов помогает немного — Omni принимает диапазоны в скобках, — так что prompt может попросить камеру успокоиться на четвёртой секунде. Сделает ли она это — другой вопрос.

Угол затвора и motion blur лежат в той же колонке: ни того ни другого нет в задокументированном словаре Google. Частота кадров — почти промах: 24 fps появляется на странице Omni только внутри разобранного примера тайминга, «12 frames at 24fps», а не как рычаг в prompt. Полезно для рассуждений о таймкодах; не то, что стоит вписывать в расчёте на управление.

Сколько стоят эксперименты с камерой на том уровне, который имеет значение

Работа с камерой — та часть prompting, которую нельзя сделать правильно с одного прохода: вы просите поведение во времени, не имея параметра, чтобы его ограничить, поэтому генерируете, смотрите, правите, генерируете снова. Значение имеет цена одного дубля.

В 4K восьмисекундный дубль — $1.44 здесь против $2.43 при прямом вызове Google. Шесть дублей, чтобы поймать движение (скромно для чего угодно с конкретным проездом), — это $8.64 против $14.60. Этот разрыв — 41%, с большим отрывом крупнейший из четырёх разрешений и причина, по которой строка 4K — единственная, о которой стоит спорить. В остальном секунда 4K стоит $0.30 у fal, $0.32 у Runware и $0.39 у WaveSpeed против $0.18 здесь; Replicate перечисляет модель вообще без посекундной ставки.

Однако способ тратить меньше — не более дешёвая секунда 4K, а прекращение тестов движений камеры в 4K. Десять восьмисекундных черновиков на уровне 360p стоят $2.38, а 360p достаточно, чтобы увидеть, сделала ли камера то, о чём вы просили: движение читается при любом разрешении, и именно поэтому его дёшево тестировать. Десять черновиков плюс один зачётный дубль в 4K — $3.82 против $14.40 за десять дублей в 4K.

Две верхние ступени — это апскейл, а не нативный рендер: справочник по модели у Google помечает их как «1080p output (upscaled)» и «4K output (upscaled)», — так что дубль в 4K покупает габариты для сдачи, а не дополнительную детализацию в том плане, который вы разбираете. Наш пост о сорокасекундных сценах разбирает, где за это всё равно стоит платить.

Цены и условия продуктов могут меняться. Перед решением о покупке проверяйте актуальные цены у каждого провайдера.

Короткая версия

Сначала скажите число планов, потом одно движение, потом кадрирование, с которого оно начинается и которым заканчивается. Дайте фокусному расстоянию причину там быть. Вынесите аудио в отдельные предложения. Удалите каждое слово, описывающее, что зритель должен почувствовать, и потратьте это место на то, где стоит камера.

Что вышло в 1.1 — в обзоре запуска, а аудит цен провайдеров объясняет, почему одинаковые веса стоят разного в зависимости от страницы. Параметры и актуальные тарифы лежат на странице модели text-to-video. Для одного движения, от которого ничего не зависит, сначала прикиньте Veo 3.1 Fast по центу за секунду — словарь камеры взят из руководства, которое Google публикует для обеих моделей, так что практика переносится.

Частые вопросы

Какие термины движения камеры понимает Gemini Omni 1.1 Flash?

Google называет словарь движений — static, pan и tilt, пары dolly, truck и pedestal, zoom, crane, drone или aerial, handheld, whip pan, arc — плюс термины ракурса, крупности и оптики. Он же предупреждает, что некоторые продвинутые ракурсы официально не поддерживаются и надёжность зависит от prompt, так что читайте названное движение как запрос, а не как параметр.

Даёт ли что-нибудь слово «cinematic» в prompt для видео?

Само по себе — немного. Справочник Runway по prompt для камеры вычёркивает и «cinematic», и «4k» на том основании, что ни одно не меняет того, что делает камера, а место лучше потратить на название движения. Слово описывает впечатление, а не точку зрения, поэтому не даёт модели ничего исполнимого — как и «masterpiece», «8k» и остальной груз из prompting для изображений.

Меняют ли результат числа фокусного расстояния вроде 35mm или 85mm?

Они сдвигают облик, потому что фотографии в обучающих данных несут фокусное расстояние в метаданных и число читается как стилевая подсказка. Длинный объектив склонен сжимать фон и отделять объект; короткий растягивает перспективу и впускает в кадр больше комнаты. Считайте это визуальным указанием, а не буквальной оптикой, и привязывайте к следствию.

Где в prompt для Omni должно стоять указание камеры?

Руководство Google по prompt для Veo ставит cinematography первым, впереди subject, action, context и style, называя его самым мощным элементом для передачи тона. Собственная документация Omni помещает термины камеры в середину списка. И то и другое — Google. У ведения с камеры есть одно практическое преимущество: инструкция про число планов — это решение по камере, и она должна зарегистрироваться до того, как модель начнёт строить нарратив.

Можно ли получить одно и то же движение камеры дважды в Gemini Omni 1.1 Flash?

Только повторно использовав seed. Документация Google говорит, что temperature, top_p, системные инструкции, stop sequences и негативные prompt не поддерживаются, и остаётся seed — необязательное целое в нашей схеме — как весь контроль воспроизводимости. Смените слово в prompt — и вы делаете новую выборку, поэтому записывайте seed, давший понравившееся движение, в тот момент, когда оно получилось.

Почему камера режет план склейкой, если я просил одно движение?

Потому что несколько планов — это дефолт. Google документирует, что Omni попытается сделать несколько планов и выстроить нарратив, если не сказано иначе, так что prompt, нагромождающий два или три движения, даёт ей повод удовлетворить каждое отдельной склейкой. Задокументированное исправление — фраза с просьбой об одной непрерывной сцене, а возврат к одному названному движению убирает сам стимул.

Можно ли задать выдержку или частоту кадров в prompt для Gemini Omni?

Ничто в задокументированном словаре камеры Google не покрывает угол затвора или motion blur, и мы не станем утверждать, что эти термины исполняются. Частота кадров тоже не рычаг prompt: 24 fps появляется на странице Omni внутри примера тайминга — «12 frames at 24fps» — а не как задаваемая спецификация. Разбирайтесь с частотой кадров на посте.

Сколько стоит тестировать prompt для камеры в 4K?

Восьмисекундный дубль в 4K — $1.44 на E2X против $2.43 при прямом вызове Google, так что шесть дублей выходят в $8.64, а не в $14.60 — разрыв в 41%, самый широкий из четырёх разрешений. Впрочем, тестировать в 4K обычно бессмысленно: движение читается и в 360p, где десять восьмисекундных черновиков дают в сумме $2.38, а один зачётный дубль в 4K доводит прогон до $3.82.