Prompting в Gemini Omni: синтаксис тегов, который Google документирует, а никто не цитирует
Большая часть советов по prompt для Omni, опубликованных на этой неделе, выдумана.
«Фреймворк из пяти элементов из официальной документации Google», на который ссылается с полдюжины руководств, не встречается ни на одной странице Google, которую мы смогли найти, а сами цитирующие руководства не сходятся в том, элементов пять или шесть. Утверждение, что диалог в кавычках переключает модель в режим липсинка, тоже отсутствует в любом документе Google — кавычки появляются в примерах Google только для текста, отрисованного на экране.
Что Google действительно документирует — полезнее и почти никем не описано: синтаксис тегов, позволяющий одному prompt адресоваться к конкретным изображениям и клипам по имени. С него это руководство и начинается.

Две ремарки к тому, что дальше
Всё процитированное здесь взято с собственных страниц Google — из раздела prompt guide документации API Gemini Omni и из общего руководства по prompt, покрывающего Omni и Veo вместе. Там, где Google молчит, мы так и говорим, а не затыкаем пробел чем-то авторитетно звучащим.
Клипы ниже сгенерированы через Veo 3.1 Fast на нашем собственном API, а не через Omni. Gemini Omni 1.1 Flash на E2X пока нет, и мы не станем иллюстрировать руководство материалом одной модели, выдавая его за другую. Приёмы, которые они демонстрируют, — словарь камеры, инструкция про один непрерывный план, работа со звуком — взяты из prompt guide, который Google публикует для обеих моделей, так что они переносятся. Синтаксис тегов из следующего раздела — нет: эта часть только для Omni, и мы показываем её как синтаксис, а не как результат.
Синтаксис тегов
Omni принимает встроенные теги, указывающие на конкретные входные данные. Это та часть документации, у которой меньше всего стороннего освещения и больше всего пользы от прочтения.
Для кадров:
<FIRST_FRAME> a woman is walking
<LAST_FRAME> отмечает кадр, на который надо прийти, и Google явно пишет, что он «должен использоваться с» <FIRST_FRAME>. Когда prompt усложняется настолько, что позиция становится неоднозначной, есть явная форма объявления:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image2]
Направьте оба тега на одно и то же изображение — и получите петлю. Google документирует это напрямую: клип возвращается туда, откуда начался:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image1]
Для референсов теги пронумерованы и начинаются с нуля:
in the style of <IMAGE_REF_0> a woman <IMAGE_REF_1> is walking
Эта одна строка берёт стиль из одного изображения, а объект — из другого. Видеоэквивалент — <VIDEO_REF_0>, тоже с нулевой индексацией, с жёстким ограничением: «Video references support a maximum of 3 clips, up to 3 seconds each», причём любой звук в референсном клипе игнорируется.
Типичный сбой здесь — модель воспринимает референс как буквальный первый кадр. Решение от Google — инструкция, дописанная к prompt:
Use the given image(s) as references for video generation.
The images should not be used as literal initial frames.
Одна граница, о которой стоит знать до того, как строить вокруг неё: «Referencing or reasoning across multiple videos is not supported». Несколько изображений-референсов — нормально, в собственном примере Google их шесть, — но prompt с несколькими видео деградирует.
Omni режет ваш клип на несколько планов, пока вы это не остановите
Это самая неожиданная строка во всей документации, и она объясняет многое в непонятных результатах:
«By default Omni Flash will try to create a video with a few different shots. It'll attempt to craft an interesting narrative based on the prompt. If you need the output video to contain a single scene, you must prompt for that»
Попросите восемь секунд человека, проходящего через дверной проём, — и можете получить три склейки. Модель вас не недопоняла. Она делает то, что делает по умолчанию.
Исправление — одна фраза, и Google даёт три формулировки: «In a single unbroken scene», «In a single continuous shot» или «No scene cuts».
Вот эта инструкция за работой, с документированным движением камеры и приложенной строкой про звук:
In a single continuous shot, no scene cuts. Slow dolly in on a battered
enamel coffee pot sitting on a cast-iron stove in a dim cabin kitchen.
Steam rises and catches a hard shaft of morning light from a window to the
left. Medium shot, shallow depth of field, warm amber and deep green
palette. Sound design: the low hiss of steam and a wood fire ticking.
No dialogue.
Четыре секунды, 720p, сгенерировано на Veo 3.1 Fast по центу за секунду. Обратите внимание, как мало в этом prompt прилагательных и как много инструкций, по которым модель может действовать.
Звуком управляют отдельными предложениями
Аудио генерируется вместе с картинкой, и рекомендация Google — описывать его отдельно: «We recommend that you use separate sentences in your prompt to describe the audio». Документация делит его на три части — звуковые эффекты, окружающий шум и диалог — с отдельными примерами для каждой.
Диалог — как раз то место, где фольклор ошибается. Документированная конвенция — двоеточие и никаких кавычек:
the man in the red hat says: Where is the rabbit?
Более длинный пример Google ведёт двух говорящих в одном prompt и закрывается атмосферой:
A medium shot in a dimly lit interrogation room. The seasoned detective
says: Your story has holes. The nervous informant, sweating under a single
bare bulb, replies: I'm telling you everything I know. The only other
sounds are the slow, rhythmic ticking of a wall clock and the faint sound
of rain against the window
Собственные примеры Omni предваряют неречевое аудио префиксом Sound design:, как в «Sound design: Gentle breeze, distant bird chirps. No dialogue.» А когда вам нужна именно музыка, так и скажите — Google отмечает этот случай как чаще всего упускаемый: «This is especially important if you want music in your video».
Два ограничения, под которые надо проектировать: редактирование голоса не поддерживается, и «Uploading audio references is unsupported in the current version of the API». Звуком вы управляете словами — или никак.
Таймкоды работают, и при продлении их отсчёт сдвигается
Тайминг не требует особого синтаксиса — «there is no precise syntax needed and you can use natural language», так что «At 5s the chorus starts in the background audio» — валидная инструкция. Есть и форма таймкода в скобках:
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
А теперь ловушка, и вполне реальная. Когда вы продлеваете существующий клип, 0s больше не значит начало видео. Он значит начало продления. Google проговаривает это прямо:
«If using timestamps or a timecode syntax, 0s refers to the beginning of the extended part of the video. If extending a 10s video, the scene cut in this prompt will happen after 12s»
То есть After 2s cut to a new scene попадёт на двенадцатую секунду готового материала. Тот, кто строит раскадровку по абсолютным таймкодам, ошибётся здесь один раз, а потом уже никогда.
Раз уж вы здесь: prompt на продление должен описывать продолжение, а не пересказывать всю сцену заново. Предлагаемые Google формы бывают короткими, как «Extend this video» или «The scene continues», с добавлениями только там, где что-то меняется: «The music continues into the chorus» для звука, «Show the same characters in the next scene» для склейки. Продление только дописывает в конец; нельзя приписать в начало или вклеить в середину.

Редактирование хочет меньше слов, а не больше
Всё вышеописанное вознаграждает детальность. Редактирование переворачивает это: «Simple prompts work best for video editing. Overly descriptive prompts can lead to unintended changes.»
Google публикует собственные пары «до и после», и их стоит читать как паттерн, а не как два примера:
Avoid: In the video of the man sitting on the sofa, please add a small
black cat that runs from the right side of the screen, jumps onto
his lap, and then he starts to stroke its head while looking down.
Simplify: Add a cat that jumps onto his lap, he begins to pet it.
Keep everything else the same.
Avoid: Please remove the cell phone that the person is holding in their
hand and fill in the background so it looks like they are just
holding their hand empty.
Simplify: Make the phone invisible. Keep everything else the same.
Работу в обоих случаях делает фраза «Keep everything else the same», которую Google рекомендует включать всегда, когда вы правите один аспект плана. Каждая лишняя деталь, которую вы подаёте, — ещё одна вещь, которую модель может решить перегенерировать.
Image-to-video снова работает в обратную сторону: «Vague prompts like 'make it move' produce less compelling results than detailed descriptions of the camera movement, subject motion, and environmental effects.» Детальность для генерации, краткость для редактирования.
Слова про камеру, которые Google действительно называет
Google публикует список словаря, и он надёжнее терминов, гуляющих по веткам с советами по prompt. Названные им движения: static, pan, tilt, dolly in и out, truck left и right, pedestal up и down, zoom, crane, aerial или drone, handheld, whip pan, arc. Ракурсы: eye-level, low, high, bird's-eye, worm's-eye, Dutch, close-up и extreme close-up, medium, full, wide или establishing, over-the-shoulder, point-of-view. Оптические эффекты: wide-angle, telephoto, малая и большая глубина резкости, lens flare, rack focus, fisheye и эффект вертиго — dolly zoom.
Google также явно различает zoom и dolly, потому что модели их путают: zoom меняет фокусное расстояние, и «This is different from a dolly, as the camera itself doesn't move.»
Однако держите в голове оговорку, которую Google повторяет дважды: «Some advanced camera angles are not officially supported. The results and reliability may vary depending on the overall prompt and your specific use case.» Назвать движение — это запрос, а не гарантия.
Вот arc-план, одно из документированных движений, запрошенный без затей:
Slow arc shot travelling left around a weathered brass sextant resting on
an unrolled nautical chart on a scuffed wooden table. Low winter sunlight
rakes in from the right and the brass catches moving highlights as the
camera travels. Single continuous shot, no scene cuts, shallow depth of
field. Sound design: faint harbour ambience, rigging tapping in wind.
No dialogue.
Кинематографические и монтажные термины тоже задокументированы — match cut, jump cut, establishing shot sequence, montage, split diopter effect. Термины, которые вам могли приписывать Google, но которых нет ни на одной из двух страниц: oner, push in и natural smartphone zoom.
Негативные prompt: две страницы Google противоречат друг другу
У Omni нет параметра негативного prompt. Документация API прямолинейна: «System instructions, temperature, top_p, stop sequences, and negative prompts are not supported (you can put your negatives in the regular prompt: e.g., 'Do not do X').»
И prompt guide для Omni рекомендует ровно это, предлагая «No dialogue», «No embellishments», «No extra sound effects».
Общее руководство Google по Omni и Veo говорит о формулировках противоположное:
«Not recommended: using instructive language or words such as 'no' or 'don't'. For example, avoid prompts such as 'no walls' or 'don't show walls'. Recommended: Describe what you don't want to see. For example, 'wall, frame'»
Мы не станем делать вид, что разрешаем это противоречие. Наиболее вероятное объяснение: вторая страница описывает выделенное поле negativePrompt у Veo, которого у Omni нет, тогда как страница Omni описывает негативы прозой, а это всё, что Omni предлагает. Это вывод, а не то, что Google утверждает. На практике: используйте формулировки со страницы Omni для Omni, а если негатив игнорируется, попробуйте другую форму, прежде чем решать, что модель так не умеет.
Ещё одно честное противоречие, поскольку оно влияет на то, что вы можете обещать клиенту. Prompt guide для Omni говорит, что модель отрисовывает экранный текст «in a way that is correct and readable». Model card от DeepMind перечисляет «rendering perfectly accurate text» среди того, что «remain a challenge». И то и другое — Google. Проверяйте, прежде чем брать обязательства.
Чек-лист, которым можно реально пользоваться
Исходя из вышесказанного, prompt, который учитывает поведение модели, обычно несёт:
- Инструкцию про число планов, потому что мультиплановость — дефолт и, скорее всего, не то, что вам нужно
- Объект и его движение, конкретно — а не «make it move»
- Одно документированное движение камеры, названное по списку Google
- Свет: направление, характер, цвет
- Отдельное предложение под звук, с префиксом
Sound design:, если это не диалог - Диалог в форме
speaker says: line, через двоеточие, без кавычек - Любые негативы короткими прозаическими фразами в конце
- Только для правок: срежьте большую часть вышеперечисленного и добавьте «Keep everything else the same»
Собственная сводка структуры от Google длиннее — объект, действие, сцена, ракурс камеры, движение камеры, объектив, визуальный стиль, временные элементы, аудио, кинематографические термины, негативы — с оговоркой, что «You don't need to use all elements in every prompt».
Где всё это запускать сегодня
Prompting — навык, который приобретается через повторяющиеся неудачи, а значит, цена одной неудачи и есть самое важное число. Четырёхсекундный тест на Veo 3.1 Fast стоит четыре цента. Тот же тест на Gemini Omni 1.1 Flash, доступной здесь с 28 августа 2026 года по девять центов за секунду, — тридцать шесть, или около двенадцати, если сначала сделать черновик в 360p: этот уровень релиз 1.1 добавил ровно для такого случая. За вечер выяснения того, где инструкция камере перестаёт исполняться, эта разница решает, сколько раз вам позволено ошибиться.
Поэтому отрабатывайте переносимую половину дёшево — число планов, словарь камеры, работу со звуком, негативы, — всё это идёт из руководства, которое Google публикует для обеих моделей. Оба клипа выше сделаны ровно так. Переходите к семейству Omni, когда понадобится то, что умеет только оно: синтаксис тегов, продление и консистентность по референсам. Одно замечание о тегах кадров, которым это руководство уделяет больше всего места: теперь у них есть собственный эндпоинт — start-end-frame-to-video, принимающий два кадра как поля, а image-to-video делает то же самое для одного открывающего кадра. Практику с image-to-video и первым и последним кадром по дороге всё равно закроет Veo 3.1 Fast. Тарифы актуальны на 28 августа 2026 года.
Отдельно мы разобрали что вышло в 1.1 и что о ней на самом деле говорят рейтинги. Смотрите по задачам в text-to-video или читайте машиночитаемую спецификацию, если вам ближе диффать параметры, а не прозу.
Цены и условия продуктов могут меняться. Перед решением о покупке проверяйте актуальные цены у каждого провайдера.
Частые вопросы
Как написать prompt для Gemini Omni 1.1 Flash?
Сначала назовите число планов, потому что Omni по умолчанию выдаёт несколько планов, а вам обычно нужен один. Затем опишите объект и его движение, одно названное движение камеры и свет. Аудио вынесите в отдельное предложение с префиксом «Sound design:» для неречевых звуков, а диалог пишите как «speaker says: line» — через двоеточие и без кавычек. Любые негативы добавьте короткими фразами в конце.
Что такое тег FIRST_FRAME в Gemini Omni?
Это встроенный тег, который говорит Omni использовать переданное изображение как открывающий кадр; пишется как тег, за которым идёт ваше описание. Парный ему LAST_FRAME отмечает кадр, на котором надо закончить, и, согласно документации Google, должен использоваться вместе с FIRST_FRAME. Если направить оба тега на одно и то же изображение, получится зацикленный клип.
Поддерживает ли Gemini Omni негативные prompt?
Не как параметр. Документация API Google указывает, что негативные prompt не поддерживаются, и предлагает вместо этого помещать негативы в обычный prompt, например «Do not do X». Prompt guide для Omni предлагает короткие фразы вроде «No dialogue» или «No extra sound effects». Общее руководство Google по Omni и Veo советует против такой формулировки, но, судя по всему, описывает отдельное поле негативного prompt у Veo, а не Omni.
Почему Gemini Omni добавляет склейки, которых я не просил?
Потому что несколько планов — это дефолт. Документация Google говорит, что Omni попытается создать видео из нескольких планов и выстроить нарратив по вашему prompt, если не сказать иначе. Документированное исправление — добавить в prompt «In a single continuous shot» или «No scene cuts».
Как работают таймстемпы при продлении видео в Omni?
Их отсчёт сдвигается. После того как вы продлеваете клип, 0s означает начало продления, а не начало оригинала. Пример Google: продление десятисекундного видео с инструкцией на 2s помещает этот момент на двенадцатую секунду готового материала. Продление только дописывает в конец — нельзя приписать содержимое в начало или отредактировать середину клипа.
Нужно ли брать диалог в кавычки для Gemini Omni?
Нет. Документированная Google форма — «speaker says: line», через двоеточие, без кавычек. Широко растиражированное утверждение, что кавычки включают режим липсинка, не встречается ни в одном документе Google. Кавычки появляются в примерах Google только для текста, который должен быть отрисован на экране, — вероятно, отсюда и пошла путаница.
Сколько стоит практиковаться в prompting для Omni?
На нашем API Gemini Omni 1.1 Flash идёт по $0.09 за секунду в 720p, так что четырёхсекундный тест — $0.36, или около $0.12, если делать черновик в 360p, по состоянию на 28 августа 2026 года. Veo 3.1 Fast стоит $0.01 за секунду, и тот же тест обойдётся в четыре цента. Поскольку приёмы по камере, числу планов и звуку взяты из prompt guide, который Google публикует для обеих моделей, тренировка на более дешёвой стоит в девять раз меньше и отрабатывает те же навыки.