Фотореалистичные люди в Gemini Omni 1.1 Flash: удалите слово «красивая»
Самый быстрый способ сделать сгенерированного человека фальшивым — попросить привлекательного.
Напишите beautiful woman, perfect skin, flawless, stunning — и модель подчинится: она потянется в ту область обучающих данных, где живут такие подписи, а это отретушированная коммерческая фотография. Поры исчезли, асимметрия исчезла, а вместе с ними ушли и мелкие напряжения, по которым лицо читается как занятое кем-то. Ничего неправильного в выводе нет. Prompt попросил рекламу косметики — и получил её.
Собственные рекомендации Google по prompt указывают в другую сторону одним предложением — «Будьте предельно детальны в описаниях персонажей и окружения». Детальны, а не комплиментарны. Это разные инструкции, и они дают разные лица. Дальше — про эту разницу: лица, руки, аудио, которое нельзя выключить, и то, куда Google решил вас не пускать.

Лицо — это список фактов, а не список комплиментов
Каждое прилагательное — голос за кластер подписей, а gorgeous голосует за сток. 8k, hyperrealistic, masterpiece пришли из фольклора моделей изображений, где служили токенами качества; на видеомодели без параметров сэмплинга они лишь конкурируют со словами, описывающими ваш план. Замены конкретны и скучны — в этом и суть:
Возраст числом или десятилетием. «A woman in her late forties» — это ограничение; «a young woman» — лотерейный билет.
Один названный изъян. Выпуклый шрам, скол на переднем зубе, однажды сломанный и чуть криво сросшийся нос. Одного достаточно; три читаются как анкета персонажа.
Кожа как поверхность. Видимые поры на носу и щеках, блеск на лбу, полопавшиеся капилляры у крыла носа. Самая доходная подстановка во всём prompt: «perfect skin» и «visible pores across the nose» сидят на противоположных концах пространства подписей.
Взгляд с направлением и переменой. Не «looking at the camera», а «reads something off frame to the right, then her eyes flick to the lens for about a second and away again». Непрерывный зрительный контакт на весь клип — то, чего почти никто из людей не делает, поэтому незаданная линия взгляда оставляет модель гадать ровно о том, что зритель считывает первым.
Одна микромимика, привязанная ко времени. «The corner of her mouth tightens once.» Поставленное событие лучше, чем «emotional», потому что событие модель поставить может, а абстракцию — нет.
Износ на всём, что не кожа. Воротник, стиранный две сотни раз, разношенный ремешок часов, кофейный круг на бумагах. Костюм продаёт человека надёжнее, чем лицо.
Обмен, доведённый до конкретики. Сначала версия, похожая на стоковое фото, научившееся моргать:
A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.
Большинство этих слов описывают фотографию; ни одно не описывает человека. Переписанная версия сохраняет план и меняет каждый комплимент на факт:
In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.
Ничто во второй версии не просит качества. Она поставляет фактуру для отрисовки, причину для линии взгляда и одно событие во времени — три вещи, с которыми модель может работать, тогда как «stunning» — это три вещи, с которыми она работать не может. Обратите внимание и на фразу о числе планов в начале: Omni по умолчанию строит несколько планов, как мы разбирали в руководстве по prompt, а портрет, который дважды режется за шесть секунд, лицо не удержит.

Одно предостережение про глаза: «wet eyes» и «glossy tear film» — это слова о качестве в техническом костюме, называющие блик, а не его причину. Дайте глазу занятие и позвольте бликам следовать из уже заданного вами света.
Руки: дайте им работу
Руки — традиционный позор генеративного видео и по-прежнему самое вероятное, из-за чего дубль пойдёт в корзину. Model card от DeepMind не выделяет их отдельно, но называет их категорию: «сохранение полной консистентности на протяжении правок, генерация сцен со сложным движением или отрисовка идеально точного текста остаются сложной задачей». Пальцы — это сложное движение на маленьком участке кадра, сочленённое множеством способов и постоянно само себя заслоняющее.
Исправление контринтуитивно. Не описывайте руки — дайте им задачу. Рука, держащая конкретный предмет заданным хватом, имеет форму и точку контакта, к которым можно привязаться. «Beautiful, elegant hands» не даёт ни того ни другого и оставляет число пальцев на изобретение модели.
Сравните:
- Слабо: her hands rest naturally at her sides
- Лучше: she holds a chipped enamel mug in both hands, thumbs overlapping on the near side
- Слабо: he gestures while speaking
- Лучше: he turns a pen over in his right hand twice, then sets it down on the papers
Вторая форма в каждой паре неявно фиксирует число пальцев, даёт движению начало и конец и производит такт, на который можно резать.
Одна оговорка, распространяющаяся на все сторонние цифры в этом посте. Два опубликованных практических обзора, которые нам удалось найти, — от invideo и мультитёрновый тест команды JXP от 21 мая 2026 года — оба называют тестируемую модель Gemini Omni Flash, без суффикса 1.1 нигде в тексте. Ни один не измеряет ту модель, о которой этот пост; читайте их как свидетельство о семействе. JXP сообщает, что на пятом шаге редактирования плана со скрипкой «её левая рука слегка съехала с грифа». Руки ушли первыми, пока всё остальное ещё держалось.
Ещё два правила, которые ничего не стоят. Держите руки в одной плоскости фокуса — рука, вытянутая в широкий объектив, самое трудное, о чём можно попросить. И держите руки подальше от лица: перекрытие двух сложных структур не усредняет ошибку, а умножает её.

Вы режиссируете голос, хотели вы того или нет
Аудио здесь нативное: производится в том же проходе, что и картинка, не отключается ни одним параметром и не тарифицируется отдельно ни одним из проверенных нами провайдеров. Prompt, ничего не говорящий о звуке, — это поэтому не просьба о тишине, а неконтролируемое задание, и модель его заполнит.
Так что пишите аудио осознанно, отдельными предложениями. Задокументированная Google форма диалога — двоеточие без кавычек, the man says: We lost it, — а многократно повторяемое утверждение, что кавычки включают режим липсинка, не встречается ни в одном документе Google.
Работает ли говорящий план, решают четыре вещи:
Длина реплики. invideo в обзоре, называющем тестируемую модель Gemini Omni Flash, сообщает, что «для одного говорящего человека липсинк держится примерно до 6–7 секунд, а затем начинает разваливаться». Это направление, а не спецификация, но оно указывает в одну сторону: реплика из четырёх–двенадцати слов, поставленная рано, затем тишина и реакция, лучше, чем предложение длиной во весь дубль.
Один говорящий в кадре. Тот же обзор прям: «Два говорящих в одном кадре остаются слабым местом, поскольку Omni часто теряет синхронизацию или неверно приписывает реплики, так что планы с одним говорящим — сегодня безопасная ставка». Сделайте второго человека плечом на краю кадра, вне фокуса, а его реплику снимите отдельной генерацией.
Указание по голосу прозой. Параметра голоса не существует, поэтому акцент, возраст, регистр и темп идут обычным английским: tired, quiet, American accent, no rise at the end.
Явная тишина. Напишите No dialogue. или No music.
До и после для диалогового плана. Слабая версия совершает все перечисленные ошибки разом — два говорящих в кадре, кавычки, по реплике каждому, прилагательные вместо режиссуры:
A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.
Переписанная версия выводит одного говорящего за кадр, сокращает реплику до четырёх слов и описывает голос вместо того, чтобы его хвалить:
In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.
Её ответ — это вторая генерация, снятая на неё: два клипа вместо одного, и всё равно дешевле, чем восемь раз перекатывать двойной план в надежде, что синхронизация ляжет сразу на оба лица.
Одна задокументированная граница: нельзя взять загруженное видео говорящего человека и продлить его новым диалогом. Это удержано, а не отсутствует, и model card говорит об этом прямо: «В рамках редактирования видео Gemini Omni Flash способна изменять речь людей. Пока мы ограничиваем эту возможность и работаем над тем, чтобы лучше понять, как безопасно и ответственно принести её нашим пользователям». Модель может переозвучить человека; Google решил, что вам нельзя. Дубляж — не тот продукт, который здесь можно построить.
Толпа, фоновые фигуры и куда не стоит тратиться
Фоновые люди получают то внимание, что осталось, и оживлённая улица с пешеходами — это ряд лиц, который не переживёт кнопки паузы. Дайте число — «four people at scattered tables» лучше, чем «a crowded café», потому что расплывчатое количество приглашает к приблизительности. Держите их вне плоскости фокуса: фигуры, смягчённые малой глубиной резкости на 50mm, правдоподобны там, где те же фигуры, резкие на f/11, — галерея почти-попаданий. И дайте каждому по одному действию, спиной к камере: затылки бесплатны. Если конкретное фоновое лицо важно, повысьте его до собственного плана.
Сколько стоят дубли и почему 4K — то самое число
Лица — это то, на чём вы жжёте генерации: перекатываете ради линии взгляда, потом ради руки, потом потому что голос вышел лет на двадцать моложе. Честно оценивать эту работу — значит считать дубли, а не клипы. И разрыв между провайдерами шире всего на верхней ступени лестницы. Десять секунд 4K по состоянию на 29 августа 2026 года:
| Где вызываете | 10 с в 4K |
|---|---|
| E2X | $1.80 |
| fal | $3.00 |
| Google, напрямую | $3.04 |
| Runware | $3.20 |
| WaveSpeed | $3.90 |
Цифра Google выводится из его опубликованной токенной ставки за секунду, а не из ценника, а цифра fal — passthrough прайса Google, а не независимая оценка вычислений. Разброс структурный: от базы 720p Google берёт втрое за 4K там, где мы берём вдвое. На 41% дешевле в 4K — самый широкий из наших четырёх уровней, а восьмисекундный дубль стоит здесь $1.44 против $2.43 напрямую. Остальное — в аудите провайдер за провайдером.
Вторая половина арифметики — где именно вы итерируете. Десять поисковых проходов в 360p плюс один финиш в 1080p выходят в $1.73 против $5.40 за десять проходов сразу в 1080p — на шестьдесят восемь процентов меньше за одну лишнюю генерацию. Черновой проход несёт достаточно разрешения для линии взгляда, мизансцены и того, нашла ли рука кружку; недостаточно — для фактуры кожи или липсинка, поэтому закладывайте два полноразмерных дубля после закрытия цикла. И спросите себя, нужна ли плану именно эта модель: Veo 3.1 Fast идёт здесь по центу за секунду, и для одиночного портрета без продолжения девятикратная премия покупает очень мало.
Ограничения, названные прямо
Это не раздел дисклеймеров. Каждый пункт ниже уже поменял кому-то план проекта.
SynthID есть в каждом кадре, и переключателя нет. Формулировка Google: «Все сгенерированные видео содержат маркировку SynthID, невидимую для зрителей, но программно детектируемую для подтверждения происхождения». Ни один провайдер не выставляет тумблер, а поскольку метка сделана так, чтобы переживать перекодирование, кадрирование и изменения цвета, «мы вычистим это на посте» — не план. Если договор на сдачу запрещает материалы с водяными знаками, решите вопрос до рендера.
Редактирование загруженного видео недоступно в ЕЭЗ, Швейцарии и Великобритании. Строка Google, включая скобку, которая и решает, насколько это для вас плохо: «Редактирование или продление загруженных видео сейчас недоступно пользователям в Европейской экономической зоне (ЕЭЗ), Швейцарии и Великобритании (редактирование или продление видео, сгенерированных моделью, поддерживается)». Европейская команда всё ещё может сгенерировать план и продлить собственный вывод; чего она не может — продолжить материал, загруженный пользователем. Последствия мы разбирали в посте о сорокасекундных сценах — самый дорогой пункт здесь, если узнать о нём поздно.
Загрузки с определёнными людьми отклоняются. Ещё две строки из того же раздела ограничений, обе привязанные к тем же регионам: «Загрузка и редактирование изображений, содержащих несовершеннолетних, не поддерживается в Европейской экономической зоне, Швейцарии и Великобритании» и «Загрузка и редактирование изображений, содержащих определённых узнаваемых людей, не поддерживается в Европейской экономической зоне, Швейцарии и Великобритании». Поверхность отказов выглядит шире этой формулировки: JXP в том же обзоре эпохи предшественницы сообщает, что prompt с названием реального бренда «был заблокирован при отправке с общим сообщением о политике», а запрос «состарить обобщённого взрослого персонажа на десять лет» заблокировали тоже. Не стройте пайплайн, зависящий от того, что отказов не будет.
Реальные люди — сначала юридический вопрос, потом технический. Узнаваемое сходство с конкретным человеком, сделанное без его согласия, упирается в права на изображение и на публичность, которые различаются по юрисдикциям и не отменяются тем, что вывод синтетический. Отдельно: обязанности по прозрачности из статьи 50 EU AI Act применяются с 2 августа 2026 года — операторы обязаны раскрывать, что контент искусственно сгенерирован или изменён, ясно и при первом контакте. SynthID отвечает на требование машиночитаемой маркировки; он не отвечает на обязанность сказать это смотрящему человеку. Это решение о маркировке, которое принимают с юристом, а не флаг в вызове API.
Сгенерированное лицо — не человек, но оно может оказаться достаточно близко к чьему-то, чтобы кому-то навредить. Согласие, раскрытие и готовность не делать этот план принадлежат этому ремеслу так же, как фокусное расстояние.
Частые вопросы
Как получить реалистичную кожу в Gemini Omni 1.1 Flash?
Описывайте поверхность вместо того, чтобы её хвалить. «Perfect skin», «flawless» и «beautiful» отбирают отретушированную коммерческую съёмку и сглаживают фактуру. Замените их наблюдаемыми фактами — видимые поры на носу и щеках, блеск на лбу, небольшой шрам — и укажите возраст. Google просит предельно детального описания персонажа, а это не то же самое, что просьба о привлекательном персонаже.
Почему руки в ИИ-видео выходят неправильными и как это исправить в prompt?
Пальцы — сложное движение в маленькой самозаслоняющейся области, а model card Google называет сложное движение тем, что «остаётся сложной задачей». Дайте рукам работу вместо описания: конкретный предмет с заданным хватом или действие с началом и концом. Держите их в одной плоскости фокуса и подальше от лица.
Можно ли отключить звук в Gemini Omni 1.1 Flash?
Нет. Аудио генерируется нативно вместе с картинкой, ни один параметр его не отключает, и оно не тарифицируется отдельно от посекундной ставки. Им можно управлять предложением с префиксом «Sound design:» и явными фразами «No dialogue.» или «No music.», но отказаться от него нельзя. Для беззвучного воспроизведения приглушите плеер.
Как писать диалог в prompt для Omni?
Используйте задокументированную Google форму: говорящий, двоеточие, реплика, без кавычек. Указание по голосу идёт дальше обычной прозой, поскольку параметра голоса не существует, — акцент, возраст, регистр и темп приходят английским текстом. Держите реплики короткими, ставьте их рано, описывайте тон вместо просьбы об «emotional» подаче.
Сколько Gemini Omni держит липсинк?
invideo в обзоре, называющем тестируемую модель Gemini Omni Flash, а не 1.1, сообщает, что при одном говорящем липсинк держится примерно шесть-семь секунд, прежде чем разваливаться, и называет двух говорящих в одном кадре слабым местом, где модель теряет синхронизацию или неверно приписывает реплики. Это находка обозревателя на более ранней модели, а не спецификация Google, но она аргументирует в пользу одного говорящего на генерацию и коротких реплик, поставленных рано.
Может ли Gemini Omni 1.1 Flash сгенерировать сходство с реальным человеком?
Ненадёжно, и подумайте дважды, прежде чем пробовать. Документация Google говорит, что загрузка и редактирование изображений с определёнными узнаваемыми людьми не поддерживаются в ЕЭЗ, Швейцарии и Великобритании, а тестировщики сообщают об отказах на реальные названия брендов и на обычные правки персонажей. Помимо фильтра, права на изображение различаются по юрисдикциям и не отменяются тем, что материал синтетический.
Появляется ли водяной знак SynthID в каждом кадре и можно ли его удалить?
Каждое сгенерированное видео несёт SynthID, встроенный на этапе генерации, невидимый для зрителей и детектируемый программно. Ни один провайдер не выставляет переключатель, а метка переживает сжатие, кадрирование и изменения цвета, поэтому удаление — не тот процесс, на который можно рассчитывать. Если спецификация сдачи запрещает материалы с водяными знаками, решите это до рендера.
Дешевле ли итерировать по лицам на низком разрешении?
Да, существенно. Десять поисковых проходов в 360p плюс один финиш в 1080p стоят $1.73 на E2X против $5.40 за десять проходов в 1080p — на шестьдесят восемь процентов меньше за одну лишнюю генерацию. Черновые проходы несут достаточно разрешения для линии взгляда и мизансцены, но не для фактуры кожи или липсинка, поэтому закладывайте два полноразмерных дубля после закрытия чернового цикла.
Цены и условия продуктов меняются. Перед решением о покупке проверяйте актуальные цены у каждого провайдера.
Схемы и живые тарифы всех четырёх возможностей лежат на странице модели. Рядом: задокументированный синтаксис prompt, сколько на самом деле стоят сорокасекундные последовательности и где те же веса продают дороже.