Gemini Omni 1.1 Flash의 사실적인 인물: '아름다운'이라는 단어를 지우십시오
생성된 인물을 가짜로 보이게 만드는 가장 빠른 방법은 매력적인 사람을 요청하는 것입니다.
beautiful woman, perfect skin, flawless, stunning이라고 쓰시면 모델은 따릅니다. 그 캡션들이 사는 학습 데이터 영역, 즉 보정된 상업 사진을 끌어옵니다. 모공이 사라지고, 비대칭이 사라지고, 얼굴을 누군가가 들어차 있는 것으로 읽히게 만드는 작은 긴장들도 함께 사라집니다. 결과물에 잘못된 것은 없습니다. prompt가 뷰티 광고를 요청했고 그것을 받은 것입니다.
Google 자신의 prompt 지침은 한 문장으로 반대 방향을 가리킵니다. "인물과 환경에 대한 묘사에서 극도로 상세하십시오." 상세하라는 것이지 칭찬하라는 것이 아닙니다. 이 둘은 다른 지시이고 다른 얼굴을 만들어 냅니다. 이어지는 내용이 그 차이입니다. 얼굴, 손, 끌 수 없는 오디오, 그리고 Google이 여러분은 가면 안 된다고 결정한 곳입니다.

얼굴은 칭찬의 목록이 아니라 사실의 목록입니다
모든 형용사는 캡션 군집에 던지는 한 표이고, gorgeous는 스톡 사진에 표를 던집니다. 8k, hyperrealistic, masterpiece는 이미지 모델 민간 전승에서 왔고 거기서는 품질 토큰 노릇을 했습니다. 샘플링 파라미터가 없는 영상 모델에서 그것들은 여러분의 숏을 묘사하는 단어들과 경쟁할 뿐입니다. 대체어들은 구체적이고 지루한데, 바로 그것이 요점입니다:
나이는 숫자나 연대로. "A woman in her late forties"는 제약이지만 "a young woman"은 복권입니다.
이름 붙인 결함 하나. 도드라진 흉터, 이가 나간 앞니, 한 번 부러진 뒤 살짝 어긋나게 붙은 코. 하나면 충분하고, 셋이면 캐릭터 시트처럼 읽힙니다.
피부는 표면으로. 코와 뺨에 걸쳐 보이는 모공, 이마의 번들거림, 콧방울의 실핏줄. prompt에서 수익률이 가장 높은 치환입니다. "perfect skin"과 "visible pores across the nose"는 캡션 공간의 양 끝에 앉아 있습니다.
시선은 방향과 변화를 가지고. "looking at the camera"가 아니라 "reads something off frame to the right, then her eyes flick to the lens for about a second and away again"입니다. 클립 내내 끊기지 않는 눈맞춤은 거의 어떤 사람도 하지 않는 일이므로, 시선을 지정하지 않으면 시청자가 가장 먼저 읽는 바로 그것을 모델이 추측하게 됩니다.
타이밍을 준 미세 표정 하나. "The corner of her mouth tightens once." 연출된 사건이 "emotional"을 이깁니다. 모델은 사건을 연출할 수 있지만 추상을 연출할 수는 없기 때문입니다.
피부가 아닌 모든 것에 닳은 흔적을. 이백 번 빤 옷깃, 부드러워진 시곗줄, 서류에 남은 커피 자국. 의상은 얼굴보다 더 믿음직하게 사람을 팔아 줍니다.
그 교환을 구체적으로 보겠습니다. 먼저 스톡 사진이 눈 깜박이는 법을 배운 것처럼 보이는 판본입니다:
A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.
그 단어들 대부분은 사진을 묘사하고, 사람을 묘사하는 것은 하나도 없습니다. 다시 쓴 쪽은 숏을 유지하면서 모든 칭찬을 사실로 바꿉니다:
In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.
두 번째 판본에는 품질을 요청하는 것이 하나도 없습니다. 렌더링할 질감, 시선의 이유, 타이밍을 준 사건 하나를 공급합니다. 모델이 실행할 수 있는 세 가지이고, "stunning"은 실행할 수 없는 세 가지입니다. 맨 앞의 숏 개수 절도 눈여겨보십시오. prompting 가이드에서 다뤘듯 Omni는 기본적으로 여러 숏을 만들며, 6초 안에 두 번 컷하는 인물 숏은 얼굴을 붙들 수 없습니다.

눈에 대한 주의 하나. "wet eyes"와 "glossy tear film"은 기술 용어의 옷을 입은 품질 단어이며, 원인이 아니라 하이라이트에 이름을 붙입니다. 눈에 할 일을 주시고, 반사광은 이미 지정하신 빛에서 따라 나오게 두십시오.
손: 일거리를 주십시오
손은 생성 영상의 전통적인 망신거리이고 여전히 테이크를 끝장낼 가능성이 가장 큰 요소입니다. DeepMind의 모델 카드는 손을 따로 지목하지 않지만 그 범주에는 이름을 붙입니다. "편집 전반에 걸쳐 완전한 일관성을 유지하는 것, 복잡한 움직임이 있는 장면을 생성하는 것, 완벽하게 정확한 텍스트를 렌더링하는 것은 여전히 과제로 남아 있습니다." 손가락은 화면의 작은 조각 안에서 벌어지는 복잡한 움직임이며, 여러 방향으로 관절이 꺾이고 끊임없이 스스로를 가립니다.
해법은 직관에 어긋납니다. 손을 묘사하지 마시고 손에 과업을 배정하십시오. 명시된 쥐는 방식으로 구체적인 물건을 든 손에는 붙들 형태와 접촉점이 있습니다. "Beautiful, elegant hands"는 둘 다 공급하지 않으며 손가락 개수를 모델이 지어내도록 남겨 둡니다.
비교해 보십시오:
- 약함: her hands rest naturally at her sides
- 나음: she holds a chipped enamel mug in both hands, thumbs overlapping on the near side
- 약함: he gestures while speaking
- 나음: he turns a pen over in his right hand twice, then sets it down on the papers
각 짝의 두 번째 형태는 손가락 개수를 암묵적으로 고정하고, 움직임에 시작과 끝을 주며, 컷을 넣을 수 있는 비트를 만들어 냅니다.
이 글에 나오는 모든 제3자 수치를 규율하는 단서가 하나 있습니다. 저희가 찾을 수 있었던 공개된 실사용 리뷰는 둘 — invideo의 것과 2026년 5월 21일자 서명이 달린 JXP 팀의 멀티 턴 테스트 — 인데, 둘 다 테스트한 모델을 Gemini Omni Flash로 부르며 어느 글에도 1.1이라는 접미사는 나오지 않습니다. 어느 쪽도 이 글이 다루는 모델을 측정하지 않았습니다. 계열에 대한 증거로 읽으십시오. JXP는 바이올린 숏의 다섯 번째 편집 턴에서 *"그녀의 왼손이 지판에서 살짝 벗어났다"*고 보고합니다. 다른 모든 것이 아직 버티고 있는 동안 손이 먼저 무너졌습니다.
비용이 들지 않는 규칙 둘이 더 있습니다. 손을 하나의 초점면 안에 두십시오. 광각 렌즈 앞으로 내민 손은 요청하실 수 있는 것 중 가장 어렵습니다. 그리고 손을 얼굴에서 떨어뜨리십시오. 어려운 구조 둘 사이의 가림은 실패를 평균 내는 것이 아니라 곱하기 때문입니다.

의도하셨든 아니든 여러분은 목소리를 연출하고 계십니다
여기서 오디오는 네이티브입니다. 그림과 같은 패스에서 만들어지고, 어떤 파라미터로도 끌 수 없으며, 저희가 확인한 어떤 제공업체도 따로 청구하지 않습니다. 그러므로 소리에 대해 아무 말도 하지 않는 prompt는 침묵을 요청하는 것이 아닙니다. 감독 없는 브리프이고, 모델이 그것을 채웁니다.
그러니 오디오를 자기 몫의 문장에 의도적으로 쓰십시오. Google이 문서화한 대사 형식은 따옴표 없는 콜론입니다. the man says: We lost it이며, 따옴표가 립싱크 모드를 촉발한다는 널리 반복되는 주장은 어떤 Google 문서에도 나오지 않습니다.
말하는 숏이 성공하는지는 네 가지가 결정합니다:
대사 길이. invideo는 테스트한 모델을 Gemini Omni Flash로 부르는 리뷰에서 *"한 사람이 말하는 경우 립싱크는 약 6~7초까지 버티다가 무너지기 시작합니다"*라고 보고합니다. 사양이라기보다 방향이지만 한쪽을 가리킵니다. 네 단어에서 열두 단어 사이의 대사를 앞쪽에 놓고 그다음 침묵과 반응을 두는 편이, 테이크 길이만큼 이어지는 문장을 이깁니다.
화면에 화자 한 명. 같은 리뷰는 단도직입적입니다. "한 화면에 화자 둘은 여전히 약점입니다. Omni가 자주 싱크를 놓치거나 대사를 잘못 배정하므로, 오늘로서는 단일 화자 숏이 안전한 선택입니다." 두 번째 사람은 화면 가장자리의 초점 나간 어깨로 만드시고, 그의 대사는 별도의 생성으로 찍으십시오.
목소리 연출은 산문으로. 목소리 파라미터는 존재하지 않으므로 억양, 나이, 음역, 속도가 평범한 영어로 들어갑니다. tired, quiet, American accent, no rise at the end처럼요.
침묵은 명시적으로. No dialogue.나 No music.이라고 쓰십시오.
대사 숏의 전과 후입니다. 약한 판본은 위의 모든 실패를 한꺼번에 저지릅니다. 화면에 화자 둘, 따옴표, 각자 한 줄씩, 그리고 연출 자리를 대신 차지한 형용사들입니다:
A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.
다시 쓴 쪽은 화자 하나를 화면 밖으로 내보내고, 대사를 네 단어로 줄이고, 목소리를 칭찬하는 대신 묘사합니다:
In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.
그녀의 대답은 그녀를 잡은 두 번째 생성에 속합니다. 하나 대신 두 클립이고, 그래도 두 얼굴에 싱크가 한꺼번에 떨어지기를 바라며 투 숏을 여덟 번 다시 돌리는 것보다 쌉니다.
문서화된 경계가 하나 있습니다. 누군가 말하는 업로드된 영상을 가져와 새 대사로 확장하실 수 없습니다. 이는 없는 것이 아니라 보류된 것이고, 모델 카드가 그것을 분명히 말합니다. "영상 편집의 일부로 Gemini Omni Flash는 사람의 발화를 바꿀 수 있습니다. 당분간 저희는 이 기능을 제한하고 있으며, 그것을 어떻게 안전하고 책임 있게 사용자에게 제공할지 더 잘 이해하기 위해 작업하고 있습니다." 모델은 사람의 목소리를 다시 입힐 수 있지만 Google은 여러분이 그러면 안 된다고 결정했습니다. 더빙은 여기서 만드실 수 있는 제품이 아닙니다.
군중, 배경 인물, 그리고 돈을 쓰지 말아야 할 곳
배경 인물은 남는 주의만 받고, 보행자로 붐비는 거리는 일시정지 버튼을 견디지 못할 얼굴들의 행렬입니다. 숫자를 주십시오. "four people at scattered tables"가 "a crowded café"를 이깁니다. 막연한 수량은 근사치를 불러들이기 때문입니다. 그들을 초점면 밖에 두십시오. 얕은 50mm로 부드러워진 인물들은 믿을 만하지만, 같은 인물들이 f/11에서 선명하면 아슬아슬한 실패작들의 전시장이 됩니다. 그리고 각자에게 동작 하나씩, 등을 돌린 채로 주십시오. 뒤통수는 공짜입니다. 특정 배경 얼굴이 중요하다면 그것을 자기 몫의 숏으로 승격시키십시오.
테이크의 값, 그리고 4K가 중요한 숫자인 이유
얼굴은 생성 횟수를 태우는 곳입니다. 시선 때문에 다시 돌리고, 그다음 손 때문에, 그다음 목소리가 스무 살 어리게 나와서 다시 돌립니다. 이 작업의 값을 정직하게 매긴다는 것은 클립이 아니라 테이크의 값을 매긴다는 뜻입니다. 그리고 제공업체 간 격차는 사다리 꼭대기에서 가장 큽니다. 2026년 8월 29일 기준 4K 10초입니다:
| 어디서 부르는가 | 4K 10초 |
|---|---|
| E2X | 1.80달러 |
| fal | 3.00달러 |
| Google, 직접 | 3.04달러 |
| Runware | 3.20달러 |
| WaveSpeed | 3.90달러 |
Google의 수치는 정가가 아니라 공개된 초당 토큰 요율에서 나온 것이고, fal의 수치는 연산에 대한 독립적인 판단이 아니라 Google 정가를 그대로 넘긴 것입니다. 격차는 구조적입니다. 720p를 기준으로 Google은 4K에 세 배를 받고 저희는 두 배를 받습니다. 4K에서 41퍼센트 낮은 것이 저희 네 티어 중 가장 큰 격차이고, 8초 테이크는 여기서 1.44달러, 직접 부르면 2.43달러입니다. 나머지는 제공업체별 감사에 있습니다.
산수의 나머지 절반은 어디서 반복하시는가입니다. 360p 탐색 패스 열 번에 1080p 마무리 하나를 더하면 1.73달러로, 1080p로 곧장 열 번 도는 5.40달러에 대비됩니다. 생성 한 번을 더하는 것으로 68퍼센트 절감입니다. 드래프트 패스는 시선, 동선, 손이 머그를 찾았는지를 보기에 충분한 해상도를 갖지만 피부 질감이나 립싱크에는 충분하지 않으므로, 반복이 닫힌 뒤 풀 해상도 테이크 두 번을 예산에 넣으십시오. 그리고 그 숏에 이 모델이 필요한지 물으십시오. Veo 3.1 Fast는 여기서 초당 1센트이고, 이어 붙일 것이 없는 단일 인물 숏이라면 9배의 프리미엄이 사 주는 것은 매우 적습니다.
한계, 있는 그대로
면책 조항 섹션이 아닙니다. 아래의 모든 항목은 누군가의 프로젝트 계획을 바꿔 놓았습니다.
SynthID는 모든 프레임에 있고 스위치는 없습니다. Google의 표현은 이렇습니다. "생성된 모든 영상에는 SynthID 워터마크가 들어가며, 시청자에게는 보이지 않지만 출처 검증을 위해 프로그램으로 탐지할 수 있습니다." 어떤 제공업체도 토글을 열어 주지 않고, 그 표식은 재인코딩, 크롭, 색 변경을 견디도록 만들어졌으므로 "후반에서 벗겨 내겠다"는 계획이 아닙니다. 납품 계약이 워터마크가 있는 소재를 금지한다면 렌더링 전에 정리하십시오.
업로드된 영상 편집은 EEA, 스위스, 영국에서 쓸 수 없습니다. 이것이 여러분에게 얼마나 나쁜지를 결정하는 괄호까지 포함한 Google의 문장입니다. "업로드된 영상을 편집하거나 확장하는 기능은 현재 유럽 경제 지역(EEA), 스위스, 영국의 사용자에게는 제공되지 않습니다(모델이 생성한 영상을 편집하거나 확장하는 것은 지원됩니다)." 유럽 팀도 숏을 생성하고 자기 출력물을 확장할 수는 있습니다. 할 수 없는 것은 사용자가 업로드한 푸티지를 이어 가는 일입니다. 그 결과는 40초 장면 글에서 다뤘습니다. 여기서 늦게 발견했을 때 가장 값비싼 항목입니다.
특정 인물이 담긴 업로드는 거부됩니다. 같은 제약 섹션의 두 문장이 더 있고, 둘 다 그 지역들로 범위가 한정돼 있습니다. "미성년자가 포함된 이미지의 업로드와 편집은 유럽 경제 지역, 스위스, 영국에서 지원되지 않습니다", 그리고 "식별 가능한 특정 인물이 포함된 이미지의 업로드와 편집은 유럽 경제 지역, 스위스, 영국에서 지원되지 않습니다." 실제 거부 표면은 그 표현보다 넓어 보입니다. JXP는 같은 이전 세대 리뷰에서, 실제 브랜드를 지목한 prompt가 *"제출 단계에서 일반적인 정책 메시지와 함께 차단됐다"*고 보고하며, "평범한 성인 캐릭터를 열 살 늙게" 해 달라는 요청도 차단됐다고 전합니다. 거부가 일어나지 않는다는 데 기대는 파이프라인을 만드시면 안 됩니다.
실존 인물은 기술 문제이기 전에 법률 문제입니다. 실제 사람의 식별 가능한 초상을 동의 없이 만드는 것은 관할권마다 다른 인격권과 퍼블리시티권에 부딪히며, 결과물이 합성이라는 이유로 그 권리가 면제되지는 않습니다. 별도로 EU AI법 제50조의 투명성 의무가 2026년 8월 2일부터 적용됩니다. 배포자는 콘텐츠가 인공적으로 생성되거나 조작된 것임을 명확하게, 그리고 최초 노출 시점에 고지해야 합니다. SynthID는 기계가 읽을 수 있는 표시 요건에 답하지만, 보고 있는 사람에게 알릴 의무에는 답하지 않습니다. 이는 API 호출의 플래그가 아니라 법률 자문과 함께 내려야 할 표기 결정입니다.
생성된 얼굴은 사람이 아니지만, 누군가가 피해를 입을 만큼 사람에 가까이 앉을 수 있습니다. 동의, 고지, 그리고 그 숏을 만들지 않겠다는 의지는 초점 거리가 그러하듯 이 기술의 일부입니다.
자주 묻는 질문
Gemini Omni 1.1 Flash에서 사실적인 피부는 어떻게 얻습니까?
칭찬하는 대신 표면을 묘사하십시오. "Perfect skin", "flawless", "beautiful"은 보정된 상업 이미지를 선택하게 하고 질감을 납작하게 만듭니다. 그것들을 관찰 가능한 사실로 바꾸십시오. 코와 뺨에 걸쳐 보이는 모공, 이마의 번들거림, 작은 흉터이며 나이도 밝히십시오. Google은 극도로 상세한 인물 묘사를 요구하는데, 이는 매력적인 인물을 요구하는 것과 같지 않습니다.
AI 영상에서 손이 왜 이상해 보이고, prompt로 어떻게 고칩니까?
손가락은 작고 스스로를 가리는 영역에서 벌어지는 복잡한 움직임이고, Google의 모델 카드는 복잡한 움직임을 "여전히 과제로 남아 있는" 것으로 지목합니다. 손을 묘사하지 마시고 일거리를 주십시오. 쥐는 방식이 명시된 구체적인 물건, 또는 시작과 끝이 있는 동작입니다. 손은 하나의 초점면에, 얼굴에서 떨어뜨려 두십시오.
Gemini Omni 1.1 Flash에서 오디오를 끌 수 있습니까?
아닙니다. 오디오는 그림과 함께 네이티브로 생성되고, 어떤 파라미터로도 끌 수 없으며, 초당 요율과 별도로 청구되지도 않습니다. "Sound design:" 문장과 명시적인 "No dialogue." 또는 "No music." 절로 연출하실 수는 있지만 거절하실 수는 없습니다. 무음 재생이 필요하시면 플레이어를 음소거하십시오.
Omni prompt에서 대사는 어떻게 써야 합니까?
Google이 문서화한 형식을 쓰십시오. 화자, 콜론, 대사이며 따옴표는 없습니다. 목소리 파라미터가 존재하지 않으므로 목소리 연출은 평범한 산문으로 이어집니다. 억양, 나이, 음역, 속도가 모두 영어로 들어갑니다. 대사는 짧게 유지하시고, 앞쪽에 놓으시고, "emotional"한 연기를 요청하는 대신 톤을 묘사하십시오.
Gemini Omni는 립싱크를 얼마나 오래 유지합니까?
invideo는 테스트한 모델을 1.1이 아니라 Gemini Omni Flash로 부르는 리뷰에서, 한 사람이 말할 때 립싱크가 약 6~7초까지 버티다가 무너진다고 보고하며, 한 화면의 화자 둘을 모델이 싱크를 놓치거나 대사를 잘못 배정하는 약점으로 부릅니다. Google의 사양이 아니라 이전 모델에 대한 리뷰어의 발견이지만, 생성당 화자 한 명과 앞쪽에 놓인 짧은 대사를 뒷받침합니다.
Gemini Omni 1.1 Flash로 실존 인물의 초상을 생성할 수 있습니까?
믿을 만하게는 아니며, 시도하시기 전에 깊이 생각하십시오. Google 문서는 식별 가능한 특정 인물이 포함된 이미지의 업로드와 편집이 EEA, 스위스, 영국에서 지원되지 않는다고 말하고, 테스터들은 실제 브랜드명과 평범한 캐릭터 편집에서도 거부를 보고합니다. 필터를 넘어서, 초상권은 관할권마다 다르며 푸티지가 합성이라는 이유로 면제되지 않습니다.
SynthID 워터마크는 모든 프레임에 들어가고, 제거할 수 있습니까?
생성된 모든 영상은 생성 시점에 심긴 SynthID를 지니며, 시청자에게는 보이지 않고 프로그램으로 탐지할 수 있습니다. 어떤 제공업체도 스위치를 열어 주지 않고, 그 표식은 압축, 크롭, 색 변경을 견디므로 제거는 계획에 넣으실 수 있는 작업 흐름이 아닙니다. 납품 사양이 워터마크가 있는 소재를 금지한다면 렌더링 전에 정리하십시오.
얼굴 작업의 반복은 낮은 해상도에서 하는 편이 쌉니까?
예, 상당히 그렇습니다. 360p 탐색 패스 열 번에 1080p 마무리 하나를 더하면 E2X에서 1.73달러이고, 1080p로 열 번 도는 5.40달러에 대비됩니다. 생성 한 번을 더하는 것으로 68퍼센트 절감입니다. 드래프트 패스는 시선과 동선에는 충분한 해상도를 갖지만 피부 질감이나 립싱크에는 아니므로, 드래프트 반복이 닫힌 뒤 풀 해상도 테이크 두 번을 계획하십시오.
가격과 제품 약관은 바뀝니다. 구매를 결정하시기 전에 각 제공자의 현재 가격을 확인하십시오.
네 가지 기능 전부의 스키마와 실시간 요율은 모델 페이지에 있습니다. 옆에는 문서화된 prompt 문법, 40초 시퀀스가 실제로 얼마인지, 그리고 같은 가중치가 더 비싸게 팔리는 곳이 있습니다.