Gemini Omni prompting: Google이 문서화했지만 아무도 인용하지 않는 태그 문법
이번 주에 나온 Omni prompting 조언은 대부분 지어낸 것입니다.
여섯 개 남짓의 가이드가 인용하는 "Google 공식 문서의 다섯 요소 프레임워크"는 저희가 찾을 수 있는 어떤 Google 페이지에도 없고, 그것을 인용하는 가이드들끼리도 요소가 다섯인지 여섯인지 의견이 갈립니다. 대사를 따옴표로 감싸면 모델이 립싱크 모드로 전환된다는 주장 역시 어떤 Google 문서에도 없습니다. Google의 예시에서 따옴표는 화면에 렌더링되는 텍스트에만 나옵니다.
Google이 실제로 문서화한 것은 더 쓸모 있고 거의 아무도 정리한 적이 없습니다. 하나의 prompt가 특정 이미지와 클립을 이름으로 지목하게 해 주는 태그 문법입니다. 이 가이드는 거기서 시작합니다.

이어지는 내용에 대한 두 가지 참고
여기 인용된 모든 것은 Google 자신의 페이지에서 온 것입니다. Gemini Omni API 문서의 prompt 가이드 섹션, 그리고 Omni와 Veo를 함께 다루는 공용 prompting 가이드입니다. Google이 침묵하는 지점에서는 권위 있게 들리는 무언가로 빈칸을 채우는 대신 그렇다고 말씀드립니다.
아래 클립들은 Omni가 아니라 저희 API에서 Veo 3.1 Fast로 생성했습니다. Gemini Omni 1.1 Flash는 아직 E2X에 없고, 저희는 한 모델의 영상으로 가이드를 예시하면서 다른 모델에서 나온 척할 생각이 없습니다. 이 클립들이 보여 주는 기법 — 카메라 어휘, 단일 숏 지시, 사운드 연출 — 은 Google이 두 모델 모두를 위해 공개하는 prompt 가이드에서 나온 것이므로 그대로 옮겨 갑니다. 다음 섹션의 태그 문법은 그렇지 않습니다. 그 부분은 Omni 전용이고, 그래서 결과물이 아니라 문법으로 보여 드립니다.
태그 문법
Omni는 특정 입력을 가리키는 인라인 태그를 받습니다. 문서에서 제3자 설명이 가장 적으면서 읽어서 얻을 것이 가장 많은 부분입니다.
프레임의 경우:
<FIRST_FRAME> a woman is walking
<LAST_FRAME>은 도착할 프레임을 표시하며, Google은 이것이 <FIRST_FRAME>과 *"함께 사용되어야 한다"*고 명시합니다. prompt가 복잡해져 위치가 모호해질 때를 위해 명시적인 선언 형식이 있습니다:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image2]
두 태그를 같은 이미지로 가리키면 루프가 됩니다. Google이 직접 문서화한 내용으로, 클립은 시작한 곳으로 되돌아옵니다:
[# Sources <FIRST_FRAME>@Image1 <LAST_FRAME>@Image1]
레퍼런스의 경우 태그에 번호가 붙고 0부터 시작합니다:
in the style of <IMAGE_REF_0> a woman <IMAGE_REF_1> is walking
이 한 줄이 한 이미지에서 스타일을, 다른 이미지에서 피사체를 끌어옵니다. 영상 쪽 대응물은 <VIDEO_REF_0>이고 역시 0부터 시작하며, 확고한 한도가 있습니다. *"영상 레퍼런스는 최대 3개 클립, 각 최대 3초를 지원합니다"*이고, 레퍼런스 클립에 담긴 오디오는 무시됩니다.
여기서의 실패 양상은 모델이 레퍼런스를 문자 그대로의 첫 프레임으로 다루는 것입니다. Google의 해법은 prompt 뒤에 덧붙이는 지시문입니다:
Use the given image(s) as references for video generation.
The images should not be used as literal initial frames.
설계에 들어가기 전에 알아 둘 만한 경계가 하나 있습니다. "여러 영상에 걸친 참조나 추론은 지원되지 않습니다." 다중 이미지 레퍼런스는 괜찮고 — Google 자신의 예시는 여섯 개를 씁니다 — 다중 영상 prompting은 성능이 떨어집니다.
Omni는 막지 않으면 클립을 여러 숏으로 자릅니다
문서에서 가장 놀라운 한 줄이고, 혼란스러운 결과물을 많이 설명해 줍니다.
"기본적으로 Omni Flash는 몇 개의 서로 다른 숏으로 영상을 만들려 시도합니다. prompt를 바탕으로 흥미로운 내러티브를 짜려고 합니다. 출력 영상이 단일 장면을 담아야 한다면, 그렇게 되도록 직접 prompt로 요청해야 합니다"
어떤 사람이 문간을 지나가는 8초를 요청하시면 그것을 세 컷으로 받으실 수도 있습니다. 모델이 여러분을 잘못 읽은 것이 아닙니다. 기본값대로 하고 있는 것입니다.
해법은 절 하나이며, Google은 세 가지 표현을 제시합니다. "In a single unbroken scene", "In a single continuous shot", 또는 *"No scene cuts"*입니다.
문서화된 카메라 무빙 하나와 사운드 한 줄을 붙여, 그 지시문이 제 일을 하는 모습입니다:
In a single continuous shot, no scene cuts. Slow dolly in on a battered
enamel coffee pot sitting on a cast-iron stove in a dim cabin kitchen.
Steam rises and catches a hard shaft of morning light from a window to the
left. Medium shot, shallow depth of field, warm amber and deep green
palette. Sound design: the low hiss of steam and a wood fire ticking.
No dialogue.
4초, 720p, 초당 1센트에 Veo 3.1 Fast로 생성했습니다. 저 prompt에서 형용사는 얼마나 적고 모델이 실행할 수 있는 지시는 얼마나 많은지 보십시오.
소리는 자기 몫의 문장으로 연출합니다
오디오는 그림과 함께 생성되며, Google의 지침은 그것을 따로 묘사하라는 것입니다. "prompt에서 오디오를 묘사할 때는 별도의 문장을 쓰시기를 권장합니다." 문서는 이를 셋으로 나눕니다. 음향 효과, 주변음, 대사이며, 각각에 별도의 예시가 있습니다.
민간 전승이 틀린 곳은 대사입니다. 문서화된 관행은 콜론이고 따옴표는 없습니다:
the man in the red hat says: Where is the rabbit?
Google의 더 긴 예시는 하나의 prompt에서 두 화자를 돌리고 주변음으로 마무리합니다:
A medium shot in a dimly lit interrogation room. The seasoned detective
says: Your story has holes. The nervous informant, sweating under a single
bare bulb, replies: I'm telling you everything I know. The only other
sounds are the slow, rhythmic ticking of a wall clock and the faint sound
of rain against the window
Omni 자체 예시들은 말이 아닌 오디오 앞에 Sound design:을 붙입니다. *"Sound design: Gentle breeze, distant bird chirps. No dialogue."*처럼요. 그리고 음악을 특별히 원하실 때는 그렇게 말씀하십시오. Google은 이것을 가장 놓치기 쉬운 경우로 짚습니다. "영상에 음악을 넣고 싶다면 이것이 특히 중요합니다".
설계할 때 감안할 제약 둘. 음성 편집은 지원되지 않으며, "현재 버전의 API에서는 오디오 레퍼런스 업로드가 지원되지 않습니다". 소리는 말로 연출하시거나 아예 하지 않으시거나입니다.
타임코드는 작동하고, 확장하면 기준이 바뀝니다
타이밍에는 특별한 문법이 필요 없습니다. *"정확한 문법이 필요하지 않으며 자연어를 쓰실 수 있습니다"*이므로 *"At 5s the chorus starts in the background audio"*도 유효한 지시입니다. 대괄호 타임코드 형식도 있습니다:
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
이제 함정이고, 진짜 함정입니다. 기존 클립을 확장하실 때 0s는 더 이상 영상의 시작을 뜻하지 않습니다. 확장분의 시작을 뜻합니다. Google은 이를 명시합니다.
"타임스탬프나 타임코드 문법을 사용하는 경우, 0s는 영상에서 확장된 부분의 시작을 가리킵니다. 10초 영상을 확장한다면 이 prompt의 장면 전환은 12초 후에 일어납니다"
그러므로 After 2s cut to a new scene은 완성본의 12초 지점에 떨어집니다. 절대 타임코드로 숏 리스트를 짜는 사람은 이걸 한 번 틀리고 다시는 틀리지 않게 됩니다.
이참에 하나 더. 확장 prompt는 장면 전체를 다시 기술하지 말고 이어지는 부분을 묘사해야 합니다. Google이 제안하는 형태는 *"Extend this video"*나 *"The scene continues"*만큼 짧고, 무언가 달라지는 곳에만 덧붙입니다. 오디오라면 "The music continues into the chorus", 컷이라면 "Show the same characters in the next scene" 같은 식입니다. 확장은 뒤에 붙이기만 합니다. 앞에 붙이거나 중간에 끼워 넣으실 수는 없습니다.

편집은 더 많은 말이 아니라 더 적은 말을 원합니다
위의 모든 것은 디테일에 보상을 줍니다. 편집은 그것을 뒤집습니다. "영상 편집에는 단순한 prompt가 가장 잘 작동합니다. 지나치게 묘사적인 prompt는 의도치 않은 변경으로 이어질 수 있습니다."
Google은 자체 before-and-after 쌍을 공개하는데, 두 개의 예시가 아니라 하나의 패턴으로 읽을 만합니다:
Avoid: In the video of the man sitting on the sofa, please add a small
black cat that runs from the right side of the screen, jumps onto
his lap, and then he starts to stroke its head while looking down.
Simplify: Add a cat that jumps onto his lap, he begins to pet it.
Keep everything else the same.
Avoid: Please remove the cell phone that the person is holding in their
hand and fill in the background so it looks like they are just
holding their hand empty.
Simplify: Make the phone invisible. Keep everything else the same.
둘 다에서 일하고 있는 절은 **"Keep everything else the same"**이며, Google은 숏의 한 측면을 편집하실 때마다 이것을 넣기를 권합니다. 여러분이 덧붙이는 모든 추가 디테일은 모델이 다시 생성하기로 결정할 수 있는 대상이 하나 더 생기는 일입니다.
image-to-video는 또 반대로 갑니다. "'움직이게 해 줘' 같은 막연한 prompt는 카메라 움직임, 피사체 동작, 환경 효과를 자세히 묘사한 것보다 덜 설득력 있는 결과를 냅니다." 생성에는 디테일, 편집에는 간결함입니다.
Google이 실제로 이름 붙인 카메라 용어들
Google은 어휘 목록을 공개하는데, prompt 팁 스레드에서 도는 용어들보다 믿을 만합니다. 이름 붙인 무빙: 스태틱, 팬, 틸트, 달리 인과 아웃, 트럭 좌우, 페데스탈 업다운, 줌, 크레인, 항공 또는 드론, 핸드헬드, 휩 팬, 아크. 앵글: 아이레벨, 로우, 하이, 버즈아이, 웜즈아이, 더치, 클로즈업과 익스트림 클로즈업, 미디엄, 풀, 와이드 또는 설정 숏, 오버 더 숄더, 시점 숏. 광학 효과: 광각, 망원, 얕은 심도와 깊은 심도, 렌즈 플레어, 랙 포커스, 어안, 그리고 현기증 효과 — 달리 줌입니다.
Google은 줌과 달리를 명시적으로 구분하기도 하는데, 모델들이 둘을 혼동하기 때문입니다. 줌은 초점 거리를 바꾸며, "이것은 카메라 자체가 움직이지 않는다는 점에서 달리와 다릅니다."
다만 Google이 두 번 언급하는 단서는 함께 가져가십시오. "일부 고급 카메라 앵글은 공식적으로 지원되지 않습니다. 결과와 신뢰도는 전체 prompt와 구체적인 사용 사례에 따라 달라질 수 있습니다." 무빙에 이름을 붙이는 것은 요청이지 보장이 아닙니다.
문서화된 무빙 중 하나인 아크 숏을 평범하게 요청한 예입니다:
Slow arc shot travelling left around a weathered brass sextant resting on
an unrolled nautical chart on a scuffed wooden table. Low winter sunlight
rakes in from the right and the brass catches moving highlights as the
camera travels. Single continuous shot, no scene cuts, shallow depth of
field. Sound design: faint harbour ambience, rigging tapping in wind.
No dialogue.
영화적 용어와 편집 용어도 문서화돼 있습니다. 매치 컷, 점프 컷, 설정 숏 시퀀스, 몽타주, 스플릿 디옵터 효과. Google에서 나왔다고 알려진 것을 보셨을 수 있지만 두 페이지 어디에도 없는 용어들: oner, push in, natural smartphone zoom입니다.
네거티브 prompt: Google의 두 페이지가 서로 어긋납니다
Omni에는 네거티브 prompt 파라미터가 없습니다. API 문서는 단도직입적입니다. "시스템 지시, temperature, top_p, 정지 시퀀스, 네거티브 prompt는 지원되지 않습니다(네거티브는 일반 prompt에 넣으실 수 있습니다. 예: 'Do not do X')."
그리고 Omni prompt 가이드는 바로 그것을 권하며 "No dialogue", "No embellishments", *"No extra sound effects"*를 제안합니다.
Google의 Omni와 Veo 공용 가이드는 표현에 관해 정반대를 말합니다.
"권장하지 않음: 'no'나 'don't' 같은 지시형 표현이나 단어를 사용하는 것. 예를 들어 'no walls'나 'don't show walls' 같은 prompt는 피하십시오. 권장: 보고 싶지 않은 것을 묘사하십시오. 예를 들어 'wall, frame'"
저희는 이것을 해결한 척하지 않겠습니다. 가장 그럴듯한 설명은 두 번째 페이지가 Omni에는 없는 Veo의 전용 negativePrompt 필드를 설명하고 있고, Omni 페이지는 Omni가 제공하는 전부인 산문형 네거티브를 설명하고 있다는 것입니다. 이는 추론이지 Google이 명시한 내용이 아닙니다. 실무에서는 Omni에는 Omni 페이지의 표현을 쓰시고, 네거티브가 무시되는 것 같으면 모델이 못 한다고 단정하기 전에 다른 형식을 시도해 보십시오.
고객에게 무엇을 약속하실 수 있는지에 영향을 주므로 정직한 모순 하나를 더 짚습니다. Omni prompt 가이드는 모델이 화면 내 텍스트를 "정확하고 읽을 수 있는 방식으로" 렌더링한다고 말합니다. DeepMind 모델 카드는 *"완벽하게 정확한 텍스트를 렌더링하는 것"*을 "여전히 과제로 남아 있는" 것들 중에 넣습니다. 둘 다 Google입니다. 약속하시기 전에 테스트하십시오.
실제로 쓰실 수 있는 체크리스트
위의 내용을 정리하면, 모델의 실제 동작을 존중하는 prompt는 대개 이런 것들을 담습니다:
- 숏 개수 지시. 멀티 숏이 기본값이고 아마 여러분이 원하는 것이 아니기 때문입니다
- 피사체와 그 움직임을 구체적으로. "움직이게 해 줘"가 아니라
- Google 목록에서 이름을 가져온, 문서화된 카메라 무빙 하나
- 빛: 방향, 성질, 색
- 소리를 위한 별도 문장. 대사가 아니라면
Sound design:을 앞에 붙여서 - 대사는
speaker says: line으로, 콜론, 따옴표 없이 - 네거티브는 짧은 산문 절로 끝에
- 편집일 때만: 위의 대부분을 걷어내고 "Keep everything else the same"를 붙이기
Google 자신의 구조 요약은 더 깁니다. 피사체, 동작, 장면, 카메라 앵글, 카메라 무빙, 렌즈, 시각 스타일, 시간 요소, 오디오, 영화적 용어, 네거티브이며, *"모든 prompt에서 모든 요소를 쓰실 필요는 없습니다"*라는 안심시키는 말이 붙습니다.
오늘 이것을 어디서 돌릴까
prompting은 거듭 실패하면서 익히는 기술이고, 그래서 가장 중요한 숫자는 실패 한 번의 값입니다. Veo 3.1 Fast에서 4초짜리 테스트는 4센트입니다. 2026년 8월 28일부터 여기서 쓸 수 있고 초당 9센트인 Gemini Omni 1.1 Flash에서 같은 테스트는 36센트, 360p로 먼저 드래프트하면 약 12센트입니다. 바로 이 용도로 1.1 릴리스가 더한 티어가 그 360p입니다. 카메라 지시가 어디서부터 지켜지지 않는지를 배우며 보내는 한나절 동안, 그 차이가 여러분이 몇 번이나 틀려 볼 수 있는지를 결정합니다.
그러니 옮겨 갈 수 있는 절반은 값싸게 익히십시오. 숏 개수, 카메라 어휘, 사운드 연출, 네거티브이며, 모두 Google이 두 모델 모두를 위해 공개하는 가이드에서 나온 것들입니다. 위의 두 클립도 정확히 그렇게 만들었습니다. Omni 계열로 올라가시는 것은 그것만 할 수 있는 것이 필요할 때입니다. 태그 문법, 확장, 그리고 레퍼런스 기반 일관성입니다. 이 가이드가 가장 많은 분량을 쓴 프레임 태그에 대해 하나 덧붙이면, 이제 그것만을 위한 엔드포인트 start-end-frame-to-video가 있고 두 프레임을 태그가 아니라 필드로 받습니다. image-to-video도 시작 정지 이미지 한 장에 대해 같은 일을 합니다. 그 과정에서도 Veo 3.1 Fast가 image-to-video와 첫 프레임과 마지막 프레임 연습을 여전히 다뤄 줍니다. 요율은 2026년 8월 28일 기준입니다.
저희는 1.1에서 무엇이 나왔는지와 리더보드가 그것에 대해 실제로 무엇을 말하는지를 따로 정리했습니다. 작업별로는 text-to-video에서 둘러보시고, 산문보다 파라미터를 비교하고 싶으시다면 기계가 읽을 수 있는 스펙을 읽으십시오.
가격과 제품 약관은 바뀔 수 있습니다. 구매를 결정하시기 전에 각 제공자의 현재 가격을 확인하십시오.
자주 묻는 질문
Gemini Omni 1.1 Flash용 prompt는 어떻게 씁니까?
숏 개수를 먼저 밝히십시오. Omni는 기본적으로 여러 숏을 만들어 내는데 보통은 하나를 원하시기 때문입니다. 그다음 피사체와 그 움직임, 이름 붙인 카메라 무빙 하나, 그리고 조명을 묘사하십시오. 오디오는 자기 몫의 문장에 넣고 말이 아닌 소리에는 "Sound design:"을 앞에 붙이며, 대사는 콜론을 쓰고 따옴표 없이 "speaker says: line"으로 쓰십시오. 네거티브는 짧은 절로 끝에 더하십시오.
Gemini Omni의 FIRST_FRAME 태그란 무엇입니까?
제공된 이미지를 첫 프레임으로 쓰라고 Omni에 알려 주는 인라인 태그이며, 태그 뒤에 묘사를 이어 씁니다. 짝이 되는 LAST_FRAME은 끝낼 프레임을 표시하고, Google 문서에 따르면 FIRST_FRAME과 함께 사용되어야 합니다. 두 태그를 같은 이미지로 가리키면 루프 클립이 만들어집니다.
Gemini Omni는 네거티브 prompt를 지원합니까?
파라미터로는 아닙니다. Google의 API 문서는 네거티브 prompt가 지원되지 않는다고 명시하며, 대신 "Do not do X"처럼 네거티브를 일반 prompt에 넣으라고 안내합니다. Omni prompt 가이드는 "No dialogue"나 "No extra sound effects" 같은 짧은 절을 제안합니다. Google의 Omni와 Veo 공용 가이드는 그 표현을 권하지 않는데, 이는 Omni가 아니라 Veo의 별도 네거티브 prompt 필드를 설명하는 것으로 보입니다.
Gemini Omni가 요청하지도 않은 장면 전환을 넣는 이유는 무엇입니까?
여러 숏이 기본값이기 때문입니다. Google 문서는 Omni가 달리 지시하지 않는 한 여러 숏으로 영상을 만들고 여러분의 prompt에서 내러티브를 짜려 한다고 말합니다. prompt에 "In a single continuous shot"이나 "No scene cuts"를 넣는 것이 문서화된 해법입니다.
Omni 영상을 확장할 때 타임스탬프는 어떻게 작동합니까?
기준이 바뀝니다. 클립을 확장하고 나면 0s는 원본의 시작이 아니라 확장분의 시작을 가리킵니다. Google의 예시로는, 10초 영상을 2s 지시와 함께 확장하면 그 순간은 완성본의 12초에 놓입니다. 확장은 뒤에 붙이기만 합니다. 앞에 내용을 붙이거나 클립 중간을 편집하실 수는 없습니다.
Gemini Omni에서 대사는 따옴표 안에 넣어야 합니까?
아닙니다. Google이 문서화한 형식은 "speaker says: line"이며, 콜론을 쓰고 따옴표는 없습니다. 따옴표가 립싱크 모드를 촉발한다는 널리 반복되는 주장은 어떤 Google 문서에도 나오지 않습니다. Google의 예시에서 따옴표는 화면에 렌더링될 텍스트에만 등장하는데, 혼동은 아마 거기서 시작됐을 것입니다.
Omni prompting을 연습하는 데 비용이 얼마나 듭니까?
저희 API에서 Gemini Omni 1.1 Flash는 720p 기준 초당 0.09달러이므로 2026년 8월 28일 기준 4초짜리 테스트가 0.36달러, 360p로 드래프트하면 약 0.12달러입니다. Veo 3.1 Fast는 초당 0.01달러라 같은 테스트가 4센트입니다. 카메라, 숏 개수, 오디오 기법은 Google이 두 모델 모두를 위해 공개하는 prompt 가이드에서 나온 것이므로, 더 싼 쪽에서 연습하면 비용은 9분의 1이면서 같은 습관을 익히게 됩니다.