Nano Banana 모델이 실제로 따르는 prompt 쓰는 법
prompt 가이드 대부분은 형용사 목록입니다. 형용사는 prompt에서 가장 덜 중요한 부분입니다.
저희는 Nano Banana 네 모델을 전부 하나의 API 뒤에서 돌리고 있고, prompt가 실패하는 방식은 적어 둘 수 있을 만큼 일관됩니다. 품질 형용사에 마흔 단어를 쓰고 빛에 두 단어를 씁니다. Pro 길이의 구성 브리프를 가장 싼 티어에 쏩니다. 장면 전체를 다시 묘사하는 편집 요청이 다른 그림이 되어 돌아옵니다. 이 중 어느 것도 모델 문제가 아닙니다. 글쓰기 문제이고, 글쓰기 문제에는 해법이 있습니다.

매체, 피사체, 빛, 프레임 — 이 순서로
prompt는 전체로 읽히지만, 앞쪽 절이 뒤쪽 절보다 더 많은 일을 합니다. 문장의 나머지가 살아야 할 공간을 앞쪽이 정해 주기 때문입니다. "아름다운 여성"으로 여시면 모델은 자기가 사진을 만드는지 유화를 만드는지 3D 렌더를 만드는지 추측해야 하고, 여러분의 다른 단어들이 통계적으로 암시하는 쪽으로 추측할 겁니다. "35mm 에디토리얼 사진"으로 여시면 이어지는 모든 결정이 이미 하나의 매체로 좁혀집니다.
그래서 순서는 이렇습니다.
- 매체. 나무에서 가장 큰 갈림길입니다. 사진, 아이소메트릭 렌더, 플랫 벡터 일러스트, 과슈 회화, 매크로 제품 컷. 하나를 고르시고 첫 네 단어 안에 지목하십시오.
- 피사체. 범주가 아니라 구체적인 그것입니다. "카페 테이블의 여성"은 스톡 사진입니다. "오십 대 여성, 두 손으로 흰 컵을 감싸 쥔"은 그림입니다.
- 빛. 방향, 성질, 색. 이 한 문장이 다른 무엇보다 결과를 크게 움직이는데, 거의 아무도 쓰지 않습니다.
- 프레임. 카메라 높이, 거리, 크롭, 피사계 심도, 그리고 빈 공간이 어디로 가는지.
같은 요청을 못 쓴 것과 제대로 쓴 것입니다.
커피숍의 아름다운 여성, 매우 디테일함, 8k, 마스터피스,
아트스테이션 인기작, 초사실적, 프로페셔널 사진, 수상작,
선명한 초점, 보케
35mm 에디토리얼 사진. 오십 대 여성이 대리석 카페 테이블에 혼자 앉아
두 손으로 흰 컵을 감싸 쥔 채 화면 왼쪽 바깥을 바라본다. 그녀 뒤쪽
창으로 들어오는 낮은 겨울 햇빛이 머리카락 윤곽을 훑고 바깥 거리를
하얗게 날린다. 옆 테이블에서 앉은 눈높이로, 허리 위까지, 얕은 피사계
심도, 배경은 부드러운 회색으로 떨어진다.
무엇이 바뀌었는가. 매체가 앞으로 왔고, 피사체가 구체적인 몸짓 하나를 얻었고, 빛이 방향과 색온도를 얻었고, 카메라가 위치를 얻었습니다. 품질에 관해서는 아무것도 더하지 않았습니다. 두 번째 prompt는 막연한 의미에서 더 디테일한 것이 아니라, 더 결정된 것입니다.
그리고 "매우 디테일함, 8k, 마스터피스" 쓰기를 그만두십시오. 이 모델들에서는 아무 일도 하지 않습니다. 그 토큰들은 2022년 Stable Diffusion prompt 문화에서 온 화물이고, 거기서는 훨씬 작은 모델을 학습 데이터의 특정 조각 쪽으로 밀어 주었습니다. Gemini 세대 모델은 그것에 반응하지 않으며, 하나하나가 빛이 어디서 오는지를 묘사하는 데 쓰실 수 있었던 예산입니다.

빈 공간은 여러분이 차지하지 않으면 채워집니다
이 모델들은 무언가를 비워 두지 않습니다. 머그를 묘사하고 그 주변에 대해 아무 말도 하지 않으시면, 이미지에는 그래도 주변이 담기고, 그것은 머그 사진에 보통 담기는 무엇이 됩니다. 나무 테이블, 리넨 냅킨, 어떤 식물 가지 하나, 초점이 나간 창, 그리고 대략 40% 확률로 머그에 인쇄된 단어 하나입니다.
저희가 가장 자주 듣는 불만이고, 품질 문제가 아닙니다. 하지 말라고 아무도 말하지 않았을 뿐입니다.
테이블 위 세라믹 머그, 제품 컷
유약을 입히지 않은 석기 머그 한 점의 매크로 제품 사진, 무광 오트밀
빛깔의 몸체, 손때가 밴 손잡이, 이음매 없는 중간 회색 스위프 정중앙에
서 있다. 왼쪽 위에서 들어오는 크고 부드러운 광원, 오른쪽 아래로
떨어지는 은은한 그림자 하나. 머그에 텍스트 없음, 로고 없음, 다른
오브젝트 없음, 손 없음, 소품 없음, 배경 디테일 없음.
저 고쳐 쓴 것의 마지막 문장이 앞의 세 문장을 합친 것보다 많은 일을 하고 있습니다. 배제 항목은 prompt 끝에 나머지와 같은 어조로 평범한 목록으로 쓰십시오. "텍스트 없음, 로고 없음, 인물 없음, 잡동사니 없음"이 파일에서 가장 값진 줄인 경우가 많습니다. 그리고 나중에 진짜 활자가 얹힐 이미지라면 그건 선택이 아닙니다.
합성하실 계획인 무엇에든 이건 평소보다 더 중요합니다. 없던 로즈메리 가지가 들어앉은 생성 배경은 여러분이 mask해야 하는 배경입니다.

실제로 호출하시는 티어에 맞춰 쓰십시오
네 모델은 받는 prompt 양이 다르고, 원하는 prompt의 형태도 다릅니다. 천장은 사람들이 예상하는 곳에 있지 않습니다.
| 모델 | prompt 천장 | 원하는 것 |
|---|---|---|
| Nano Banana 2 Lite | 32,000자 | 짧게, 피사체 하나, 평평한 절 구조 |
| Nano Banana 2 | 20,000자 | 중간 길이, 관련된 요소 두셋을 감당 |
| Nano Banana Pro | 50,000자 | 공간 관계가 담긴 긴 구성 브리프 |
| Nano Banana (레거시) | — | 2026년 10월 2일 퇴역, 튜닝 말고 마이그레이션 |
Nano Banana 2는 가격이 중간에 앉아 있으면서도 현행 세 티어 중 천장이 가장 낮습니다. 처음 보면 다들 놀랍니다.
다만 천장이 진짜 제약은 아닙니다. Lite는 lite 모델이고, 긴 prompt는 거기서 특정한 방식으로 실패합니다. 첫 절과 마지막 절을 지키고 가운데를 조용히 버립니다. 중첩된 조건("테이블이 있는 방, 그 위에 그릇이 있고, 그 안에 배가 세 개 있으며, 그중 하나는 멍이 들어 있다")은 배가 통째로 빠진 채 돌아옵니다. Lite에는 평평한 문장을 쓰십시오. 피사체 하나, 배경 하나, 광원 하나, 배제 목록 하나입니다.
황금빛 시간대 현대식 개방형 사무실의 아이소메트릭 3D 렌더, 스탠딩
데스크에 선 뚜렷이 구분되는 직원 열네 명, 왼쪽에 화이트보드가 놓인
유리벽 회의실, 구석마다 떡갈잎고무나무 화분, 뒷벽을 따라 바리스타가
있는 커피 바, 위쪽에 노출된 덕트, 창을 반사하는 폴리싱 콘크리트
바닥, 그리고 앞에서 세 번째 책상 위에 잠든 고양이
황금빛 시간대 개방형 사무실의 아이소메트릭 3D 렌더. 줄지어 늘어선
스탠딩 데스크, 왼쪽의 유리벽 회의실, 높은 창이 폴리싱 콘크리트
바닥을 가로질러 길고 따뜻한 빛을 던진다. 절제된 색조, 깔끔한 기하.
텍스트 없음, 사인물 없음, 인물 없음.
첫 번째 prompt가 틀린 게 아닙니다. Lite에게 틀린 겁니다. Pro로 보내시면 직원 열네 명도, 덕트도, 고양이도 다 도착합니다. Lite로 보내시면 사무실 하나와 창 하나, 그리고 $0.0238짜리 청구서를 받으십니다.
반대 방향으로도 쓸모 있는 조언이 됩니다. prompt가 예순 단어 아래이고 피사체가 하나라면, Pro는 30초의 대기와 대략 세 배의 비용 말고는 아무것도 사 주지 않습니다. 사람들이 생성하는 것의 대부분은 Lite 작업입니다. 자리 채우기용 배경에 최상위 티어를 파느니 그 말씀을 드리는 편을 택하겠습니다. 어느 작업에 어느 티어인지의 완전한 분해는 Nano Banana 네 모델 비교에 따로 정리했습니다.
Aspect ratio는 크롭이 아니라 구성 지시입니다
문장을 쓰기 전에 형태를 정하십시오. 형태가 문장이 무엇을 말해야 하는지를 바꾸기 때문입니다. 21:9 배너는 지평선과 중심에서 밀려난 피사체를 원합니다. 9:16 스토리는 수직으로 쌓인 구성과 머리 위 여백을 원합니다. 정사각형용 prompt를 써서 와이드로 렌더링하시면 양옆에 패딩이 붙은 정사각형 구성을 얻고, 딱 그렇게 보입니다.
구성을 prompt 안에서 소리 내어 말하십시오. "지평선은 아래 3분의 1, 피사체는 오른쪽 3분의 1, 왼쪽 위로는 카피가 들어갈 빈 하늘"은 진짜 지시이고 이 모델들은 그걸 잘 따릅니다.
그리고 자산 batch 하나를 통째로 날리는 함정이 있습니다. 기본 aspect ratio가 티어마다 같지 않습니다. Nano Banana와 Nano Banana 2, Nano Banana Pro에서 저희 기본값은 9:16입니다. Nano Banana 2 Lite에서는 1:1입니다. 그래서 aspect_ratio를 한 번도 고정하지 않는 설정은 세 모델에서 세로 이미지를, 네 번째에서 정사각형을 만들어 냅니다. 돈을 아끼려고 티어를 옮기시면 출력의 형태가 발밑에서 소리 없이 바뀝니다.
고정하십시오. 언제나, 모든 호출에서, 기본값이 마침 원하시는 것일 때조차도요.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-2-lite/text-to-image",
"input": {
"prompt": "평평한 흐린 빛 아래 화강암 능선의 와이드 풍경 사진, 지평선은 아래 3분의 1, 능선이 오른쪽에서 들어오고, 왼쪽 위로는 빈 창백한 하늘. 텍스트 없음, 인물 없음, 구조물 없음.",
"aspect_ratio": "21:9"
}
}'
티어를 알아야 할 이유가 하나 더 있습니다. Lite는 저희 카탈로그의 다른 어디에도 없는 aspect ratio 넷을 답니다. 1:4, 4:1, 1:8, 8:1입니다. 진짜로 쓸모 있고 진짜로 덜 쓰입니다. 사이트 전역 헤더 레일이나 긴 사이드바 유닛을 8:1로 렌더링하는 편이 16:9를 생성해 80%를 잘라 내는 것보다 낫습니다. 구성에서도 그렇고, 버린 픽셀에 치른 값에서도 그렇습니다.

편집은 다른 기술입니다. 델타를 쓰십시오
가장 노련한 prompt 작성자가 가장 심하게 퇴행하는 곳이 여기입니다. text-to-image에서 온 본능이 원하는 그림을 묘사하라고 시키기 때문입니다. 편집 호출에서는 이미 그 그림을 갖고 계십니다. 다시 묘사하는 것은 그것과 경쟁하는 일입니다.
편집 prompt에는 할 일이 둘 있습니다. 무엇이 바뀌는지 지목하고, 무엇이 바뀌면 안 되는지 지목하는 것입니다. 그 밖의 것은 거기 들어갈 자리가 없습니다.
낮은 겨울빛 속 대리석 카페 테이블의 오십 대 여성, 파란 코트 대신
빨간 코트를 입고, 같은 얼굴, 같은 자세, 에디토리얼 사진, 35mm,
얕은 피사계 심도, 따뜻한 톤
코트를 네이비에서 짙은 벽돌빛 빨강으로 바꿔 주세요. 원단의 무게감과
칼라 모양, 드레이프는 동일하게 유지하세요. 화면의 나머지는 전부
그대로입니다. 같은 얼굴, 같은 표정, 같은 손, 같은 컵, 같은 창빛,
같은 크롭.
첫 번째 버전은 매체와 렌즈와 톤을 다시 지정하고, 그 재지정 하나하나가 모델이 행동에 옮길 수 있는 새 지시입니다. 미묘하게 다른 얼굴이 나오는 경로가 그것입니다. 두 번째 버전은 하나만 건드리고 나머지를 명시적으로 얼립니다.
편집 파이프라인을 만드시기 전에 알아 둘 기계적인 사실 둘입니다. 참조 장수는 티어마다 다릅니다. 레거시 모델은 이미지 세 장, Nano Banana 2의 edit endpoint는 열네 장, Nano Banana Pro의 것 역시 열네 장이되 역할로 나눕니다. 정체성을 위한 인물 이미지 최대 다섯, 제품 충실도를 위한 오브젝트 이미지 여섯, 스타일 참조 셋입니다. Pro가 광고 합성 하나를 단일 request로 조립할 수 있는 이유가 그 역할 분할이고, 그 자체로 하나의 주제입니다. Nano Banana 생성물 전반에서 캐릭터를 일관되게 유지하기에서 다룹니다.
이미지 내 텍스트, 그리고 굳이 하지 않아도 될 때
이미지 안의 읽히는 글자는 Gemini 3 세대에서 도착했습니다. 레거시 gemini-2.5-flash-image는 하지 못합니다. 단어 하나는 가끔 살아남고, 문장은 결코 살아남지 못합니다. 진짜 활자가 들어가는 무엇이든 Nano Banana 2를 원하시게 되고, 활자 자체가 요점인 무엇이든 Pro를 원하시게 됩니다. Pro는 스타일이 입혀진 다국어 텍스트를 충분히 잘 렌더링해서, 영어 인포그래픽을 건네면 아트워크를 그대로 둔 채 스페인어 버전을 돌려줍니다.
텍스트를 요청하실 때는 규칙이 빡빡해집니다.
- 단어를 나타나야 할 그대로 따옴표 안에 넣으십시오.
- 단어가 몇 개인지, 화면 어디에 앉는지 말하십시오.
- 글자꼴을 폰트 이름이 아니라 스타일로 묘사하십시오. "길쭉한 기하학적 아르데코 대문자, 넉넉한 자간"은 통합니다. 특정 서체를 지목하는 것은 대체로 통하지 않습니다.
- "다른 텍스트는 어디에도 없음"으로 닫으십시오. 그러지 않으면 모델이 요청하지 않은 그럴듯한 부제를 붙입니다.
아르데코 글자로 LISBOA라고 적힌 리스본 빈티지 여행 포스터
1930년대 빈티지 여행 포스터 일러스트, 인쇄 판이 어긋난 자국이 보이는
플랫 실크스크린 스타일. 크림색 트램이 가파른 파스텔빛 거리를 오르고,
그 뒤로 테주강 하구가 세 겹의 평면적인 파랑으로 놓인다. 텍스트는 한
줄만: 아래 4분의 1을 가로지르는 "LISBOA"를 길쭉한 기하학적 아르데코
대문자로, 크림 바탕에 짙은 황토색, 넉넉한 자간. 이미지 안 다른
어디에도 텍스트 없음.
이제 인기 없는 부분입니다. 이미지 안의 텍스트 대부분은 이미지 안에 있으면 안 됩니다. 그 단어가 언젠가 바뀌거나, 번역되거나, 선택되거나, 스크린 리더로 읽히거나, 법무 검토 후 고쳐져야 한다면, 아트워크는 깨끗하게 생성하시고 활자는 HTML이나 Figma, 템플릿 엔진에서 얹으십시오. 모델이 할 수 있다는 이유로 헤드라인을 픽셀에 구워 넣는 것은 첫 카피 수정 때 값을 치르게 되는 결정입니다. 활자가 진짜로 아트워크의 일부일 때 — 포스터, 손으로 칠한 가게 간판, 정물 속 책등 — 렌더링된 텍스트를 요청하시고, 그 밖에는 건너뛰십시오.
데이터 성격을 띤 것에는 이 날이 더 예리합니다. 그럴듯한 텍스트를 렌더링하는 모델은 그럴듯한 숫자와 그럴듯한 지명도 렌더링하는데, 포스터에서는 괜찮고 차트나 지도에서는 재앙입니다. 정확히 왜 그런지는 AI 이미지 생성기가 지도에 그토록 약한 이유에서 파고들었습니다.
간직할 만한 템플릿
사람들이 실제로 생성하는 것 대부분을 덮는 뼈대 넷입니다. 대괄호를 채우시고, 해당 없는 것은 지우시고, 배제 줄은 남기십시오.
합성용 무지 바탕 위의 깨끗한 피사체:
[매체: 매크로 제품 사진 / 스튜디오 정물]으로 담은 [구체적인 소재
디테일 하나가 있는 피사체] 한 점, 이음매 없는 [색] 스위프 정중앙.
[방향]에서 들어오는 [광원과 크기], [방향]으로 떨어지는 그림자 하나.
텍스트 없음, 로고 없음, 소품 없음, 손 없음, 배경 디테일 없음.
카피 공간이 있는 에디토리얼 장면:
[구체적인 동작 하나를 하고 있는 피사체]의 [매체], [배경].
[빛: 방향, 성질, 색온도]. [카메라 높이와 거리]에서 촬영, [크롭],
[피사계 심도]. [피사체]는 [왼쪽/오른쪽] 3분의 1에, [영역]을 가로질러
카피가 들어갈 빈 [면 또는 하늘]. 텍스트 없음, 로고 없음.
하나만 바꾸는 편집:
[요소]를 [현재 상태]에서 [목표 상태]로 바꿔 주세요. [그 요소에서
반드시 살아남아야 할 속성 두셋]은 동일하게 유지하세요. 화면의 나머지는
전부 그대로입니다. 같은 [가장 위태로운 부분들을 나열].
활자 한 줄이 들어가는 일러스트, Pro 티어:
[일러스트 스타일과 시대], [기법 디테일]. [장면을 두 문장으로 묘사].
텍스트는 한 줄만: "[단어]"를 [글자꼴 묘사]로, [색] 바탕에 [색],
[위치]에 배치. 이미지 안 다른 어디에도 텍스트 없음.
prompt가 문제가 아닐 때
어느 시점부터는 prompt는 멀쩡하고 파이프라인이 문제입니다. 재시도, seed, 큐잉, URL이 만료되기 전에 출력을 저장하는 일이요. 그건 다른 분야이고 대량으로 이미지를 자동 생성하는 법에 정리해 두었습니다. 그리고 좁히려는 격차가 지시 이행이 아니라 구체적으로 사진적 설득력이라면, 그 체크리스트는 가장 사실적인 AI 이미지 생성기 가이드에 삽니다.
모델마다 정확한 파라미터 목록 — 전체 aspect ratio 집합, 기본값, 무엇을 거부하는지 — 을 기계가 읽는 스펙으로 공개합니다. Nano Banana 2 Lite 스펙 파일이 그 예입니다. 모델을 바꾼 뒤 말을 안 듣기 시작한 prompt를 다시 쓰시기 전에 그것부터 읽으십시오. 열에 아홉은 prompt가 멀쩡했고 기본값이 그 밑에서 움직인 것입니다. text-to-image 카테고리의 모든 모델 뒤에, 그리고 저희가 돌리는 나머지 전부 뒤에 스펙 파일이 있습니다.
자주 묻는 질문
Nano Banana prompt는 어떻게 구성해야 합니까?
매체가 먼저, 그다음 피사체, 그다음 빛, 그다음 프레이밍, 그다음 배제 목록입니다. 첫 단어에서 매체를 지목하면 이어지는 모든 결정이 좁혀지고, 빛을 명시적으로 묘사하는 것이 아무리 많은 품질 형용사보다 결과에 더 기여합니다. 무엇이 나타나면 안 되는지로 마무리하십시오. "텍스트 없음, 로고 없음, 소품 없음"입니다. 이 모델들은 지정되지 않은 공간을 비워 두는 대신 채우기 때문입니다.
"8k"나 "마스터피스" 같은 품질 단어가 Nano Banana에서 도움이 됩니까?
아닙니다. 그 토큰들은 학습 데이터의 특정 부분집합 쪽으로 출력을 몰아 주던 이전 오픈웨이트 디퓨전 모델에서 왔습니다. Gemini 세대 모델은 그것에 반응하지 않으며, 광원 방향이나 카메라 위치, 배제 항목에 쓰는 편이 나았을 prompt 예산을 잡아먹습니다.
Nano Banana prompt는 얼마나 길 수 있습니까?
Nano Banana 2 Lite는 최대 32,000자, Nano Banana 2는 최대 20,000자, Nano Banana Pro는 최대 50,000자를 받습니다. 그것은 목표가 아니라 하드 천장입니다. 특히 Lite는 한도에 닿기 훨씬 전부터 긴 prompt에서 성능이 떨어집니다. 여는 절과 닫는 절을 지키고 가운데를 버리는 경향이 있기 때문입니다.
모델을 바꾸면 이미지 형태가 잘못 나오는 이유는 무엇입니까?
기본 aspect ratio가 티어마다 다르기 때문입니다. 저희 API에서 Nano Banana와 Nano Banana 2, Nano Banana Pro의 기본값은 9:16이고, Nano Banana 2 Lite의 기본값은 1:1입니다. 그래서 aspect_ratio를 한 번도 설정하지 않는 request는 그 모델들 사이를 옮길 때 형태가 바뀝니다. 모든 호출에서 명시적으로 설정하십시오.
Nano Banana 편집 prompt는 어떻게 씁니까?
장면이 아니라 델타를 쓰십시오. 바뀌는 것 하나를 지목하고, 그것에서 살아남아야 할 속성을 지목한 다음, 나머지는 전부 그대로임을 밝히고 가장 위태로운 요소들을 나열하십시오. 얼굴, 자세, 조명, 크롭 같은 것들입니다. 편집 prompt에서 매체나 렌즈, 분위기를 다시 묘사하는 것이 이미지 다른 곳에서 의도치 않은 변화를 만드는 원인입니다.
어느 Nano Banana 모델이 이미지 안에 읽히는 텍스트를 렌더링할 수 있습니까?
Nano Banana 2와 Nano Banana Pro가 할 수 있습니다. 읽히는 이미지 내 텍스트가 Gemini 3 세대의 capability이기 때문입니다. 활자가 요점일 때 믿을 만한 선택은 Nano Banana Pro입니다. 스타일이 입혀진 다국어 텍스트까지 감당하기 때문입니다. 레거시 gemini-2.5-flash-image는 읽히는 텍스트를 아예 렌더링하지 못합니다.
prompt를 더 잘 따르게 하려면 Nano Banana Pro가 필요합니까?
보통은 아닙니다. Pro의 강점은 여러 공간 관계가 담긴 긴 구성 브리프를 감당하는 것, 그리고 역할이 분리된 참조 이미지와 믿을 만한 이미지 내 텍스트입니다. prompt가 예순 단어 아래의 단일 피사체라면 $0.0238의 Nano Banana 2 Lite가 똑같이 충실하게 따르고 더 빨리 돌려줍니다.