Generasi Gambar yang Konsisten dengan API Nano Banana
Menghasilkan satu gambar yang bagus nyaris sudah terpecahkan. Menghasilkan yang kedua puluh yang masih menyatu dengan sembilan belas sebelumnya adalah tempat proyek mati.
Jaraknya bukan soal keahlian prompt. Ia soal bahwa "konsistensi" adalah tiga masalah rekayasa berbeda yang mengenakan satu kata, dan teknik yang memperbaiki satu di antaranya tidak berbuat apa-apa untuk dua lainnya. Kami menjalankan model Nano Banana di API kami, dan inilah request yang paling sering salah dibuat orang — bukan karena modelnya tidak bisa, melainkan karena referensinya masuk tanpa label dan modelnya dibiarkan menebak tiap referensi itu untuk apa.

Tiga masalah, bukan satu
Pisahkan ketiganya sebelum Anda menulis prompt. Mereka gagal secara berbeda dan berbiaya secara berbeda.
Konsistensi karakter. Orang yang sama di banyak frame — wajah, perawakan dan rambut yang sama, dikenali sebagai satu individu entah ia duduk di frame keempat atau berjalan di frame kesembilan belas. Ini masalah identitas: modelnya harus membawa sebuah wajah melintasi komposisi yang belum pernah ia lihat.
Kesetiaan produk. Bukan botol yang mirip. Botol itu. Proporsi tutup yang persis, penempatan label, gradasi hijau yang sama. Kesetiaan lebih ketat daripada identitas — sebuah wajah punya toleransi, kemasan seorang klien tidak.
Konsistensi gaya. Set-nya terbaca sebagai satu set — color grade yang sama, karakter lensa yang sama, kualitas cahaya yang sama, grain yang sama. Tidak ada objek yang perlu berulang; perlakuannya yang berulang.
Kebanyakan brief butuh dua di antaranya sekaligus dan memintanya sebagai satu instruksi. "Bikin konsisten" bukan permintaan yang bisa dijalankan sebuah API. "Gambar 1 adalah orangnya, gambar 2 adalah botolnya, gambar 3 hanya color grading" adalah permintaan yang bisa.
Pembagian perannya adalah fiturnya yang sesungguhnya
Nano Banana Pro menerima sampai 14 gambar referensi. Begitu juga Nano Banana 2, pada harga hampir separuhnya. Jumlahnya bukan pembedanya. Pro membagi jatah itu berdasarkan peran:
| Peran | Jatah | Yang ia pegang |
|---|---|---|
| Karakter | sampai 5 | Referensi identitas untuk seseorang atau sebuah figur |
| Objek | sampai 6 | Produk, properti, kemasan dengan kesetiaan tinggi |
| Gaya | sampai 3 | Color grade, suasana pencahayaan, perlakuan saja |
Empat belas totalnya, tetapi teralokasi. Alokasi itulah yang mengubah gambar referensi dari sebuah saran menjadi sebuah instruksi.
Pikirkan apa yang terjadi tanpanya. Anda menyerahkan empat belas gambar dan satu kalimat kepada sebuah model, dan ia menyimpulkan dari prosanya gambar mana yang merupakan wajah yang harus dipertahankan, mana yang produk yang harus direproduksi persis, dan mana yang hanya ada demi suasana. Ia sering salah menyimpulkan. Tandanya adalah produk yang keluar "dengan gaya" kemasan Anda alih-alih sebagai kemasan Anda, atau sebuah wajah yang mengenakan grade dari mood board.
Dengan pembagian perannya Anda tidak sedang meminta, Anda sedang menyatakan. Lima slot untuk siapa, enam untuk apa, tiga untuk bagaimana tampilannya. Satu komposit iklan dalam satu request alih-alih tiga putaran komposit.
Pro adalah $0.075 per request pada harga kami tanggal 26 Agustus 2026, melawan harga list $0.15. Satu hal lagi yang layak diketahui: 1K dan 2K berbiaya sama di Pro. Untuk aset hero, ambil yang 2K. Ia gratis.

Memberi label gambar referensi di dalam prompt
Pembagian perannya mengerjakan bagian strukturalnya. Prompt mengerjakan bagian semantiknya, dan ia harus eksplisit dengan cara yang terasa nyaris kasar. Referensi tiba dalam urutan, jadi sebutlah mereka menurut posisinya dan katakan tiap gambar itu untuk apa, termasuk untuk apa ia bukan. Bagian terakhir itulah tempat kebanyakan prompt bocor.
Gambar 1 dan gambar 2 adalah perempuan yang sama — pertahankan wajahnya,
panjang rambutnya dan perawakannya persis. Gambar 3 adalah produknya:
reproduksi bentuk botolnya, proporsi tutupnya dan artwork labelnya secara
presisi, jangan menggayakannya ulang. Gambar 4 hanya color grading dan
suasana pencahayaan — jangan menyalin objek, pose atau komposisi apa pun
darinya.
Tempatkan perempuan dari gambar 1-2 sedang memegang botol dari gambar 3,
duduk di meja kafe dekat jendela, tampak tiga perempat, cahaya sore hangat
yang cocok dengan grade di gambar 4.
Empat hal membuat prompt itu berhasil, tidak satu pun berupa kata sifat kelima:
- Setiap referensi dipertanggungjawabkan. Tidak ada gambar yang masuk tanpa tugas yang dinyatakan.
- Referensi gayanya membawa pengecualian yang eksplisit. Tanpa itu, sebuah mood board membocorkan perabotannya ke dalam adegan Anda.
- Kata-kata identitasnya konkret — wajah, panjang rambut, perawakan — bukan "mirip dia".
- Instruksi produknya berbunyi "jangan menggayakannya ulang", dan frasa itulah yang memisahkan kesetiaan dari inspirasi.
Kami tidak akan membahas penyusunan prompt secara umum di sini; itu ada di panduan prompting. Yang ini khusus soal memberi tahu modelnya referensi Anda untuk apa.
Request-nya
Pekerjaan konsistensi adalah penyuntingan, bukan generasi, jadi ia pergi ke slug edit-image bersama image_urls.
curl -X POST https://api.e2x.ai/v1/jobs/submit \
-H "Authorization: Bearer $E2X_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "google/nano-banana-pro/edit-image",
"input": {
"prompt": "Gambar 1 dan gambar 2 adalah perempuan yang sama - pertahankan wajahnya, panjang rambutnya dan perawakannya persis. Gambar 3 adalah produknya: reproduksi bentuk botolnya, proporsi tutupnya dan artwork labelnya secara presisi, jangan menggayakannya ulang. Gambar 4 hanya color grading dan suasana pencahayaan, jangan menyalin objek atau komposisi apa pun darinya. Tempatkan perempuan itu sedang memegang botolnya, duduk di meja kafe dekat jendela, tampak tiga perempat, cahaya sore hangat.",
"image_urls": [
"https://cdn.example.com/refs/model-face-front.jpg",
"https://cdn.example.com/refs/model-face-three-quarter.jpg",
"https://cdn.example.com/refs/bottle-front.jpg",
"https://cdn.example.com/refs/grade-warm-afternoon.jpg"
],
"aspect_ratio": "4:5",
"resolution": "2K"
}
}'
Submit mengembalikan sebuah job ID; lakukan polling terhadapnya atau oper webhookUrl. Pro butuh sekitar 30 detik karena ia menghasilkan "gambar pikiran" antara sembari menyusun komposisinya — Google tidak mengembalikannya dan kami tidak menagihkannya. Setel aspect_ratio secara eksplisit, karena Pro default ke 9:16. Penelusuran parameter selengkapnya ada di tutorial API Nano Banana Pro.
Di mana tier yang lebih murah mendarat
Kami lebih suka membujuk Anda turun satu tier daripada menjual Pro untuk pekerjaan yang tidak membutuhkannya.
Nano Banana 2 menerima 14 referensi yang sama pada $0.04, tanpa pembagian peran. Itu sungguh memadai untuk konsistensi gaya, di mana setiap referensi mengerjakan tugas yang sama dan tidak ada yang perlu diperjelas. Enam header blog yang berbagi palet dan suasana pencahayaan tidak butuh Pro. Mereka butuh satu referensi gaya yang bagus dan satu template prompt yang dibekukan. Nano Banana 2 juga mencapai 4K, yang sama sekali tidak bisa disentuh Lite.
Nano Banana 2 Lite adalah $0.0238 dan dibangun untuk volume, bukan kesetiaan. Raih ia ketika Anda butuh empat ratus gambar yang berbagi satu tampilan dan tidak satu pun membawa wajah atau kemasan seorang klien. Ia hanya 1K, tanpa parameter resolution — mengirimnya adalah error, bukan no-op.
Nano Banana yang legacy mentok di 3 gambar referensi, dan itu tidak cukup untuk mengerjakan karakter dan produk dalam frame yang sama, lalu Google memensiunkannya pada 2 Oktober 2026 — cerita lengkap soal model itu adalah tulisan terpisah. Jangan memulai proyek konsistensi di atasnya.
Aturan kasarnya: pekerjaan yang hanya soal gaya pergi ke Nano Banana 2 atau Lite. Apa pun yang di dalamnya wajah manusia tertentu atau produk fisik tertentu harus selamat utuh pergi ke Pro. Jarak harga antara $0.04 dan $0.075 berhenti penting begitu seorang klien menolak satu batch karena labelnya keliru.
Harga dan ketentuan produk dapat berubah sewaktu-waktu. Periksa harga terkini masing-masing provider sebelum mengambil keputusan pembelian. Harga Google Batch atau Flex tidak setara langsung dengan request API on-demand standar karena kondisi penjadwalan, ketersediaan, dan pemrosesannya berbeda; karena itu harga tersebut tidak disertakan dalam perbandingan ini. Ini adalah perbandingan dengan cakupan terbatas, bukan klaim bahwa E2X adalah opsi termurah di dunia dalam setiap konfigurasi.
Bangun satu set referensi kanonik sekali saja
Kebiasaan yang paling cepat membayar dirinya sendiri di sini sama sekali tidak berhubungan dengan API.
Bangun set referensinya sekali, dengan sengaja, dan pakai ulang selamanya. Bukan "foto apa pun yang kebetulan ada" — sebuah set yang tetap, berversi, tersimpan, yang menjadi sumber setiap request. Untuk sebuah karakter: beberapa sudut wajah yang sama di bawah cahaya netral, depan, tiga perempat, samping, ditambah satu foto seluruh badan untuk perawakannya. Untuk sebuah produk: depan, belakang, satu crop detail labelnya. Untuk gaya: satu atau dua gambar yang membawa grade-nya dan tidak ada yang mengganggu.
Lalu bekukan. Simpan URL-nya di tempat yang permanen — bucket Anda sendiri, bukan tautan sementara — dan oper array yang sama di setiap request sepanjang umur proyeknya.
Ini lebih penting daripada penyetelan prompt karena penyimpangannya kumulatif. Hasilkan frame 5 dari frame 4 dan frame 6 dari frame 5, dan kesalahan kecil berlipat sampai frame 20 menjadi orang yang berbeda. Menambatkan setiap frame ke set kanonik yang sama berarti tiap generasi menyimpang dari aslinya sejauh satu langkah, tidak pernah dua puluh. Sebuah kipas, bukan sebuah rantai.
Kebiasaan terkait: kalau set-nya memuat gambar yang Anda hasilkan sendiri, simpan file sumbernya. URL pengiriman dari API gambar mana pun kedaluwarsa, jadi unduh dan simpan aset Anda sendiri — cara menjalankan generasi secara otomatis memuat loop lengkapnya.
Hasilkan satu hero, lalu turunkan variannya
Alur kerja yang menghasilkan output paling terpakai per dolar bukan "hasilkan dua puluh gambar". Ia "hasilkan satu gambar dua puluh kali".
Buat satu foto hero di Pro dan buat ia benar — komposisi, pencahayaan, wajah, produk. Bakar beberapa percobaan; pada $0.075 eksplorasinya murah.
Lalu berhentilah menghasilkan dan mulailah menyunting. Suapkan hero yang disetujui itu kembali sebagai referensi berdampingan dengan set kanonik Anda dan mintalah perubahan yang Anda inginkan: sudut berbeda, latar berbeda, crop berbeda, model memandang menjauh alih-alih ke kamera. Tiap varian tertambat ke sesuatu yang sudah lolos tinjauan alih-alih ke lemparan dadu yang baru.
Menyunting mengalahkan meregenerasi karena alasan yang mudah terlewat. Sebuah regenerasi memutuskan ulang segalanya; tiap parameter yang tadinya Anda sukai kembali dipertaruhkan. Sebuah suntingan menahan apa yang tidak Anda sebut. Setelah menghabiskan satu sore membuat sebuah wajah menjadi benar, memutuskannya ulang dua puluh kali adalah hal terakhir yang Anda inginkan.
Dua catatan praktis. Awasi jumlah referensinya sembari Anda menambahkan hero-nya kembali — hero ditambah set karakter lima gambar ditambah sebuah produk sudah tujuh dari empat belas. Dan simpan prompt hero yang disetujui itu di sebelah gambarnya; sebuah varian biasanya prompt itu dengan dua klausa ditukar, dan menulisnya ulang dari ingatan memasukkan kembali penyimpangan yang baru saja Anda bayar untuk dihilangkan.

Bagian yang tidak diperbaiki set referensi mana pun
Google mencap SynthID ke dalam setiap gambar yang diproduksi modelnya. Ia tak kasatmata, ia berjalan di dalam file-nya, dan ia bukan pengaturan yang dipaparkan siapa pun karena ia sama sekali bukan pengaturan. Itu lebih penting di sini daripada di kebanyakan tulisan: proyek konsistensi adalah proyek klien, dan kontrak seorang klien bisa memuat klausa tentang aset hasil AI. Selesaikan klausa itu sebelum Anda memotret set referensinya, bukan setelah dua puluh frame yang disetujui duduk di dalam sebuah dek.
Pekerjaan konsistensi hampir selalu berupa penyuntingan, jadi model image-to-image adalah rak yang pertama dijelajahi, dan katalog punya sisi videonya kalau brief-nya bergeser.
Pertanyaan yang sering diajukan
Bagaimana saya menjaga karakter yang sama di beberapa gambar hasil AI?
Bangun set referensi kanonik — beberapa sudut wajah yang sama di bawah cahaya netral, ditambah satu foto seluruh badan untuk perawakan — simpan secara permanen, dan oper gambar yang sama ke setiap request. Pakai slot karakter Nano Banana Pro, yang memegang sampai 5 gambar identitas, dan nyatakan di dalam prompt gambar mana yang merupakan orangnya. Tambatkan setiap frame ke set aslinya alih-alih ke frame sebelumnya, atau kesalahannya berlipat menjadi wajah yang berbeda pada frame kedua puluh.
Berapa banyak gambar referensi yang diterima API Nano Banana?
Nano Banana Pro menerima 14, terbagi berdasarkan peran: sampai 5 gambar karakter, sampai 6 gambar objek, dan sampai 3 referensi gaya. Nano Banana 2 juga menerima 14 tetapi tanpa pembagian peran. Nano Banana 2 Lite dibangun untuk volume alih-alih pekerjaan yang berat referensi, dan Nano Banana yang legacy mentok di 3.
Apa beda konsistensi karakter dan kesetiaan produk?
Konsistensi karakter berarti satu orang tetap dikenali di banyak gambar — wajah, rambut dan perawakan yang sama, toleran terhadap variasi kecil. Kesetiaan produk berarti objeknya bereproduksi persis: artwork label yang presisi, proporsi tutup dan warnanya, tanpa penggayaan ulang. Pro menanganinya di slot referensi yang berbeda karena keduanya butuh tingkat ketat yang berbeda, dan prompt-nya sebaiknya menyebutkan gambar mana yang mana.
Sebaiknya saya memakai Nano Banana Pro atau Nano Banana 2 untuk gambar yang konsisten?
Pakai Nano Banana 2 di $0.04 ketika kebutuhannya bersifat gaya — gambar yang berbagi palet, pencahayaan dan perlakuan, tanpa wajah atau produk tertentu yang harus dipertahankan. Pakai Nano Banana Pro di $0.075 ketika wajah tertentu atau produk fisik tertentu harus selamat utuh, karena jatah referensi yang terbagi peran itulah yang memberi tahu modelnya mana yang mana. Jarak harganya kecil di sebelah satu batch yang ditolak.
Bagaimana saya memberi label gambar referensi di dalam prompt Nano Banana?
Rujuk mereka menurut posisinya dalam urutan Anda mengopernya di image_urls, dan nyatakan tiap gambar itu untuk apa. "Gambar 1 dan 2 adalah perempuan yang sama, pertahankan wajah dan perawakannya; gambar 3 adalah produknya, reproduksi persis; gambar 4 hanya color grading, jangan menyalin objek atau komposisi apa pun darinya." Pengecualiannya sama pentingnya dengan instruksinya, karena referensi gaya yang tidak dibatasi akan membocorkan objek dan komposisinya ke dalam adegan Anda.
Lebih baik menyunting gambar yang sudah ada atau menghasilkan yang baru?
Sunting, begitu Anda punya gambar yang Anda setujui. Sebuah regenerasi memutuskan ulang setiap elemen, termasuk yang tadinya Anda sukai; sebuah suntingan menahan semua yang tidak Anda sebut. Alur kerja yang efisien adalah satu hero yang dibuat dengan cermat, lalu varian yang diturunkan darinya lewat endpoint edit-image dengan referensi kanonik Anda terlampir.
Kenapa gambar hasil saya menyimpang menjauh dari karakter aslinya?
Hampir selalu karena tiap gambar baru dihasilkan dari gambar sebelumnya alih-alih dari set referensi yang tetap. Itu membuat kesalahannya kumulatif — rahang yang sedikit lebih bulat di frame 3 menjadi garis dasar bagi frame 4, dan pada frame 20 ia orang yang berbeda. Tambatkan setiap request ke gambar kanonik tersimpan yang sama sehingga tiap output berjarak satu langkah dari aslinya alih-alih dua puluh.