Kembali ke Blog

Manusia Fotorealistis di Gemini Omni 1.1 Flash: Hapus Kata 'Cantik'

E2X Team··16 menit membaca
gemini-omniprompt-engineeringphotorealismtext-to-videogoogle

Cara tercepat membuat manusia hasil generasi terlihat palsu adalah meminta yang menarik.

Tulis beautiful woman, perfect skin, flawless, stunning dan modelnya menurut — ia meraih wilayah data pelatihannya tempat kapsi-kapsi itu tinggal, yaitu fotografi komersial yang sudah diretouch. Pori hilang, asimetri hilang, dan ketegangan-ketegangan kecil yang membuat sebuah wajah terbaca sebagai dihuni seseorang ikut hilang bersamanya. Tidak ada yang salah pada outputnya. Prompt-nya meminta iklan kecantikan dan mendapatkannya.

Panduan prompt milik Google sendiri menunjuk arah sebaliknya dalam satu kalimat — "Be extremely detailed in your descriptions of characters and environments." Detail, bukan pujian. Itu dua instruksi yang berbeda dan keduanya menghasilkan wajah yang berbeda. Yang menyusul adalah perbedaannya: wajah, tangan, audio yang tidak bisa Anda matikan, dan ke mana Google memutuskan Anda tidak boleh pergi.

Potret extreme close-up seorang pria berusia enam puluhan di samping jendela menghadap utara, memenuhi frame dari alis hingga dagu, cahaya siang lembut berarah memunculkan tekstur pori dan janggut pendek beruban

Sebuah wajah adalah daftar fakta, bukan daftar pujian

Setiap kata sifat adalah suara untuk sebuah klaster kapsi, dan gorgeous memilih stok. 8k, hyperrealistic, masterpiece datang dari folklor model gambar, tempat mereka berfungsi sebagai token kualitas; pada model video tanpa parameter sampling mereka hanya bersaing dengan kata-kata yang menggambarkan shot Anda. Penggantinya spesifik dan membosankan, dan justru itulah maksudnya:

Usia sebagai angka atau dekade. "Seorang perempuan di akhir usia empat puluhan" adalah sebuah batasan; "seorang perempuan muda" adalah tiket lotre.

Satu ketidaksempurnaan yang disebutkan namanya. Bekas luka menonjol, gigi depan yang gompal, hidung yang pernah patah dan menyatu sedikit miring. Satu sudah cukup; tiga terbaca seperti lembar karakter.

Kulit sebagai permukaan. Pori terlihat di hidung dan pipi, kilap di dahi, kapiler pecah di sisi lubang hidung. Substitusi dengan hasil tertinggi dalam sebuah prompt: "perfect skin" dan "visible pores across the nose" duduk di dua ujung berlawanan ruang kapsi.

Tatapan dengan arah dan perubahan. Bukan "menatap kamera" melainkan "membaca sesuatu di luar frame sebelah kanan, lalu matanya melirik ke lensa sekitar satu detik dan menjauh lagi." Kontak mata tak terputus sepanjang satu klip adalah sesuatu yang nyaris tak dilakukan manusia mana pun, jadi garis pandang yang tak ditentukan membiarkan modelnya menebak hal pertama yang dibaca penonton.

Satu mikro-ekspresi, berwaktu. "Sudut mulutnya mengencang satu kali." Peristiwa yang dipentaskan mengalahkan "emosional", karena modelnya bisa mementaskan sebuah peristiwa dan tidak bisa mementaskan sebuah abstraksi.

Keausan pada segala sesuatu yang bukan kulit. Kerah yang sudah dicuci dua ratus kali, tali jam yang melunak, bekas cincin kopi di atas berkas. Wardrobe menjual seorang manusia lebih andal daripada wajah.

Pertukarannya, secara konkret. Pertama, versi yang tampak seperti foto stok yang belajar berkedip:

A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.

Sebagian besar kata itu menggambarkan sebuah foto; tak satu pun menggambarkan seorang manusia. Tulis ulangnya mempertahankan shot-nya dan menukar setiap pujian dengan sebuah fakta:

In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.

Tidak ada apa pun di versi kedua yang meminta kualitas. Ia memasok sebuah tekstur untuk dirender, sebuah alasan bagi garis pandang, dan satu peristiwa berwaktu — tiga hal yang bisa ditindaklanjuti modelnya, sementara "stunning" adalah tiga hal yang tidak bisa. Perhatikan juga klausa jumlah shot di depan: Omni membangun beberapa shot secara default, seperti kami bahas di panduan prompting, dan potret yang memotong dua kali dalam enam detik tidak bisa mempertahankan sebuah wajah.

Makro ekstrem pipi dan pelipis manusia yang disinari cahaya keras menyapu dari ujung kiri, separuh frame terang dan bertekstur sementara separuh lainnya jatuh ke bayangan

Satu peringatan soal mata: "wet eyes" dan "glossy tear film" adalah kata kualitas berkostum teknis, menyebut sebuah sorotan alih-alih sebuah sebab. Beri mata itu sesuatu untuk dilakukan dan biarkan spekularnya mengikuti cahaya yang sudah Anda tentukan.

Tangan: beri mereka pekerjaan

Tangan adalah aib tradisional video generatif dan masih menjadi hal yang paling mungkin menggagalkan sebuah take. Model card DeepMind tidak menyebutnya secara khusus, tetapi ia menyebut kategorinya: "maintaining complete consistency throughout edits, generating scenes with complex motion, or rendering perfectly accurate text remains a challenge." Jari adalah gerakan kompleks di sepetak kecil frame, berartikulasi dalam banyak cara dan terus-menerus menutupi dirinya sendiri.

Perbaikannya berlawanan intuisi. Jangan menggambarkan tangannya — berikan sebuah tugas. Tangan yang memegang objek spesifik dengan cengkeraman yang dinyatakan punya bentuk dan titik sentuh untuk dijadikan jangkar. "Beautiful, elegant hands" tidak memasok keduanya, dan menyerahkan jumlah jarinya untuk dikarang modelnya.

Bandingkan:

  • Lemah: tangannya beristirahat wajar di sisi tubuhnya
  • Lebih baik: ia memegang cangkir enamel gompal dengan kedua tangan, ibu jari bertumpang tindih di sisi dekat
  • Lemah: ia bergestur sambil berbicara
  • Lebih baik: ia memutar sebuah pena di tangan kanannya dua kali, lalu meletakkannya di atas berkas

Bentuk kedua di tiap pasangan mengunci jumlah jarinya secara implisit, memberi gerakannya awal dan akhir, dan menghasilkan sebuah beat yang bisa Anda potong.

Satu peringatan yang mengatur setiap angka pihak ketiga dalam tulisan ini. Dua ulasan langsung terbit yang bisa kami temukan — milik invideo dan uji multi-turn tim JXP, bertanggal 21 Mei 2026 — keduanya menyebut model yang diuji sebagai Gemini Omni Flash, tanpa akhiran 1.1 di mana pun dalam kedua tulisan. Tak satu pun mengukur model yang menjadi topik tulisan ini; bacalah keduanya sebagai bukti tentang keluarganya. JXP melaporkan bahwa pada putaran penyuntingan kelima sebuah shot biola, "Her left hand drifted slightly off the fingerboard." Tangan lebih dulu gugur, sementara yang lain masih bertahan.

Dua aturan lagi yang tak berbiaya. Jaga tangan dalam satu bidang fokus — tangan yang disodorkan ke lensa lebar adalah hal tersulit yang bisa Anda minta. Dan jauhkan tangan dari wajah, karena tumpang tindih antara dua struktur sulit melipatgandakan kegagalannya alih-alih merata-ratakannya.

Foto makro dua tangan basah seorang pembuat tembikar merapat mengelilingi silinder tanah liat yang berputar, lumpur tanah mengalir di antara jari-jari, urat dan lipatan buku jari ditonjolkan cahaya

Anda mengarahkan sebuah suara, sengaja atau tidak

Audio di sini native: dihasilkan dalam proses yang sama dengan gambarnya, tidak dinonaktifkan parameter apa pun, tidak ditagih terpisah oleh penyedia mana pun yang kami periksa. Prompt yang tidak mengatakan apa-apa soal suara karena itu bukan permintaan untuk hening — ia adalah brief tanpa pengawasan, dan modelnya akan mengisinya.

Jadi tulislah audionya dengan sengaja, dalam kalimatnya sendiri. Bentuk dialog terdokumentasi Google adalah titik dua tanpa tanda kutip — the man says: We lost it — dan klaim yang sering diulang bahwa tanda kutip memicu mode lip-sync tidak muncul di dokumen Google mana pun.

Empat hal menentukan apakah sebuah shot bicara berhasil:

Panjang kalimat. invideo, dalam ulasan yang menyebut model yang diuji sebagai Gemini Omni Flash, melaporkan bahwa "For a single person talking, the lip sync holds up until about 6 to 7 seconds before it begins to drop off." Sebuah arahan alih-alih spesifikasi, tetapi ia menunjuk satu arah: kalimat empat sampai dua belas kata yang ditempatkan di awal, lalu hening dan sebuah reaksi, mengalahkan kalimat yang membentang sepanjang take.

Satu pembicara dalam frame. Ulasan yang sama blak-blakan: "Two speakers in one frame remain a weak spot, since Omni often drops sync or misattributes dialogue, so single-speaker shots are the safe bet today." Jadikan orang kedua sebagai bahu di tepi frame, di luar fokus, dan ambil kalimatnya sebagai generasi terpisah.

Arahan suara dalam prosa. Tidak ada parameter suara, jadi aksen, usia, register, dan tempo masuk sebagai bahasa Inggris biasa: tired, quiet, American accent, no rise at the end.

Hening yang eksplisit. Tuliskan No dialogue. atau No music.

Sebelum dan sesudah untuk sebuah shot dialog. Versi lemahnya melakukan setiap kesalahan di atas sekaligus — dua pembicara dalam frame, tanda kutip, satu kalimat masing-masing, kata sifat menggantikan arahan:

A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.

Tulis ulangnya mengeluarkan satu pembicara dari frame, memangkas kalimatnya jadi empat kata, dan menggambarkan suaranya alih-alih memujinya:

In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.

Balasannya milik generasi kedua, dibingkai padanya — dua klip alih-alih satu, dan tetap lebih murah daripada mengulang shot dua orang delapan kali sambil berharap sinkronisasinya mendarat di kedua wajah sekaligus.

Satu batas terdokumentasi: Anda tidak bisa mengambil video unggahan seseorang yang berbicara lalu memperpanjangnya dengan dialog baru. Ini ditahan, bukan tidak ada, dan model card mengatakannya terus terang — "As part of editing videos, Gemini Omni Flash is capable of changing people's speech. For now, we are restricting this capability and working to better understand how to safely and responsibly bring it to our users." Modelnya bisa menyulih suara seseorang; Google memutuskan Anda tidak boleh. Dubbing bukan produk yang bisa Anda bangun di sini.

Kerumunan, figur latar, dan di mana tidak perlu berbelanja

Orang-orang di latar mendapat perhatian sisa, dan jalanan ramai berisi pejalan kaki adalah barisan wajah yang tidak akan selamat dari tombol jeda. Beri sebuah angka — "empat orang di meja-meja yang tersebar" mengalahkan "kafe yang ramai", karena kuantitas yang kabur mengundang perkiraan. Jaga mereka di luar bidang fokus, sebab figur yang dilembutkan 50mm dangkal terasa masuk akal sementara figur yang sama tajam pada f/11 adalah galeri nyaris-meleset. Dan beri mereka satu aksi masing-masing, menghadap menjauh: bagian belakang kepala itu gratis. Bila sebuah wajah latar tertentu penting, naikkan ia ke shot-nya sendiri.

Berapa biaya take-nya, dan mengapa 4K adalah angka yang penting

Wajah adalah tempat Anda membakar generasi — Anda mengulang demi garis pandang, lalu demi tangan, lalu karena suaranya keluar dua puluh tahun terlalu muda. Menghargai pekerjaan ini dengan jujur berarti menghargai take, bukan klip. Dan selisih penyedia paling lebar di puncak tangganya. Sepuluh detik 4K, per 29 Agustus 2026:

Tempat Anda memanggilnya10 dtk pada 4K
E2X$1.80
fal$3.00
Google, langsung$3.04
Runware$3.20
WaveSpeed$3.90

Angka Google diturunkan dari tarif token-per-detik yang ia terbitkan alih-alih harga tempel, dan angka fal adalah passthrough dari daftar Google alih-alih pembacaan independen atas komputasinya. Selisihnya struktural: dari basis 720p, Google menagih tiga kali lipat untuk 4K sementara kami menagih dua kali lipat. 41% lebih murah pada 4K adalah yang terlebar dari empat tier kami, dan take delapan detik adalah $1.44 di sini melawan $2.43 langsung. Audit penyedia demi penyedia memuat sisanya.

Separuh aritmetika lainnya adalah di mana Anda beriterasi. Sepuluh jalan pencarian pada 360p plus satu finish 1080p menjadi $1.73 melawan $5.40 untuk sepuluh jalan 1080p langsung — enam puluh delapan persen lebih murah dengan satu generasi tambahan. Sebuah jalan draf membawa resolusi cukup untuk garis pandang, blocking, dan apakah tangannya menemukan cangkirnya; tidak cukup untuk tekstur kulit atau lip sync, jadi anggarkan dua take resolusi penuh setelah loopnya ditutup. Dan tanyakan apakah shot itu memang butuh model ini: Veo 3.1 Fast berjalan satu sen per detik di sini, dan untuk satu potret tanpa kelanjutan, premi sembilan kali lipat membeli sangat sedikit.

Batas-batasnya, dinyatakan terus terang

Ini bukan bagian penafian. Setiap butir di bawah pernah mengubah rencana proyek seseorang.

SynthID ada di setiap frame, dan tidak ada sakelarnya. Rumusan Google: "All generated videos include SynthID watermarking, which is invisible to viewers but can be detected programmatically for provenance verification." Tidak ada penyedia yang membuka tombolnya, dan karena tandanya dibuat untuk selamat dari pengodean ulang, pemangkasan, dan perubahan warna, "nanti kita bersihkan di pascaproduksi" bukan sebuah rencana. Bila kontrak pengiriman melarang aset berwatermark, selesaikan itu sebelum Anda merender.

Penyuntingan video unggahan tidak tersedia di EEA, Swiss, dan Inggris. Kalimat Google, termasuk kurung yang menentukan seberapa buruk ini bagi Anda: "Editing or extending uploaded videos is not currently available for users in the European Economic Area (EEA), Switzerland, and the United Kingdom (editing or extending videos generated by the model is supported)." Tim Eropa tetap bisa menghasilkan sebuah shot dan memperpanjang outputnya sendiri; yang tidak bisa ia lakukan adalah melanjutkan footage yang diunggah pengguna. Kami membahas konsekuensinya di tulisan adegan empat puluh detik — butir termahal di sini bila baru diketahui terlambat.

Unggahan yang memuat orang-orang tertentu ditolak. Dua kalimat lagi dari bagian batasan yang sama, keduanya terbatas pada wilayah-wilayah itu: "Uploading and editing images containing minors is not supported in European Economic Area, Switzerland, and the United Kingdom", dan "Uploading and editing images containing certain recognizable people is not supported in European Economic Area, Switzerland, and the United Kingdom." Permukaan penolakannya tampak lebih luas dari rumusan itu: JXP, dalam ulasan era pendahulu yang sama, melaporkan bahwa sebuah prompt yang menyebut merek nyata "was blocked at submission with a generic policy message", dan permintaan untuk "age a generic adult character ten years" juga diblokir. Jangan membangun pipeline yang bergantung pada penolakan yang tidak terjadi.

Orang nyata adalah persoalan hukum sebelum persoalan teknis. Kemiripan yang dapat dikenali dari seseorang yang nyata, dibuat tanpa persetujuannya, berbenturan dengan hak kepribadian dan publisitas yang berbeda menurut yurisdiksi dan tidak gugur hanya karena outputnya sintetis. Terpisah dari itu, kewajiban transparansi di bawah Pasal 50 EU AI Act berlaku sejak 2 Agustus 2026: penyelenggara wajib mengungkapkan bahwa konten dihasilkan atau dimanipulasi secara artifisial, dengan jelas dan pada paparan pertama. SynthID menjawab persyaratan penandaan yang terbaca mesin; ia tidak menjawab kewajiban memberi tahu orang yang menonton. Itu keputusan pelabelan yang diambil bersama penasihat hukum, bukan sebuah flag dalam panggilan API.

Wajah hasil generasi bukanlah seorang manusia, tetapi ia bisa duduk cukup dekat pada seseorang sehingga seseorang dirugikan. Persetujuan, pengungkapan, dan kesediaan untuk tidak membuat shot-nya adalah bagian dari kerajinan ini sebagaimana panjang fokus.

Pertanyaan yang sering diajukan

Bagaimana cara mendapatkan kulit realistis di Gemini Omni 1.1 Flash?

Gambarkan permukaannya alih-alih memujinya. "Perfect skin", "flawless", dan "beautiful" memilih citra komersial yang diretouch dan meratakan tekstur. Tukar dengan fakta yang bisa diamati — pori terlihat di hidung dan pipi, kilap di dahi, bekas luka kecil — dan sebutkan sebuah usia. Google meminta deskripsi karakter yang sangat detail, yang bukan hal yang sama dengan meminta karakter yang menarik.

Mengapa tangan terlihat salah di video AI, dan bagaimana memperbaikinya lewat prompt?

Jari adalah gerakan kompleks di wilayah kecil yang menutupi dirinya sendiri, dan model card Google menyebut gerakan kompleks sebagai sesuatu yang "remains a challenge." Beri tangan sebuah pekerjaan alih-alih menggambarkannya: objek spesifik dengan cengkeraman yang dinyatakan, atau aksi dengan awal dan akhir. Jaga mereka dalam satu bidang fokus, jauh dari wajah.

Bisakah audio dimatikan di Gemini Omni 1.1 Flash?

Tidak. Audio dihasilkan secara native bersama gambarnya, tidak ada parameter yang menonaktifkannya, dan ia tidak ditagih terpisah dari tarif per detik. Anda bisa mengarahkannya dengan kalimat "Sound design:" dan klausa eksplisit "No dialogue." atau "No music.", tetapi tidak bisa menolaknya. Untuk pemutaran hening, bisukan pemutarnya.

Bagaimana dialog sebaiknya ditulis dalam prompt Omni?

Gunakan bentuk terdokumentasi Google: pembicara, titik dua, kalimat, tanpa tanda kutip. Arahan suara menyusul dalam prosa biasa, sebab tidak ada parameter suara — aksen, usia, register, dan tempo semuanya datang sebagai bahasa Inggris. Jaga kalimat tetap pendek, tempatkan di awal, gambarkan nada alih-alih meminta penyampaian yang "emosional".

Berapa lama Gemini Omni bisa mempertahankan lip sync?

invideo, dalam ulasan yang menyebut model yang diuji sebagai Gemini Omni Flash alih-alih 1.1, melaporkan bahwa dengan satu orang bicara lip sync bertahan sekitar enam sampai tujuh detik sebelum menurun, dan menyebut dua pembicara dalam satu frame sebagai titik lemah tempat modelnya kehilangan sinkronisasi atau salah menautkan dialog. Temuan seorang pengulas pada model terdahulu, bukan spesifikasi Google, tetapi ia mendukung satu pembicara per generasi dan kalimat pendek yang ditempatkan di awal.

Bisakah Gemini Omni 1.1 Flash menghasilkan kemiripan orang nyata?

Tidak dengan andal, dan pikirkan baik-baik sebelum mencoba. Dokumentasi Google mengatakan pengunggahan dan penyuntingan gambar yang memuat orang tertentu yang dapat dikenali tidak didukung di EEA, Swiss, dan Inggris, dan para penguji melaporkan penolakan untuk nama merek nyata dan suntingan karakter biasa. Di luar filternya, hak kemiripan berbeda menurut yurisdiksi dan tidak gugur hanya karena footagenya sintetis.

Apakah watermark SynthID muncul di setiap frame, dan bisakah dihapus?

Setiap video hasil generasi membawa SynthID, tertanam saat generasi, tak terlihat oleh penonton dan terdeteksi secara programatis. Tidak ada penyedia yang membuka sakelarnya, dan tandanya selamat dari kompresi, pemangkasan, dan perubahan warna, jadi penghapusan bukan alur kerja yang bisa Anda rencanakan. Bila spesifikasi pengiriman melarang material berwatermark, selesaikan itu sebelum merender.

Apakah lebih murah beriterasi pada wajah di resolusi rendah?

Ya, jauh lebih murah. Sepuluh jalan pencarian pada 360p plus satu finish 1080p berbiaya $1.73 di E2X melawan $5.40 untuk sepuluh jalan pada 1080p — enam puluh delapan persen lebih murah dengan satu generasi tambahan. Jalan draf membawa resolusi cukup untuk garis pandang dan blocking, tetapi tidak untuk tekstur kulit atau lip sync, jadi rencanakan dua take resolusi penuh setelah loop draf ditutup.

Harga dan ketentuan produk berubah. Periksa harga terkini tiap penyedia sebelum mengambil keputusan pembelian.

Skema dan tarif langsung untuk keempat kapabilitasnya ada di halaman model. Di sebelahnya: sintaks prompt yang terdokumentasi, berapa sebenarnya biaya sekuens empat puluh detik, dan di mana bobot yang sama dijual lebih mahal.