ब्लॉग पर वापस जाएं

Gemini Omni 1.1 Flash पर फ़ोटोरियलिस्टिक लोग: 'सुंदर' शब्द हटा दीजिए

E2X Team··19 मिनट पढ़ें
gemini-omniprompt-engineeringphotorealismtext-to-videogoogle

बनाए गए किसी इंसान को नक़ली दिखाने का सबसे तेज़ तरीक़ा है किसी आकर्षक इंसान की माँग करना।

beautiful woman, perfect skin, flawless, stunning लिखिए और मॉडल मान लेता है — वह अपने training data के उस इलाक़े तक पहुँचता है जहाँ ये captions रहते हैं, और वह है retouch की हुई commercial photography। रोमछिद्र ग़ायब, विषमता ग़ायब, और वे छोटे तनाव भी उनके साथ ग़ायब जो किसी चेहरे को किसी के भीतर बसा हुआ दिखाते हैं। Output में कुछ भी ग़लत नहीं है। Prompt ने एक सौंदर्य विज्ञापन माँगा और वही मिला।

Google का अपना prompt मार्गदर्शन एक ही वाक्य में उल्टी दिशा दिखाता है — "Be extremely detailed in your descriptions of characters and environments." विस्तृत, तारीफ़ भरा नहीं। ये अलग निर्देश हैं और अलग चेहरे बनाते हैं। आगे यही फ़र्क़ है: चेहरे, हाथ, वह audio जिसे आप बंद नहीं कर सकते, और वे जगहें जहाँ Google ने तय किया है कि आप नहीं जा सकते।

उत्तर-मुखी खिड़की के पास साठ की उम्र के एक आदमी का extreme close-up चित्र, भौंह से ठुड्डी तक पूरा frame भरता हुआ, नरम दिशात्मक दिन-रोशनी में रोमछिद्रों की बनावट और सफ़ेद पड़ती कटी दाढ़ी उभरी हुई

चेहरा तारीफ़ों की सूची नहीं, तथ्यों की सूची है

हर विशेषण किसी caption समूह के लिए एक वोट है, और gorgeous stock को वोट देता है। 8k, hyperrealistic, masterpiece image-model की लोककथा से आए, जहाँ वे quality tokens का काम करते थे; बिना sampling parameters वाले video मॉडल पर वे सिर्फ़ आपके shot को बताने वाले शब्दों से होड़ करते हैं। इनकी जगह लेने वाले शब्द ख़ास और उबाऊ हैं, और यही बात है:

उम्र, संख्या या दशक के रूप में। "चालीस के आख़िरी सालों की एक औरत" एक बंधन है; "एक जवान औरत" एक लॉटरी टिकट है।

एक नामित ख़ामी। एक उभरा हुआ निशान, एक टूटा हुआ सामने का दाँत, एक नाक जो एक बार टूटकर थोड़ी टेढ़ी बैठ गई। एक काफ़ी है; तीन किसी character sheet जैसे पढ़े जाते हैं।

त्वचा, एक सतह के रूप में। नाक और गालों पर दिखते रोमछिद्र, माथे पर चमक, नथुने के पास फटी केशिकाएँ। Prompt में सबसे ज़्यादा फल देने वाला बदलाव: "perfect skin" और "visible pores across the nose" caption-अंतरिक्ष के दो विपरीत छोरों पर बैठते हैं।

नज़र, जिसमें दिशा और बदलाव हो। "कैमरे को देख रही है" नहीं, बल्कि "frame के बाहर दाईं ओर कुछ पढ़ती है, फिर उसकी आँखें क़रीब एक सेकंड के लिए lens पर आती हैं और फिर हट जाती हैं।" पूरी clip भर अटूट नज़रें मिलाना लगभग कोई इंसान नहीं करता, इसलिए बिना बताई गई eyeline मॉडल को उसी चीज़ पर अंदाज़ा लगाने देती है जिसे दर्शक सबसे पहले पढ़ता है।

एक micro-expression, समय के साथ। "उसके मुँह का कोना एक बार कसता है।" मंचित किया गया एक घटनाक्रम "भावुक" को हरा देता है, क्योंकि मॉडल घटना मंचित कर सकता है, अमूर्तता नहीं।

त्वचा के अलावा हर चीज़ पर घिसाव। दो सौ बार धुला कॉलर, नरम पड़ चुका घड़ी का पट्टा, काग़ज़ों पर कॉफ़ी का गोल निशान। पहनावा किसी इंसान को चेहरे से ज़्यादा भरोसे के साथ बेचता है।

यह अदला-बदली, ठोस रूप में। पहले वह संस्करण जो पलक झपकाना सीख चुकी stock photo जैसा लगता है:

A beautiful young woman with perfect flawless skin sits by a window,
looking at the camera. Cinematic, photorealistic, 8k, ultra detailed,
masterpiece, stunning gorgeous eyes, professional studio lighting, sharp
focus, high quality, award winning photography, perfect symmetry, smooth
glowing complexion, elegant, breathtaking, hyperrealistic render,
trending, best quality, dramatic mood, beautiful composition.

उनमें से ज़्यादातर शब्द एक तस्वीर बताते हैं; कोई भी एक इंसान नहीं बताता। दोबारा लिखी शक्ल shot वही रखती है और हर तारीफ़ को एक तथ्य से बदल देती है:

In a single continuous shot, no scene cuts. Close-up of a woman in her
late forties sitting at a kitchen table beside a north-facing window.
Faint vertical lines between her brows, a small raised scar on the left
side of her chin, uneven eyebrows, a few grey hairs escaping a loose tie.
Skin carries visible pores across the nose and cheeks and a slight shine
on the forehead, no makeup on the jawline. She reads something off frame
to the right, then her eyes flick to the lens for about a second and away
again. The corner of her mouth tightens once. Soft window light from
camera left, one dim practical behind her. Shallow depth of field, 50mm.
Sound design: a kettle settling in the next room, distant traffic.
No dialogue.

दूसरे संस्करण में कोई चीज़ गुणवत्ता नहीं माँगती। वह render करने के लिए एक बनावट देता है, eyeline के लिए एक वजह और एक समयबद्ध घटना — तीन चीज़ें जिन पर मॉडल अमल कर सकता है, जबकि "stunning" तीन ऐसी चीज़ें हैं जिन पर नहीं कर सकता। शुरुआत में shot-count वाला वाक्यांश भी देखिए: Omni डिफ़ॉल्ट रूप से कई shots बनाता है, जैसा हमने prompting गाइड में बताया, और छह सेकंड में दो बार कटने वाला portrait किसी चेहरे को टिका नहीं सकता।

बिलकुल बाएँ छोर से आती तीखी छूती रोशनी में नहाए इंसानी गाल और कनपटी का extreme macro, आधा frame चमकीला और बनावट भरा और बाक़ी आधा छाया में डूबता हुआ

आँखों पर एक चेतावनी: "wet eyes" और "glossy tear film" तकनीकी पोशाक पहने quality शब्द हैं, जो किसी कारण के बजाय एक highlight का नाम लेते हैं। आँख को कुछ करने के लिए दीजिए और specular को उसी रोशनी से निकलने दीजिए जो आप पहले ही बता चुके हैं।

हाथ: उन्हें एक काम दीजिए

हाथ generative video की पुरानी शर्मिंदगी हैं और अब भी सबसे ज़्यादा संभावना वाली चीज़ जो एक take ख़त्म कर दे। DeepMind का model card उन्हें अलग से नहीं गिनाता, पर उनकी श्रेणी का नाम लेता है: "maintaining complete consistency throughout edits, generating scenes with complex motion, or rendering perfectly accurate text remains a challenge." उँगलियाँ frame के एक छोटे टुकड़े में complex motion हैं, कई तरह से मुड़ती हैं और लगातार ख़ुद को ढँकती रहती हैं।

उपाय सहज-बुद्धि के उलट है। हाथों का वर्णन मत कीजिए — उन्हें एक काम सौंपिए। किसी ख़ास वस्तु को बताई गई पकड़ के साथ थामे हाथ के पास एक आकार और एक स्पर्श-बिंदु होता है जिससे वह बँधा रहे। "Beautiful, elegant hands" इनमें से कुछ नहीं देता, और उँगलियों की गिनती मॉडल के गढ़ने के लिए छोड़ देता है।

तुलना कीजिए:

  • कमज़ोर: उसके हाथ सहज रूप से बग़ल में टिके हैं
  • बेहतर: वह एक चिटका हुआ enamel मग दोनों हाथों में थामे है, पास वाली तरफ़ अंगूठे एक-दूसरे पर चढ़े हुए
  • कमज़ोर: वह बोलते हुए हाथ हिलाता है
  • बेहतर: वह दाहिने हाथ में एक पेन दो बार घुमाता है, फिर उसे काग़ज़ों पर रख देता है

हर जोड़ी का दूसरा रूप उँगलियों की गिनती को परोक्ष रूप से तय कर देता है, गति को शुरुआत और अंत देता है, और एक ऐसा beat बनाता है जिस पर आप cut कर सकें।

एक चेतावनी जो इस पोस्ट के हर तीसरे-पक्ष आँकड़े पर लागू है। जो दो प्रकाशित hands-on समीक्षाएँ हमें मिलीं — invideo की और JXP टीम का multi-turn परीक्षण, 21 मई 2026 की byline वाला — दोनों परीक्षित मॉडल को Gemini Omni Flash बताती हैं, दोनों में कहीं 1.1 प्रत्यय नहीं। दोनों में से कोई उस मॉडल को नहीं मापती जिस पर यह पोस्ट है; उन्हें इस परिवार के बारे में साक्ष्य की तरह पढ़िए। JXP बताता है कि एक violin shot के पाँचवें editing turn पर, "Her left hand drifted slightly off the fingerboard." हाथ पहले गए, जबकि बाक़ी सब अब भी टिका हुआ था।

बिना क़ीमत वाले दो और नियम। हाथों को एक ही focus तल में रखिए — चौड़ी lens की ओर बढ़ाया गया हाथ सबसे कठिन चीज़ है जो आप माँग सकते हैं। और हाथों को चेहरे से दूर रखिए, क्योंकि दो कठिन संरचनाओं के बीच का ढँकाव नाकामी को औसत करने के बजाय गुणा कर देता है।

घूमते मिट्टी के बेलन को घेरते कुम्हार के दो गीले हाथों की macro तस्वीर, उँगलियों के बीच से बहती गीली मिट्टी, रोशनी से उभरी नसें और पोरों की सिलवटें

आप एक आवाज़ निर्देशित कर रहे हैं, चाहे आपका इरादा हो या न हो

यहाँ audio native है: तस्वीर के साथ उसी pass में बनता है, किसी parameter से बंद नहीं होता, और हमने जितने providers देखे उनमें से कोई इसे अलग से बिल नहीं करता। इसलिए आवाज़ के बारे में कुछ न कहने वाला prompt ख़ामोशी की माँग नहीं है — वह एक बिना निगरानी वाला brief है, और मॉडल उसे भर देगा।

तो audio जानबूझकर लिखिए, अपने अलग वाक्यों में। Google का दर्ज संवाद-रूप बिना उद्धरण चिह्न वाला colon है — the man says: We lost it — और यह बहु-दोहराया दावा कि उद्धरण चिह्न lip-sync mode चालू कर देते हैं, किसी Google दस्तावेज़ में नहीं मिलता।

बोलते हुए shot के चलने या न चलने का फ़ैसला चार चीज़ें करती हैं:

संवाद की लंबाई। invideo, एक समीक्षा में जो परीक्षित मॉडल को Gemini Omni Flash बताती है, कहती है कि "For a single person talking, the lip sync holds up until about 6 to 7 seconds before it begins to drop off." यह किसी specification से ज़्यादा एक दिशा है, पर वह एक ही ओर इशारा करती है: शुरू में रखा गया चार से बारह शब्दों का संवाद, फिर ख़ामोशी और एक प्रतिक्रिया, पूरे take भर चलने वाले वाक्य से बेहतर है।

Frame में एक ही बोलने वाला। वही समीक्षा दो-टूक है: "Two speakers in one frame remain a weak spot, since Omni often drops sync or misattributes dialogue, so single-speaker shots are the safe bet today." दूसरे व्यक्ति को frame के किनारे पर, focus से बाहर, एक कंधा बना दीजिए और उसका संवाद अलग generation में शूट कीजिए।

गद्य में आवाज़ का निर्देशन। कोई voice parameter है नहीं, इसलिए लहजा, उम्र, स्वर और रफ़्तार सादी अंग्रेज़ी में जाते हैं: tired, quiet, American accent, no rise at the end।

स्पष्ट ख़ामोशी। No dialogue. या No music. लिखिए।

एक संवाद shot के लिए पहले और बाद में। कमज़ोर संस्करण ऊपर की हर ग़लती एक साथ करता है — frame में दो बोलने वाले, उद्धरण चिह्न, हर एक का एक संवाद, निर्देशन की जगह खड़े विशेषण:

A man in an office says "We lost the contract" to his colleague and she
replies "I know" while they talk to each other, both very emotional,
dramatic scene, cinematic dialogue, photorealistic, perfect lip sync,
realistic voices, high quality conversation, intense acting, beautiful
faces, professional film look, 4k, detailed, award winning drama scene.

दोबारा लिखी शक्ल एक बोलने वाले को frame से बाहर कर देती है, संवाद को चार शब्दों तक काटती है, और आवाज़ की तारीफ़ करने के बजाय उसका वर्णन करती है:

In a single continuous shot, no scene cuts. Medium close-up of a man in
his early fifties in a glass-walled meeting room after hours, tie
loosened, two days of stubble, a coffee ring on the papers in front of
him. He is alone in frame; a second person's shoulder sits out of focus
at the right edge. He turns a pen over in his right hand twice, sets it
down, and looks up. The man says: We lost it. Tired, quiet, American
accent, no rise at the end. He holds the look for a beat, then glances
down. Overhead fluorescents plus city light through the glass, 50mm,
shallow depth of field. Sound design: air conditioning hum and one
distant door closing. No music.

उसका जवाब दूसरी generation का हिस्सा है, उस पर framed — एक के बजाय दो clips, और फिर भी किसी दो-लोगों वाले shot को आठ बार दोबारा चलाने से सस्ता, यह उम्मीद करते हुए कि sync दोनों चेहरों पर एक साथ बैठ जाए।

एक दर्ज सीमा: आप बोलते हुए किसी व्यक्ति का अपलोड किया वीडियो लेकर उसे नए संवाद के साथ आगे नहीं बढ़ा सकते। यह अनुपस्थित नहीं, रोका हुआ है, और model card इसे साफ़ कहता है — "As part of editing videos, Gemini Omni Flash is capable of changing people's speech. For now, we are restricting this capability and working to better understand how to safely and responsibly bring it to our users." मॉडल किसी की आवाज़ बदल सकता है; Google ने तय किया है कि आप ऐसा नहीं कर सकते। Dubbing यहाँ बनाया जा सकने वाला उत्पाद नहीं है।

भीड़, background की आकृतियाँ, और कहाँ ख़र्च न करें

Background के लोगों को वही ध्यान मिलता है जो बचता है, और पैदल चलने वालों से भरी एक व्यस्त सड़क चेहरों की ऐसी क़तार है जो pause बटन से नहीं बचेगी। एक संख्या दीजिए — "बिखरी मेज़ों पर चार लोग", "भीड़ भरा कैफ़े" को हरा देता है, क्योंकि धुँधली मात्रा अनुमानों को न्योता देती है। उन्हें focus तल से बाहर रखिए, क्योंकि उथले 50mm से नरम पड़ी आकृतियाँ विश्वसनीय होती हैं जबकि वही आकृतियाँ f/11 पर तेज़ होकर लगभग-चूकों की प्रदर्शनी बन जाती हैं। और हर एक को एक-एक क्रिया दीजिए, मुँह दूसरी ओर: सिर के पिछले हिस्से मुफ़्त हैं। अगर background का कोई ख़ास चेहरा मायने रखता है, तो उसे उसके अपने shot में पदोन्नत कीजिए।

Takes की क़ीमत, और 4K ही क्यों वह संख्या है जो मायने रखती है

चेहरे वही जगह हैं जहाँ आप generations जलाते हैं — आप eyeline के लिए दोबारा चलाते हैं, फिर हाथ के लिए, फिर इसलिए कि आवाज़ बीस साल जवान निकल आई। इस काम की ईमानदार क़ीमत लगाने का मतलब है takes की क़ीमत लगाना, clips की नहीं। और provider का अंतर सीढ़ी के सबसे ऊपर सबसे चौड़ा है। 4K के दस सेकंड, 29 अगस्त 2026 तक:

आप कहाँ से कॉल करते हैं4K पर 10 सेकंड
E2X$1.80
fal$3.00
Google, सीधे$3.04
Runware$3.20
WaveSpeed$3.90

Google का आँकड़ा किसी sticker price के बजाय उसकी प्रकाशित प्रति-सेकंड token दर से निकलता है, और fal का आँकड़ा compute पर स्वतंत्र पाठ के बजाय Google की सूची का passthrough है। यह फ़ासला संरचनात्मक है: 720p आधार से Google 4K के लिए तिगुना लेता है जबकि हम दोगुना। 4K पर 41% कम हमारे चारों tiers में सबसे चौड़ा है, और आठ सेकंड का take यहाँ $1.44 है जबकि सीधे $2.43। बाक़ी provider-दर-provider ऑडिट में है।

गणित का दूसरा आधा यह है कि आप कहाँ दोहराते हैं। 360p पर दस search passes और एक 1080p finish $1.73 पड़ते हैं, जबकि सीधे दस 1080p passes $5.40 — एक अतिरिक्त generation के बदले अड़सठ प्रतिशत की कमी। एक draft pass में eyeline, blocking और यह देखने भर का resolution है कि हाथ को मग मिला या नहीं; त्वचा की बनावट या lip sync के लिए नहीं, इसलिए loop बंद होने के बाद पूरे resolution के दो takes का बजट रखिए। और यह भी पूछिए कि shot को यही मॉडल चाहिए या नहीं: Veo 3.1 Fast यहाँ एक सेंट प्रति सेकंड पर चलता है, और बिना किसी continuation वाले अकेले portrait के लिए नौगुना premium बहुत कम ख़रीदता है।

सीमाएँ, साफ़-साफ़ कही हुई

यह कोई अस्वीकरण खंड नहीं है। नीचे की हर बात ने किसी न किसी की project योजना बदली है।

SynthID हर frame में है, और कोई स्विच नहीं है। Google के शब्द: "All generated videos include SynthID watermarking, which is invisible to viewers but can be detected programmatically for provenance verification." कोई provider इसका toggle नहीं देता, और चूँकि यह निशान re-encoding, cropping और रंग-बदलाव से बचने के लिए बना है, "हम इसे post में हटा देंगे" कोई योजना नहीं है। अगर कोई delivery अनुबंध watermark वाली assets मना करता है, तो render करने से पहले यह तय कर लीजिए।

अपलोड किए वीडियो का editing EEA, स्विट्ज़रलैंड और यूके में उपलब्ध नहीं है। Google की पंक्ति, उस कोष्ठक समेत जो तय करता है कि यह आपके लिए कितनी बुरी है: "Editing or extending uploaded videos is not currently available for users in the European Economic Area (EEA), Switzerland, and the United Kingdom (editing or extending videos generated by the model is supported)." कोई यूरोपीय टीम अब भी एक shot बना सकती है और अपने ही output को आगे बढ़ा सकती है; जो वह नहीं कर सकती वह है उपयोगकर्ता के अपलोड किए footage को जारी रखना। परिणामों को हमने चालीस सेकंड के दृश्यों वाली पोस्ट में देखा — देर से पता चलने पर यहाँ की सबसे महँगी बात यही है।

कुछ ख़ास लोगों वाले अपलोड ठुकरा दिए जाते हैं। उसी limitations खंड की दो और पंक्तियाँ, दोनों उन्हीं क्षेत्रों तक सीमित: "Uploading and editing images containing minors is not supported in European Economic Area, Switzerland, and the United Kingdom", और "Uploading and editing images containing certain recognizable people is not supported in European Economic Area, Switzerland, and the United Kingdom." इनकार का दायरा इन शब्दों से चौड़ा दिखता है: JXP, उसी पूर्ववर्ती-दौर की समीक्षा में, बताता है कि एक असली ब्रांड का नाम लेने वाला prompt "was blocked at submission with a generic policy message", और "age a generic adult character ten years" का अनुरोध भी रोक दिया गया। ऐसी pipeline मत बनाइए जो इस पर टिकी हो कि इनकार नहीं होंगे।

असली लोग तकनीकी से पहले क़ानूनी सवाल हैं। किसी असली व्यक्ति की पहचानी जा सकने वाली शक्ल, उसकी सहमति के बिना बनाई गई, व्यक्तित्व और publicity अधिकारों से टकराती है जो अधिकार-क्षेत्र के हिसाब से बदलते हैं और इसलिए ख़त्म नहीं हो जाते कि output कृत्रिम है। अलग से, EU AI Act के अनुच्छेद 50 के तहत पारदर्शिता दायित्व 2 अगस्त 2026 से लागू हैं: deployers को स्पष्ट रूप से और पहले ही संपर्क पर बताना होगा कि सामग्री कृत्रिम रूप से बनाई या बदली गई है। SynthID मशीन-पठनीय चिह्नांकन की शर्त पूरी करता है; देखने वाले व्यक्ति को बताने का दायित्व वह पूरा नहीं करता। यह किसी API call का flag नहीं, बल्कि क़ानूनी सलाह के साथ लिया जाने वाला labelling फ़ैसला है।

बनाया गया चेहरा कोई इंसान नहीं है, पर वह किसी के इतने क़रीब बैठ सकता है कि किसी को नुक़सान हो। सहमति, प्रकटीकरण और shot न बनाने की तैयारी इस कारीगरी का उतना ही हिस्सा हैं जितना focal length।

अक्सर पूछे जाने वाले सवाल

Gemini Omni 1.1 Flash में यथार्थवादी त्वचा कैसे मिलती है?

तारीफ़ करने के बजाय सतह का वर्णन कीजिए। "Perfect skin", "flawless" और "beautiful" retouch की गई commercial तस्वीरें चुनते हैं और बनावट को सपाट कर देते हैं। इन्हें देखे जा सकने वाले तथ्यों से बदलिए — नाक और गालों पर दिखते रोमछिद्र, माथे पर चमक, एक छोटा निशान — और उम्र बताइए। Google बेहद विस्तृत character वर्णन माँगता है, जो आकर्षक character माँगने जैसा नहीं है।

AI video में हाथ ग़लत क्यों दिखते हैं, और prompt में इसे कैसे ठीक करें?

उँगलियाँ एक छोटे, ख़ुद को ढँकते इलाक़े में complex motion हैं, और Google का model card complex motion को उन चीज़ों में गिनाता है जो "remains a challenge." हाथों का वर्णन करने के बजाय उन्हें काम दीजिए: बताई गई पकड़ के साथ कोई ख़ास वस्तु, या शुरुआत और अंत वाली कोई क्रिया। उन्हें एक ही focus तल में और चेहरे से दूर रखिए।

क्या Gemini Omni 1.1 Flash में audio बंद किया जा सकता है?

नहीं। Audio तस्वीर के साथ natively बनता है, कोई parameter उसे बंद नहीं करता, और प्रति-सेकंड दर से अलग उसका बिल नहीं बनता। आप उसे "Sound design:" वाले वाक्य और स्पष्ट "No dialogue." या "No music." वाक्यांशों से दिशा दे सकते हैं, पर मना नहीं कर सकते। ख़ामोश playback के लिए player को mute कीजिए।

Omni prompt में संवाद कैसे लिखा जाना चाहिए?

Google का दर्ज रूप इस्तेमाल कीजिए: बोलने वाला, colon, संवाद, कोई उद्धरण चिह्न नहीं। आवाज़ का निर्देशन सादे गद्य में आगे आता है, क्योंकि कोई voice parameter नहीं है — लहजा, उम्र, स्वर और रफ़्तार सब अंग्रेज़ी में आते हैं। संवाद छोटे रखिए, शुरू में रखिए, और "भावुक" प्रस्तुति माँगने के बजाय tone का वर्णन कीजिए।

Gemini Omni कितनी देर lip sync टिका पाता है?

invideo, एक समीक्षा में जो परीक्षित मॉडल को 1.1 के बजाय Gemini Omni Flash बताती है, कहती है कि एक व्यक्ति के बोलने पर lip sync गिरने से पहले क़रीब छह से सात सेकंड टिकता है, और एक frame में दो बोलने वालों को कमज़ोर जगह बताती है जहाँ मॉडल sync खो देता है या संवाद ग़लत व्यक्ति को सौंप देता है। यह Google का specification नहीं बल्कि पुराने मॉडल पर एक समीक्षक का निष्कर्ष है, पर यह प्रति generation एक ही बोलने वाले और शुरू में रखे छोटे संवादों के पक्ष में तर्क देता है।

क्या Gemini Omni 1.1 Flash किसी असली व्यक्ति की शक्ल बना सकता है?

भरोसे के साथ नहीं, और कोशिश करने से पहले अच्छी तरह सोचिए। Google का दस्तावेज़ कहता है कि पहचाने जा सकने वाले कुछ ख़ास लोगों वाली तस्वीरें अपलोड करना और editing करना EEA, स्विट्ज़रलैंड और यूके में समर्थित नहीं है, और परीक्षक असली ब्रांड नामों तथा साधारण character edits पर इनकार बताते हैं। Filter से परे, शक्ल के अधिकार अधिकार-क्षेत्र के हिसाब से बदलते हैं और इसलिए ख़त्म नहीं हो जाते कि footage कृत्रिम है।

क्या SynthID watermark हर frame पर आता है, और क्या उसे हटाया जा सकता है?

हर बनाया गया वीडियो SynthID लिए होता है, generation के वक़्त embed हुआ, दर्शकों को अदृश्य और programmatically पहचाना जा सकने वाला। कोई provider इसका स्विच नहीं देता, और यह निशान compression, cropping और रंग-बदलाव से बच जाता है, इसलिए हटाना ऐसा workflow नहीं जिसकी योजना बनाई जा सके। अगर delivery spec watermark वाली सामग्री मना करता है, तो render से पहले यह तय कर लीजिए।

क्या चेहरों पर कम resolution में दोहराना सस्ता है?

हाँ, काफ़ी। 360p पर दस search passes और एक 1080p finish E2X पर $1.73 पड़ते हैं, जबकि 1080p पर दस passes $5.40 — एक अतिरिक्त generation के बदले अड़सठ प्रतिशत की कमी। Draft passes में eyeline और blocking भर का resolution है, पर त्वचा की बनावट या lip sync के लिए नहीं, इसलिए draft loop बंद होने के बाद पूरे resolution के दो takes की योजना बनाइए।

क़ीमतें और उत्पाद की शर्तें बदलती हैं। ख़रीद का फ़ैसला लेने से पहले हर provider की मौजूदा क़ीमत देख लीजिए।

चारों capabilities के schemas और live दरें मॉडल पेज पर हैं। बग़ल में: दर्ज किया गया prompt syntax, चालीस सेकंड के sequences असल में कितने पड़ते हैं, और वही weights कहाँ महँगे बिकते हैं।