Gemini Omni 1.1 Flash पर shot निरंतरता: कौन-सा endpoint कौन-सा खिसकाव ठीक करता है
Google ने इस मॉडल के बारे में एक ही लॉन्च पर दो वाक्य छापे, और वे उलटी दिशाओं में इशारा करते हैं।
पहला घोषणा में है: जब Omni किसी clip को आगे बढ़ाता है तो अब वह "up to 10 seconds of prior context — a leap from previous models that only referenced the final second" पढ़ता है। दस गुना स्मृति। दूसरा DeepMind के model card में है, limitations के नीचे: "maintaining complete consistency throughout edits, generating scenes with complex motion, or rendering perfectly accurate text remains a challenge."
दोनों सच हैं, और मिलकर वे इस काम का वर्णन करते हैं। यहाँ निरंतरता कोई स्विच नहीं जिसे आप चालू करें, बल्कि input पर लिए गए फ़ैसलों का समुच्चय है — आप कौन-सा endpoint कॉल करते हैं, किसी image से क्या बाँधते हैं, कौन-से वाक्य शब्दशः दोहराते हैं। चार हिस्सों वाले sequence की लागत एक अलग बहस है जिसे हम दोबारा नहीं चलाएँगे।

चार endpoints, स्थिर रखी गई चार अलग चीज़ें
E2X पर gemini-omni-1.1-flash एक ही क़ीमत पर चार capabilities के रूप में आता है — 4K पर $0.18 प्रति सेकंड, आप इनमें से कोई भी कॉल करें। यह इनके बारे में सोचने का तरीक़ा बदल देता है: इनमें से चुनना कभी बजट का फ़ैसला नहीं होता, सिर्फ़ कारीगरी का।
हर एक क्या बाँधता है:
| Capability | जो वह स्थिर रखता है | जो वह नहीं रखेगा |
|---|---|---|
| text-to-video | आपके शब्दों के अलावा कुछ नहीं | वह सब जो आपने लिखा नहीं |
| image-to-video | शुरुआती frame, ठीक वैसा ही | मोटे तौर पर पहले सेकंड के बाद सब कुछ |
| start-end-frame-to-video | shot के दोनों सिरे | उनके बीच का रास्ता |
| reference-to-video | subject की पहचान और शक्ल | framing, staging, कैमरे की जगह |
इसे feature सूची के बजाय एक निदान-तालिका की तरह पढ़िए: जो खिसकाव आप देख रहे हैं उसका नाम लीजिए, फिर वह endpoint चुनिए जो उसे सँभालता है।
Shot ग़लत शुरू होता है। आपका दूसरा कोण किसी और कमरे में खुलता है, या किरदार पहले से ही किसी हाव-भाव के बीच में अंदर आता है। उसे एक frame दीजिए: image-to-video एक still लेकर वहीं से शुरू करता है, तो दूसरा shot पहले shot के आख़िरी frame से लिए गए grab पर खुल सकता है, या ऐसे still render पर जिसे आपने पहले मंज़ूर किया था। यह मॉडल की दी हुई सबसे सस्ती निरंतरता-मरम्मत है।
Shot ग़लत ख़त्म होता है। गति सही है और उतरना नहीं — हाथ दरवाज़े की ओर बढ़ता है और दरवाज़ा कहीं और है। यह start-end-frame-to-video का काम है। आप start_frame_url और end_frame_url देते हैं, मॉडल बीच का अंतराल भरता है, और जिस frame से आपके अगले cut को मेल खाना है वह वही है जो आपने चुना, न कि जो आपको थमा दिया गया।
व्यक्ति बदल जाता है। framing नहीं, staging नहीं — चेहरा, बाल, jacket। यह reference-to-video है, चारों में से अकेला जिसका मक़सद पहचान है। हमारा image_urls array कम से कम एक और ज़्यादा से ज़्यादा सात लेता है; Runware वही सीमा दर्ज करता है — "up to 7 images" — जबकि Google का reference कोई संख्या नहीं बताता, हालाँकि उसका हल किया उदाहरण छह tags चलाता है। सात को प्रकाशित गारंटी नहीं, तीसरे-पक्ष की आम सहमति मानिए।
Video references पर सीमा और सख़्त है और Google वे संख्याएँ छापता भी है: "Video references support a maximum of 3 clips, up to 3 seconds each", साथ में "Referencing or reasoning across multiple videos is not supported" — तीन वह छत है जिसके पास आप पहुँचते हैं, वह लक्ष्य नहीं जिसे आप भरते हैं। Reference image में क्या होना चाहिए इस पर Runware का दस्तावेज़ Google से ज़्यादा ख़ास है और एक साफ़ mid-shot portrait सुझाता है — कमर से ऊपर की framing, तटस्थ background, पहचान वाली डिटेल दिखती हुई — क्योंकि "Full-body shots, busy backgrounds, or extreme angles dilute the model's read on the character."
Seed क्या बाँधता है, और क्या नहीं
इस endpoint पर कोई sampler नहीं है। Google का दस्तावेज़ इस पर सपाट है: "System instructions, temperature, top_p, stop sequences, and negative prompts are not supported." Sampling तल न होने का मतलब है दोहराव का एक ही नियंत्रण, और वह है seed — एक वैकल्पिक integer जिसे हमारे चारों capability schemas स्वीकार करते हैं।
यह जानना ज़रूरी है कि वह field आता कहाँ से है, क्योंकि Google के reference में वह है ही नहीं। Runware का 1.1 दस्तावेज़ एक seed रखता है और बताता है कि आपके न देने पर वह "the randomly generated seed" लौटाता है; हम यह field हर capability पर खोलते हैं; Google, जिस पन्ने को आप पहले देखेंगे, वहाँ कुछ नहीं कहता। इसे इस्तेमाल कीजिए, पर अनुबंध मत मानिए।
जो हिस्सा लोगों को फँसाता है: seed नमूने को बाँधता है, subject को नहीं। वही seed और byte-दर-byte वही prompt एक दोहराव है। वही seed और एक बदला हुआ शब्द एक नया draw है — ताज़ा sampling, न कि हल्का धक्का। यह temperature की घुंडी के ठीक उलट है, और इसका मतलब है कि prompt बदलते हुए seed थामे रखने की image-model वाली आदत यहाँ काम नहीं आती।
इससे multi-shot काम में seed ठीक दो चीज़ों के लिए उपयोगी बचता है, और तीसरी के लिए बेकार:
- किसी रखे हुए take को ऊँचे tier पर दोबारा render करना। Draft बनाइए, take ढूँढिए, फिर वही prompt और seed अपने delivery resolution पर चलाइए। कुछ नहीं बदला, तो कुछ दोबारा sample नहीं होता।
- एक चर को अलग करना। Lighting वाला वाक्य बदलिए, seed थामे रखिए, और जो हिलेगा उसका श्रेय उसी वाक्य को दिया जा सकेगा। यह नियंत्रित प्रयोग नहीं, पर अंधाधुंध दोबारा sampling से तेज़ है।
- दो अलग shots के बीच एक चेहरा ले जाना। यह नहीं होगा। दो prompts दो prompts हैं; seed आपके किरदार को याद नहीं रखता। Shots के आर-पार पहचान reference images से आती है, किसी integer से नहीं।
जिस पल कोई take काम करे, seed को prompt के बग़ल में लिख लीजिए। उसे बाद में वापस पाने के लिए कोई history नहीं है।
Lock blocks: वही पैराग्राफ़, शब्दशः दोहराया हुआ
चूँकि किसी text-to-video कॉल के पास आपकी पिछली कॉल की कोई स्मृति नहीं है, चलन में मौजूद सबसे आम निरंतरता-निर्देश दरअसल किसी को संबोधित ही नहीं है: "सब कुछ पिछले shot के अनुरूप रखिए" ऐसे shot की ओर इशारा करता है जिसे मॉडल ने कभी देखा ही नहीं।
उपाय बेरौनक़ है। शक्ल और set के तथ्यों का एक block लिखिए और उसे sequence के हर prompt में बिना बदले चिपकाइए — न दूसरे शब्दों में, न कसा हुआ, न क्रम बदला हुआ। नया वर्णन एक नया draw है।
दो shots वाले sequence के दूसरे shot के दो संस्करण। पहले वह जो खिसकता है:
Continuing the same scene, a tighter shot of the same man at his
workbench in the garage. Cinematic lighting, moody atmosphere,
highly detailed, professional colour grading. He lifts the machined
part into the light and turns it slowly while his colleague watches
from the right. Keep the characters and the location consistent
with the previous shot. Single continuous shot, no scene cuts.
Sound design: workshop room tone and quiet handling noise.
गिनिए कि वह prompt क्या-क्या खुला छोड़ता है और आपके पास उन चीज़ों की सूची आ जाएगी जो बदलने के लिए आज़ाद हैं: jacket का ठीक-ठीक हरा रंग, cuff उधड़ा है या नहीं, bandana है भी या नहीं, pegboard पर क्या टँगा है, रोशनी कहाँ से आती है। इनमें से कुछ लिखा नहीं गया, इसलिए इनमें से कुछ आपका बकाया नहीं — किसी और दोपहर का एक क़ाबिल shot उस सवाल का सही जवाब है जो पूछा गया था।
दोबारा लिखी शक्ल क्रिया वही रखती है और अपने शब्द विशेषणों के बजाय तथ्यों पर ख़र्च करती है:
In a single continuous shot, no scene cuts. Medium two-shot in a
cluttered garage workshop, 40mm lens at f/4, both subjects sharp.
[Lock - repeat verbatim in every shot of this sequence]
Man: mid-forties, close-cropped grey hair parted on his left, faded
green canvas work jacket, frayed left cuff, oil stain on the right
pocket, steel watch on his left wrist. Woman: thirties, dark hair
tied back, grey knit sweater, red bandana at her neck, clipboard in
her right hand. Set: steel workbench, pegboard behind with three
wrenches hanging left of centre, one overhead fluorescent tube,
cold white key from above, no window light.
Action: he lifts a machined aluminium part into the light and turns
it once; she does not move. Sound design: fluorescent hum, the part
clicking down onto steel. No dialogue.
कोष्ठक वाला लेबल आपके लिए है, मॉडल के लिए नहीं — वह उस हिस्से को चिह्नित करता है जिसे आप कॉपी करते हैं। उस block में जगह पाने का हक़दार वह सब है जो असममित या क्षतिग्रस्त हो: बाल किस तरफ़ बँटे हैं, कौन-सा cuff उधड़ा है, घड़ी किस कलाई पर है, clipboard किस हाथ में। खिसकाव समरूपता में छिपता है, क्योंकि दर्पण जैसी समरूप डिटेल अकेले में सही दिखती है और किसी cut में ग़लत। रंगों के नाम वहीं जाते हैं, और रोशनी भी: दिशा, कठोरता, और उस स्रोत की स्पष्ट अनुपस्थिति जो आप नहीं चाहते।

एक चीज़ block से बाहर रखनी है: छपे हुए लेबल, साइनबोर्ड, props पर पढ़ा जा सकने वाला text। Model card सटीक text को खुली समस्याओं में गिनाता है, इसलिए ऐसा prop जिसे दो shots में एक जैसा पढ़ा जाना है, उपलब्ध सबसे कम भरोसेमंद लंगर है। उसके बजाय आकार और धब्बे पर लंगर डालिए।
Extension आगे की ओर चलता है, इसलिए पीछे से योजना बनाइए
Google के शब्द कोई गुंजाइश नहीं छोड़ते: "Video extension is limited to appending to the end of a video; prepending or extending the middle of a clip is not supported." Continuations दस-सेकंड के क़दमों में चलते हैं "up to a total length of 40s", और अपलोड की गई clip को extend करने से पहले उसका "10 seconds or less in length" होना ज़रूरी है।
योजना पर इसका असर दिखने से बड़ा है: किसी chain में undo नहीं होता। पहला shot उसके बाद जुड़ने वाली हर चीज़ के लिए palette, रोशनी और camera व्याकरण तय कर देता है, इसलिए वहाँ की ग़लती वह sequence है जिसे आप दोबारा बनाते हैं, न कि वह shot जिसे दोबारा render करते हैं। और सबसे जोखिम भरा shot — मुश्किल हाव-भाव, पेचीदा परावर्तन — आमतौर पर बीच में बैठता है, ठीक वहीं जहाँ आप पहुँच नहीं सकते।
तो पहली कॉल से पहले एक संरचनात्मक चुनाव करना होता है:
- एक extension chain आपको असली frame-दर-frame continuation और दस सेकंड का वह context ख़रीदकर देती है जिसे मॉडल सचमुच पढ़ता है। इसकी क़ीमत है पूँछ के अलावा कुछ भी ठीक कर पाने की क्षमता।
- editor में जोड़ी गई स्वतंत्र generations, हर एक किसी reference image या start frame से लंगर डाली हुई, आपसे निर्बाध जोड़ छीन लेती हैं और बदले में यह देती हैं कि आप तीसरा shot तीस बार दोबारा चला सकें और पहले और दूसरे को छूना भी न पड़े।
ऐसी क्रिया के लिए जो दिखने में कटी न लगे, extend कीजिए। ऐसे sequence के लिए जिसमें वैसे भी cuts हैं, अलग-अलग बनाइए — और यही वह विकल्प भी है जो client की टिप्पणी से बच जाता है, और ज़्यादातर sequences को एक तो मिलती ही है।
वह clip जोड़े गए दो shots नहीं, बल्कि एक reframe लिए हुए एक ही generation है:
A two-shot in a cluttered garage workshop, 40mm lens at f/4, both
subjects sharp. A man in a faded green work jacket with a torn left
cuff stands at the bench; a woman in a grey knit sweater with a red
bandana tied at her neck stands to his right holding a clipboard.
The camera holds the wide two-shot for four seconds while he lifts
a machined aluminium part into the light and turns it. Then the
camera pushes in and reframes to a tighter two-shot from the same
axis - same jacket, same torn cuff, same bandana, same bench clutter
behind them, same overhead fluorescent light. No cut, no wardrobe
change, no relight. Sound: fluorescent hum and the part clicking
down onto steel.
Cut points आवाज़ के भी cut हैं
Audio तस्वीर के साथ बनता है और उसे मना करने का कोई स्विच नहीं है। यह आमतौर पर sound design के ख़ाने में आता है; निरंतरता के लिए यह एक बंधन है, क्योंकि आपका cut ऐसे soundtrack के बीच में उतरता है जिसे आपने रचा नहीं और जिसे आप स्रोत पर काट नहीं सकते।
इससे दो नियम निकलते हैं। Cut के दोनों ओर ambience का वर्णन बिलकुल एक ही शब्दों में कीजिए, ठीक वैसे ही जैसे आप wardrobe block दोहराते हैं — दोनों prompts में "fluorescent hum", न कि एक में "fluorescent hum" और दूसरे में "the buzz of the overhead light"। जोड़ पर खिसकने वाले room tone को अनदेखा करना उस jacket से ज़्यादा मुश्किल है जिसकी रंगत बदल जाए, क्योंकि कान के पास छिपने के लिए कोई shot सीमा नहीं होती।
फिर कहाँ काटना है यह आवाज़ को ध्यान में रखकर चुनिए। हाव-भाव के बीच काटना मॉडल से माँगता है कि वह दूसरी तरफ़ वही motion vector दोबारा बनाए — ठीक वही "complex motion" मामला जिसे model card चिह्नित करता है। ठहरी हुई मुद्रा पर काटना — पुर्ज़ा रख दिया गया, हाथ स्थिर — अगली generation को एक निर्विवाद शुरुआती स्थिति और audio को एक स्वाभाविक जोड़ देता है। इसकी क़ीमत गति का एक beat है और बदले में ऐसा जोड़ मिलता है जो टिकता है।

इन सबसे पहले एक फ़ैसला आता है: aspect ratio। मॉडल 16:9 और 9:16 देता है और कुछ नहीं। चूँकि extension सिर्फ़ पीछे जोड़ता है और reference images वही framing लिए आती हैं जिसमें वे शूट हुईं, sequence के बीच में orientation बदलना कोई setting बदलना नहीं है — यह उससे पहले की हर asset को रद्द कर देता है। Orientation को delivery के हिसाब से, पहले shot पर ही चुनिए।
चार shots वाले sequence की क़ीमत
इस मॉडल पर निरंतरता के औज़ार मुफ़्त हैं। सात images वाली reference-to-video कॉल की क़ीमत वही है जो एक सादी text-to-video कॉल की; start-end-frame-to-video को दिए गए frames कुछ नहीं जोड़ते। आप सेकंड और resolution के पैसे देते हैं।
आठ सेकंड के चार shots बत्तीस सेकंड हैं। सबसे ऊपरी tier पर:
| कहाँ से | 4K पर 32 सेकंड |
|---|---|
| E2X | $5.76 |
| Google, प्रकाशित token दरों से | $9.73 |
| fal | $9.60 |
| Runware | $10.24 |
| WaveSpeed | $12.48 |
वह अंतर छूट की कहानी नहीं, गुणक की कहानी है। दोनों सीढ़ियाँ 360p से 1080p तक एक ही तरह चढ़ती हैं; सबसे ऊपरी पायदान पर Google अपनी 720p दर को तिगुना करता है और हम दोगुना, इसलिए फ़ासला ठीक वहीं सबसे चौड़ा है जहाँ तैयार sequences डिलीवर होते हैं। Tier-दर-tier हिसाब, और ऊपरी tier upscale क्यों है, यह हमारी 4K पोस्ट में है।
अब इसे इस पर लागू कीजिए कि निरंतरता का काम असल में कैसे चलता है। कोई चार shots चार generations में नहीं उतारता। अगर तीसरे shot में छह कोशिशें और चौथे में तीन लगें, तो यह पंद्रह jobs हुए — 4K पर यहाँ $21.60 बनाम सीधे $36.49। यही एक chain के मुक़ाबले स्वतंत्र generations के पक्ष में सबसे मज़बूत तर्क है: एक दोबारा-चलाने की क़ीमत एक shot है, sequence की पूँछ नहीं। निरंतरता के परीक्षण 360p पर चलाइए, जो प्रति सेकंड 4K दर का छठा हिस्सा है, और फिर take को ऊपर ले जाइए।
अब भी कहाँ फिसलता है
ईमानदार संस्करण, क्योंकि model card हमें इसकी भाषा देता है।
बँटवारा इससे निकलता है कि दोनों तंत्र क्या encode कर सकते हैं। एक वाक्य और एक reference तस्वीर मोटे, नाम लिए जा सकने वाले गुण ले जाते हैं: silhouette और कपड़े का रंग, बालों की लंबाई और रंग, कमरे की geometry, palette, रोशनी की दिशा और कठोरता, बड़े props की मोटी जगह। इन्हें एक lock block कह सकता है और एक reference image दिखा सकती है।
जो दोनों में से कोई नहीं ले जाता वह है नाम के स्तर से नीचे की सटीकता — दूर-दूर की framings के बीच चेहरे की ठीक-ठीक geometry, गहने, छोटे background objects, कपड़े की बारीक डिटेल, और कुछ भी छपा हुआ, जिसे model card अलग से अविश्वसनीय बताता है। Google इस पैटर्न का नाम सिर्फ़ आम शब्दों में लेता है, और तीसरे-पक्ष के समीक्षक बताते हैं कि यह किसी थमे हुए shot के भीतर के बजाय दृश्य-परिवर्तनों और camera गतियों पर सबसे तीखा पड़ता है। यह दस्तावेज़ और रिपोर्टिंग का हमारा पाठ है, कोई मापा गया दावा नहीं; हमने ऐसा कोई rig नहीं चलाया जो इस पर संख्या रख सके।
व्यवहार में: जिस sequence में एक hero close-up हो, उसे वह close-up किसी wide से विरासत में लेने के बजाय एक reference set से बनाना चाहिए, क्योंकि पहचान scale बदलने की तुलना में reframe से बेहतर बचती है। अकेले shot में चेहरे की तकनीक ख़ुद अपनी एक पोस्ट है, और दो shots को एक ही अक्ष पर रखने वाली camera शब्दावली camera वाली पोस्ट में है।
किसी को इस मॉडल पर तीस shots की कथा बेचकर ऐसा चेहरा नहीं वादा करना चाहिए जो कभी न हिले। जो आप बेच सकते हैं वह है ऐसा sequence जिसमें खिसकाव इतना छोटा हो कि किसी cut के भीतर बैठ जाए — references, lock blocks और ठहराव पर चुने गए cut points से यह पहुँच में है।
ऊपर की तालिका से शुरू कीजिए: खिसकाव का नाम लीजिए, औज़ार चुनिए, block एक बार लिखिए, हूबहू दोहराइए। Google का API reference references को नाम से बाँधने के tag रूप लिए है, और capability पेज मौजूदा दरें और schemas।
क़ीमतें और उत्पाद की शर्तें बदलती हैं। ख़रीद का फ़ैसला लेने से पहले हर provider की मौजूदा क़ीमत देख लीजिए।
अक्सर पूछे जाने वाले सवाल
Gemini Omni 1.1 Flash में किसी किरदार को shots के आर-पार एक जैसा कैसे रखें?
दो तंत्र मिलकर। किरदार को reference-to-video के ज़रिए reference images के रूप में भेजिए — हमारा schema एक से सात लेता है, और Runware वही सीमा दर्ज करता है — और शक्ल के तथ्यों का बिलकुल वही block हर prompt में दोहराइए, दूसरे शब्दों में कहने के बजाय कॉपी करके। References पहचान ले जाते हैं; दोहराया गया text wardrobe, props और रोशनी ले जाता है। Google का model card साफ़ कहता है कि edits के आर-पार पूरी एकरूपता अब भी खुली समस्या है, इसलिए अकेले में कोई काफ़ी नहीं।
क्या seed दो Gemini Omni prompts के बीच वही किरदार बनाए रखता है?
नहीं। Seed एक नमूने को बाँधता है, किसी subject को नहीं। दो अलग prompts seed चाहे जो हो, दो अलग draws हैं, और बाक़ी हर तरह से एक जैसे prompt में एक बदला शब्द किसी बदलाव के बजाय ताज़ा नमूना है। Seed अपनी जगह तब कमाता है जब किसी मंज़ूर take को ऊँचे resolution पर दोबारा render करना हो या किसी एक बदले वाक्य को अलग करना हो। Shots के आर-पार पहचान reference images से आती है।
जिस shot को किसी ख़ास frame पर ख़त्म होना है, उसके लिए कौन-सी Omni capability इस्तेमाल करूँ?
start-end-frame-to-video। आप एक शुरुआती और एक अंतिम image देते हैं, मॉडल बीच का हिस्सा बनाता है, और जिस frame से आपके अगले cut को मेल खाना है वह वही है जो आपने चुना। E2X पर इसकी प्रति-सेकंड क़ीमत सादे text-to-video जितनी ही है, इसलिए इससे बचने की कोई क़ीमत-वजह नहीं है।
क्या Gemini Omni 1.1 Flash किसी video को पीछे की ओर बढ़ा सकता है?
नहीं। Google का दस्तावेज़ कहता है कि extension सिर्फ़ clip के अंत में जोड़ता है, आगे जोड़ने या बीच बढ़ाने का कोई तरीक़ा नहीं। Continuations दस-सेकंड के क़दमों में चालीस सेकंड के कुल तक चलते हैं, और जिस clip को आप बढ़ाते हैं वह दस सेकंड या उससे छोटी होनी चाहिए। यानी पहली generation उसके बाद की हर चीज़ की शक्ल तय कर देती है, और शुरुआती ग़लती chain दोबारा बनाए बिना नहीं सुधरती।
Gemini Omni 1.1 Flash कितनी reference images लेता है?
हमारा reference-to-video schema एक से सात लेता है, और Runware का दस्तावेज़ वही अधिकतम बताता है। Google का अपना reference कोई संख्या नहीं छापता, हालाँकि उसका हल किया उदाहरण एक ही prompt में छह tagged images बाँधता है — इसलिए सात को दर्ज गारंटी नहीं, तीसरे-पक्ष की आम सहमति मानिए। Video references पर Google अलग से तीन clips की सीमा रखता है, हर एक तीन सेकंड तक।
दो बनाए गए shots के बीच काटने की सबसे अच्छी जगह कौन-सी है?
गति के बीच नहीं, ठहराव पर। ठहरी हुई मुद्रा अगली generation को एक निर्विवाद शुरुआती स्थिति देती है; किसी हाव-भाव के भीतर का cut मॉडल से motion vector दोबारा बनाने को कहता है, वही complex motion मामला जिसे Google का model card जानी हुई कमज़ोरी बताता है। और चूँकि हर clip ऐसे soundtrack के साथ आती है जिसे आप मना नहीं कर सकते, जोड़ के दोनों ओर ambience का वर्णन बिलकुल एक ही शब्दों में कीजिए, वरना cut पर room tone खिसक जाएगा।
क्या मैं एक ही Omni sequence में 16:9 और 9:16 shots मिला सकता हूँ?
उपयोगी ढंग से नहीं। ये दो अनुपात ही एकमात्र विकल्प हैं, extension उसी orientation में जोड़ता है जिसमें वह शुरू हुआ, और reference images वही framing लिए आती हैं जिसमें वे शूट हुईं — तो बीच में orientation बदलना उससे पहले की हर asset को रद्द कर देता है। Landscape या portrait का फ़ैसला delivery फ़ॉर्मैट के हिसाब से पहले shot से पहले कीजिए।
Sequence बनाने में extend करना सस्ता है या shots अलग-अलग बनाना?
प्रति-सेकंड दर दोनों तरह एक जैसी है — extension पर कोई छूट नहीं — इसलिए फ़र्क़ यह है कि एक दोबारा-चलाने की क़ीमत क्या है। किसी chain में, शुरुआती shot ठीक करने पर उसके बाद जुड़ा सब कुछ बेकार हो जाता है। Reference images या start frames से लंगर डाली स्वतंत्र generations में एक ख़राब shot की क़ीमत एक shot है। E2X पर बत्तीस सेकंड 4K $5.76 है बनाम सीधे Google से $9.73, और हर फेंके गए take के साथ यह फ़ासला चौड़ा होता जाता है।