TL; DR - सात ओपन-सोर्स अवतार मॉडल हमारे कटऑफ को पूरा करते हैंः अगस्त के बीच एक सार्वजनिक रिलीज 23, 2025 and अगस्त 23, 2026, plus कम से कम 1,000 GitHub सितारे। हमने उनमें से प्रत्येक को चलाया। छह ने एक ही सार्वजनिक अवतार और पुरुष वॉइसओवर से वीडियो बनाए। LTX-2.3 DubIt शुरू नहीं कर सका क्योंकि इसके आधिकारिक चेकपॉइंट को गले लगाना अनुमोदन की आवश्यकता होती है। लाइवएवर ने सबसे तेज भारी वजन का परिणाम दिया, EchoMimicV3-Flash ने 48 GB GPU पर सबसे अच्छा संतुलन प्रदान किया, और SoulX-FlashHead शिखर VRAM के 5.8 GB पर सबसे हल्का था।
सवाल जिसका जवाब हम चाहते थे
खुले स्रोत से बात कर रहे हैं अब अधिक से अधिक से अधिक के लिए पोस्टों की तुलना में तेजी से आ रहा है. "सही समय", "इन्टियों की तुलना "और" और "संक्रमात्मकता" क्योंकि अलग इनपुट, प्रस्ताव, जीपीयूस, और परिभाषाओं के समय में.
हम एक सकेत, पुनःप्रयोगात्मक जवाब चाहते थे: कौनसे हाल ही में अर्थपूर्ण समुदाय के साथ परिचय एक ऐसी तस्वीर और कल्पना को एक विश्वसनीय भाषण में बदल सकते हैं, और हर व्यक्ति को वास्तव में क्या चलाने की ज़रूरत है?
इस दौर के लिए, एक मॉडल केवल अगर यह दोनों नियमों से मिले तो योग्य:
- इसका पहला आधिकारिक, उपयोग योग्य कोड और वजन अगस्त से जारी किया गया था 23, 2025 through अगस्त 23, 2026.
- इसकी आधिकारिक GitHub भंडार में अगस्त में 1,000 stars से अधिक 23, 2026. थे
भंडारण सितारे ध्यान का एक उपाय हैं, गुणवत्ता नहीं। Wan2.2 और LTX-2.3, the के लिए स्टार गिनती मूल परियोजना से संबंधित है क्योंकि अवतार क्षमता उस भंडारण के अंदर जहाज करती है।
सात योग्य आदर्श
| मॉडल | GitHub सितारे | सार्वजनिक | आधिकारिक इनपुट | जाँच परिणाम |
|---|---|---|---|---|
| वान 2.2 - एस 2V - 14B | 17,261 | अगस्त 26, 2025 | छवि + ऑडियो, वैकल्पिक वीडियो प्रस्तुत करें | समाप्त |
| LTX-2.3 DubIt | 9,226 | मई 11, 2026 | संदर्भ वीडियो + लक्ष्य पाठ | गेट चेकपाइंट द्वारा अवरोधित किया गया |
| लॉन्गकैट-वीडियो-अवतार 1.5 | 7,515 | मई 21, 2026 | छवि + ऑडियो | समाप्त |
| लाइव GenericName | 2,384 | दिसंबर 8, 2025 | छवि + ऑडियो | समाप्त |
| SoulX-FlashTalk | 1,476 | जनवरी 8, 2026 | छवि + ऑडियो | समाप्त |
| इकोनफेस वी3- फ़िक्स | 1,025 | जनवरी 22, 2026 | छवि + ऑडियो | समाप्त |
| SoulX-FlashHead | 1,006 | फरवरी 12, 2026 | छवि + ऑडियो | समाप्त |
पहले तक काट दिया गया था, फिर चाहे उनकी तारे गिनती कितनी भी न हो।
समान सार्वजनिक अवतार, वही आवाज़
हर सफल सफल दौड़ता ने इस फ्रेम को मौन रूप से इस्तेमाल किया। AI - उत्पन्न Pexels वीडियो द्वारा AI25 स्टूडियो., के अंतर्गत Pexels लाइसेंसस्रोत निर्माता इस तुलना का समर्थन नहीं करता है।
![]()
3.63-दूसरी वॉइसओवर में डैनियल का उपयोग किया गया, जो macOS के साथ शामिल एक तटस्थ पुरुष प्रणाली आवाज हैः
स्रोत अवतार मॉडल अब एक छवि से विश्वव्यापी वीडियो बना सकता है.
हम पर सरकारी भंडार और वजन के संस्करण की तैनात्ड लटका संस्करण Modal. मापा गया समय तब शुरू होता है जब पीढ़ी कंटेनर शुरू होता है और समाप्त होता है जब अंतिम MP4 वापस किया जाता है। मॉडल वजन पहले से ही एक निरंतर Modal वॉल्यूम में संग्रहीत किया गया था, इसलिए प्रारंभिक इंटरनेट डाउनलोड समय को बाहर रखा गया है, लेकिन मॉडल लोडिंग, प्रीप्रोसेसिंग, पीढ़ी, डिकोडिंग और म्यूक्सिंग शामिल हैं।
परिणाम
| मॉडल | GPU जांच | न्यून. हमेशा GPU/मो | शिखर VRAM | समय | इस्ट. गणना | मॉडल कैश | आउटपुट |
|---|---|---|---|---|---|---|---|
| वान 2.2 - एस 2V - 14B | एच200 | $2,843 (H100) | 58,681 MiB | 780.29s | $1.3692 | 45.76 GiB | 512 x 896, 16 fps |
| LTX-2.3 DubIt | कोई नहीं | अज्ञात | कोई नहीं | GPU के पहले अवरोधित | $0 GPU | जाँच- बिन्दु गेट | कोई आउटपुट नहीं |
| लॉन्गकैट-वीडियो-अवतार 1.5 | एच200 | $2,843 (H100) | 46,827 MiB | 233.08s | $0.4011 | 44.82 GB | 480 x 832, 25 fps |
| लाइव GenericName | एच200 | $2,843 (H100) | 61,401 MiB | 181.44s | $0.3184 | 47.03 GiB | 384 x 704, 25 fps |
| SoulX-FlashTalk | एच200 | $2,843 (H100) | 57,805 MiB | 331.93s | $0.5825 | 51.07 GiB | 416 x 720, 25 fps |
| इकोनफेस वी3- फ़िक्स | L40S | $1,405 (L40S) | 33,726 MiB | 251.94s | $0.2120 | 22.28 GiB | 480 x 848, 25 fps |
| SoulX-FlashHead थोड़ा | L40S | $575 (L4) | 5,763 MiB | 235.31s | $0.1980 | 7.60 GiB | 512 x 512, 25 fps |
गणना अनुमान Modal स अगस्त 23, 2026 सूचीबद्ध मूल्य निवेदित GPU, CPU, और याद जिसके लिए ज्ञात पीढ़ी के दौरान. वे भंडारण, इंटरनेट ट्रांसफर, और एक बार scrat डाउनलोड.
मासिक स्तंभ एक है GPU - केवल एक वर्ष के दौरान निरंतर संचालन के लिए क्षमता अनुमान 30 - दिन महीने. यह सबसे सस्ता उपयोग करता है. Modal GPU वर्ग हम पाइपलाइन को फिर से डिजाइन किए बिना मापा विन्यास चलाने की उम्मीद करते हैंः एच 100 भारी वजन के मॉडल के लिए, L 40S इकोमीमिक और एल के लिए 4 फ्लैशहेड लाइट के लिए। CPU, मेमोरी, मात्रा, और नेटवर्क शुल्क अतिरिक्त हैं। Modal शून्य के लिए पैमाने, तो वास्तविक मासिक न्यूनतम है $0 और उपयोग-आधारित तैनाती हमेशा के अनुमान से बहुत कम खर्च कर सकती है।
ये तैनाती माप हैं, एक पूर्ण रूप से नियंत्रित मॉडल-टंद्र नहीं। अधिकारी इम्प्राइट विभिन्न प्रस्ताव बनाता है और विभिन्न चरणों का उपयोग करता है। परिणाम का हिस्सा है: यह दिखाता है कि हर परियोजना के सिफ़ारिश पथ को मुक्त करता है।
उत्पन्न किया वीडियो
वान 2.2 - एस 2V - 14B
वान ने पहचान और पृष्ठभूमि को स्थिर रखा, जिसमें चेहरे की गति सीमित थी। यह 13 minutes के लिए 3.8-सेकंड आउटपुट के लिए सबसे धीमा सफल रन भी था।
वान है भारी वजन के सिनेमाई विकल्प. हम आधिकारिक चलाया 40 -एक H पर भाषण-वीडियो पथ कदम 200. यह एक स्वच्छ, स्थिर चित्र उत्पन्न किया, लेकिन आंदोलन रूढ़िवादी था और 16 fps आउटपुट कम तरल था 25 FPS मॉडल. पीक VRAM प्राप्त किया गया 58,681 MiB, और अनुमानित गणना लागत लाइवएवाटार के चार गुना से अधिक थी।
सरकारी सेटअप में कई अतिरेचन सुधार की आवश्यकता थी इससे पहले कि इसके ऑडियो और वीडियो रीडर द्वारा उपयोग किया गया पैकेज सम्मिलित हो. इनमें से कोई भी विफल प्रयास ऊपर दिए गए बिना नहीं भेजा गया है, इसलिए वे ऊपर दिए समय में शामिल नहीं हैं.
लॉन्गकैट-वीडियो-अवतार 1.5
लंबे अरसे से सिर और शरीर का काम सबसे बड़ा बनाया गया है।
LongCat सबसे अभिव्यंजक छवि-टू-वीडियो परिणाम बना रहा। इसके 8-चरण INT8 पथ ने सिर, चेहरे और ऊपरी शरीर की गति जोड़ते हुए अवतार को पहचानने योग्य बना दिया। कुछ मुंह फ्रेम थोड़ा अतिरंजित लग रहे थे, लेकिन इससे स्थिर छवि को अधिक रूढ़िवादी मॉडल की तुलना में पूर्ण प्रदर्शन की तरह महसूस हुआ।
आधिकारिक उदाहरण दो GPUs का उपयोग करता है. हम इसे एक H पर चलाया 200 एक के साथ संदर्भ समानांतरता निर्धारित करके। 46,827 MiB, जो एक विशिष्ट पर आराम के लिए बहुत करीब है 48 GB कार्ड एक बार फ्रेमवर्क ओवरहेड शामिल हो जाता है।
लाइव GenericName
येले ने सबसे तेज़ भारी परिणाम उत्पन्न किया और सबसे तेज़ सफलता H200 काम किया।
लाइवएवाटर ने हमें तेज पहचान, आश्वस्त मुंह के आकार, चमक और बड़े मॉडल के बीच संयमित अभिव्यक्ति का सबसे अच्छा संयोजन दिया। इसकी चार चरणों की FP8 पाइपलाइन 181.44 seconds में समाप्त हुई, जो LongCat, FlashTalk और Wan से तेज थी।
यह गति इसे एक छोटा मॉडल नहीं बनाती है। यह 61,401 MiB पर पहुंच गया और अंतिम VAE डिकोड के लिए मॉडल उतारने पर निर्भर था। अपस्ट्रीम सिंगल-GPU रनर भी वितरित प्रक्रिया वातावरण चर का मानता है, और इसका प्रलेखित एक बार पथ संकलन अक्षम के साथ सबसे अच्छा काम करता है। उन आधिकारिक सेटिंग्स से मेल खाने के बाद, रन विश्वसनीय रूप से पूरा हुआ।
SoulX-FlashTalk 14B
फ्लैशटॉक दृश्य रूप से मजबूत था और इसे टुकड़े टुकड़े, निरंतर पीढ़ी के लिए डिज़ाइन किया गया था, लेकिन इसका 14B कोल्ड स्टार्ट महंगा था।
फ्लैशटॉक ने स्पष्ट मुंह आंदोलन के साथ एक स्थिर चेहरा का उत्पादन किया। पहले उत्पन्न टुकड़ा ने 119.58 seconds लिया क्योंकि टॉर्चइंड्यूक्टर ने अपना ग्राफ संकलित किया। बाद के टुकड़ों ने प्रत्येक में लगभग 3.75 seconds लिया। यह 331.93-सेकंड को ठंडा काम को गर्म स्ट्रीमिंग तैनाती से भी बदतर लगता है।
ट्रांजेक्शन बुनियादी ढांचे है। पीक VRAM 57,805 MiB था, और लगातार कैश 51.07 GiB पर इस परीक्षण में सबसे बड़ा था। यह 80 GB वर्ग GPU का है जब तक कि तैनाती अधिक आक्रामक उतार-चढ़ाव या मात्रा जोड़ती नहीं है।
इकोनफेस वी3- फ़िक्स
इकोमिमिक ने सबसे अच्छा व्यावहारिक संतुलन प्रदान कियाः सस्ता L40S पर स्वच्छ पहचान और होंठ आंदोलन।
EchoMimicV3-Flash सबसे आकर्षक तैनाती उम्मीदवार था। इसकी 1.3B, 8-चरण पाइपलाइन ने एक स्वच्छ 25 fps वीडियो का उत्पादन किया, चेहरे को अच्छी तरह से संरक्षित किया, और H200 के बजाय एक L40S पर चलाया। मुंह और शरीर की गति LongCat से अधिक सूक्ष्म थी, लेकिन पूर्ण-फ्रेम में विचलित करने वाले परिवर्तन कम थे।
हमारे 768 क्षेत्र की आधिकारिक कॉन्फ़िगरेशन 33,726 MiB पर चरम पर पहुंच गई। परियोजना कम स्मृति मोड का विज्ञापन करती है, इसलिए यह हमारी सेटिंग्स के लिए एक सिद्धांतिक न्यूनतम के बारे में दावा करने के बजाय देखा जाता है। इसका 22.28 GiB कैश 14B मॉडल के आधे से कम आकार का था।
SoulX-FlashHead 1.3B थोड़ा
लेकिन जब वह छोटा था, तो उसकी सबसे छोटी फसल, नरम - सा पहचान और कमज़ोर मुँह की आवाज़ ने उसे कम - से - कम कायल कर दिया।
फ्लैशहेड लाइट ने केवल 5,763 MiB पर शिखर प्राप्त किया, जो बड़े जनरेटरों से एक क्रम में नीचे है। फ्लैशटॉक की तरह, इसके ठंड समय पर पहली रन संकलन का वर्चस्व था। पहले टुकड़े ने 155.7 seconds लिया, जबकि बाद के टुकड़े ने प्रत्येक के बारे में 0.19 seconds लिया।
यह एक हमेशा के लिए एक निरंतर चलती सेवा के लिए दिलचस्प है और यह L40S से अधिक हल्का हार्डवेयर पर चला सकता है. एक उड़ान भरी हुई यात्रा के लिए, हम स्निपरेशन के मजबूत दृश्य परिणाम चुन सकते हैं.
क्यों LTX-2.3 DubIt यहाँ कोई वीडियो नहीं है
LTX-2.3 DubIt ऊपर से ऑडियो- अप मॉडल से भिन्न है. यह एक आवाजात्मक संदर्भ वीडियो और लक्ष्य पाठ लेता है, फिर स्पीकर की मुख- मुद्रा पहचान रखने की कोशिश में मेल- जोल बनाता है.
इसकी कोड सार्वजनिक है, लेकिन अधिकारी है Lightricks/LTX-2.3-22b-IC-LoRA-DubIt चेकपॉइंट ने Hugging Face से एक प्राधिकरण त्रुटि लौटा दी. हमारे पास परीक्षण वातावरण में कोई स्वीकृत टोकन नहीं था, इसलिए काम के दौरान बंद हो गया। CPU - केवल वजन तैयारी से पहले GPU आवंटित किया गया था।
हमने आधिकारिक एक्सेस गेट को बायपास करने वाले तृतीय-पक्ष दर्पण को प्रतिस्थापित नहीं किया। पुनरुत्पादन और पहुंच एक ओपन-सोर्स रिलीज का मूल्यांकन करने का हिस्सा हैं। एक बार आधिकारिक एक्सेस को मंजूरी दे दी गई है, तैयार Modal धावक सार्वजनिक संदर्भ वीडियो और लक्ष्य वाक्य के साथ एक ही परीक्षण कर सकता है।
क्या हर मॉडल की सुरक्षा होती है या फिर आवाज़ होती है?
अधिकांश अवतार मॉडल कोई आवाज नहीं चुनते या क्लोन करते हैं. वे किसी दी गई ऑडियो फ़ाइल को सजीव करते हैं, तब मौजूदा वीडियो में वही ऑडियो फ़ाइल में. आवाज बनाना एक अलग पाठ- से- वार्ता या आवाज- अपिंग चरण है.
| मॉडल | अंतर्निर्मित आवाज चयनक | दी गई बोली इस्तेमाल करें | संदर्भ आवाज से सीखिए | जो हमने देखा |
|---|---|---|---|---|
| वान 2.2 - एस 2V - 14B | नहीं | हाँ | नहीं | इनपुट ऑडियो संरक्षित, संबद्धता 0.999897 |
| LTX-2.3 DubIt | कोई आवाज मेन्यू नहीं | नहीं, यह लक्ष्य पाठ लेता है | जी हाँ, आवाज्ड संदर्भ वीडियो से | क्योंकि भार गेट रखे थे, वे नहीं चला जा सकता |
| लॉन्गकैट-वीडियो-अवतार 1.5 | नहीं | हाँ | नहीं | इनपुट ऑडियो संरक्षित, संबद्धता 0.999562 |
| लाइव GenericName | नहीं | हाँ | नहीं | इनपुट ऑडियो संरक्षित, संबद्धता 0.999897 |
| SoulX-FlashTalk | नहीं | हाँ | नहीं | इनपुट ऑडियो संरक्षित, संबद्धता 0.999751 |
| इकोनफेस वी3- फ़िक्स | नहीं | हाँ | नहीं | इनपुट ऑडियो संरक्षित, संबद्धता 0.999198 |
| SoulX-FlashHead | नहीं | हाँ | नहीं | इनपुट ऑडियो संरक्षित, संबद्धता 0.999751 |
छोटे अंतर एक अलग सिंथेटिक स्पीकर से नहीं, बल्कि पुनः नमूनाकरण और AAC एन्कोडिंग से हैं। दूसरे शब्दों में, छह सफल मॉडल एक वास्तविक रिकॉर्डिंग, एक सहमति से कहीं और बनाया गया क्लोन या किसी भी TTS आवाज का उपयोग कर सकते हैं। वे स्वयं आवाज की पहचान नहीं बदलते हैं।
DubIt इसका उद्देश्य संदर्भ वीडियो में आवाज की तरह एक नया लक्ष्य भाषा या लक्ष्य स्क्रिप्ट भाषण बनाना है। यह इसे डबिंग के लिए उपयोगी बनाता है, लेकिन इसका आउटपुट ऑडियो मूल की एक तरंग स्वरूप प्रति नहीं होगा।
पैरामीटर ट्यूनिंग मूल्य
डिफ़ॉल्ट आवश्यक नहीं है हर चेहरा या शासकी के लिए सबसे अच्छा विन्यास. ये सबसे बड़े- कठोर नियंत्रण हैं मॉडल कोड को बदलने से पहले की जांच करने के लिए:
| मॉडल | पैरामीटर जो सबसे अधिक मामले को बताता है | संभवतः व्यापार बन्द |
|---|---|---|
| वान 2.2 - एस 2V - 14B | कुछ कदम, मार्गदर्शन स्केल, आउटपुट क्षेत्र, बीज, वैकल्पिक वीडियो प्रस्तुत करें | और ज़्यादा क़दम और पिक्सेल तीव्र मात्रा में वृद्धि; वातावरण को नियंत्रित करने से शरीर की गति बेहतर हो सकती है |
| LTX-2.3 DubIt | संकेत, लक्ष्य पाठ, संदर्भ- वीडियो लंबाई, लोरवर, बीज | और यह भी हो सकता है कि आप अपने हालात को बदलने के लिए कुछ कदम उठाएँ। |
| लॉन्गकैट-वीडियो-अवतार 1.5 | 8-चरण में डिस्टिल्ट बनाम पूर्ण पथ, क्वांटिज़ेशन, गाइड, बीज, संदर्भ समानांतर | पूरी तरह ठीक या ज़्यादा कदम उठाने से हम सही - सही समझ पा सकते हैं, मगर ज़्यादा याद रखने और ज़्यादा समय बिताने की ज़रूरत पड़ सकती है |
| लाइव GenericName | सेंपल चरण, आउटपुट क्षेत्र, FP8, मॉडल लोडेड, लोडेड | कम्प्लीशन से बार- बार काम आता है, लोड करने से स्मृति बन्द करता है, लेकिन आगे बढ़ें |
| SoulX-FlashTalk | क्लीग आकार, सेंटीमीटर, कम्पाइल, ऑडियो मार्गदर्शन, बीज | इससे बड़ा बदलाव करने में सुधार आता है, मगर देर और याददाश्त की कमी बढ़ जाती है |
| इकोनफेस वी3- फ़िक्स | इंच, मार्गदर्शन पैमाने, ऑडियो मार्गदर्शन, सेंपल आकार, वंश | उच्च ऑडियो मार्गदर्शन मुँह गति को मज़बूत कर सकता है लेकिन यह बढ़ा सकता है |
| SoulX-FlashHead | एलआईडी वी पूरे जांच बिन्दु, खेत, रीफ्रेक्ट लम्बाई, कम्पाला्ड्ड | पूरी मॉडल को उच्च मेमोरी लागत में गुणवत्ता को सुधारना चाहिए; फ़सल का गहरा प्रभाव उस पर पड़ता है |
एक उचित उत्पाद परीक्षण के लिए, एक समय पर एक वेरिएबल के लिए एक ही तस्वीर और कहानी के खिलाफ एक ही. सबसे उपयोगी कदम होगा इकोनिट के लिए, बीज, और चमक गुणवत्ता और दोनों के लिए पूर्ण जाँच गुणवत्ता, और दोनों आत्मा मॉडलों के लिए एक गर्म अनुरोध.
हार्डवेयर वास्तव में कैसा दिखता है
छः सफल फिल्टरों के तीन व्यावहारिक समूहों में से तीन में से तीन में गिरता है:
- 16 GB: SoulX-FlashHead Lite एकमात्र परीक्षण पूर्ण जनरेटर है जो स्पष्ट रूप से फिट बैठता है। इसका 5.8 GB पीक 12 GB या 16 GB कार्ड के लिए जगह छोड़ता है, हालांकि विलंबता और फ्रेमवर्क समर्थन को अभी भी उपभोक्ता हार्डवेयर पर सत्यापन की आवश्यकता होती है।
- 48 GB क्लास: EchoMimicV3-Flash 33.7 GB पर L40S पर आराम से चलाया गया। LongCats 46.8 GB आवंटन एक आरामदायक 48 GB तैनाती के लिए सीमा के बहुत करीब है।
- 80 GB क्लास: Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk और LongCat को 80 GB या अधिक मेमोरी वाले H100 अथवा H200 श्रेणी के GPU पर चलाना सबसे सुरक्षित है।
फ्लैशहेड और इकोमीमिक का उपयोग 7.6 और 22.3 बड़े मॉडल के लिए लगभग 45 51 इस लेख में सभी कैश को एक साथ होस्ट करने से बहुत अधिक खपत होगी 200 कंटेनर छवियों, आउटपुट और अस्थायी फ़ाइलों से पहले GiB।
Modal प्रयोगों के लिए अच्छा फिट है क्योंकि कंटेनर शून्य तक स्केल कर सकते हैं जबकि मॉडल कैश निरंतर मात्रा पर रहते हैं। इस परीक्षण के बाद, प्रत्येक Modal ऐप ने शून्य चल रहे कार्यों की सूचना दी और कोई भी GPU सक्रिय नहीं रहा।
आज हम क्या इस्तेमाल करेंगे
कोई भी अवतार कार्य प्रवाह के लिए कोई विजेता नहीं है.
- लाइव-रेक प्रयोग करें जब भारी वजन छवि-वीडियो गुणवत्ता सबसे अधिक मायने रखता है और एक 80 GB GPU उपलब्ध है. यह हमारे तेज बड़े मॉडल परिणाम का उत्पादन किया और सबसे तेज H200 ठंड काम किया.
- इको निरस्तीकरण वमू3- फ़िक्स उपयोग करें यह एक सस्ता L40S पर चलाया गया, एक बहुत छोटा कैश का उपयोग किया, और एक साफ परिणाम दिया।
- LongCat-Video-Avatar 1.5 का उपयोग करें जब शरीर की गति को बढ़ानेवाली जानकारी का प्रभाव होता है तो यह अति - महत्त्वपूर्ण पहचान बचाव से ज़्यादा होता है।
- उपयोग करें SoulX-FlashHead थोड़ा जब कम VRAM और गर्म प्रवाह गति पॉलिश से अधिक मायने रखते हैं।
सबसे आश्चर्यजनक परिणाम यह नहीं था कि सबसे बड़ा मॉडल सबसे अच्छा देखा गया था। यह था कि एक सस्ता GPU और मॉडल भंडारण के आधे से भी कम समय के उपयोग के दौरान EchoMimic कितना करीब आया। ओपन सोर्स अवतार पीढ़ी अब व्यावहारिक है, लेकिन सेवा रणनीति अभी भी चेकपॉइंट के रूप में महत्वपूर्ण है।
