TL;DR - استوفى سبعة من نماذج الشخصيات الافتراضية مفتوحة المصدر معاييرنا: إصدار عام بين 23 أغسطس 2025 و23 أغسطس 2026، وما لا يقل عن 1,000 نجمة على GitHub. اختبرناها جميعًا؛ وتمكّن ستة منها من إنشاء فيديو باستخدام الصورة العامة والصوت الذكوري نفسيهما. تعذّر تشغيل LTX-2.3 DubIt لأن ملفه الرسمي يتطلب موافقة Hugging Face. قدّم LiveAvatar أوضح نتيجة بين النماذج الكبيرة، وحقق EchoMimicV3-Flash أفضل توازن على بطاقة رسومية بسعة 48 GB، بينما كان SoulX-FlashHead الأخف بفارق واضح عند ذروة استخدام بلغت 5.8 GB من VRAM.
السؤال الذي أردنا الإجابة عليه
تتسارع إصدارات نماذج الشخصيات الناطقة مفتوحة المصدر إلى حد يصعب معه على مقالات المقارنة مواكبتها. كما يصعب مقارنة ادعاءات مثل «الوقت الحقيقي» و«المدة غير المحدودة» و«الحفاظ على الهوية»، لأن كل مشروع يستخدم مدخلات ودقات وبطاقات رسومية وتعريفات مختلفة لزمن الاستدلال.
أردنا إجابة محددة وقابلة لإعادة الاختبار: أي النماذج الحديثة التي تبنّاها المجتمع بصورة ملموسة يستطيع تحويل الصورة والتعليق الصوتي نفسيهما إلى فيديو ناطق مقنع، وما المتطلبات الفعلية لتشغيل كل نموذج؟
في هذه الجولة، يكون النموذج مؤهلاً فقط إذا استوفى القاعدتين:
- تم إصدار أول كود وأوزان رسمية قابلة للاستخدام في الفترة من 23 أغسطس 2025 حتى 23 أغسطس 2026.
- كان مستودعها الرسمي GitHub يحتوي على أكثر من 1000 نجم في 23 أغسطس 2026.
عدد نجوم المستودع مقياس للاهتمام لا للجودة. وفي حالتي Wan2.2 وLTX-2.3، يعود عدد النجوم إلى المشروع الأم لأن ميزة الشخصية الافتراضية مضمّنة داخل مستودعه.
النماذج المؤهلة السبعة
| نموذج | GitHub نجوم | الإصدار العام | المدخلات الرسمية | نتيجة الاختبار |
|---|---|---|---|---|
| Wan2.2-S2V-14B | 17,261 | 26 أغسطس 2025 | صورة + صوت، مقطع فيديو اختياري | مكتمل |
| LTX-2.3 DubIt | 9,226 | 11 مايو 2026 | الفيديو المرجعي + النص المستهدف | منعت من قبل نقطة تفتيش مسورة |
| LongCat-فيديو-الصورة الرمزية 1.5 | 7,515 | 21 مايو 2026 | صورة + صوت | مكتمل |
| LiveAvatar | 2,384 | 8 ديسمبر 2025 | صورة + صوت | مكتمل |
| SoulX-FlashTalk | 1,476 | 8 يناير 2026 | صورة + صوت | مكتمل |
| EchoMimicV3-فلاش | 1,025 | 22 يناير 2026 | صورة + صوت | مكتمل |
| SoulX-FlashHead | 1,006 | 12 فبراير 2026 | صورة + صوت | مكتمل |
تم استبعاد المشاريع التي تم إصدارها قبل الموعد النهائي بغض النظر عن عدد نجومها.
نفس الصورة الرمزية العامة، نفس الصوت الذكوري
كل جولة ناجحة تستخدم هذا الإطار من الصمت، تم إنشاء فيديو Pexels باستخدام الذكاء الاصطناعي بواسطة AI25.Studio، تحت رخصة Pexels. لا يؤيد منشئ المحتوى المصدر هذه المقارنة.
![]()
استخدم السرد الذي مدته 3.63 ثانية صوت دانيال، صوت نظامي ذكر محايد مدمج مع macOS:
يمكن الآن لنماذج الصور الرمزية مفتوحة المصدر إنشاء مقاطع فيديو مقنعة من صورة واحدة.
قمنا بنشر إصدارات مثبتة من المستودعات والأوزان الرسمية Modal. يبدأ الوقت المقاس عندما تبدأ حاوية التوليد وينتهي عند إرجاع MP4 النهائي. تم بالفعل تخزين أوزان النماذج في مجلد ثابت Modal، لذلك تم استبعاد وقت التنزيل الأولي عبر الإنترنت، ولكن تم تضمين تحميل النموذج والمعالجة المسبقة والتوليد وفك التشفير والمزج.
النتائج في لمحة
| نموذج | تم اختبار GPU | دقيقة. دائمًا قيد التشغيل GPU/mo | الذروة VRAM | الوقت | مؤسسة. حساب | ذاكرة التخزين المؤقت النموذجية | الإخراج |
|---|---|---|---|---|---|---|---|
| Wan2.2-S2V-14B | H200 | $2,843 (H100) | 58,681 مليون ميجابايت | 780.29s | $1.3692 | 45.76 جيجا بايت | 512 × 896، 16 إطارًا في الثانية |
| LTX-2.3 DubIt | لا شيء | غير معروف | لا شيء | محظور قبل GPU | $0 GPU | نقطة تفتيش ببوابات | لا يوجد إخراج |
| LongCat-فيديو-الصورة الرمزية 1.5 | H200 | $2,843 (H100) | 46,827 مليون ميجابايت | 233.08s | $0.4011 | 44.82 GB | 480 × 832، 25 إطارًا في الثانية |
| LiveAvatar | H200 | $2,843 (H100) | 61,401 ميجابايت | 181.44s | $0.3184 | 47.03 جيجا بايت | 384 × 704، 25 إطارًا في الثانية |
| SoulX-FlashTalk | H200 | $2,843 (H100) | 57,805 ميجابايت | 331.93s | $0.5825 | 51.07 جيجا بايت | 416 × 720، 25 إطارًا في الثانية |
| EchoMimicV3-فلاش | L40S | $1,405 (L40S) | 33,726 مليون ميجابايت | 251.94s | $0.2120 | 22.28 جيجا بايت | 480 × 848، 25 إطارًا في الثانية |
| SoulX-FlashHead لايت | L40S | $575 (L4) | 5,763 ميجابايت | 235.31s | $0.1980 | 7.60 جيجا بايت | 512 × 512، 25 إطارًا في الثانية |
استخدام التقديرات الحسابية قائمة أسعار Modal بتاريخ 23 أغسطس 2026 بالنسبة ل GPU وCPU والذاكرة المطلوبة أثناء دالة التوليد المقاسة. تستثني التخزين، ونقل الإنترنت، والتنزيل لمرة واحدة بوزن واحد.
يعرض العمود الشهري تقديرًا لتكلفة سعة GPU وحدها عند التشغيل المتواصل لمدة 30 يومًا. واعتمدنا أقل فئة من بطاقات Modal نتوقع أن تشغّل الإعداد المقاس من دون إعادة تصميم مسار المعالجة: H100 للنماذج الأعلى استهلاكًا للموارد، وL40S لـ EchoMimic، وL4 لـ FlashHead Lite. لا يشمل التقدير تكلفة المعالج والذاكرة والتخزين والشبكة. وبما أن Modal يخفض الموارد إلى الصفر عند عدم الاستخدام، فالحد الأدنى الفعلي هو 0 دولار شهريًا، وقد تكون تكلفة النشر حسب الاستخدام أقل بكثير من تقدير التشغيل الدائم.
هذه هي قياسات النشر، وليست مقياسًا مرجعيًا لجودة النموذج يتم التحكم فيه بشكل كامل. تنتج خطوط الأنابيب الرسمية دقة مختلفة وتستخدم عددًا مختلفًا من الخطوات. وهذا جزء من النتيجة: فهو يوضح ما يقدمه المسار القابل للتشغيل الموصى به لكل مشروع.
مقاطع الفيديو التي تم إنشاؤها
Wan2.2-S2V-14B
أبقى وان هويته وخلفيته ثابتة، مع تقييد حركة الوجه. كان أيضًا أبطأ تشغيل ناجح حيث بلغ 13 دقيقة لإخراج 3.8 ثانية.
Wan هو الخيار السينمائي الثقيل. قمنا بتشغيل المسار الرسمي للتحويل من الكلام إلى الفيديو المكون من 40 خطوة على جهاز H200 واحد. أنتج صورة شخصية نظيفة ومستقرة، لكن الحركة كانت محافظة وكانت ناتج 16 إطارًا في الثانية أقل سلاسة من نماذج 25 إطارًا في الثانية. وصل الحد الأقصى VRAM إلى 58,681 ميبي، وكان تكلفة الحوسبة المقدرة أكثر من أربعة أضعاف LiveAvatar.
يتطلب الإعداد الرسمي أيضًا العديد من إصلاحات التبعية قبل بدء الاستدلال، بما في ذلك الحزم التي تستخدمها أجهزة قراءة الصوت والفيديو. ولم تصل أي من تلك المحاولات الفاشلة إلى تقليل الضوضاء، لذا فهي غير متضمنة في التوقيت أعلاه.
LongCat-فيديو-الصورة الرمزية 1.5
ابتكرت LongCat الأداء الأكثر وضوحًا للرأس والجسم، بما في ذلك إيماءة اليد غير الموجودة في الصورة المرجعية.
ظلت LongCat هي نتيجة تحويل الصورة إلى الفيديو الأكثر تعبيراً. أدى مسار INT8 المكون من 8 خطوات إلى الحفاظ على إمكانية التعرف على الصورة الرمزية أثناء إضافة حركة الرأس والوجه والجزء العلوي من الجسم. بدت بعض إطارات الفم مبالغًا فيها بعض الشيء، لكنها جعلت الصورة الثابتة تبدو وكأنها أداء كامل أكثر من النماذج الأكثر تحفظًا.
يستخدم المثال الرسمي وحدتي GPU. قمنا بتشغيله على جهاز H200 واحد من خلال ضبط توازي السياق على واحد. بلغت ذروتها عند 46,827 ميجابايت، وهو قريب جدًا من الراحة على بطاقة GB النموذجية ذات 48 بمجرد تضمين الحمل الإضافي لإطار العمل.
LiveAvatar
أنتجت LiveAvatar النتيجة الأكثر وضوحًا للوزن الثقيل وأسرع مهمة H200 ناجحة.
لقد أعطتنا LiveAvatar أفضل مزيج من الهوية الحادة وأشكال الفم المقنعة والوميض والتعبير المقيد بين النماذج الكبيرة. تم الانتهاء من خط الأنابيب FP8 المكون من أربع خطوات في 181.44 ثانية، وهو أسرع من LongCat وFlashTalk وWan.
هذه السرعة لا تجعل منه نموذجًا صغيرًا. فقد وصل إلى 61,401 ميبي بايت وكان يعتمد على تفريغ النموذج لفك تشفير VAE النهائي. كما أن مشغل GPU الفردي في المصدر يفترض وجود متغيرات بيئة العمليات الموزعة، ويعمل أفضل مسار موثق لمرة واحدة عندما يكون التجميع معطلًا. بعد مطابقة تلك الإعدادات الرسمية، اكتمل التشغيل بشكل موثوق.
SoulX-FlashTalk 14B
كان FlashTalk قويًا بصريًا ومصممًا للجيل المستمر والمقطع، لكن بدايته الباردة 14B كانت باهظة الثمن.
أنتج FlashTalk وجهًا مستقرًا مع حركة فم واضحة. استغرق الجزء الأول الذي تم إنشاؤه 119.58 ثانية لأن TorchInductor قام بتجميع الرسم البياني الخاص به. استغرقت القطع اللاحقة حوالي 3.75 ثانية لكل منها. وهذا يجعل المهمة الباردة التي تبلغ 331.93 ثانية تبدو أسوأ مما قد تشعر به عملية نشر البث المباشر.
والمقايضة هي البنية التحتية. بلغت الذروة VRAM 57,805 ميجا بايت، وكانت ذاكرة التخزين المؤقت المستمرة هي الأكبر في هذا الاختبار عند 51.07 جيجا بايت. إنه ينتمي إلى فئة 80 GB GPU ما لم يضيف النشر تفريغًا أو تكميمًا أكثر قوة.
EchoMimicV3-فلاش
قدم EchoMimic أفضل توازن عملي: الهوية النظيفة وحركة الشفاه على L40S الأرخص.
كان EchoMimicV3-Flash هو المرشح الأكثر إقناعًا للنشر. أنتج خط الأنابيب 1.3B المكون من 8 خطوات فيديو نظيفًا بمعدل 25 إطارًا في الثانية، وحافظ على الوجه جيدًا، وعمل على L40S بدلاً من H200. كانت حركة الفم والجسم أكثر دقة من حركة LongCat، ولكن كانت هناك تغييرات أقل تشتيتًا للانتباه في الإطار الكامل.
بلغ تكويننا الرسمي لمنطقة 768 ذروته عند 33726 ميجابايت. يعلن المشروع عن أوضاع الذاكرة المنخفضة، لذلك يتم ملاحظة هذا الاستخدام لإعداداتنا بدلاً من المطالبة بالحد الأدنى النظري. كانت ذاكرة التخزين المؤقت التي تبلغ سعتها 22.28 جيجا بايت أقل من نصف حجم طرازات 14 جيجا بايت.
SoulX-FlashHead 1.3B لايت
كان FlashHead أصغر حجمًا بشكل كبير، لكن القطع المتقارب والهوية الأكثر ليونة وحركة الفم الأضعف جعلتها النتيجة الأقل إقناعًا.
بلغ FlashHead Lite ذروته عند 5763 ميجابايت فقط، وهو ترتيب أقل من المولدات الكبيرة. مثل FlashTalk، سيطر التجميع الذي يتم تشغيله لأول مرة على توقيته البارد. استغرقت القطعة الأولى 155.7 ثانية، بينما استغرقت القطعة اللاحقة حوالي 0.19 ثانية لكل منها.
هذا مثير للاهتمام بالنسبة لخدمة البث الدافئة دائمًا ويقترح أنه يمكن تشغيله على أجهزة أرخص بكثير من جهاز L40S المستخدم هنا. ومع ذلك، لمقطع صفحة الهبوط الاحترافي، سنختار النتيجة البصرية الأقوى لـ EchoMimic.
لماذا لا يوجد فيديو هنا في LTX-2.3 DubIt
LTX-2.3 DubIt يختلف عن نماذج الصوت أعلاه. يأخذ فيديو مرجعي يحتوي على صوت ونصًا مستهدفًا، ثم يولد خطابًا وحركة الشفاه المتطابقة مع محاولة الحفاظ على هوية صوت المتحدث.
رمزها عام، ولكن الرسمي Lightricks/LTX-2.3-22b-IC-LoRA-DubIt أعاد نقطة التفتيش خطأ في التفويض من Hugging Face. لم يكن لدينا رمز موافقة في بيئة الاختبار، لذا توقف العمل أثناء تجهيز الأوزان المخصصة CPU فقط قبل تخصيص أي GPU.
لم نستبدل مرآة خارجية تتجاوز بوابة الدخول الرسمية. تعد إمكانية التكرار والوصول جزءًا من تقييم إصدار مفتوح المصدر. بمجرد الموافقة على الوصول الرسمي، يمكن لعداء Modal المجهز تنفيذ نفس الاختبار باستخدام الفيديو المرجعي العام والجملة المستهدفة.
هل يحافظ كل نموذج على الصوت أو يختاره؟
لا تقوم معظم نماذج الصور الرمزية بتحديد الصوت أو استنساخه. يقومون بتحريك ملف صوتي مرفق، ثم يضعون نفس الصوت في الفيديو النهائي. يعد إنشاء الصوت بمثابة خطوة منفصلة لتحويل النص إلى كلام أو استنساخ الصوت.
| نموذج | محدد الصوت المدمج | يستخدم الكلام المزود | يتعلم من صوت مرجعي | ما لاحظناه |
|---|---|---|---|---|
| Wan2.2-S2V-14B | لا | نعم | لا | تم الحفاظ على إدخال الصوت، الارتباط 0.999897 |
| LTX-2.3 DubIt | لا توجد قائمة صوتية | لا، فهو يأخذ النص المستهدف | نعم، من الفيديو المرجعي الصوتي | لا يتم تشغيله لأن الأوزان كانت مسورة |
| LongCat-فيديو-الصورة الرمزية 1.5 | لا | نعم | لا | تم حفظ إدخال الصوت، الارتباط 0.999562 |
| LiveAvatar | لا | نعم | لا | تم الحفاظ على إدخال الصوت، الارتباط 0.999897 |
| SoulX-FlashTalk | لا | نعم | لا | تم حفظ إدخال الصوت، الارتباط 0.999751 |
| EchoMimicV3-فلاش | لا | نعم | لا | تم الحفاظ على إدخال الصوت، الارتباط 0.999198 |
| SoulX-FlashHead | لا | نعم | لا | تم حفظ إدخال الصوت، الارتباط 0.999751 |
تعود الاختلافات الصغيرة إلى إعادة التشكيل وترميز AAC، وليس إلى مكبر صوت مركب مختلف. بمعنى آخر، يمكن للنماذج الستة الناجحة استخدام تسجيل حقيقي، أو استنساخ موافق عليه تم إجراؤه في مكان آخر، أو أي صوت TTS. إنهم لا يغيرون الهوية الصوتية بأنفسهم.
DubIt هو الاستثناء. والغرض منه هو إنشاء لغة مستهدفة جديدة أو خطاب نصي مستهدف يشبه الصوت في الفيديو المرجعي. وهذا يجعله مفيدًا للدبلجة، لكن الصوت الناتج لن يكون نسخة موجية من الأصل.
المعلمات تستحق الضبط
لا تعد الإعدادات الافتراضية بالضرورة أفضل إعداد لكل وجه أو عملية نشر. هذه هي عناصر التحكم ذات التأثير الأعلى التي يجب اختبارها قبل تغيير رمز النموذج:
| نموذج | المعلمات الأكثر أهمية | المقايضة المحتملة |
|---|---|---|
| Wan2.2-S2V-14B | خطوات تقليل الضوضاء، ومقياس التوجيه، ومنطقة الإخراج، والبذور، والفيديو الاختياري | يؤدي المزيد من الخطوات والبكسلات إلى زيادة زمن الوصول بشكل حاد؛ التحكم في الوضعية يمكن أن يحسن حركة الجسم |
| LTX-2.3 DubIt | موجه، النص المستهدف، طول الفيديو المرجعي، قوة LoRA، البذور | قد يؤدي التكييف الأقوى إلى تحسين الهوية ولكنه يقلل من التباين الطبيعي |
| LongCat-فيديو-الصورة الرمزية 1.5 | 8 خطوات مقطرة مقابل المسار الكامل، التكميم، التوجيه، البذور، توازي السياق | قد تؤدي الدقة الكاملة أو المزيد من الخطوات إلى تحسين التفاصيل ولكنها تحتاج إلى مزيد من الذاكرة والوقت |
| LiveAvatar | خطوات العينة، منطقة الإخراج، FP8، تفريغ النموذج، التجميع | التجميع يساعد على تكرار المهام؛ يؤدي إلغاء التحميل إلى حفظ الذاكرة ولكنه يضيف عمليات نقل |
| SoulX-FlashTalk | حجم القطعة، التداخل، التجميع، التوجيه الصوتي، البذور | يمكن للأجزاء الأكبر حجمًا تحسين الاستمرارية ولكنها تزيد من زمن الوصول والذاكرة |
| EchoMimicV3-فلاش | خطوات الاستدلال، المقياس الإرشادي، الإرشاد الصوتي، حجم العينة، البذرة | يمكن أن يؤدي التوجيه الصوتي العالي إلى تقوية حركة الفم ولكنه قد يبالغ فيها |
| SoulX-FlashHead | لايت مقابل نقطة التفتيش الكاملة، والمحاصيل، وطول القطعة، والتجميع | يجب أن يعمل النموذج الكامل على تحسين الجودة بتكلفة ذاكرة أعلى؛ يؤثر المحصول بشدة على التكوين |
للحصول على اختبار عادل للمنتج، قم بضبط متغير واحد في كل مرة مقابل نفس الصورة والسرد. سيكون التمرير الأول الأكثر فائدة هو التوجيه الصوتي لـ EchoMimic، وخطوات العينة لـ LiveAvatar، وجودة الاقتصاص ونقطة التفتيش الكاملة لـ FlashHead، والطلب الثاني الدافئ لكلا طرازي SoulX.
كيف تبدو الأجهزة حقًا
تنقسم المولدات الستة الناجحة إلى ثلاث مجموعات عملية للبنية التحتية:
- أقل من 16 عامًا GB: SoulX-FlashHead Lite هو المولد الكامل الوحيد الذي تم اختباره والذي يناسبه بشكل واضح. تبلغ ذروتها 5.8 GB مساحة لبطاقة 12 GB أو 16 GB، على الرغم من أن زمن الوصول ودعم إطار العمل لا يزالان بحاجة إلى التحقق من صحة أجهزة المستهلك.
- 48 GB فئة: تم تشغيل EchoMimicV3-Flash بشكل مريح على L40S عند 33.7 GB. تخصيص LongCat 46.8 GB قريب جدًا من الحد الأقصى للنشر المريح 48 GB.
- 80 GB فئة: Wan2.2-S2V وLiveAvatar وSoulX-FlashTalk وLongCat هي الأكثر أمانًا على وحدات معالجة الرسومات من فئة H100 أو H200 مع 80 GB أو أكثر.
التخزين المستمر مهم أيضًا. يستخدم FlashHead وEchoMimic حوالي 7.6 و22.3 جيجا بايت على التوالي. تحتاج النماذج الكبيرة إلى ما يقرب من 45 إلى 51 جيجا بايت لكل منها. ستستهلك استضافة كل ذاكرة تخزين مؤقت في هذه المقالة مرة واحدة ما يزيد عن 200 جيجا بايت قبل صور الحاوية والمخرجات والملفات المؤقتة.
يعد Modal مناسبًا للتجارب نظرًا لأن الحاويات يمكن أن تتوسع إلى الصفر بينما تظل ذاكرات التخزين المؤقت للنماذج على وحدات تخزين ثابتة. بعد هذا الاختبار، أبلغ كل تطبيق Modal عن عدم وجود مهام قيد التشغيل ولم يظل GPU نشطًا.
ما سوف نستخدمه اليوم
لا يوجد خيار واحد أقوى لكل سير عمل للصورة الرمزية:
- استخدم LiveAvatar عندما تكون جودة الصورة إلى الفيديو الكبيرة هي الأهم ومتوفر 80 GB GPU. أنتج أفضل نتيجة لدينا للنموذج الكبير وكان أسرع مهام H200 الباردة.
- استخدم EchoMimicV3-Flash لأفضل توازن عملي بين الجودة والبنية التحتية. تم تشغيله على جهاز L40S الأرخص، استخدم ذاكرة تخزين مؤقت أصغر بكثير، وأنتج نتيجة نظيفة.
- استخدم LongCat-Video-Avatar 1.5 عندما تصبح حركة الجسد التعبيرية أكثر أهمية من الحفاظ المحافظ على الهوية.
- استخدم SoulX-FlashHead Lite عندما يكون VRAM المنخفض وسرعة البث الدافئ أهم من الدقة.
النتيجة الأكثر إثارة للدهشة لم تكن أن النموذج الأكبر يبدو أفضل. لقد كان مدى قرب EchoMimic من استخدام GPU الأرخص وأقل من نصف مساحة تخزين النموذج. أصبح إنشاء الصور الرمزية مفتوحة المصدر أمرًا عمليًا الآن، لكن استراتيجية الخدمة لا تزال مهمة بقدر أهمية نقطة التفتيش.
