انتقل إلى المقالة
← العودة إلى الهندسة

لقد اختبرنا كل نماذج الصور الرمزية مفتوحة المصدر الشائعة التي تم إصدارها في العام الماضي (أغسطس 2026)

رسم توضيحي للغلاف لـ لقد اختبرنا كل نماذج الصور الرمزية مفتوحة المصدر الشائعة التي تم إصدارها في العام الماضي (أغسطس 2026)

TL;DR - استوفى سبعة من نماذج الشخصيات الافتراضية مفتوحة المصدر معاييرنا: إصدار عام بين 23 أغسطس 2025 و23 أغسطس 2026، وما لا يقل عن 1,000 نجمة على GitHub. اختبرناها جميعًا؛ وتمكّن ستة منها من إنشاء فيديو باستخدام الصورة العامة والصوت الذكوري نفسيهما. تعذّر تشغيل LTX-2.3 DubIt لأن ملفه الرسمي يتطلب موافقة Hugging Face. قدّم LiveAvatar أوضح نتيجة بين النماذج الكبيرة، وحقق EchoMimicV3-Flash أفضل توازن على بطاقة رسومية بسعة 48 GB، بينما كان SoulX-FlashHead الأخف بفارق واضح عند ذروة استخدام بلغت 5.8 GB من VRAM.


السؤال الذي أردنا الإجابة عليه

تتسارع إصدارات نماذج الشخصيات الناطقة مفتوحة المصدر إلى حد يصعب معه على مقالات المقارنة مواكبتها. كما يصعب مقارنة ادعاءات مثل «الوقت الحقيقي» و«المدة غير المحدودة» و«الحفاظ على الهوية»، لأن كل مشروع يستخدم مدخلات ودقات وبطاقات رسومية وتعريفات مختلفة لزمن الاستدلال.

أردنا إجابة محددة وقابلة لإعادة الاختبار: أي النماذج الحديثة التي تبنّاها المجتمع بصورة ملموسة يستطيع تحويل الصورة والتعليق الصوتي نفسيهما إلى فيديو ناطق مقنع، وما المتطلبات الفعلية لتشغيل كل نموذج؟

في هذه الجولة، يكون النموذج مؤهلاً فقط إذا استوفى القاعدتين:

  • تم إصدار أول كود وأوزان رسمية قابلة للاستخدام في الفترة من 23 أغسطس 2025 حتى 23 أغسطس 2026.
  • كان مستودعها الرسمي GitHub يحتوي على أكثر من 1000 نجم في 23 أغسطس 2026.

عدد نجوم المستودع مقياس للاهتمام لا للجودة. وفي حالتي Wan2.2 وLTX-2.3، يعود عدد النجوم إلى المشروع الأم لأن ميزة الشخصية الافتراضية مضمّنة داخل مستودعه.

النماذج المؤهلة السبعة

نموذجGitHub نجومالإصدار العامالمدخلات الرسميةنتيجة الاختبار
Wan2.2-S2V-14B17,26126 أغسطس 2025صورة + صوت، مقطع فيديو اختياريمكتمل
LTX-2.3 DubIt9,22611 مايو 2026الفيديو المرجعي + النص المستهدفمنعت من قبل نقطة تفتيش مسورة
LongCat-فيديو-الصورة الرمزية 1.57,51521 مايو 2026صورة + صوتمكتمل
LiveAvatar2,3848 ديسمبر 2025صورة + صوتمكتمل
SoulX-FlashTalk1,4768 يناير 2026صورة + صوتمكتمل
EchoMimicV3-فلاش1,02522 يناير 2026صورة + صوتمكتمل
SoulX-FlashHead1,00612 فبراير 2026صورة + صوتمكتمل

تم استبعاد المشاريع التي تم إصدارها قبل الموعد النهائي بغض النظر عن عدد نجومها.

نفس الصورة الرمزية العامة، نفس الصوت الذكوري

كل جولة ناجحة تستخدم هذا الإطار من الصمت، تم إنشاء فيديو Pexels باستخدام الذكاء الاصطناعي بواسطة AI25.Studio، تحت رخصة Pexels. لا يؤيد منشئ المحتوى المصدر هذه المقارنة.

الإطار المرجعي العام المتوفر لنماذج الصورة الرمزية

استخدم السرد الذي مدته 3.63 ثانية صوت دانيال، صوت نظامي ذكر محايد مدمج مع macOS:

يمكن الآن لنماذج الصور الرمزية مفتوحة المصدر إنشاء مقاطع فيديو مقنعة من صورة واحدة.

قمنا بنشر إصدارات مثبتة من المستودعات والأوزان الرسمية Modal. يبدأ الوقت المقاس عندما تبدأ حاوية التوليد وينتهي عند إرجاع MP4 النهائي. تم بالفعل تخزين أوزان النماذج في مجلد ثابت Modal، لذلك تم استبعاد وقت التنزيل الأولي عبر الإنترنت، ولكن تم تضمين تحميل النموذج والمعالجة المسبقة والتوليد وفك التشفير والمزج.

النتائج في لمحة

نموذجتم اختبار GPUدقيقة. دائمًا قيد التشغيل GPU/moالذروة VRAMالوقتمؤسسة. حسابذاكرة التخزين المؤقت النموذجيةالإخراج
Wan2.2-S2V-14BH200$2,843 (H100)58,681 مليون ميجابايت780.29s$1.369245.76 جيجا بايت512 × 896، 16 إطارًا في الثانية
LTX-2.3 DubItلا شيءغير معروفلا شيءمحظور قبل GPU$0 GPUنقطة تفتيش ببواباتلا يوجد إخراج
LongCat-فيديو-الصورة الرمزية 1.5H200$2,843 (H100)46,827 مليون ميجابايت233.08s$0.401144.82 GB480 × 832، 25 إطارًا في الثانية
LiveAvatarH200$2,843 (H100)61,401 ميجابايت181.44s$0.318447.03 جيجا بايت384 × 704، 25 إطارًا في الثانية
SoulX-FlashTalkH200$2,843 (H100)57,805 ميجابايت331.93s$0.582551.07 جيجا بايت416 × 720، 25 إطارًا في الثانية
EchoMimicV3-فلاشL40S$1,405 (L40S)33,726 مليون ميجابايت251.94s$0.212022.28 جيجا بايت480 × 848، 25 إطارًا في الثانية
SoulX-FlashHead لايتL40S$575 (L4)5,763 ميجابايت235.31s$0.19807.60 جيجا بايت512 × 512، 25 إطارًا في الثانية

استخدام التقديرات الحسابية قائمة أسعار Modal بتاريخ 23 أغسطس 2026 بالنسبة ل GPU وCPU والذاكرة المطلوبة أثناء دالة التوليد المقاسة. تستثني التخزين، ونقل الإنترنت، والتنزيل لمرة واحدة بوزن واحد.

يعرض العمود الشهري تقديرًا لتكلفة سعة GPU وحدها عند التشغيل المتواصل لمدة 30 يومًا. واعتمدنا أقل فئة من بطاقات Modal نتوقع أن تشغّل الإعداد المقاس من دون إعادة تصميم مسار المعالجة: H100 للنماذج الأعلى استهلاكًا للموارد، وL40S لـ EchoMimic، وL4 لـ FlashHead Lite. لا يشمل التقدير تكلفة المعالج والذاكرة والتخزين والشبكة. وبما أن Modal يخفض الموارد إلى الصفر عند عدم الاستخدام، فالحد الأدنى الفعلي هو 0 دولار شهريًا، وقد تكون تكلفة النشر حسب الاستخدام أقل بكثير من تقدير التشغيل الدائم.

هذه هي قياسات النشر، وليست مقياسًا مرجعيًا لجودة النموذج يتم التحكم فيه بشكل كامل. تنتج خطوط الأنابيب الرسمية دقة مختلفة وتستخدم عددًا مختلفًا من الخطوات. وهذا جزء من النتيجة: فهو يوضح ما يقدمه المسار القابل للتشغيل الموصى به لكل مشروع.

مقاطع الفيديو التي تم إنشاؤها

Wan2.2-S2V-14B

أبقى وان هويته وخلفيته ثابتة، مع تقييد حركة الوجه. كان أيضًا أبطأ تشغيل ناجح حيث بلغ 13 دقيقة لإخراج 3.8 ثانية.

Wan هو الخيار السينمائي الثقيل. قمنا بتشغيل المسار الرسمي للتحويل من الكلام إلى الفيديو المكون من 40 خطوة على جهاز H200 واحد. أنتج صورة شخصية نظيفة ومستقرة، لكن الحركة كانت محافظة وكانت ناتج 16 إطارًا في الثانية أقل سلاسة من نماذج 25 إطارًا في الثانية. وصل الحد الأقصى VRAM إلى 58,681 ميبي، وكان تكلفة الحوسبة المقدرة أكثر من أربعة أضعاف LiveAvatar.

يتطلب الإعداد الرسمي أيضًا العديد من إصلاحات التبعية قبل بدء الاستدلال، بما في ذلك الحزم التي تستخدمها أجهزة قراءة الصوت والفيديو. ولم تصل أي من تلك المحاولات الفاشلة إلى تقليل الضوضاء، لذا فهي غير متضمنة في التوقيت أعلاه.

LongCat-فيديو-الصورة الرمزية 1.5

ابتكرت LongCat الأداء الأكثر وضوحًا للرأس والجسم، بما في ذلك إيماءة اليد غير الموجودة في الصورة المرجعية.

ظلت LongCat هي نتيجة تحويل الصورة إلى الفيديو الأكثر تعبيراً. أدى مسار INT8 المكون من 8 خطوات إلى الحفاظ على إمكانية التعرف على الصورة الرمزية أثناء إضافة حركة الرأس والوجه والجزء العلوي من الجسم. بدت بعض إطارات الفم مبالغًا فيها بعض الشيء، لكنها جعلت الصورة الثابتة تبدو وكأنها أداء كامل أكثر من النماذج الأكثر تحفظًا.

يستخدم المثال الرسمي وحدتي GPU. قمنا بتشغيله على جهاز H200 واحد من خلال ضبط توازي السياق على واحد. بلغت ذروتها عند 46,827 ميجابايت، وهو قريب جدًا من الراحة على بطاقة GB النموذجية ذات 48 بمجرد تضمين الحمل الإضافي لإطار العمل.

LiveAvatar

أنتجت LiveAvatar النتيجة الأكثر وضوحًا للوزن الثقيل وأسرع مهمة H200 ناجحة.

لقد أعطتنا LiveAvatar أفضل مزيج من الهوية الحادة وأشكال الفم المقنعة والوميض والتعبير المقيد بين النماذج الكبيرة. تم الانتهاء من خط الأنابيب FP8 المكون من أربع خطوات في 181.44 ثانية، وهو أسرع من LongCat وFlashTalk وWan.

هذه السرعة لا تجعل منه نموذجًا صغيرًا. فقد وصل إلى 61,401 ميبي بايت وكان يعتمد على تفريغ النموذج لفك تشفير VAE النهائي. كما أن مشغل GPU الفردي في المصدر يفترض وجود متغيرات بيئة العمليات الموزعة، ويعمل أفضل مسار موثق لمرة واحدة عندما يكون التجميع معطلًا. بعد مطابقة تلك الإعدادات الرسمية، اكتمل التشغيل بشكل موثوق.

SoulX-FlashTalk 14B

كان FlashTalk قويًا بصريًا ومصممًا للجيل المستمر والمقطع، لكن بدايته الباردة 14B كانت باهظة الثمن.

أنتج FlashTalk وجهًا مستقرًا مع حركة فم واضحة. استغرق الجزء الأول الذي تم إنشاؤه 119.58 ثانية لأن TorchInductor قام بتجميع الرسم البياني الخاص به. استغرقت القطع اللاحقة حوالي 3.75 ثانية لكل منها. وهذا يجعل المهمة الباردة التي تبلغ 331.93 ثانية تبدو أسوأ مما قد تشعر به عملية نشر البث المباشر.

والمقايضة هي البنية التحتية. بلغت الذروة VRAM 57,805 ميجا بايت، وكانت ذاكرة التخزين المؤقت المستمرة هي الأكبر في هذا الاختبار عند 51.07 جيجا بايت. إنه ينتمي إلى فئة 80 GB GPU ما لم يضيف النشر تفريغًا أو تكميمًا أكثر قوة.

EchoMimicV3-فلاش

قدم EchoMimic أفضل توازن عملي: الهوية النظيفة وحركة الشفاه على L40S الأرخص.

كان EchoMimicV3-Flash هو المرشح الأكثر إقناعًا للنشر. أنتج خط الأنابيب 1.3B المكون من 8 خطوات فيديو نظيفًا بمعدل 25 إطارًا في الثانية، وحافظ على الوجه جيدًا، وعمل على L40S بدلاً من H200. كانت حركة الفم والجسم أكثر دقة من حركة LongCat، ولكن كانت هناك تغييرات أقل تشتيتًا للانتباه في الإطار الكامل.

بلغ تكويننا الرسمي لمنطقة 768 ذروته عند 33726 ميجابايت. يعلن المشروع عن أوضاع الذاكرة المنخفضة، لذلك يتم ملاحظة هذا الاستخدام لإعداداتنا بدلاً من المطالبة بالحد الأدنى النظري. كانت ذاكرة التخزين المؤقت التي تبلغ سعتها 22.28 جيجا بايت أقل من نصف حجم طرازات 14 جيجا بايت.

SoulX-FlashHead 1.3B لايت

كان FlashHead أصغر حجمًا بشكل كبير، لكن القطع المتقارب والهوية الأكثر ليونة وحركة الفم الأضعف جعلتها النتيجة الأقل إقناعًا.

بلغ FlashHead Lite ذروته عند 5763 ميجابايت فقط، وهو ترتيب أقل من المولدات الكبيرة. مثل FlashTalk، سيطر التجميع الذي يتم تشغيله لأول مرة على توقيته البارد. استغرقت القطعة الأولى 155.7 ثانية، بينما استغرقت القطعة اللاحقة حوالي 0.19 ثانية لكل منها.

هذا مثير للاهتمام بالنسبة لخدمة البث الدافئة دائمًا ويقترح أنه يمكن تشغيله على أجهزة أرخص بكثير من جهاز L40S المستخدم هنا. ومع ذلك، لمقطع صفحة الهبوط الاحترافي، سنختار النتيجة البصرية الأقوى لـ EchoMimic.

لماذا لا يوجد فيديو هنا في LTX-2.3 DubIt

LTX-2.3 DubIt يختلف عن نماذج الصوت أعلاه. يأخذ فيديو مرجعي يحتوي على صوت ونصًا مستهدفًا، ثم يولد خطابًا وحركة الشفاه المتطابقة مع محاولة الحفاظ على هوية صوت المتحدث.

رمزها عام، ولكن الرسمي Lightricks/LTX-2.3-22b-IC-LoRA-DubIt أعاد نقطة التفتيش خطأ في التفويض من Hugging Face. لم يكن لدينا رمز موافقة في بيئة الاختبار، لذا توقف العمل أثناء تجهيز الأوزان المخصصة CPU فقط قبل تخصيص أي GPU.

لم نستبدل مرآة خارجية تتجاوز بوابة الدخول الرسمية. تعد إمكانية التكرار والوصول جزءًا من تقييم إصدار مفتوح المصدر. بمجرد الموافقة على الوصول الرسمي، يمكن لعداء Modal المجهز تنفيذ نفس الاختبار باستخدام الفيديو المرجعي العام والجملة المستهدفة.

هل يحافظ كل نموذج على الصوت أو يختاره؟

لا تقوم معظم نماذج الصور الرمزية بتحديد الصوت أو استنساخه. يقومون بتحريك ملف صوتي مرفق، ثم يضعون نفس الصوت في الفيديو النهائي. يعد إنشاء الصوت بمثابة خطوة منفصلة لتحويل النص إلى كلام أو استنساخ الصوت.

نموذجمحدد الصوت المدمجيستخدم الكلام المزوديتعلم من صوت مرجعيما لاحظناه
Wan2.2-S2V-14Bلانعملاتم الحفاظ على إدخال الصوت، الارتباط 0.999897
LTX-2.3 DubItلا توجد قائمة صوتيةلا، فهو يأخذ النص المستهدفنعم، من الفيديو المرجعي الصوتيلا يتم تشغيله لأن الأوزان كانت مسورة
LongCat-فيديو-الصورة الرمزية 1.5لانعملاتم حفظ إدخال الصوت، الارتباط 0.999562
LiveAvatarلانعملاتم الحفاظ على إدخال الصوت، الارتباط 0.999897
SoulX-FlashTalkلانعملاتم حفظ إدخال الصوت، الارتباط 0.999751
EchoMimicV3-فلاشلانعملاتم الحفاظ على إدخال الصوت، الارتباط 0.999198
SoulX-FlashHeadلانعملاتم حفظ إدخال الصوت، الارتباط 0.999751

تعود الاختلافات الصغيرة إلى إعادة التشكيل وترميز AAC، وليس إلى مكبر صوت مركب مختلف. بمعنى آخر، يمكن للنماذج الستة الناجحة استخدام تسجيل حقيقي، أو استنساخ موافق عليه تم إجراؤه في مكان آخر، أو أي صوت TTS. إنهم لا يغيرون الهوية الصوتية بأنفسهم.

DubIt هو الاستثناء. والغرض منه هو إنشاء لغة مستهدفة جديدة أو خطاب نصي مستهدف يشبه الصوت في الفيديو المرجعي. وهذا يجعله مفيدًا للدبلجة، لكن الصوت الناتج لن يكون نسخة موجية من الأصل.

المعلمات تستحق الضبط

لا تعد الإعدادات الافتراضية بالضرورة أفضل إعداد لكل وجه أو عملية نشر. هذه هي عناصر التحكم ذات التأثير الأعلى التي يجب اختبارها قبل تغيير رمز النموذج:

نموذجالمعلمات الأكثر أهميةالمقايضة المحتملة
Wan2.2-S2V-14Bخطوات تقليل الضوضاء، ومقياس التوجيه، ومنطقة الإخراج، والبذور، والفيديو الاختيارييؤدي المزيد من الخطوات والبكسلات إلى زيادة زمن الوصول بشكل حاد؛ التحكم في الوضعية يمكن أن يحسن حركة الجسم
LTX-2.3 DubItموجه، النص المستهدف، طول الفيديو المرجعي، قوة LoRA، البذورقد يؤدي التكييف الأقوى إلى تحسين الهوية ولكنه يقلل من التباين الطبيعي
LongCat-فيديو-الصورة الرمزية 1.58 خطوات مقطرة مقابل المسار الكامل، التكميم، التوجيه، البذور، توازي السياققد تؤدي الدقة الكاملة أو المزيد من الخطوات إلى تحسين التفاصيل ولكنها تحتاج إلى مزيد من الذاكرة والوقت
LiveAvatarخطوات العينة، منطقة الإخراج، FP8، تفريغ النموذج، التجميعالتجميع يساعد على تكرار المهام؛ يؤدي إلغاء التحميل إلى حفظ الذاكرة ولكنه يضيف عمليات نقل
SoulX-FlashTalkحجم القطعة، التداخل، التجميع، التوجيه الصوتي، البذوريمكن للأجزاء الأكبر حجمًا تحسين الاستمرارية ولكنها تزيد من زمن الوصول والذاكرة
EchoMimicV3-فلاشخطوات الاستدلال، المقياس الإرشادي، الإرشاد الصوتي، حجم العينة، البذرةيمكن أن يؤدي التوجيه الصوتي العالي إلى تقوية حركة الفم ولكنه قد يبالغ فيها
SoulX-FlashHeadلايت مقابل نقطة التفتيش الكاملة، والمحاصيل، وطول القطعة، والتجميعيجب أن يعمل النموذج الكامل على تحسين الجودة بتكلفة ذاكرة أعلى؛ يؤثر المحصول بشدة على التكوين

للحصول على اختبار عادل للمنتج، قم بضبط متغير واحد في كل مرة مقابل نفس الصورة والسرد. سيكون التمرير الأول الأكثر فائدة هو التوجيه الصوتي لـ EchoMimic، وخطوات العينة لـ LiveAvatar، وجودة الاقتصاص ونقطة التفتيش الكاملة لـ FlashHead، والطلب الثاني الدافئ لكلا طرازي SoulX.

كيف تبدو الأجهزة حقًا

تنقسم المولدات الستة الناجحة إلى ثلاث مجموعات عملية للبنية التحتية:

  • أقل من 16 عامًا GB: SoulX-FlashHead Lite هو المولد الكامل الوحيد الذي تم اختباره والذي يناسبه بشكل واضح. تبلغ ذروتها 5.8 GB مساحة لبطاقة 12 GB أو 16 GB، على الرغم من أن زمن الوصول ودعم إطار العمل لا يزالان بحاجة إلى التحقق من صحة أجهزة المستهلك.
  • 48 GB فئة: تم تشغيل EchoMimicV3-Flash بشكل مريح على L40S عند 33.7 GB. تخصيص LongCat 46.8 GB قريب جدًا من الحد الأقصى للنشر المريح 48 GB.
  • 80 GB فئة: Wan2.2-S2V وLiveAvatar وSoulX-FlashTalk وLongCat هي الأكثر أمانًا على وحدات معالجة الرسومات من فئة H100 أو H200 مع 80 GB أو أكثر.

التخزين المستمر مهم أيضًا. يستخدم FlashHead وEchoMimic حوالي 7.6 و22.3 جيجا بايت على التوالي. تحتاج النماذج الكبيرة إلى ما يقرب من 45 إلى 51 جيجا بايت لكل منها. ستستهلك استضافة كل ذاكرة تخزين مؤقت في هذه المقالة مرة واحدة ما يزيد عن 200 جيجا بايت قبل صور الحاوية والمخرجات والملفات المؤقتة.

يعد Modal مناسبًا للتجارب نظرًا لأن الحاويات يمكن أن تتوسع إلى الصفر بينما تظل ذاكرات التخزين المؤقت للنماذج على وحدات تخزين ثابتة. بعد هذا الاختبار، أبلغ كل تطبيق Modal عن عدم وجود مهام قيد التشغيل ولم يظل GPU نشطًا.

ما سوف نستخدمه اليوم

لا يوجد خيار واحد أقوى لكل سير عمل للصورة الرمزية:

  • استخدم LiveAvatar عندما تكون جودة الصورة إلى الفيديو الكبيرة هي الأهم ومتوفر 80 GB GPU. أنتج أفضل نتيجة لدينا للنموذج الكبير وكان أسرع مهام H200 الباردة.
  • استخدم EchoMimicV3-Flash لأفضل توازن عملي بين الجودة والبنية التحتية. تم تشغيله على جهاز L40S الأرخص، استخدم ذاكرة تخزين مؤقت أصغر بكثير، وأنتج نتيجة نظيفة.
  • استخدم LongCat-Video-Avatar 1.5 عندما تصبح حركة الجسد التعبيرية أكثر أهمية من الحفاظ المحافظ على الهوية.
  • استخدم SoulX-FlashHead Lite عندما يكون VRAM المنخفض وسرعة البث الدافئ أهم من الدقة.

النتيجة الأكثر إثارة للدهشة لم تكن أن النموذج الأكبر يبدو أفضل. لقد كان مدى قرب EchoMimic من استخدام GPU الأرخص وأقل من نصف مساحة تخزين النموذج. أصبح إنشاء الصور الرمزية مفتوحة المصدر أمرًا عمليًا الآن، لكن استراتيجية الخدمة لا تزال مهمة بقدر أهمية نقطة التفتيش.

شارك على x