Aller à l’article
← Retour vers Ingénierie

Nous avons testé tous les modèles d’avatar open source populaires publiés l’année dernière (août 2026)

Illustration de couverture pour Nous avons testé tous les modèles d’avatar open source populaires publiés l’année dernière (août 2026)

TL ;DR - Sept modèles d’avatar open source ont atteint notre seuil : une sortie publique entre 23 août 2025 et 23 août 2026, plus au moins 1 000 étoiles GitHub. Nous les avons tous exécutés. Six ont produit des vidéos à partir du même avatar public et de la même narration masculine. LTX-2.3 DubIt n’a pas pu démarrer car son point de contrôle officiel nécessite l’approbation du Hugging Face. LiveAvatar a obtenu le résultat le plus net chez les poids lourds, EchoMimicV3-Flash offrait le meilleur équilibre sur un 48 GB GPU, et SoulX-FlashHead était de loin le plus léger à 5.8 GB de crête VRAM.


La question à laquelle nous voulions répondre

Les versions d’avatar parlant open source arrivent maintenant plus rapidement que la plupart des publications de comparaison ne peuvent les suivre. Des revendications telles que « temps réel », « longueur infinie » et « préservation de l’identité » sont difficiles à comparer car les projets utilisent des entrées, des résolutions, des GPU et des définitions de temps d’inférence différents.

Nous voulions une réponse plus étroite et reproductible : quels modèles récents avec une adoption significative par la communauté peuvent transformer le même portrait et la même narration en une vidéo parlante convaincante, et de quoi chacun a-t-il réellement besoin pour fonctionner ?

Pour ce tour, un modèle ne se qualifiait que s’il respectait les deux règles :

  • Son premier code officiel utilisable et ses poids ont été publiés à partir du 23 août 2025 jusqu'le 23 août 2026.
  • Son dépôt officiel GitHub avait plus de 1 000 étoiles le 23 août 2026.

Les étoiles de référentiel sont une mesure de l’attention, pas de la qualité. Pour Wan2.2 et LTX-2.3, le nombre d’étoiles appartient au projet parent car la capacité avatar est publiée dans ce référentiel.

Les sept modèles éligibles

ModèleÉtoiles GitHubDiffusion publiqueContribution officielleRésultat d’essai
Réseau étendu 2.2-S2V-14B17,26126 août 2025Image + audio, vidéo de pose facultativeTerminé
LTX-2.3 Doute9,22611 mai 2026Vidéo de référence + texte cibleBloqué par un point de contrôle fermé
Chat long-Vidéo-Avatar 1.57,51521 mai 2026Image + audioTerminé
LiveAvatar2,3848 décembre 2025Image + audioTerminé
SoulX-FlashTalk1,4768 janvier 2026Image + audioTerminé
EchoMimicV3-Flash1,02522 janvier 2026Image + audioTerminé
SoulX-FlashHead1,00612 février 2026Image + audioTerminé

Les projets publiés avant la date limite ont été exclus quel que soit leur nombre d’étoiles.

Même avatar public, même voix masculine

Chaque exécution réussie utilisait ce cadre à partir d’un silencieux, IA - vidéo Pexels générée par AI25.Atelier, sous le Licence Pexels. Le créateur de la source n’approuve pas cette comparaison.

Le référentiel public fourni aux modèles d’avatar

La narration de 3,63 secondes utilisait Daniel, une voix masculine neutre incluse avec macOS :

Les modèles d’avatar open source peuvent désormais générer des vidéos convaincantes à partir d’une seule image.

Nous avons déployé des versions épinglées des référentiels officiels et des poids sur Modal. Le temps mesuré commence au démarrage du conteneur de génération et se termine lorsque le dernier MP4 est renvoyé. Les poids des modèles étaient déjà stockés dans un volume persistant Modal, de sorte que le temps de téléchargement initial sur Internet est exclu, mais le chargement, le prétraitement, la génération, le décodage et le multiplexage du modèle sont inclus.

Résultats en un coup d’œil

ModèleGPU testéMin. Toujours actif GPU / moisPic VRAMTempsEst. CalculerCache du modèleSortie
Réseau étendu 2.2-S2V-14BH 2002 843 $ (D100)58,681 MiO780.29l$1.369245.76 GiO512 x 896, 16 fps
LTX-2.3 DouteNéantInconnuNéantBloqué avant GPU0 $ GPUPoint de contrôle ferméAucune sortie
Chat long-Vidéo-Avatar 1.5H 2002 843 $ (D100)46,827 MiO233.08l$0.401144.82 GB480 x 832, 25 fps
LiveAvatarH 2002 843 $ (D100)61,401 MiO181.44l$0.318447.03 GiO384 x 704, 25 fps
SoulX-FlashTalkH 2002 843 $ (D100)57,805 MiO331.93l$0.582551.07 GiO416 x 720, 25 fps
EchoMimicV3-FlashL40S1 405 $ (L40S)33,726 MiO251.94l$0.212022.28 GiO480 x 848, 25 fps
SoulX-FlashHead LégèreL40S575 $ (L4)5 763 MiO235.31l$0.19807.60 GiO512 x 512, 25 fps

Calculer les estimations utilisation Prix catalogue du 23 août 2026 de Modal Pour la demande GPU, CPU, et mémoire pendant la fonction de génération mesurée. Ils excluent le stockage, le transfert Internet et le téléchargement ponctuel du poids.

La colonne mensuelle est une estimation de la capacité GPU uniquement pour un fonctionnement continu sur un mois de 30 jours. Il utilise le moins cher Modal GPU classe nous prévoyons d’exécuter la configuration mesurée sans reconcevoir le pipeline : H100 pour les modèles lourds, L40S pour EchoMimic et L4 pour FlashHead Lite. CPU, la mémoire, les volumes et les frais de réseau sont en sus. Modal évolue à zéro, de sorte que le minimum mensuel réel est de 0 USD et qu’un déploiement basé sur l’utilisation peut coûter beaucoup moins cher que l’estimation permanente.

Ce sont des mesures de déploiement, pas un benchmark de qualité de modèle parfaitement contrôlé. Les pipelines officiels produisent différentes résolutions et utilisent différents nombres d’étapes. Cela fait partie du résultat : il montre ce que le chemin exécutable recommandé de chaque projet fournit.

Les vidéos générées

Réseau étendu 2.2-S2V-14B

Wan a gardé l’identité et l’arrière-plan stables, avec des mouvements faciaux restreints. C’était aussi la course réussie la plus lente à 13 minutes pour une sortie de 3,8 secondes.

Le Wan est l’option cinématographique la plus lourde. Nous avons exécuté le chemin officiel de la parole à la vidéo en 40 étapes sur un H200. Il produisait un portrait net et stable, mais le mouvement était conservateur et la sortie à 16 ips était moins fluide que les modèles à 25 ips. Le pic VRAM a atteint 58 681 Mio, et le coût de calcul estimé était plus de quatre fois celui de LiveAvatar.

La configuration officielle a également nécessité plusieurs correctifs de dépendances avant que l’inférence ne démarre, y compris les packages utilisés par ses lecteurs audio et vidéo. Aucune de ces tentatives infructueuses n’a atteint le débruitage, elles ne sont donc pas incluses dans le synchronisation ci-dessus.

Chat long-Vidéo-Avatar 1.5

LongCat a créé la performance de la tête et du corps la plus visible, y compris un geste de la main non présent dans l’image de référence.

LongCat est resté le résultat image-vidéo le plus expressif. Son chemin 8-step INT8 gardait l’avatar reconnaissable tout en ajoutant des mouvements de la tête, du visage et du haut du corps. Quelques cadres de bouche semblaient légèrement exagérés, mais l’image fixe ressemblait davantage à une performance complète que les modèles plus conservateurs.

L’exemple officiel utilise deux GPU. Nous l’avons exécuté sur un H200 en définissant le parallélisme de contexte sur un. Il a culminé à 46 827 MiO, ce qui est trop proche pour le confort d’une carte typique de 48 GB une fois que la surcharge du framework est incluse.

LiveAvatar

LiveAvatar a produit le résultat le plus net en poids lourd et le travail H200 réussi le plus rapide.

LiveAvatar nous a donné la meilleure combinaison d’identité nette, de formes de bouche convaincantes, de clignements d’yeux et d’expression sobre parmi les grands modèles. Son pipeline en quatre étapes FP8 s’est terminé en 181.44 secondes, plus rapidement que LongCat, FlashTalk et Wan.

Cette vitesse n’en fait pas un petit modèle. Il a culminé à 61 401 Mio et dépendait du déchargement du modèle pour le décodage final VAE. Le runner single-GPU en amont suppose également des variables d’environnement de processus distribué, et son chemin unique documenté fonctionne mieux avec la compilation désactivée. Après avoir fait correspondre ces paramètres officiels, la course s’est terminée de manière fiable.

SoulX-FlashTalk 14B

FlashTalk était visuellement fort et est conçu pour une génération fragmentée et continue, mais son 14B démarrage à froid était coûteux.

FlashTalk a produit un visage stable avec un mouvement de la bouche clair. Le premier bloc généré a pris 119.58 secondes car TorchInductor a compilé son graphe. Les morceaux suivants ont pris environ 3.75 secondes chacun. Cela rend le travail froid de 331.93-second pire qu’un déploiement de streaming chauffé.

Le compromis est l’infrastructure. Le pic VRAM était de 57 805 Mio, et le cache persistant était le plus important de ce test à 51,07 GiO. Il appartient à une classe de 80 GB GPU à moins que le déploiement n’ajoute un déchargement ou une quantification plus agressif.

EchoMimicV3-Flash

EchoMimic a offert le meilleur équilibre pratique : une identité nette et un mouvement des lèvres sur un L40S moins cher.

EchoMimicV3-Flash était le candidat de déploiement le plus convaincant. Son pipeline 1.3 B, 8-step produisait une vidéo fps propre 25, préservait bien le visage et fonctionnait sur un L40S au lieu d’un H 200. Les mouvements de la bouche et du corps étaient plus subtils que ceux de LongCat, mais il y avait moins de changements gênants en plein cadre.

Notre configuration officielle de 768 zones a culminé à 33 726 MiO. Le projet annonce des modes à faible mémoire, il s’agit donc d’une utilisation observée pour nos paramètres plutôt que d’une affirmation sur le minimum théorique. Son cache de 22,28 GiO était inférieur à la moitié de la taille des modèles 14B.

SoulX-FlashHead 1.3 B Lite

La tête éclair était considérablement plus petite, mais le recadrage serré, l’identité plus douce et le mouvement de la bouche plus faible en faisaient le résultat le moins convaincant.

FlashHead Lite a culminé à seulement 5 763 Mio, un ordre de grandeur en dessous des gros générateurs. Comme FlashTalk, son synchronisation froid a été dominé par la compilation de première exécution. Le premier morceau a pris 155.7 secondes, tandis que les morceaux suivants ont pris environ 0.19 secondes chacun.

C’est intéressant pour un service de streaming toujours chaleureux et suggère qu’il pourrait fonctionner sur du matériel beaucoup moins cher que les L40S utilisés ici. Pour un clip de page de destination soigné, cependant, nous choisirions le résultat visuel plus fort d’EchoMimic.

Pourquoi LTX-2.3 DubIt n’a pas de vidéo ici

LTX-2.3 Doute Est différent des modèles audio ci-dessus. Il prend une vidéo de référence vocale et un texte cible, puis génère un discours et un mouvement des lèvres correspondants tout en essayant de conserver l’identité vocale du locuteur.

Son code est public, mais l’officiel Lightricks/LTX-2.3-22b-IC-LoRA-DubIt Checkpoint a renvoyé une erreur d’autorisation d’Hugging Face. Nous n’avions aucun jeton approuvé dans l’environnement de test, donc le travail s’est arrêté pendant la préparation du poids uniquement CPU avant qu’aucun GPU ne soit alloué.

Nous n’avons pas substitué un miroir tiers qui contournait la porte d’accès officielle. La reproductibilité et l’accès font partie de l’évaluation d’une version open source. Une fois l’accès officiel approuvé, le coureur préparé Modal peut exécuter le même test avec la vidéo de référence publique et la phrase cible.

Chaque modèle préserve-t-il ou sélectionne-t-il une voix ?

La plupart des modèles d’avatar ne sélectionnent ni ne clonent une voix. Ils animent un fichier audio fourni, puis placent ce même son dans la vidéo finale. La création vocale est une étape distincte de synthèse vocale ou de clonage vocal.

ModèleSélecteur vocal intégréUtilise la parole fournieApprend d’une voix de référenceCe que nous avons observé
Réseau étendu 2.2-S2V-14BNonOuiNonAudio d’entrée préservé, corrélation 0.999897
LTX-2.3 DoutePas de menu vocalNon, il faut du texte cibleOui, à partir de la vidéo de référence vocaleNe pas courir parce que les poids étaient fermés
Chat long-Vidéo-Avatar 1.5NonOuiNonAudio d’entrée préservé, corrélation 0.999562
LiveAvatarNonOuiNonAudio d’entrée préservé, corrélation 0.999897
SoulX-FlashTalkNonOuiNonAudio d’entrée préservé, corrélation 0.999751
EchoMimicV3-FlashNonOuiNonAudio d’entrée préservé, corrélation 0.999198
SoulX-FlashHeadNonOuiNonAudio d’entrée préservé, corrélation 0.999751

Les petites différences proviennent du rééchantillonnage et de l’encodage AAC, pas d’un haut-parleur synthétisé différent. En d’autres termes, les six modèles réussis peuvent utiliser un enregistrement réel, un clone consenti fait ailleurs, ou n’importe quelle voix TTS. Ils ne changent pas l’identité vocale eux-mêmes.

DubIt est l’exception. Son but est de créer un nouveau discours en langue cible ou en script cible ressemblant à la voix de la vidéo de référence. Cela le rend utile pour le doublage, mais son audio de sortie ne sera pas une copie de forme d’onde de l’original.

Paramètres à régler

Les valeurs par défaut ne sont pas nécessairement les meilleurs paramètres pour chaque visage ou déploiement. Ce sont les contrôles à impact le plus élevé à tester avant de modifier le code du modèle :

ModèleParamètres qui comptent le plusCompromis probable
Réseau étendu 2.2-S2V-14BÉtapes de débruitage, échelle de guidage, zone de sortie, graine, vidéo de pose en optionPlus de pas et de pixels augmentent fortement la latence ; le contrôle de la pose peut améliorer les mouvements du corps
LTX-2.3 DouteInvite, texte cible, référence-longueur de la vidéo, force LoRa, graineUn conditionnement plus fort peut améliorer l’identité mais réduire les variations naturelles
Chat long-Vidéo-Avatar 1.58-étape distillée vs chemin complet, quantification, guidage, amorçage, parallélisme de contexteUne précision totale ou plusieurs étapes peuvent améliorer les détails mais nécessitent plus de mémoire et de temps
LiveAvatarExemples d’étapes, zone de sortie, FP8, déchargement du modèle, compilationLa compilation facilite les tâches répétées ; le déchargement économise de la mémoire mais ajoute des transferts
SoulX-FlashTalkTaille des morceaux, chevauchement, compilation, guidage audio, graineDes morceaux plus volumineux peuvent améliorer la continuité mais augmenter la latence et la mémoire
EchoMimicV3-FlashÉtapes d’inférence, échelle de guidage, guidage audio, taille de l’échantillon, graineUn guidage audio plus élevé peut renforcer le mouvement de la bouche mais peut l’exagérer
SoulX-FlashHeadLite vs point de contrôle complet, recadrage, longueur de morceau, compilationLe modèle complet devrait améliorer la qualité à un coût de mémoire plus élevé ; le recadrage affecte fortement la composition

Pour un test de produit équitable, réglez une variable à la fois sur le même portrait et la même narration. La première passe la plus utile serait un guidage audio pour EchoMimic, des étapes d’échantillonnage pour LiveAvatar, une qualité de recadrage et de point de contrôle complet pour FlashHead, et une deuxième demande réchauffée pour les deux modèles SoulX.

À quoi ressemble vraiment le matériel

Les six générateurs à succès se répartissent en trois groupes d’infrastructures pratiques :

  • Moins de 16 ans GB : SoulX-FlashHead Lite est le seul générateur complet testé qui s’adapte clairement. Son pic de 5,8 GB laisse de la place pour une carte 12 GB ou 16 GB, bien que la latence et la prise en charge de la structure nécessitent encore une validation sur le matériel grand public.
  • 48 GB classe : EchoMimicV3-Flash a fonctionné confortablement sur un L40S à 33.7 GB. Chat long 46.8 GB l’allocation est trop proche de la limite pour un confort 48 GB déploiement.
  • 80 GB classe : Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk et LongCat sont les plus sûrs sur les GPU de classe H100 ou H200 avec 80 GB ou plus.

Le stockage persistant est également important. La tête éclair et l’échomimétique utilisent environ 7,6 et 22,3 GiO, respectivement. Les grands modèles ont besoin d’environ 45 à 51 GiO chacun. Héberger chaque cache de cet article à la fois consommerait bien plus de 200 GiO avant les images de conteneur, les sorties et les fichiers temporaires.

Modal convient bien aux expériences car les conteneurs peuvent évoluer jusqu’à zéro tandis que les caches de modèles restent sur des volumes persistants. Après ce test, chaque application Modal n’a signalé aucune tâche en cours d’exécution et aucune GPU n’est restée active.

Ce que nous utiliserions aujourd'hui

Il n’y a pas de gagnant unique pour chaque flux de travail avatar :

  • Utilisez LiveAvatar Lorsque la qualité de l’image à la vidéo est la plus importante et qu’un 80 GB GPU est disponible. Il a produit notre résultat le plus net sur grand modèle et a eu le travail à froid H200 le plus rapide.
  • Utiliser EchoMimicV3-Flash Pour le meilleur équilibre pratique entre la qualité et l’infrastructure. Il fonctionnait sur un L40S moins cher, utilisait un cache beaucoup plus petit et produisait un résultat propre.
  • Utiliser LongCat-Vidéo-Avatar 1.5 Lorsque le mouvement corporel expressif importe plus que la préservation de l’identité conservatrice.
  • Utilisez SoulX-FlashHead Légère Lorsque la vitesse de streaming basse VRAM et chaude importe plus que le vernis.

Le résultat le plus surprenant n’était pas que le plus gros modèle était le plus beau. C’était à quel point EchoMimic était proche tout en utilisant un GPU moins cher et moins de la moitié du stockage du modèle. La génération d’avatars open source est désormais pratique, mais la stratégie de service compte toujours autant que le point de contrôle.

Partager sur X