TL ;DR - Sept modèles d’avatar open source ont atteint notre seuil : une sortie publique entre 23 août 2025 et 23 août 2026, plus au moins 1 000 étoiles GitHub. Nous les avons tous exécutés. Six ont produit des vidéos à partir du même avatar public et de la même narration masculine. LTX-2.3 DubIt n’a pas pu démarrer car son point de contrôle officiel nécessite l’approbation du Hugging Face. LiveAvatar a obtenu le résultat le plus net chez les poids lourds, EchoMimicV3-Flash offrait le meilleur équilibre sur un 48 GB GPU, et SoulX-FlashHead était de loin le plus léger à 5.8 GB de crête VRAM.
La question à laquelle nous voulions répondre
Les versions d’avatar parlant open source arrivent maintenant plus rapidement que la plupart des publications de comparaison ne peuvent les suivre. Des revendications telles que « temps réel », « longueur infinie » et « préservation de l’identité » sont difficiles à comparer car les projets utilisent des entrées, des résolutions, des GPU et des définitions de temps d’inférence différents.
Nous voulions une réponse plus étroite et reproductible : quels modèles récents avec une adoption significative par la communauté peuvent transformer le même portrait et la même narration en une vidéo parlante convaincante, et de quoi chacun a-t-il réellement besoin pour fonctionner ?
Pour ce tour, un modèle ne se qualifiait que s’il respectait les deux règles :
- Son premier code officiel utilisable et ses poids ont été publiés à partir du 23 août 2025 jusqu'le 23 août 2026.
- Son dépôt officiel GitHub avait plus de 1 000 étoiles le 23 août 2026.
Les étoiles de référentiel sont une mesure de l’attention, pas de la qualité. Pour Wan2.2 et LTX-2.3, le nombre d’étoiles appartient au projet parent car la capacité avatar est publiée dans ce référentiel.
Les sept modèles éligibles
| Modèle | Étoiles GitHub | Diffusion publique | Contribution officielle | Résultat d’essai |
|---|---|---|---|---|
| Réseau étendu 2.2-S2V-14B | 17,261 | 26 août 2025 | Image + audio, vidéo de pose facultative | Terminé |
| LTX-2.3 Doute | 9,226 | 11 mai 2026 | Vidéo de référence + texte cible | Bloqué par un point de contrôle fermé |
| Chat long-Vidéo-Avatar 1.5 | 7,515 | 21 mai 2026 | Image + audio | Terminé |
| LiveAvatar | 2,384 | 8 décembre 2025 | Image + audio | Terminé |
| SoulX-FlashTalk | 1,476 | 8 janvier 2026 | Image + audio | Terminé |
| EchoMimicV3-Flash | 1,025 | 22 janvier 2026 | Image + audio | Terminé |
| SoulX-FlashHead | 1,006 | 12 février 2026 | Image + audio | Terminé |
Les projets publiés avant la date limite ont été exclus quel que soit leur nombre d’étoiles.
Même avatar public, même voix masculine
Chaque exécution réussie utilisait ce cadre à partir d’un silencieux, IA - vidéo Pexels générée par AI25.Atelier, sous le Licence Pexels. Le créateur de la source n’approuve pas cette comparaison.
![]()
La narration de 3,63 secondes utilisait Daniel, une voix masculine neutre incluse avec macOS :
Les modèles d’avatar open source peuvent désormais générer des vidéos convaincantes à partir d’une seule image.
Nous avons déployé des versions épinglées des référentiels officiels et des poids sur Modal. Le temps mesuré commence au démarrage du conteneur de génération et se termine lorsque le dernier MP4 est renvoyé. Les poids des modèles étaient déjà stockés dans un volume persistant Modal, de sorte que le temps de téléchargement initial sur Internet est exclu, mais le chargement, le prétraitement, la génération, le décodage et le multiplexage du modèle sont inclus.
Résultats en un coup d’œil
| Modèle | GPU testé | Min. Toujours actif GPU / mois | Pic VRAM | Temps | Est. Calculer | Cache du modèle | Sortie |
|---|---|---|---|---|---|---|---|
| Réseau étendu 2.2-S2V-14B | H 200 | 2 843 $ (D100) | 58,681 MiO | 780.29l | $1.3692 | 45.76 GiO | 512 x 896, 16 fps |
| LTX-2.3 Doute | Néant | Inconnu | Néant | Bloqué avant GPU | 0 $ GPU | Point de contrôle fermé | Aucune sortie |
| Chat long-Vidéo-Avatar 1.5 | H 200 | 2 843 $ (D100) | 46,827 MiO | 233.08l | $0.4011 | 44.82 GB | 480 x 832, 25 fps |
| LiveAvatar | H 200 | 2 843 $ (D100) | 61,401 MiO | 181.44l | $0.3184 | 47.03 GiO | 384 x 704, 25 fps |
| SoulX-FlashTalk | H 200 | 2 843 $ (D100) | 57,805 MiO | 331.93l | $0.5825 | 51.07 GiO | 416 x 720, 25 fps |
| EchoMimicV3-Flash | L40S | 1 405 $ (L40S) | 33,726 MiO | 251.94l | $0.2120 | 22.28 GiO | 480 x 848, 25 fps |
| SoulX-FlashHead Légère | L40S | 575 $ (L4) | 5 763 MiO | 235.31l | $0.1980 | 7.60 GiO | 512 x 512, 25 fps |
Calculer les estimations utilisation Prix catalogue du 23 août 2026 de Modal Pour la demande GPU, CPU, et mémoire pendant la fonction de génération mesurée. Ils excluent le stockage, le transfert Internet et le téléchargement ponctuel du poids.
La colonne mensuelle est une estimation de la capacité GPU uniquement pour un fonctionnement continu sur un mois de 30 jours. Il utilise le moins cher Modal GPU classe nous prévoyons d’exécuter la configuration mesurée sans reconcevoir le pipeline : H100 pour les modèles lourds, L40S pour EchoMimic et L4 pour FlashHead Lite. CPU, la mémoire, les volumes et les frais de réseau sont en sus. Modal évolue à zéro, de sorte que le minimum mensuel réel est de 0 USD et qu’un déploiement basé sur l’utilisation peut coûter beaucoup moins cher que l’estimation permanente.
Ce sont des mesures de déploiement, pas un benchmark de qualité de modèle parfaitement contrôlé. Les pipelines officiels produisent différentes résolutions et utilisent différents nombres d’étapes. Cela fait partie du résultat : il montre ce que le chemin exécutable recommandé de chaque projet fournit.
Les vidéos générées
Réseau étendu 2.2-S2V-14B
Wan a gardé l’identité et l’arrière-plan stables, avec des mouvements faciaux restreints. C’était aussi la course réussie la plus lente à 13 minutes pour une sortie de 3,8 secondes.
Le Wan est l’option cinématographique la plus lourde. Nous avons exécuté le chemin officiel de la parole à la vidéo en 40 étapes sur un H200. Il produisait un portrait net et stable, mais le mouvement était conservateur et la sortie à 16 ips était moins fluide que les modèles à 25 ips. Le pic VRAM a atteint 58 681 Mio, et le coût de calcul estimé était plus de quatre fois celui de LiveAvatar.
La configuration officielle a également nécessité plusieurs correctifs de dépendances avant que l’inférence ne démarre, y compris les packages utilisés par ses lecteurs audio et vidéo. Aucune de ces tentatives infructueuses n’a atteint le débruitage, elles ne sont donc pas incluses dans le synchronisation ci-dessus.
Chat long-Vidéo-Avatar 1.5
LongCat a créé la performance de la tête et du corps la plus visible, y compris un geste de la main non présent dans l’image de référence.
LongCat est resté le résultat image-vidéo le plus expressif. Son chemin 8-step INT8 gardait l’avatar reconnaissable tout en ajoutant des mouvements de la tête, du visage et du haut du corps. Quelques cadres de bouche semblaient légèrement exagérés, mais l’image fixe ressemblait davantage à une performance complète que les modèles plus conservateurs.
L’exemple officiel utilise deux GPU. Nous l’avons exécuté sur un H200 en définissant le parallélisme de contexte sur un. Il a culminé à 46 827 MiO, ce qui est trop proche pour le confort d’une carte typique de 48 GB une fois que la surcharge du framework est incluse.
LiveAvatar
LiveAvatar a produit le résultat le plus net en poids lourd et le travail H200 réussi le plus rapide.
LiveAvatar nous a donné la meilleure combinaison d’identité nette, de formes de bouche convaincantes, de clignements d’yeux et d’expression sobre parmi les grands modèles. Son pipeline en quatre étapes FP8 s’est terminé en 181.44 secondes, plus rapidement que LongCat, FlashTalk et Wan.
Cette vitesse n’en fait pas un petit modèle. Il a culminé à 61 401 Mio et dépendait du déchargement du modèle pour le décodage final VAE. Le runner single-GPU en amont suppose également des variables d’environnement de processus distribué, et son chemin unique documenté fonctionne mieux avec la compilation désactivée. Après avoir fait correspondre ces paramètres officiels, la course s’est terminée de manière fiable.
SoulX-FlashTalk 14B
FlashTalk était visuellement fort et est conçu pour une génération fragmentée et continue, mais son 14B démarrage à froid était coûteux.
FlashTalk a produit un visage stable avec un mouvement de la bouche clair. Le premier bloc généré a pris 119.58 secondes car TorchInductor a compilé son graphe. Les morceaux suivants ont pris environ 3.75 secondes chacun. Cela rend le travail froid de 331.93-second pire qu’un déploiement de streaming chauffé.
Le compromis est l’infrastructure. Le pic VRAM était de 57 805 Mio, et le cache persistant était le plus important de ce test à 51,07 GiO. Il appartient à une classe de 80 GB GPU à moins que le déploiement n’ajoute un déchargement ou une quantification plus agressif.
EchoMimicV3-Flash
EchoMimic a offert le meilleur équilibre pratique : une identité nette et un mouvement des lèvres sur un L40S moins cher.
EchoMimicV3-Flash était le candidat de déploiement le plus convaincant. Son pipeline 1.3 B, 8-step produisait une vidéo fps propre 25, préservait bien le visage et fonctionnait sur un L40S au lieu d’un H 200. Les mouvements de la bouche et du corps étaient plus subtils que ceux de LongCat, mais il y avait moins de changements gênants en plein cadre.
Notre configuration officielle de 768 zones a culminé à 33 726 MiO. Le projet annonce des modes à faible mémoire, il s’agit donc d’une utilisation observée pour nos paramètres plutôt que d’une affirmation sur le minimum théorique. Son cache de 22,28 GiO était inférieur à la moitié de la taille des modèles 14B.
SoulX-FlashHead 1.3 B Lite
La tête éclair était considérablement plus petite, mais le recadrage serré, l’identité plus douce et le mouvement de la bouche plus faible en faisaient le résultat le moins convaincant.
FlashHead Lite a culminé à seulement 5 763 Mio, un ordre de grandeur en dessous des gros générateurs. Comme FlashTalk, son synchronisation froid a été dominé par la compilation de première exécution. Le premier morceau a pris 155.7 secondes, tandis que les morceaux suivants ont pris environ 0.19 secondes chacun.
C’est intéressant pour un service de streaming toujours chaleureux et suggère qu’il pourrait fonctionner sur du matériel beaucoup moins cher que les L40S utilisés ici. Pour un clip de page de destination soigné, cependant, nous choisirions le résultat visuel plus fort d’EchoMimic.
Pourquoi LTX-2.3 DubIt n’a pas de vidéo ici
LTX-2.3 Doute Est différent des modèles audio ci-dessus. Il prend une vidéo de référence vocale et un texte cible, puis génère un discours et un mouvement des lèvres correspondants tout en essayant de conserver l’identité vocale du locuteur.
Son code est public, mais l’officiel Lightricks/LTX-2.3-22b-IC-LoRA-DubIt Checkpoint a renvoyé une erreur d’autorisation d’Hugging Face. Nous n’avions aucun jeton approuvé dans l’environnement de test, donc le travail s’est arrêté pendant la préparation du poids uniquement CPU avant qu’aucun GPU ne soit alloué.
Nous n’avons pas substitué un miroir tiers qui contournait la porte d’accès officielle. La reproductibilité et l’accès font partie de l’évaluation d’une version open source. Une fois l’accès officiel approuvé, le coureur préparé Modal peut exécuter le même test avec la vidéo de référence publique et la phrase cible.
Chaque modèle préserve-t-il ou sélectionne-t-il une voix ?
La plupart des modèles d’avatar ne sélectionnent ni ne clonent une voix. Ils animent un fichier audio fourni, puis placent ce même son dans la vidéo finale. La création vocale est une étape distincte de synthèse vocale ou de clonage vocal.
| Modèle | Sélecteur vocal intégré | Utilise la parole fournie | Apprend d’une voix de référence | Ce que nous avons observé |
|---|---|---|---|---|
| Réseau étendu 2.2-S2V-14B | Non | Oui | Non | Audio d’entrée préservé, corrélation 0.999897 |
| LTX-2.3 Doute | Pas de menu vocal | Non, il faut du texte cible | Oui, à partir de la vidéo de référence vocale | Ne pas courir parce que les poids étaient fermés |
| Chat long-Vidéo-Avatar 1.5 | Non | Oui | Non | Audio d’entrée préservé, corrélation 0.999562 |
| LiveAvatar | Non | Oui | Non | Audio d’entrée préservé, corrélation 0.999897 |
| SoulX-FlashTalk | Non | Oui | Non | Audio d’entrée préservé, corrélation 0.999751 |
| EchoMimicV3-Flash | Non | Oui | Non | Audio d’entrée préservé, corrélation 0.999198 |
| SoulX-FlashHead | Non | Oui | Non | Audio d’entrée préservé, corrélation 0.999751 |
Les petites différences proviennent du rééchantillonnage et de l’encodage AAC, pas d’un haut-parleur synthétisé différent. En d’autres termes, les six modèles réussis peuvent utiliser un enregistrement réel, un clone consenti fait ailleurs, ou n’importe quelle voix TTS. Ils ne changent pas l’identité vocale eux-mêmes.
DubIt est l’exception. Son but est de créer un nouveau discours en langue cible ou en script cible ressemblant à la voix de la vidéo de référence. Cela le rend utile pour le doublage, mais son audio de sortie ne sera pas une copie de forme d’onde de l’original.
Paramètres à régler
Les valeurs par défaut ne sont pas nécessairement les meilleurs paramètres pour chaque visage ou déploiement. Ce sont les contrôles à impact le plus élevé à tester avant de modifier le code du modèle :
| Modèle | Paramètres qui comptent le plus | Compromis probable |
|---|---|---|
| Réseau étendu 2.2-S2V-14B | Étapes de débruitage, échelle de guidage, zone de sortie, graine, vidéo de pose en option | Plus de pas et de pixels augmentent fortement la latence ; le contrôle de la pose peut améliorer les mouvements du corps |
| LTX-2.3 Doute | Invite, texte cible, référence-longueur de la vidéo, force LoRa, graine | Un conditionnement plus fort peut améliorer l’identité mais réduire les variations naturelles |
| Chat long-Vidéo-Avatar 1.5 | 8-étape distillée vs chemin complet, quantification, guidage, amorçage, parallélisme de contexte | Une précision totale ou plusieurs étapes peuvent améliorer les détails mais nécessitent plus de mémoire et de temps |
| LiveAvatar | Exemples d’étapes, zone de sortie, FP8, déchargement du modèle, compilation | La compilation facilite les tâches répétées ; le déchargement économise de la mémoire mais ajoute des transferts |
| SoulX-FlashTalk | Taille des morceaux, chevauchement, compilation, guidage audio, graine | Des morceaux plus volumineux peuvent améliorer la continuité mais augmenter la latence et la mémoire |
| EchoMimicV3-Flash | Étapes d’inférence, échelle de guidage, guidage audio, taille de l’échantillon, graine | Un guidage audio plus élevé peut renforcer le mouvement de la bouche mais peut l’exagérer |
| SoulX-FlashHead | Lite vs point de contrôle complet, recadrage, longueur de morceau, compilation | Le modèle complet devrait améliorer la qualité à un coût de mémoire plus élevé ; le recadrage affecte fortement la composition |
Pour un test de produit équitable, réglez une variable à la fois sur le même portrait et la même narration. La première passe la plus utile serait un guidage audio pour EchoMimic, des étapes d’échantillonnage pour LiveAvatar, une qualité de recadrage et de point de contrôle complet pour FlashHead, et une deuxième demande réchauffée pour les deux modèles SoulX.
À quoi ressemble vraiment le matériel
Les six générateurs à succès se répartissent en trois groupes d’infrastructures pratiques :
- Moins de 16 ans GB : SoulX-FlashHead Lite est le seul générateur complet testé qui s’adapte clairement. Son pic de 5,8 GB laisse de la place pour une carte 12 GB ou 16 GB, bien que la latence et la prise en charge de la structure nécessitent encore une validation sur le matériel grand public.
- 48 GB classe : EchoMimicV3-Flash a fonctionné confortablement sur un L40S à 33.7 GB. Chat long 46.8 GB l’allocation est trop proche de la limite pour un confort 48 GB déploiement.
- 80 GB classe : Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk et LongCat sont les plus sûrs sur les GPU de classe H100 ou H200 avec 80 GB ou plus.
Le stockage persistant est également important. La tête éclair et l’échomimétique utilisent environ 7,6 et 22,3 GiO, respectivement. Les grands modèles ont besoin d’environ 45 à 51 GiO chacun. Héberger chaque cache de cet article à la fois consommerait bien plus de 200 GiO avant les images de conteneur, les sorties et les fichiers temporaires.
Modal convient bien aux expériences car les conteneurs peuvent évoluer jusqu’à zéro tandis que les caches de modèles restent sur des volumes persistants. Après ce test, chaque application Modal n’a signalé aucune tâche en cours d’exécution et aucune GPU n’est restée active.
Ce que nous utiliserions aujourd'hui
Il n’y a pas de gagnant unique pour chaque flux de travail avatar :
- Utilisez LiveAvatar Lorsque la qualité de l’image à la vidéo est la plus importante et qu’un 80 GB GPU est disponible. Il a produit notre résultat le plus net sur grand modèle et a eu le travail à froid H200 le plus rapide.
- Utiliser EchoMimicV3-Flash Pour le meilleur équilibre pratique entre la qualité et l’infrastructure. Il fonctionnait sur un L40S moins cher, utilisait un cache beaucoup plus petit et produisait un résultat propre.
- Utiliser LongCat-Vidéo-Avatar 1.5 Lorsque le mouvement corporel expressif importe plus que la préservation de l’identité conservatrice.
- Utilisez SoulX-FlashHead Légère Lorsque la vitesse de streaming basse VRAM et chaude importe plus que le vernis.
Le résultat le plus surprenant n’était pas que le plus gros modèle était le plus beau. C’était à quel point EchoMimic était proche tout en utilisant un GPU moins cher et moins de la moitié du stockage du modèle. La génération d’avatars open source est désormais pratique, mais la stratégie de service compte toujours autant que le point de contrôle.
