TL;DR - Siete modelos de avatar de código abierto se reunieron con nuestro corte: un lanzamiento público entre el 23 de agosto de 2025 y el 23 de agosto de 2026, más al menos 1.000 estrellas GitHub. Ejecutamos cada uno. Seis videos producidos de la misma narración pública de avatar y masculino. LTX-2.3 DubNo pudo comenzar porque su punto de control oficial requiere la aprobación de Hugging Face. LiveAvatar hizo el resultado más nítido de peso pesado, EchoMimicV3-Flash ofreció el mejor equilibrio en un 48 GB GPU, y SoulX-FlashHead fue por lejos el más ligero en 5,8 GB del pico VRAM.
La pregunta que queríamos responder
Las versiones de código abierto de parlante-avatar ahora llegan más rápido de lo que la mayoría de los posts de comparación pueden rastrearlos. Reclamos como “tiempo real”, “longitud infinita” y “conservar identidad” son difíciles de comparar porque los proyectos utilizan diferentes entradas, resoluciones, GPUs y definiciones de tiempo de inferencia.
Queríamos una respuesta más estrecha y reproducible: ¿qué modelos recientes con una adopción comunitaria significativa pueden convertir el mismo retrato y narración en un video de conversación convincente, y qué es lo que cada uno realmente requiere para ejecutar?
Para esta ronda, un modelo sólo califica si cumple ambas reglas:
- Su primer código oficial y pesas utilizables fueron lanzados desde el 23 de agosto de 2025 hasta el 23 de agosto de 2026.
- Su repositorio oficial GitHub tuvo más de 1.000 estrellas el 23 de agosto de 2026.
Las estrellas de repositorio son una medida de atención, no de calidad.Para Wan2.2 y LTX-2.3, el conteo de estrellas pertenece al proyecto padre porque la capacidad de avatar se envía dentro de ese repositorio.
Los siete modelos que califican
| Modelo | Estrellas GitHub | Publicación | Aportaciones oficiales | Resultado del ensayo |
|---|---|---|---|---|
| Wan2.2-S2V-14B | 17,261 | 26 de agosto de 2025 | Imagen + audio, pose opcional de video | Terminado |
| LTX-2,3 DubIt | 9,226 | 11 de mayo de 2026 | video de referencia + texto de destino | Bloqueado por un puesto de control cerrado |
| LongCat-Video-Avatar 1.5 | 7,515 | 21 de mayo de 2026 | Imagen + audio | Terminado |
| LiveAvatar | 2,384 | 8 de diciembre de 2025 | Imagen + audio | Terminado |
| SoulX-FlashTalk | 1,476 | 8 de enero de 2026 | Imagen + audio | Terminado |
| EchoMimicV3-Flash | 1,025 | 22 de enero de 2026 | Imagen + audio | Terminado |
| SoulX-FlashHead | 1,006 | 12 de febrero de 2026 | Imagen + audio | Terminado |
Los proyectos lanzados antes del corte fueron excluidos independientemente de su conteo de estrellas.
Mismo avatar público, misma voz masculina
Cada carrera exitosa usó este marco de un silencioso, video de Pexels generado por AI por AI25.Studio, bajo el Licencia de Pexels. El creador de la fuente no apoya esta comparación.
![]()
La narración de 3,63 segundos usó Daniel, una voz masculina neutral incluida con macOS:
Los modelos de avatar de código abierto ahora pueden generar videos convincentes a partir de una imagen.
Implementamos versiones fijas de los repositorios oficiales y pesas en ModalEl tiempo medido comienza cuando el contenedor de generación comienza y termina cuando se devuelve el MP4 final. Los pesos del modelo ya se almacenaron en un volumen Modal persistente, por lo que se excluye el tiempo inicial de descarga en Internet, pero se incluyen la carga del modelo, el preprocesamiento, la generación, la decodificación y el muxing.
Resultados de un vistazo
| Modelo | Se ha probado GPU | Mín. siempre en GPU/mo | Pico VRAM | Hora | Cálculo de la cantidad | Caché de modelos | Producto |
|---|---|---|---|---|---|---|---|
| Wan2.2-S2V-14B | H200 | 2.843 dólares (H100) | 58.681 MiB | 780.29s | $1.3692 | 45.76 GiB | 512 x 896, 16 fps |
| LTX-2,3 DubIt | Ninguno | Desconocido | Ninguno | Bloqueado antes de GPU | $0 GPU | Punto de control cerrado | Sin salida |
| LongCat-Video-Avatar 1.5 | H200 | 2.843 dólares (H100) | 46.827 MiB | 233,08s | $0.4011 | 44.82 GB | 480 x 832, 25 fps |
| LiveAvatar | H200 | 2.843 dólares (H100) | 61.401 MiB | 181.44s | $0.3184 | 47.03 GiB | 384 x 704, 25 fps |
| SoulX-FlashTalk | H200 | 2.843 dólares (H100) | 57.805 MiB | 331,93s | $0.5825 | 51.07 GiB | 416 x 720, 25 fps |
| EchoMimicV3-Flash | L40S | 1.405 dólares (L40S) | 33.726 MiB | 251,94s | $0.2120 | 22.28 GiB | 480 x 848, 25 fps |
| SoulX-FlashHead Lite | L40S | 575 dólares (L4) | 5.763 MiB | 235,31s | $0.1980 | 7.60 GiB | 512 x 512, 25 fps |
Cálculo de la utilización de estimaciones Modal’s 23 de agosto de 2026 precios listados para la GPU solicitada, CPU y la memoria durante la función de generación medida. No incluyen almacenamiento, transferencia de Internet y la descarga de peso única.
La columna mensual es una estimación de capacidad de GPU solo para operación continua durante un mes de 30 días. Utiliza la clase Modal GPU menos costosa que esperamos ejecutar la configuración medida sin rediseñar el gasoducto: H100 para los modelos pesados, L40S para EchoMimic y L4 para FlashHead Lite. CPU, memoria, volúmenes y cargas de red son extras. Escalas de modalidad a cero, por lo que el mínimo mensual real es $0 y una implementación basada en el uso puede costar mucho menos que la estimación siempre en marcha.
Estas son mediciones de despliegue, no un modelo de referencia de calidad perfectamente controlado. Los oleoductos oficiales producen diferentes resoluciones y utilizan diferentes números de pasos. Esto es parte del resultado: muestra lo que ofrece la ruta de funcionamiento recomendada de cada proyecto.
Los videos generados
Wan2.2-S2V-14B
Wan mantuvo la identidad y el fondo estables, con movimiento facial restringido. También fue el más lento de éxito a 13 minutos para una salida de 3,8 segundos.
Wan es la opción cinemática de peso pesado. Ejecutamos el discurso oficial de 40 pasos a video en un H200. Produjo un retrato limpio y estable, pero el movimiento era conservador y la salida de 16 fps era menos fluida que los modelos de 25 fps. Peak VRAM alcanzó 58.681 MiB, y el costo estimado de cálculo fue más de cuatro veces el de LiveAvatar.
La configuración oficial también requirió varias correcciones de dependencia antes de que comenzara la inferencia, incluyendo paquetes usados por sus lectores de audio y video. Ninguno de esos intentos fallidos llegó a denoizar, por lo que no están incluidos en el cronometraje anterior.
LongCat-Video-Avatar 1.5
LongCat creó la actuación más visible de la cabeza y el cuerpo, incluyendo un gesto de mano no presente en la imagen de referencia.
LongCat siguió siendo el resultado de imagen a video más expresivo. Su ruta INT8 de 8 pasos mantuvo el avatar reconocible mientras agregaba movimiento de cabeza, cara y parte superior del cuerpo. Unos cuantos marcos de boca parecían ligeramente exagerados, pero hacían que la imagen fija se sintiera más como un rendimiento completo que los modelos más conservadores.
El ejemplo oficial utiliza dos GPU. Lo ejecutamos en un H200 estableciendo paralelismo de contexto a uno. Llegó a 46.827 MiB, que es demasiado cerca para la comodidad en una tarjeta típica 48 GB una vez que se incluye el marco de cabeza.
LiveAvatar
LiveAvatar produjo el resultado más nítido y el trabajo H200 más rápido.
LiveAvatar nos dio la mejor combinación de identidad aguda, formas de boca convincentes, parpadeo y expresión restringida entre los grandes modelos. Su tubería FP8 de cuatro pasos terminó en 181,44 segundos, más rápido que LongCat, FlashTalk y Wan.
Esa velocidad no lo convierte en un modelo pequeño. Ha alcanzado un máximo de 61.401 MiB y depende de la descarga de modelos para el decodificador final VAE. El corredor de un solo GPU asume también variables de entorno de proceso distribuido, y su ruta única documentada funciona mejor con la compilación deshabilitada.
SoulX-FlashTalk 14B
FlashTalk era visualmente fuerte y está diseñado para la generación continua y troceada, pero su arranque frío 14B era caro.
FlashTalk produjo una cara estable con movimiento de boca claro. El primer trozo generado tomó 119.58 segundos porque TorchInductor compiló su gráfico. Los trozos posteriores tomaron aproximadamente 3.75 segundos cada uno. Eso hace que el trabajo en frío de 331,93 segundos parezca peor de lo que sentiría un despliegue de streaming caliente.
El punto de compensación es la infraestructura. El pico VRAM era de 57.805 MiB, y el caché persistente era el más grande en esta prueba en 51.07 GiB. Pertenece a un GB clase 80 GPU a menos que el despliegue agrega descarga más agresiva o cuantificación.
EchoMimicV3-Flash
EchoMimic ha conseguido el mejor equilibrio práctico: identidad limpia y movimiento de labios en un L40S más barato.
El candidato de despliegue más atractivo fue EchoMimicV3-Flash. Su tubería de 1.3B, de 8 pasos, produjo un video limpio de 25 fps, preservó bien la cara y corrió en un L40S en lugar de un H200. El movimiento de boca y cuerpo eran más sutiles que el de LongCat, pero hubo menos cambios de marco completo que distraen.
Nuestra configuración oficial de 768 áreas alcanzó un máximo de 33.726 MiB. El proyecto anuncia modos de memoria inferior, por lo que se observa el uso para nuestra configuración en lugar de una reclamación sobre el mínimo teórico. Su caché de 22,28 GiB era menos de la mitad del tamaño de los modelos 14B.
SoulX-FlashHead 1.3B Lite
FlashHead era dramáticamente más pequeño, pero la cosecha cercana, la identidad más suave y el movimiento de boca más débil lo hicieron el resultado menos convincente.
FlashHead Lite alcanzó un máximo de 5,763 MiB, un orden de magnitud por debajo de los grandes generadores. Como FlashTalk, su tiempo de frío estaba dominado por la compilación de primera carrera. El primer trozo tomó 155,7 segundos, mientras que los trozos posteriores tomaron aproximadamente 0,19 segundos cada uno.
Esto es interesante para un servicio de streaming siempre cálido y sugiere que podría funcionar con hardware mucho más barato que el L40S utilizado aquí. Para un clip de página de aterrizaje pulido, sin embargo, elegiríamos el resultado visual más fuerte de EchoMimic.
¿Por qué LTX-2.3 DubNo tiene ningún video aquí
LTX-2,3 DubIt es diferente de los modelos de audio impulsados por arriba. Se necesita un video de referencia y texto de destino, a continuación, genera el discurso y el movimiento de labios coincidentes mientras se intenta mantener la identidad vocal del altavoz.
Su código es público, pero el oficial Lightricks/LTX-2.3-22b-IC-LoRA-DubIt control devolvió un error de autorización de Hugging Face. No teníamos token aprobado en el entorno de prueba, por lo que el trabajo se detuvo durante la preparación de peso CPU sólo antes de que se asignara cualquier GPU.
No sustituimos un espejo de terceros que sorteó la puerta de acceso oficial. La reproducibilidad y el acceso son parte de la evaluación de una versión de código abierto. Una vez aprobado el acceso oficial, el corredor Modal preparado puede ejecutar la misma prueba con el video de referencia público y la frase de destino.
¿Cada modelo conserva o selecciona una voz?
La mayoría de los modelos de avatar no seleccionan ni clonan una voz. Animan un archivo de audio suministrado, luego colocan ese mismo audio en el video final. La creación de voz es un paso separado de texto a voz o de cierre de voz.
| Modelo | Selector de voz incorporado | Usos que se proporcionan | Aprende de una voz de referencia | Lo que observamos |
|---|---|---|---|---|
| Wan2.2-S2V-14B | No | Sí | No | Audio de entrada preservado, correlación 0.999897 |
| LTX-2,3 DubIt | Sin menú de voz | No, se necesita texto objetivo | Sí, del video de referencia de voz | No correr porque los pesos estaban cerrados |
| LongCat-Video-Avatar 1.5 | No | Sí | No | Audio de entrada preservado, correlación 0,999562 |
| LiveAvatar | No | Sí | No | Audio de entrada preservado, correlación 0.999897 |
| SoulX-FlashTalk | No | Sí | No | Audio de entrada preservado, correlación 0,999751 |
| EchoMimicV3-Flash | No | Sí | No | Audio de entrada preservado, correlación 0,999198 |
| SoulX-FlashHead | No | Sí | No | Audio de entrada preservado, correlación 0,999751 |
Las pequeñas diferencias son de la codificación de AAC y de la remuestreo, no de un altavoz sintetizado diferente. En otras palabras, los seis modelos exitosos pueden utilizar una grabación real, un clon consentido hecho en otro lugar, o cualquier voz TTS. No cambian la identidad vocal en sí mismos.
DubIt es la excepción. Su propósito es crear un nuevo lenguaje de destino o un nuevo lenguaje de destino similar a la voz en el video de referencia. Eso lo hace útil para el doblaje, pero su audio de salida no será una copia de forma de onda del original.
Parámetros que merecen ajuste
Los valores predeterminados no son necesariamente la mejor configuración para cada cara o despliegue. Estos son los controles de mayor impacto a probar antes de cambiar el código del modelo:
| Modelo | Parámetros que más importan | Probable compensación |
|---|---|---|
| Wan2.2-S2V-14B | Pasos de denegación, escala de guía, área de salida, semilla, pose opcional video | Más pasos y píxeles aumentan la latencia bruscamente; el control de poses puede mejorar el movimiento corporal |
| LTX-2,3 DubIt | Pronta, texto de destino, longitud de video de referencia, fuerza LoRA, semilla | El condicionamiento más fuerte puede mejorar la identidad pero reducir la variación natural |
| LongCat-Video-Avatar 1.5 | 8 pasos destilados frente a camino completo, cuantificación, guía, semilla, paralelismo de contexto | La precisión total o más pasos pueden mejorar el detalle pero necesitan más memoria y tiempo |
| LiveAvatar | Pasos de muestra, área de salida, FP8, descarga de modelo, compilación | Compilación ayuda a trabajos repetidos; descarga ahorra memoria pero añade transferencias |
| SoulX-FlashTalk | Tamaño de la trompa, superposición, compilación, audio guía, semilla | Los trozos más grandes pueden mejorar la continuidad pero elevar la latencia y la memoria |
| EchoMimicV3-Flash | Pasos de inferencia, escala de guía, audio guía, tamaño de la muestra, semillas | Una mayor guía de audio puede fortalecer el movimiento de la boca, pero puede exagerarlo |
| SoulX-FlashHead | Lite vs completo control, cosecha, longitud de trozo, compilación | El modelo completo debe mejorar la calidad a un costo de memoria más alto; el cultivo afecta fuertemente la composición |
Para una prueba de producto justa, afinar una variable a la vez contra el mismo retrato y narración. La primera pasada más útil sería la guía de audio para EchoMimic, pasos de muestra para LiveAvatar, calidad de cultivo y punto de control completo para FlashHead, y una segunda solicitud calentada para ambos modelos SoulX.
¿Cómo es el hardware?
Los seis generadores exitosos se dividen en tres grupos prácticos de infraestructura:
- Menos de 16 GB: SoulX-FlashHead Lite es el único generador completo probado que se ajusta claramente. Su pico de 5.8 GB deja espacio para una tarjeta de 12 GB o 16 GB, aunque latencia y soporte de marco todavía necesitan validación en hardware del consumidor.
- 48 Clase GB: EchoMimicV3-Flash funcionó cómodamente en un L40S a 33.7 GB. La asignación de LongCat 46.8 GB está demasiado cerca del límite para un cómodo despliegue de 48 GB.
- 80 Clase GB: Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk y LongCat son las GPU de clase H100 o H200 más seguras con 80 GB o más.
El almacenamiento persistente también importa. FlashHead y EchoMimic usan aproximadamente 7,6 y 22.3 GiB, respectivamente. Los modelos grandes necesitan aproximadamente 45 a 51 GiB cada uno. Alojar cada caché en este artículo a la vez consumiría más de 200 GiB antes de las imágenes, salidas y archivos temporales del contenedor.
Modal es un buen ajuste para experimentos porque los contenedores pueden escalar a cero mientras que las cachés de modelos permanecen en volúmenes persistentes. Después de esta prueba, cada aplicación Modal reportó cero tareas en ejecución y no GPU permaneció activo.
Lo que usaríamos hoy
No hay un solo ganador para cada flujo de trabajo de avatar:
- Usar LiveAvatar Cuando la calidad de imagen a video de peso pesado importa más y un GB 80 GPU está disponible. Produjo nuestro resultado más nítido de gran modelo y tuvo el trabajo frío H200 más rápido.
- Usar EchoMimicV3-flash para el mejor equilibrio práctico calidad-a-infraestructura. Funcionó en un L40S más barato, utilizó un caché mucho más pequeño, y produjo un resultado limpio.
- Usar LongCat-Video-Avatar 1.5 cuando el movimiento expresivo del cuerpo importa más que la preservación conservadora de la identidad.
- usar soulx-flashhead lite cuando VRAM baja y la velocidad de transmisión caliente materia más que el pulido.
El resultado más sorprendente no fue que el modelo más grande se veía mejor. Era cómo EchoMimic cerca vino mientras que el uso de un GPU más barato y menos de la mitad del almacenamiento del modelo. generación de avatar de código abierto es ahora práctico, pero la estrategia de servicio sigue siendo tanto como el punto de control.
