Ir al artículo
← volver a la ingeniería

Probamos cada modelo de avatar de código abierto popular lanzado en el año pasado (agosto 2026)

Ilustración de la portada para Hemos probado todos los modelos de avatar de código abierto populares lanzados en el año pasado (agosto 2026)

TL;DR - Siete modelos de avatar de código abierto se reunieron con nuestro corte: un lanzamiento público entre el 23 de agosto de 2025 y el 23 de agosto de 2026, más al menos 1.000 estrellas GitHub. Ejecutamos cada uno. Seis videos producidos de la misma narración pública de avatar y masculino. LTX-2.3 DubNo pudo comenzar porque su punto de control oficial requiere la aprobación de Hugging Face. LiveAvatar hizo el resultado más nítido de peso pesado, EchoMimicV3-Flash ofreció el mejor equilibrio en un 48 GB GPU, y SoulX-FlashHead fue por lejos el más ligero en 5,8 GB del pico VRAM.


La pregunta que queríamos responder

Las versiones de código abierto de parlante-avatar ahora llegan más rápido de lo que la mayoría de los posts de comparación pueden rastrearlos. Reclamos como “tiempo real”, “longitud infinita” y “conservar identidad” son difíciles de comparar porque los proyectos utilizan diferentes entradas, resoluciones, GPUs y definiciones de tiempo de inferencia.

Queríamos una respuesta más estrecha y reproducible: ¿qué modelos recientes con una adopción comunitaria significativa pueden convertir el mismo retrato y narración en un video de conversación convincente, y qué es lo que cada uno realmente requiere para ejecutar?

Para esta ronda, un modelo sólo califica si cumple ambas reglas:

  • Su primer código oficial y pesas utilizables fueron lanzados desde el 23 de agosto de 2025 hasta el 23 de agosto de 2026.
  • Su repositorio oficial GitHub tuvo más de 1.000 estrellas el 23 de agosto de 2026.

Las estrellas de repositorio son una medida de atención, no de calidad.Para Wan2.2 y LTX-2.3, el conteo de estrellas pertenece al proyecto padre porque la capacidad de avatar se envía dentro de ese repositorio.

Los siete modelos que califican

ModeloEstrellas GitHubPublicaciónAportaciones oficialesResultado del ensayo
Wan2.2-S2V-14B17,26126 de agosto de 2025Imagen + audio, pose opcional de videoTerminado
LTX-2,3 DubIt9,22611 de mayo de 2026video de referencia + texto de destinoBloqueado por un puesto de control cerrado
LongCat-Video-Avatar 1.57,51521 de mayo de 2026Imagen + audioTerminado
LiveAvatar2,3848 de diciembre de 2025Imagen + audioTerminado
SoulX-FlashTalk1,4768 de enero de 2026Imagen + audioTerminado
EchoMimicV3-Flash1,02522 de enero de 2026Imagen + audioTerminado
SoulX-FlashHead1,00612 de febrero de 2026Imagen + audioTerminado

Los proyectos lanzados antes del corte fueron excluidos independientemente de su conteo de estrellas.

Mismo avatar público, misma voz masculina

Cada carrera exitosa usó este marco de un silencioso, video de Pexels generado por AI por AI25.Studio, bajo el Licencia de Pexels. El creador de la fuente no apoya esta comparación.

El marco de referencia público suministrado a los modelos de avatar

La narración de 3,63 segundos usó Daniel, una voz masculina neutral incluida con macOS:

Los modelos de avatar de código abierto ahora pueden generar videos convincentes a partir de una imagen.

Implementamos versiones fijas de los repositorios oficiales y pesas en ModalEl tiempo medido comienza cuando el contenedor de generación comienza y termina cuando se devuelve el MP4 final. Los pesos del modelo ya se almacenaron en un volumen Modal persistente, por lo que se excluye el tiempo inicial de descarga en Internet, pero se incluyen la carga del modelo, el preprocesamiento, la generación, la decodificación y el muxing.

Resultados de un vistazo

ModeloSe ha probado GPUMín. siempre en GPU/moPico VRAMHoraCálculo de la cantidadCaché de modelosProducto
Wan2.2-S2V-14BH2002.843 dólares (H100)58.681 MiB780.29s$1.369245.76 GiB512 x 896, 16 fps
LTX-2,3 DubItNingunoDesconocidoNingunoBloqueado antes de GPU$0 GPUPunto de control cerradoSin salida
LongCat-Video-Avatar 1.5H2002.843 dólares (H100)46.827 MiB233,08s$0.401144.82 GB480 x 832, 25 fps
LiveAvatarH2002.843 dólares (H100)61.401 MiB181.44s$0.318447.03 GiB384 x 704, 25 fps
SoulX-FlashTalkH2002.843 dólares (H100)57.805 MiB331,93s$0.582551.07 GiB416 x 720, 25 fps
EchoMimicV3-FlashL40S1.405 dólares (L40S)33.726 MiB251,94s$0.212022.28 GiB480 x 848, 25 fps
SoulX-FlashHead LiteL40S575 dólares (L4)5.763 MiB235,31s$0.19807.60 GiB512 x 512, 25 fps

Cálculo de la utilización de estimaciones Modal’s 23 de agosto de 2026 precios listados para la GPU solicitada, CPU y la memoria durante la función de generación medida. No incluyen almacenamiento, transferencia de Internet y la descarga de peso única.

La columna mensual es una estimación de capacidad de GPU solo para operación continua durante un mes de 30 días. Utiliza la clase Modal GPU menos costosa que esperamos ejecutar la configuración medida sin rediseñar el gasoducto: H100 para los modelos pesados, L40S para EchoMimic y L4 para FlashHead Lite. CPU, memoria, volúmenes y cargas de red son extras. Escalas de modalidad a cero, por lo que el mínimo mensual real es $0 y una implementación basada en el uso puede costar mucho menos que la estimación siempre en marcha.

Estas son mediciones de despliegue, no un modelo de referencia de calidad perfectamente controlado. Los oleoductos oficiales producen diferentes resoluciones y utilizan diferentes números de pasos. Esto es parte del resultado: muestra lo que ofrece la ruta de funcionamiento recomendada de cada proyecto.

Los videos generados

Wan2.2-S2V-14B

Wan mantuvo la identidad y el fondo estables, con movimiento facial restringido. También fue el más lento de éxito a 13 minutos para una salida de 3,8 segundos.

Wan es la opción cinemática de peso pesado. Ejecutamos el discurso oficial de 40 pasos a video en un H200. Produjo un retrato limpio y estable, pero el movimiento era conservador y la salida de 16 fps era menos fluida que los modelos de 25 fps. Peak VRAM alcanzó 58.681 MiB, y el costo estimado de cálculo fue más de cuatro veces el de LiveAvatar.

La configuración oficial también requirió varias correcciones de dependencia antes de que comenzara la inferencia, incluyendo paquetes usados por sus lectores de audio y video. Ninguno de esos intentos fallidos llegó a denoizar, por lo que no están incluidos en el cronometraje anterior.

LongCat-Video-Avatar 1.5

LongCat creó la actuación más visible de la cabeza y el cuerpo, incluyendo un gesto de mano no presente en la imagen de referencia.

LongCat siguió siendo el resultado de imagen a video más expresivo. Su ruta INT8 de 8 pasos mantuvo el avatar reconocible mientras agregaba movimiento de cabeza, cara y parte superior del cuerpo. Unos cuantos marcos de boca parecían ligeramente exagerados, pero hacían que la imagen fija se sintiera más como un rendimiento completo que los modelos más conservadores.

El ejemplo oficial utiliza dos GPU. Lo ejecutamos en un H200 estableciendo paralelismo de contexto a uno. Llegó a 46.827 MiB, que es demasiado cerca para la comodidad en una tarjeta típica 48 GB una vez que se incluye el marco de cabeza.

LiveAvatar

LiveAvatar produjo el resultado más nítido y el trabajo H200 más rápido.

LiveAvatar nos dio la mejor combinación de identidad aguda, formas de boca convincentes, parpadeo y expresión restringida entre los grandes modelos. Su tubería FP8 de cuatro pasos terminó en 181,44 segundos, más rápido que LongCat, FlashTalk y Wan.

Esa velocidad no lo convierte en un modelo pequeño. Ha alcanzado un máximo de 61.401 MiB y depende de la descarga de modelos para el decodificador final VAE. El corredor de un solo GPU asume también variables de entorno de proceso distribuido, y su ruta única documentada funciona mejor con la compilación deshabilitada.

SoulX-FlashTalk 14B

FlashTalk era visualmente fuerte y está diseñado para la generación continua y troceada, pero su arranque frío 14B era caro.

FlashTalk produjo una cara estable con movimiento de boca claro. El primer trozo generado tomó 119.58 segundos porque TorchInductor compiló su gráfico. Los trozos posteriores tomaron aproximadamente 3.75 segundos cada uno. Eso hace que el trabajo en frío de 331,93 segundos parezca peor de lo que sentiría un despliegue de streaming caliente.

El punto de compensación es la infraestructura. El pico VRAM era de 57.805 MiB, y el caché persistente era el más grande en esta prueba en 51.07 GiB. Pertenece a un GB clase 80 GPU a menos que el despliegue agrega descarga más agresiva o cuantificación.

EchoMimicV3-Flash

EchoMimic ha conseguido el mejor equilibrio práctico: identidad limpia y movimiento de labios en un L40S más barato.

El candidato de despliegue más atractivo fue EchoMimicV3-Flash. Su tubería de 1.3B, de 8 pasos, produjo un video limpio de 25 fps, preservó bien la cara y corrió en un L40S en lugar de un H200. El movimiento de boca y cuerpo eran más sutiles que el de LongCat, pero hubo menos cambios de marco completo que distraen.

Nuestra configuración oficial de 768 áreas alcanzó un máximo de 33.726 MiB. El proyecto anuncia modos de memoria inferior, por lo que se observa el uso para nuestra configuración en lugar de una reclamación sobre el mínimo teórico. Su caché de 22,28 GiB era menos de la mitad del tamaño de los modelos 14B.

SoulX-FlashHead 1.3B Lite

FlashHead era dramáticamente más pequeño, pero la cosecha cercana, la identidad más suave y el movimiento de boca más débil lo hicieron el resultado menos convincente.

FlashHead Lite alcanzó un máximo de 5,763 MiB, un orden de magnitud por debajo de los grandes generadores. Como FlashTalk, su tiempo de frío estaba dominado por la compilación de primera carrera. El primer trozo tomó 155,7 segundos, mientras que los trozos posteriores tomaron aproximadamente 0,19 segundos cada uno.

Esto es interesante para un servicio de streaming siempre cálido y sugiere que podría funcionar con hardware mucho más barato que el L40S utilizado aquí. Para un clip de página de aterrizaje pulido, sin embargo, elegiríamos el resultado visual más fuerte de EchoMimic.

¿Por qué LTX-2.3 DubNo tiene ningún video aquí

LTX-2,3 DubIt es diferente de los modelos de audio impulsados por arriba. Se necesita un video de referencia y texto de destino, a continuación, genera el discurso y el movimiento de labios coincidentes mientras se intenta mantener la identidad vocal del altavoz.

Su código es público, pero el oficial Lightricks/LTX-2.3-22b-IC-LoRA-DubIt control devolvió un error de autorización de Hugging Face. No teníamos token aprobado en el entorno de prueba, por lo que el trabajo se detuvo durante la preparación de peso CPU sólo antes de que se asignara cualquier GPU.

No sustituimos un espejo de terceros que sorteó la puerta de acceso oficial. La reproducibilidad y el acceso son parte de la evaluación de una versión de código abierto. Una vez aprobado el acceso oficial, el corredor Modal preparado puede ejecutar la misma prueba con el video de referencia público y la frase de destino.

¿Cada modelo conserva o selecciona una voz?

La mayoría de los modelos de avatar no seleccionan ni clonan una voz. Animan un archivo de audio suministrado, luego colocan ese mismo audio en el video final. La creación de voz es un paso separado de texto a voz o de cierre de voz.

ModeloSelector de voz incorporadoUsos que se proporcionanAprende de una voz de referenciaLo que observamos
Wan2.2-S2V-14BNoNoAudio de entrada preservado, correlación 0.999897
LTX-2,3 DubItSin menú de vozNo, se necesita texto objetivoSí, del video de referencia de vozNo correr porque los pesos estaban cerrados
LongCat-Video-Avatar 1.5NoNoAudio de entrada preservado, correlación 0,999562
LiveAvatarNoNoAudio de entrada preservado, correlación 0.999897
SoulX-FlashTalkNoNoAudio de entrada preservado, correlación 0,999751
EchoMimicV3-FlashNoNoAudio de entrada preservado, correlación 0,999198
SoulX-FlashHeadNoNoAudio de entrada preservado, correlación 0,999751

Las pequeñas diferencias son de la codificación de AAC y de la remuestreo, no de un altavoz sintetizado diferente. En otras palabras, los seis modelos exitosos pueden utilizar una grabación real, un clon consentido hecho en otro lugar, o cualquier voz TTS. No cambian la identidad vocal en sí mismos.

DubIt es la excepción. Su propósito es crear un nuevo lenguaje de destino o un nuevo lenguaje de destino similar a la voz en el video de referencia. Eso lo hace útil para el doblaje, pero su audio de salida no será una copia de forma de onda del original.

Parámetros que merecen ajuste

Los valores predeterminados no son necesariamente la mejor configuración para cada cara o despliegue. Estos son los controles de mayor impacto a probar antes de cambiar el código del modelo:

ModeloParámetros que más importanProbable compensación
Wan2.2-S2V-14BPasos de denegación, escala de guía, área de salida, semilla, pose opcional videoMás pasos y píxeles aumentan la latencia bruscamente; el control de poses puede mejorar el movimiento corporal
LTX-2,3 DubItPronta, texto de destino, longitud de video de referencia, fuerza LoRA, semillaEl condicionamiento más fuerte puede mejorar la identidad pero reducir la variación natural
LongCat-Video-Avatar 1.58 pasos destilados frente a camino completo, cuantificación, guía, semilla, paralelismo de contextoLa precisión total o más pasos pueden mejorar el detalle pero necesitan más memoria y tiempo
LiveAvatarPasos de muestra, área de salida, FP8, descarga de modelo, compilaciónCompilación ayuda a trabajos repetidos; descarga ahorra memoria pero añade transferencias
SoulX-FlashTalkTamaño de la trompa, superposición, compilación, audio guía, semillaLos trozos más grandes pueden mejorar la continuidad pero elevar la latencia y la memoria
EchoMimicV3-FlashPasos de inferencia, escala de guía, audio guía, tamaño de la muestra, semillasUna mayor guía de audio puede fortalecer el movimiento de la boca, pero puede exagerarlo
SoulX-FlashHeadLite vs completo control, cosecha, longitud de trozo, compilaciónEl modelo completo debe mejorar la calidad a un costo de memoria más alto; el cultivo afecta fuertemente la composición

Para una prueba de producto justa, afinar una variable a la vez contra el mismo retrato y narración. La primera pasada más útil sería la guía de audio para EchoMimic, pasos de muestra para LiveAvatar, calidad de cultivo y punto de control completo para FlashHead, y una segunda solicitud calentada para ambos modelos SoulX.

¿Cómo es el hardware?

Los seis generadores exitosos se dividen en tres grupos prácticos de infraestructura:

  • Menos de 16 GB: SoulX-FlashHead Lite es el único generador completo probado que se ajusta claramente. Su pico de 5.8 GB deja espacio para una tarjeta de 12 GB o 16 GB, aunque latencia y soporte de marco todavía necesitan validación en hardware del consumidor.
  • 48 Clase GB: EchoMimicV3-Flash funcionó cómodamente en un L40S a 33.7 GB. La asignación de LongCat 46.8 GB está demasiado cerca del límite para un cómodo despliegue de 48 GB.
  • 80 Clase GB: Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk y LongCat son las GPU de clase H100 o H200 más seguras con 80 GB o más.

El almacenamiento persistente también importa. FlashHead y EchoMimic usan aproximadamente 7,6 y 22.3 GiB, respectivamente. Los modelos grandes necesitan aproximadamente 45 a 51 GiB cada uno. Alojar cada caché en este artículo a la vez consumiría más de 200 GiB antes de las imágenes, salidas y archivos temporales del contenedor.

Modal es un buen ajuste para experimentos porque los contenedores pueden escalar a cero mientras que las cachés de modelos permanecen en volúmenes persistentes. Después de esta prueba, cada aplicación Modal reportó cero tareas en ejecución y no GPU permaneció activo.

Lo que usaríamos hoy

No hay un solo ganador para cada flujo de trabajo de avatar:

  • Usar LiveAvatar Cuando la calidad de imagen a video de peso pesado importa más y un GB 80 GPU está disponible. Produjo nuestro resultado más nítido de gran modelo y tuvo el trabajo frío H200 más rápido.
  • Usar EchoMimicV3-flash para el mejor equilibrio práctico calidad-a-infraestructura. Funcionó en un L40S más barato, utilizó un caché mucho más pequeño, y produjo un resultado limpio.
  • Usar LongCat-Video-Avatar 1.5 cuando el movimiento expresivo del cuerpo importa más que la preservación conservadora de la identidad.
  • usar soulx-flashhead lite cuando VRAM baja y la velocidad de transmisión caliente materia más que el pulido.

El resultado más sorprendente no fue que el modelo más grande se veía mejor. Era cómo EchoMimic cerca vino mientras que el uso de un GPU más barato y menos de la mitad del almacenamiento del modelo. generación de avatar de código abierto es ahora práctico, pero la estrategia de servicio sigue siendo tanto como el punto de control.

compartir en x