Resumo - Sete modelos de avatar de código aberto passaram pelos nossos critérios: lançamento público entre 23 de agosto de 2025 e 23 de agosto de 2026 e pelo menos 1.000 estrelas no GitHub. Testamos todos. Seis geraram vídeos com o mesmo avatar público e a mesma narração masculina. O LTX-2.3 DubIt não iniciou porque o checkpoint oficial exige aprovação do Hugging Face. O LiveAvatar produziu o resultado mais nítido entre os modelos pesados, o EchoMimicV3-Flash ofereceu o melhor equilíbrio em uma GPU de 48 GB, e o SoulX-FlashHead foi de longe o mais leve, com pico de 5,8 GB de VRAM.
A pergunta que queríamos responder
Novos modelos de avatar falante de código aberto surgem mais rápido do que os artigos comparativos conseguem acompanhar. Promessas como “tempo real”, “duração ilimitada” e “preservação de identidade” são difíceis de comparar, pois cada projeto usa entradas, resoluções, GPUs e definições de tempo de inferência diferentes.
Buscamos uma resposta mais específica e reproduzível: quais modelos recentes, com adoção relevante pela comunidade, conseguem transformar a mesma imagem e narração em um vídeo convincente de uma pessoa falando? E o que cada um realmente exige para funcionar?
Nesta análise, incluímos apenas os modelos que atendiam aos dois critérios:
- O primeiro código oficial utilizável e os pesos do modelo foram lançados entre 23 de agosto de 2025 e 23 de agosto de 2026.
- O repositório oficial no GitHub tinha mais de 1.000 estrelas em 23 de agosto de 2026.
O número de estrelas no repositório mede o interesse da comunidade, não a qualidade. No caso do Wan2.2 e do LTX-2.3, consideramos as estrelas do projeto principal, pois é nesse repositório que o recurso de avatar é distribuído.
Os sete modelos selecionados
| Modelo | Estrelas do GitHub | Lançamento público | Entrada oficial | Resultado do teste |
|---|---|---|---|---|
| Wan2.2-S2V-14B | 17.261 | 26 de agosto de 2025 | Imagem + áudio, vídeo opcional de pose | Concluído |
| LTX-2.3 DubIt | 9.226 | 11 de maio de 2026 | Vídeo de referência + texto alvo | Bloqueado por checkpoint restrito |
| LongCat-Video-Avatar 1.5 | 7.515 | 21 de maio de 2026 | Imagem + áudio | Concluído |
| LiveAvatar | 2.384 | 8 de dezembro de 2025 | Imagem + áudio | Concluído |
| SoulX-FlashTalk | 1.476 | 8 de janeiro de 2026 | Imagem + áudio | Concluído |
| EchoMimicV3-Flash | 1.025 | 22 de janeiro de 2026 | Imagem + áudio | Concluído |
| SoulX-FlashHead | 1.006 | 12 de fevereiro de 2026 | Imagem + áudio | Concluído |
Projetos lançados antes do limite foram excluídos independentemente da contagem de estrelas.
Mesmo avatar público, mesma voz masculina
Cada execução bem-sucedida usou este quadro de um vídeo silencioso do Pexels gerado por IA pela AI25.Studio, disponibilizado sob a licença do Pexels. O autor do vídeo original não endossa esta comparação.
![]()
A narração, com 3,63 segundos, usou Daniel, uma voz masculina neutra incluída no macOS:
Modelos de avatar de código aberto agora podem gerar vídeos convincentes a partir de uma imagem.
Implantamos versões fixas dos repositórios oficiais e pesos em Modal. O tempo medido começa quando o contêiner de geração é iniciado e termina quando o MP4 final é retornado. Os pesos do modelo já estavam armazenados em um volume persistente do Modal, portanto o tempo inicial de download da internet não é contabilizado, mas o carregamento do modelo, pré-processamento, geração, decodificação e multiplexação estão incluídos.
Visão geral dos resultados
| Modelo | Testado em GPU | Custo mín. da GPU/mês em uso contínuo | VRAM máxima | Tempo | Custo estimado | Cache de modelo | Saída |
|---|---|---|---|---|---|---|---|
| Wan2.2-S2V-14B | H200 | US$ 2.843 (H100) | 58.681 MiB | 780,29 s | US$ 1,3692 | 45,76 GiB | 512 x 896, 16 fps |
| LTX-2.3 DubIt | Nenhum | Desconhecido | Nenhum | Bloqueado antes da GPU | US$ 0 GPU | Checkpoint bloqueado | Sem saída |
| LongCat-Video-Avatar 1.5 | H200 | US$ 2.843 (H100) | 46.827 MiB | 233,08 s | US$ 0,4011 | 44,82 GB | 480 x 832, 25 fps |
| LiveAvatar | H200 | US$ 2.843 (H100) | 61.401 MiB | 181,44 s | US$ 0,3184 | 47,03 GiB | 384 x 704, 25 fps |
| SoulX-FlashTalk | H200 | US$ 2.843 (H100) | 57.805 MiB | 331,93 s | US$ 0,5825 | 51,07 GiB | 416 x 720, 25 fps |
| EchoMimicV3-Flash | L40S | US$ 1.405 (L40S) | 33.726 MiB | 251,94 s | US$ 0,2120 | 22,28 GiB | 480 x 848, 25 fps |
| SoulX-FlashHead Lite | L40S | US$ 575 (L4) | 5.763 MiB | 235,31 s | US$ 0,1980 | 7,60 GiB | 512 x 512, 25 fps |
As estimativas de custo usam os preços de tabela do Modal em 23 de agosto de 2026 para a GPU, a CPU e a memória solicitadas durante a função de geração medida. Elas não incluem armazenamento, transferência pela internet nem o download inicial dos pesos.
A coluna mensal é uma estimativa de capacidade apenas de GPU para operação contínua durante um mês de 30 dias. Ela usa a classe de GPU Modal mais barata que esperamos rodar na configuração medida sem redesenhar o pipeline: H100 para os modelos pesados, L40S para EchoMimic e L4 para FlashHead Lite. CPU, memória, volumes e taxas de rede são extras. O Modal escala para zero, então o mínimo mensal real é US$ 0 e uma implantação baseada em uso pode custar muito menos do que a estimativa de funcionamento contínuo.
Estas são medições de implantação, não um benchmark perfeitamente controlado da qualidade dos modelos. Os pipelines oficiais geram resoluções diferentes e usam quantidades distintas de etapas. Isso também faz parte do resultado, pois mostra o que o fluxo de execução recomendado por cada projeto realmente entrega.
Os vídeos gerados
Wan2.2-S2V-14B
Wan manteve a identidade e o plano de fundo estáveis, com movimento facial contido. Também foi a execução bem-sucedida mais lenta, com 13 minutos para uma saída de 3,8 segundos.
Wan é a opção cinematográfica mais pesada. Executamos o caminho oficial de 40 etapas de fala para vídeo em um H200. Produziu um retrato limpo e estável, mas o movimento foi conservador e a saída de 16 fps foi menos fluida que os modelos de 25 fps. A VRAM máxima atingiu 58.681 MiB, e o custo estimado de computação foi mais de quatro vezes o do LiveAvatar.
A configuração oficial também exigiu várias correções de dependência antes que a inferência pudesse começar, incluindo pacotes usados por seus leitores de áudio e vídeo. Nenhuma dessas tentativas frustradas chegou à redução de ruído, portanto, não estão incluídas no tempo acima.
LongCat-Video-Avatar 1.5
O LongCat gerou os movimentos de cabeça e corpo mais expressivos, incluindo um gesto com a mão que não existia na imagem de referência.
LongCat permaneceu a imagem-para-vídeo mais expressiva. Seu caminho INT8 de 8 etapas manteve o avatar reconhecível enquanto adicionava movimento à cabeça, ao rosto e à parte superior do corpo. Alguns quadros da boca pareciam ligeiramente exagerados, mas isso fez a imagem estática parecer mais uma performance completa do que os modelos mais conservadores.
O exemplo oficial usa duas GPUs. Executamos o modelo em uma única H200, com o paralelismo de contexto definido como um. O pico foi de 46.827 MiB, perto demais do limite de uma placa comum de 48 GB quando se considera a sobrecarga do framework.
LiveAvatar
O LiveAvatar produziu o resultado mais nítido entre os modelos pesados e a execução bem-sucedida mais rápida na H200.
Entre os modelos grandes, o LiveAvatar ofereceu a melhor combinação de identidade nítida, movimentos convincentes da boca, piscadas e expressões naturais. Seu pipeline FP8 de quatro etapas terminou em 181,44 segundos, mais rápido que LongCat, FlashTalk e Wan.
Essa velocidade não significa que seja um modelo pequeno. O pico chegou a 61.401 MiB, com offloading do modelo na decodificação final do VAE. O executor oficial para uma única GPU também pressupõe variáveis de ambiente de processos distribuídos, e o fluxo documentado para uma execução funciona melhor com a compilação desativada. Depois de reproduzir essas configurações oficiais, concluímos a execução de forma confiável.
SoulX-FlashTalk 14B
O FlashTalk apresentou boa qualidade visual e foi projetado para geração contínua em blocos, mas a inicialização a frio do modelo de 14B teve um custo alto.
O FlashTalk gerou um rosto estável e movimentos nítidos da boca. O primeiro bloco levou 119,58 segundos porque o TorchInductor precisou compilar o grafo. Os blocos seguintes levaram cerca de 3,75 segundos cada. Por isso, os 331,93 segundos da execução a frio parecem bem piores do que o desempenho de uma implantação de streaming já aquecida.
A contrapartida está na infraestrutura. O pico de VRAM foi de 57.805 MiB, e o cache persistente foi o maior do teste, com 51,07 GiB. O modelo exige uma GPU da classe de 80 GB, a menos que a implantação use offloading ou quantização mais agressivos.
EchoMimicV3-Flash
O EchoMimic ofereceu o melhor equilíbrio prático: identidade bem preservada e bom movimento labial em uma L40S mais barata.
O EchoMimicV3-Flash foi o candidato mais atraente para implantação. Seu pipeline de 1,3B e 8 etapas gerou um vídeo limpo a 25 fps, preservou bem o rosto e rodou em uma L40S, em vez de uma H200. Os movimentos da boca e do corpo foram mais sutis do que no LongCat, mas houve menos alterações perceptíveis no quadro inteiro.
Nossa configuração oficial, com área de 768, atingiu um pico de 33.726 MiB. O projeto oferece modos que consomem menos memória; portanto, esse é o uso observado nas nossas configurações, não uma afirmação sobre o mínimo teórico. O cache de 22,28 GiB ocupou menos da metade do espaço exigido pelos modelos de 14B.
SoulX-FlashHead 1.3B Lite
O FlashHead foi muito menor, mas o enquadramento fechado, a identidade menos nítida e o movimento labial mais fraco fizeram dele o resultado menos convincente.
FlashHead Lite atingiu um pico de apenas 5.763 MiB, uma ordem de magnitude abaixo dos grandes geradores. Como o FlashTalk, seu tempo frio foi dominado pela compilação na primeira execução. O primeiro bloco levou 155,7 segundos, enquanto os blocos posteriores levaram cerca de 0,19 segundos cada.
Isso é interessante para um serviço de streaming sempre aquecido e sugere que o modelo poderia rodar em hardware bem mais barato do que a L40S usada aqui. Para um clipe profissional em uma landing page, porém, escolheríamos o resultado visual superior do EchoMimic.
Por que LTX-2.3 DubIt não tem vídeo aqui
LTX-2.3 DubIt é diferente dos modelos direcionados por áudio acima. Ele recebe um vídeo de referência com voz e um texto alvo, depois gera a fala e o movimento labial correspondente enquanto tenta manter a identidade vocal do locutor.
O código é público, mas o checkpoint oficial Lightricks/LTX-2.3-22b-IC-LoRA-DubIt retornou um erro de autorização do Hugging Face. Como não havia um token aprovado no ambiente de teste, a execução parou durante o carregamento dos pesos na CPU, antes da alocação de qualquer GPU.
Não usamos um espelho de terceiros para contornar a restrição de acesso oficial. Reprodutibilidade e acesso também fazem parte da avaliação de uma versão de código aberto. Assim que o acesso oficial for aprovado, o executor preparado no Modal poderá repetir o teste com o vídeo público de referência e a frase desejada.
Cada modelo preserva ou seleciona uma voz?
A maioria dos modelos de avatar não seleciona ou clona uma voz. Eles animam um arquivo de áudio fornecido e depois colocam o mesmo áudio no vídeo final. A criação de voz é uma etapa separada de texto para fala ou clonagem de voz.
| Modelo | Seletor de voz integrado | Usa fala fornecida | Aprende a partir de uma voz de referência | O que observamos |
|---|---|---|---|---|
| Wan2.2-S2V-14B | Não | Sim | Não | Áudio de entrada preservado, correlação 0,999897 |
| LTX-2.3 DubIt | Nenhum menu de voz | Não, ele leva o texto-alvo | Sim, a partir do vídeo de referência com voz | Não executado porque os pesos estavam bloqueados |
| LongCat-Video-Avatar 1.5 | Não | Sim | Não | Áudio de entrada preservado, correlação 0,999562 |
| LiveAvatar | Não | Sim | Não | Áudio de entrada preservado, correlação 0,999897 |
| SoulX-FlashTalk | Não | Sim | Não | Áudio de entrada preservado, correlação 0,999751 |
| EchoMimicV3-Flash | Não | Sim | Não | Áudio de entrada preservado, correlação 0,999198 |
| SoulX-FlashHead | Não | Sim | Não | Áudio de entrada preservado, correlação 0,999751 |
As pequenas diferenças vêm da reamostragem e da codificação AAC, não de um locutor sintetizado diferente. Em outras palavras, os seis modelos bem-sucedidos podem usar uma gravação real, um clone consentido feito em outro lugar ou qualquer voz TTS. Eles mesmos não alteram a identidade vocal.
DubIt é a exceção. Seu objetivo é criar fala em novo idioma-alvo ou roteiro-alvo parecida com a voz do vídeo de referência. Isso o torna útil para dublagem, mas o áudio de saída não será uma cópia em forma de onda do original.
Parâmetros que valem a pena ajustar
As configurações padrão não são necessariamente as melhores para todo rosto ou implantação. Estes são os controles de maior impacto para testar antes de alterar o código do modelo:
| Modelo | Parâmetros que mais importam | Possível contrapartida |
|---|---|---|
| Wan2.2-S2V-14B | Passos de redução de ruído, escala de orientação, área de saída, semente, vídeo opcional de pose | Mais etapas e pixels aumentam drasticamente a latência; controle de pose pode melhorar o movimento do corpo |
| LTX-2.3 DubIt | Prompt, texto alvo, duração do vídeo de referência, força do LoRA, semente | Condicionamento mais forte pode melhorar a identidade, mas reduzir a variação natural |
| LongCat-Video-Avatar 1.5 | Caminho destilado em 8 etapas vs caminho completo, quantização, orientação, semente, paralelismo de contexto | Precisão total ou mais etapas podem melhorar o detalhe, mas precisam de mais memória e tempo |
| LiveAvatar | Etapas de amostra, área de saída, FP8, descarregamento de modelo, compilação | A compilação ajuda em tarefas repetidas; descarregar salva memória, mas adiciona transferências |
| SoulX-FlashTalk | Tamanho do bloco, sobreposição, compilação, orientação de áudio, semente | Blocos maiores podem melhorar a continuidade, mas aumentam a latência e o consumo de memória |
| EchoMimicV3-Flash | Passos de inferência, escala de orientação, orientação de áudio, tamanho da amostra, semente | Orientação de áudio maior pode fortalecer o movimento da boca, mas pode exagerá-lo |
| SoulX-FlashHead | Checkpoint lite vs completo, corte, comprimento de fragmento, compilação | O modelo completo deve melhorar a qualidade com um custo de memória mais alto; o corte afeta fortemente a composição. |
Para um teste justo de produto, ajuste uma variável de cada vez usando o mesmo retrato e narração. A primeira análise mais útil seria orientação de áudio para o EchoMimic, passos de amostra para o LiveAvatar, qualidade de recorte e de checkpoint completo para o FlashHead, e uma segunda solicitação aquecida para ambos os modelos SoulX.
O hardware necessário na prática
Os seis geradores bem-sucedidos se dividem em três grupos de infraestrutura prática:
- Abaixo de 16 GB: O SoulX-FlashHead Lite é o único gerador completo testado que cabe com folga. Seu pico de 5,8 GB deixa espaço em uma placa de 12 GB ou 16 GB, embora a latência e a compatibilidade do framework ainda precisem ser validadas em hardware de consumo.
- 48 GB classe: EchoMimicV3-Flash rodou confortavelmente em um L40S com 33,7 GB. A alocação de 46,8 GB do LongCat é próxima demais do limite para uma implantação confortável de 48 GB.
- Classe 80 GB: Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk e LongCat são mais seguros em GPUs classe H100 ou H200 com 80 GB ou mais.
O armazenamento persistente também importa. FlashHead e EchoMimic usam cerca de 7,6 e 22,3 GiB, respectivamente. Os modelos grandes precisam de aproximadamente 45 a 51 GiB cada. Hospedar todos os caches mencionados neste artigo de uma vez consumiria bem mais de 200 GiB antes das imagens do contêiner, saídas e arquivos temporários.
O Modal é adequado para experimentos porque os contêineres podem escalar até zero enquanto os caches de modelos permanecem em volumes persistentes. Após este teste, todos os aplicativos Modal relataram zero tarefas em execução e nenhuma GPU permaneceu ativa.
O que usaríamos hoje
Não há um único vencedor para todos os fluxos de trabalho de avatar:
- Use o LiveAvatar quando a qualidade de imagem para vídeo é a prioridade e há uma GPU de 80 GB disponível. Foi o resultado mais nítido entre os modelos grandes e teve a execução a frio mais rápida na H200.
- Use o EchoMimicV3-Flash para o melhor equilíbrio prático entre qualidade e infraestrutura. Ele rodou em um L40S mais barato, usou um cache muito menor e produziu um resultado limpo.
- Use o LongCat-Video-Avatar 1.5 quando o movimento corporal expressivo importa mais do que a preservação conservadora da identidade.
- Use o SoulX-FlashHead Lite quando baixa VRAM e velocidade de streaming aquecida importam mais do que acabamento.
O resultado mais surpreendente não foi o maior modelo ter apresentado a melhor qualidade, mas o EchoMimic ter chegado tão perto usando uma GPU mais barata e menos da metade do armazenamento. A geração de avatares de código aberto já é viável, mas a estratégia de implantação continua tão importante quanto o checkpoint.
