Ga naar het artikel
← Terug naar Engineering

We hebben elk populair open-source-avatarmodel dat in het afgelopen jaar is uitgebracht (augustus 2026) getest.

Omslagillustratie voor We hebben elk populair open-source avatarmodel getest dat het afgelopen jaar is uitgebracht (augustus 2026)

Kortom - Zeven open-source avatarmodellen voldeden aan onze criteria: een publieke release tussen 23 augustus 2025 en 23 augustus 2026, plus minstens 1.000 GitHub sterren. We hebben ze allemaal getest. Zes produceerden video's van dezelfde publieke avatar en mannelijke voice-over. LTX-2.3 DubIt kon niet starten omdat het officiële checkpoint goedkeuring van Hugging Face vereist. LiveAvatar leverde het scherpste zware resultaat, EchoMimicV3-Flash bood de beste balans op een 48 GB GPU, en SoulX-FlashHead was verreweg het lichtst met 5.8 GB piek VRAM.


De vraag die we wilden beantwoorden

Open-source pratende-avatar releases komen nu sneller uit dan de meeste vergelijkingsposts ze kunnen bijhouden. Claims zoals "real time", "oneindige lengte" en "identiteit behoudend" zijn moeilijk te vergelijken omdat projecten verschillende inputs, resoluties, GPU's en definities van inferentietijd gebruiken.

We wilden een nauwkeuriger, reproduceerbaar antwoord: welke recente modellen met betekenisvolle gemeenschapsadoptie kunnen hetzelfde portret en dezelfde voice-over omzetten in een overtuigende praatvideo, en wat heeft elk model daadwerkelijk nodig om te draaien?

Voor deze ronde kwalificeerde een model alleen als het aan beide regels voldeed:

  • De eerste officiële, bruikbare code en gewichten werden uitgebracht van 23 augustus 2025 tot 23 augustus 2026.
  • De officiële GitHub-repository had meer dan 1.000 sterren in 23 augustus 2026.

Repository-sterren zijn een maat voor aandacht, niet voor kwaliteit. Voor Wan2.2 en LTX-2.3, behoort het aantal sterren toe aan het bovenliggende project omdat de avatar-functionaliteit in die repository wordt geleverd.

De zeven kwalificerende modellen

ModelGitHub sterrenOpenbare releaseOfficiële invoerTestresultaat
Wan2.2-S2V-14B17,26126 augustus 2025Afbeelding + audio, optioneel posevideoVoltooid
LTX-2.3 DubIt9,226Mag 11, 2026Referentievideo + doelscriptGeblokkeerd door afgeschermde checkpoint
LongCat-Video-Avatar 1.57,51521 mei 2026Afbeelding + audioVoltooid
LiveAvatar2,3848 december 2025Afbeelding + audioVoltooid
SoulX-FlashTalk1,4768 januari 2026Afbeelding + audioVoltooid
EchoMimicV3-Flash1,02522 januari 2026Afbeelding + audioVoltooid
SoulX-FlashHead1,00612 februari 2026Afbeelding + audioVoltooid

Projecten die voor de cutoff zijn uitgebracht, werden uitgesloten ongeacht hun sterrenscore.

Zelfde publieke avatar, dezelfde mannelijke stem

Elke succesvolle uitvoering gebruikte deze frame van een stille, AI-gegenereerde Pexels-video door AI25.Studio, onder het Pexels-licentie. De oorspronkelijke maker steunt deze vergelijking niet.

Het openbare referentiekader dat aan de avatarmodellen wordt geleverd

De 3.63-seconden durende voice-over gebruikte Daniel, een neutrale mannelijke systeemstem die bij macOS is inbegrepen:

Open source avatarmodellen kunnen nu overtuigende video's genereren van één afbeelding.

We hebben gepinde versies van de officiële repositories en gewichten ingezet op Modaal. De gemeten tijd begint wanneer de generatiecontainer start en eindigt wanneer de uiteindelijke MP4 wordt geretourneerd. Modelgewichten werden al opgeslagen in een persistent Modal-volume, dus de initiële internetdownloadtijd is uitgesloten, maar het laden van het model, voorbewerkingen, generatie, decodering en muxing zijn inbegrepen.

Resultaten in één oogopslag

ModelGPU getestMin. altijd-aan GPU/maandPiek VRAMTijdGeschatte berekeningModelcacheUitvoer
Wan2.2-S2V-14BH200$ 2.843 (H100)58.681 MiB780.29s$1.369245.76 GiB512 x 896, 16 fps
LTX-2.3 DubItGeenOnbekendGeenGeblokkeerd vóór GPU$ 0 GPUCheckpoint afgeschermdGeen uitvoer
LongCat-Video-Avatar 1.5H200$ 2.843 (H100)46.827 MiB233.08,$0.401144.82 GB480 x 832, 25 fps
LiveAvatarH200$ 2.843 (H100)61.401 MiB181.44,$0.318447.03 GiB384 x 704, 25 fps
SoulX-FlashTalkH200$ 2.843 (H100)57.805 MiB331.93,$0.582551.07 GiB416 x 720, 25 fps
EchoMimicV3-FlashL40S$ 1.405 (L40S)33.726 MiB251.94,$0.212022.28 GiB480 x 848, 25 fps
SoulX-FlashHead LiteL40S$ 575 (L4)5.763 MiB235.31,$0.19807.60 GiB512 x 512, 25 fps

Schattingen berekenen gebruiken Modal’s 23 augustus 2026 prijslijst voor de gevraagde GPU, CPU en geheugen tijdens de gemeten generatiefunctie. Ze sluiten opslag, internetoverdracht en het eenmalige gewicht downloaden uit.

De maandelijkse kolom is een GPU-only capaciteitsraming voor doorlopende werking over een 30-dagen maand. Het gebruikt de goedkoopste Modal GPU-klasse waarvan we verwachten dat deze de gemeten configuratie kan draaien zonder de pijplijn te herontwerpen: H100 voor de zware modellen, L40S voor EchoMimic, en L4 voor FlashHead Lite. CPU-, geheugen-, volume- en netwerkvergoedingen zijn extra. Modal schaalt tot nul, dus het werkelijke maandelijkse minimum is $0 en een op gebruik gebaseerde implementatie kan veel minder kosten dan de always-on raming.

Dit zijn implementatiemetingen, geen perfect gecontroleerde modelkwaliteitsbenchmark. De officiële pipelines produceren verschillende resoluties en gebruiken een verschillend aantal stappen. Dat maakt deel uit van het resultaat: het laat zien wat het aanbevolen uitvoerbare pad van elk project levert.

De gegenereerde video's

Wan2.2-S2V-14B

Wan hield de identiteit en achtergrond stabiel, met terughoudende gezichtsbewegingen. Het was ook de langzaamste succesvolle uitvoering van 13 minuten voor een 3.8-seconden output.

Wan is de zwaargewicht cinematische optie. We hebben het officiële 40-staps spraak-naar-video-pad uitgevoerd op een H200.. Het produceerde een schoon, stabiel portret, maar de beweging was terughoudend en de 16 fps-output was minder vloeiend dan de 25 fps-modellen. De piek VRAM bereikte 58.681 MiB, en de geschatte rekenkost was meer dan vier keer die van LiveAvatar.

De officiële setup vereiste ook verschillende afhankelijkheidsfixes voordat de inferentie zou starten, inclusief pakketten die werden gebruikt door de audio- en videolezers. Geen van die mislukte pogingen bereikte denoising, dus ze zijn niet opgenomen in de bovenstaande timing.

LongCat-Video-Avatar 1.5

LongCat creëerde de meest zichtbare hoofd- en lichaamsuitvoering, inclusief een handgebaar dat niet aanwezig was in de referentieafbeelding.

LongCat bleef het meest expressieve image-to-video resultaat. Zijn 8-stap INT8 pad hield het avatar herkenbaar terwijl hoofd-, gezicht- en bovenlichaamsbewegingen werden toegevoegd. Een paar mondframes zagen er iets overdreven uit, maar het zorgde ervoor dat de stilstaande afbeelding meer aanvoelde als een volledige uitvoering dan de conservatievere modellen.

Het officiële voorbeeld gebruikt twee GPU's. We hebben het uitgevoerd op één H200 door contextparallelisme op één te zetten. Het piekte op 46.827 MiB, wat te dicht bij de limiet ligt voor comfort op een typische 48 GB kaart zodra de framework-overhead is inbegrepen.

LiveAvatar

LiveAvatar produceerde het scherpste zware resultaat en de snelste succesvolle H200-job.

LiveAvatar gaf ons de beste combinatie van scherpe identiteit, overtuigende mondvormen, knipperen en gereserveerde uitdrukking onder de grote modellen. De vierstaps FP8-pijplijn voltooide in 181.44 seconden, sneller dan LongCat, FlashTalk en Wan.

Die snelheid maakt het model niet klein. Het bereikte een piek van 61.401 MiB en was afhankelijk van model-offloading voor de uiteindelijke VAE-decodering. De upstream single-GPU runner gaat er ook van uit dat omgevingsvariabelen voor gedistribueerde processen aanwezig zijn, en het gedocumenteerde eenmalige pad werkt het beste met compilatie uitgeschakeld. Na het afstemmen op die officiële instellingen, werd de run betrouwbaar voltooid.

SoulX-FlashTalk 14B

FlashTalk was visueel sterk en is ontworpen voor gesegmenteerde, continue generatie, maar de 14B koude start was duur.

FlashTalk produceerde een stabiel gezicht met duidelijke mondbeweging. Het eerste gegenereerde segment kostte 119.58 seconden omdat TorchInductor zijn grafiek compileerde. Latere segmenten kostten ongeveer 3.75 seconden per stuk. Dat laat de 331.93-seconden koude start er slechter uitzien dan een verwarmde streaming-implementatie zou voelen.

De afweging is infrastructuur. Pieks-VRAM was 57.805 MiB, en de persistente cache was de grootste in deze test met 51.07 GiB. Het behoort op een 80 GB-klasse GPU tenzij de implementatie meer agressieve offloading of kwantisering toevoegt.

EchoMimicV3-Flash

EchoMimic leverde de beste praktische balans: schone identiteit en lipbeweging op een goedkopere L40S.

EchoMimicV3-Flash was de meest overtuigende implementatiekandidaat. De 1.3B, 8-staps pijplijn produceerde een schone 25 fps-video, behield het gezicht goed en draaide op een L40S in plaats van een H200.. De mond- en lichaamsbeweging waren subtieler dan die van LongCat, maar er waren minder afleidende veranderingen in het volledige frame.

Onze 768-gebiedsconfiguratie piekte op 33.726 MiB. Het project adverteert met modi met minder geheugen, dus dit is waargenomen gebruik voor onze instellingen in plaats van een bewering over het theoretische minimum. De 22.28 GiB-cache was minder dan de helft van de grootte van de 14B-modellen.

SoulX-FlashHead 1.3B Lite

FlashHead was aanzienlijk kleiner, maar de nauwe uitsnede, zachtere identiteit en zwakkere mondbeweging maakten het het minst overtuigende resultaat.

FlashHead Lite bereikte slechts 5.763 MiB, een orde van grootte lager dan de grote generators. Net als FlashTalk werd de koude timing gedomineerd door compilatie bij de eerste uitvoering. Het eerste segment duurde 155.7 seconden, terwijl latere segmenten ongeveer 0.19 seconden duurden.

Dat is interessant voor een altijd warme streamingdienst en suggereert dat het op veel goedkopere hardware kan draaien dan de L40S die hier gebruikt wordt. Voor een gepolijste clip voor de landingspagina zouden we echter de sterkere visuele resultaten van EchoMimic kiezen.

Waarom heeft LTX-2.3 DubIt hier geen video

LTX-2.3 DubIt is anders dan de hierboven genoemde audio-gestuurde modellen. Het neemt een gesproken referentievideo en doeltekst, en genereert vervolgens spraak en lipbewegingen die erbij passen, terwijl het probeert de vocale identiteit van de spreker te behouden.

De code is openbaar, maar de officiële Lightricks/LTX-2.3-22b-IC-LoRA-DubIt checkpoint gaf een autorisatiefout terug van Hugging Face. We hadden geen goedgekeurde token in de testomgeving, dus de taak stopte tijdens de voorbereiding van alleen CPU-gewichten voordat er een GPU werd toegewezen.

We hebben geen derde partij mirror gebruikt die de officiële toegangspoort omzeilde. Reproduceerbaarheid en toegang maken deel uit van het evalueren van een open-source release. Zodra officiële toegang is goedgekeurd, kan de voorbereide Modal runner dezelfde test uitvoeren met de openbare referentievideo en doelsentence.

Behoudt of selecteert elk model een stem?

De meeste avatarmodellen selecteren of klonen geen stem. Ze animeren een aangeleverd audiobestand en plaatsen diezelfde audio vervolgens in de definitieve video. Stemcreatie is een aparte tekst-naar-spraak- of stemkloningsstap.

ModelIngebouwde stemkiezerGebruikt geleverde spraakLeert van een referentiestemWat we hebben waargenomen
Wan2.2-S2V-14BNeeJaNeeInput-audio behouden, correlatie 0.999897
LTX-2.3 DubItGeen stemmenuNee, het neemt doelteksJa, van de ingesproken referentievideoNiet uitgevoerd omdat de gewichten beperkt waren
LongCat-Video-Avatar 1.5NeeJaNeeInput-audio behouden, correlatie 0.999562
LiveAvatarNeeJaNeeInput-audio behouden, correlatie 0.999897
SoulX-FlashTalkNeeJaNeeInput-audio behouden, correlatie 0.999751
EchoMimicV3-FlashNeeJaNeeIngevoerde audio behouden, correlatie 0.999198
SoulX-FlashHeadNeeJaNeeInput-audio behouden, correlatie 0.999751

De kleine verschillen komen door resampling en AAC-codering, niet door een andere gesynthetiseerde spreker. Met andere woorden, de zes succesvolle modellen kunnen een echte opname gebruiken, een elders gemaakte toestemminggevende kloon, of elke TTS-stem. Ze veranderen de vocale identiteit zelf niet.

DubIt is de uitzondering. Het doel ervan is het creëren van nieuwe doeltaal- of doelscript-spraak die lijkt op de stem in de referentievideo. Dat maakt het nuttig voor nasynchronisatie, maar de uitvoeraudio zal geen golfvormkopie van het origineel zijn.

Parameters die het waard zijn om aan te passen

De standaardinstellingen zijn niet per se de beste instelling voor elk gezicht of elke implementatie. Dit zijn de meest invloedrijke bedieningselementen om te testen voordat je de modelcode wijzigt:

ModelParameters die het meest belangrijk zijnWaarschijnlijke afweging
Wan2.2-S2V-14BOntstoringsstappen, begeleidingsschaal, uitvoergebied, zaad, optionele pose-videoMeer stappen en pixels verhogen de latentie sterk; posebesturing kan lichaamsbeweging verbeteren
LTX-2.3 DubItPrompt, doeltekst, referentie-videolengte, LoRA-sterkte, seedSterkere conditionering kan de identiteit verbeteren maar de natuurlijke variatie verminderen
LongCat-Video-Avatar 1.58-stap gedistilleerd vs volledige pad, kwantisering, begeleiding, zaad, context parallelismeVolledige precisie of meer stappen kan detail verbeteren maar vergt meer geheugen en tijd
LiveAvatarVoorbeeldstappen, uitvoergebied, FP8, model offload, compilatieCompilatie helpt bij herhaalde taken; offload bespaart geheugen maar voegt overdrachten toe
SoulX-FlashTalkChunk-grootte, overlap, samenstelling, audiobegeleiding, zaadGrotere brokken kunnen de continuïteit verbeteren maar verhogen de latentie en het geheugen
EchoMimicV3-FlashInferentiestappen, begeleidingsschaal, audiobegeleiding, steekproefgrootte, zaadHogere audiobegeleiding kan mondbewegingen versterken maar kan ze overdrijven
SoulX-FlashHeadLite versus volledige checkpoint, bijsnijden, chunk-lengte, compilatieHet volledige model zou de kwaliteit moeten verbeteren tegen een hogere geheugenkost; bijsnijden beïnvloedt de compositie sterk

Voor een eerlijke producttest, pas één variabele tegelijk aan tegen hetzelfde portret en dezelfde voice-over. De meest nuttige eerste poging zou geluidsbegeleiding voor EchoMimic zijn, voorbeeldstappen voor LiveAvatar, bijgesneden en volledige checkpoint-kwaliteit voor FlashHead, en een opgewarmd tweede verzoek voor beide SoulX-modellen.

Hoe de hardware er echt uitziet

De zes succesvolle generatoren vallen in drie praktische infrastructuurgroepen:

  • Onder 16 GB: SoulX-FlashHead Lite is de enige geteste volledige generator die duidelijk past. Zijn 5.8 GB piek laat ruimte voor een 12 GB of 16 GB kaart, hoewel latency en framework-ondersteuning nog moeten worden gevalideerd op consumentenhardware.
  • 48 GB klasse: EchoMimicV3-Flash draaide comfortabel op een L40S bij 33.7 GB. LongCat’s 46.8 GB-toewijzing ligt te dicht bij de limiet voor een comfortabele 48 GB-implementatie.
  • 80 GB klasse: Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk en LongCat zijn het veiligst op H100- of H200-klasse GPU's met 80 GB of meer.

Persistent opslag is ook belangrijk. FlashHead en EchoMimic gebruiken respectievelijk ongeveer 7.6 en 22.3 GiB. De grote modellen hebben ongeveer 45 tot 51 GiB per stuk nodig. Het tegelijk hosten van elke cache in dit artikel zou ruim 200 GiB verbruiken, nog los van containerafbeeldingen, uitvoerbestanden en tijdelijke bestanden.

Modal is een goede keuze voor experimenten omdat containers naar nul kunnen schalen terwijl modelcaches op persistente volumes blijven. Na deze test rapporteerde elke Modal-app nul lopende taken en bleef geen enkele GPU actief.

Wat we vandaag zouden gebruiken

Er is geen enkele winnaar voor elke avatar-workflow:

  • Gebruik LiveAvatar wanneer de hoogste kwaliteit van afbeelding-naar-video van belang is en een 80 GB GPU beschikbaar is. Het leverde ons scherpste resultaat van een groot model en had de snelste H200 koude taak.
  • Gebruik EchoMimicV3-Flash voor de beste praktische kwaliteit- tot infrastructuurbalans. Het draaide op een goedkopere L40S, gebruikte een veel kleinere cache en produceerde een schoon resultaat.
  • Gebruik LongCat-Video-Avatar 1.5 wanneer expressieve lichaamsbeweging belangrijker is dan het behoud van een conservatieve identiteit.
  • Gebruik SoulX-FlashHead Lite wanneer lage VRAM en warme streaming-snelheid belangrijker zijn dan afwerking.

Het meest verrassende resultaat was niet dat het grootste model er het beste uitzag. Het was hoe dicht EchoMimic kwam terwijl het een goedkopere GPU en minder dan de helft van de modelopslag gebruikte. Open-source avatar generatie is nu praktisch, maar de serverstrategie blijft even belangrijk als de checkpoint.

Delen op X