본문으로 건너뛰기
← 엔지니어링으로 돌아가기

지난 1년간 출시된 인기 오픈 소스 아바타 모델을 모두 테스트했습니다(2026년 8월 기준)

지난 1년간 출시된 모든 인기 오픈 소스 아바타 모델 테스트 표지 일러스트(2026년 8월)

TL;DR - 일곱 개의 오픈 소스 아바타 모델이 기준을 충족했습니다: 2025년 8월 23일부터 2026년 8월 23일 사이의 공개 릴리스, 그리고 최소 1,000 GitHub 별. 모든 모델을 실행했습니다. 여섯 개는 동일한 공개 아바타와 남성 내레이션으로 영상을 생성했습니다. LTX-2.3 DubIt는 공식 체크포인트가 Hugging Face 승인을 필요로 하여 시작할 수 없었습니다. LiveAvatar는 가장 강력한 고급 결과를 만들었고, EchoMimicV3-Flash는 48 GB GPU에서 가장 균형 잡힌 결과를 제공했으며, SoulX-FlashHead는 최대 VRAM 5.8 GB로 가장 가벼웠습니다.


확인하고자 한 질문

오픈 소스 토킹 아바타 릴리스는 이제 대부분의 비교 게시물이 추적할 수 있는 것보다 더 빠르게 도착합니다. “실시간,” “무한 길이,” “정체성 유지”와 같은 주장들은 프로젝트마다 사용되는 입력, 해상도, GPU, 추론 시간 정의가 달라 비교하기 어렵습니다.

우리는 더 좁고 재현 가능한 답을 원했습니다: 의미 있는 커뮤니티 채택이 있는 최근 모델 중 어떤 모델이 동일한 초상화와 내레이션을 설득력 있는 대화형 동영상으로 변환할 수 있고, 각 모델을 실행하려면 실제로 무엇이 필요한가?

이번 라운드에서는, 모델이 두 가지 규칙을 모두 충족해야만 자격이 주어졌습니다:

  • 그의 첫 번째 공식 사용 가능한 코드와 가중치는 2025년 8월 23일부터 2026년 8월 23일까지 공개되었습니다.
  • 공식 GitHub 저장소는 2026년 8월 23일 기준으로 1,000개 이상의 별을 보유하고 있었습니다.

저장소 스타 수은 품질이 아니라 관심도의 척도입니다. Wan2.2와 LTX-2.3의 경우, 별 수는 아바타 기능이 해당 저장소 안에 포함되어 있기 때문에 상위 프로젝트에 속합니다.

선정 기준을 충족한 7개 모델

모델GitHub 별점공개 출시공식 입력테스트 결과
Wan2.2-S2V-14B17,2612025년 8월 26일이미지 + 오디오, 선택적 포즈 동영상완료됨
LTX-2.3 DubIt9,2262026년 5월 11일참조 동영상 + 대상 텍스트게이트 체크포인트에 의해 차단됨
LongCat-Video-Avatar 1.57,5152026년 5월 21일이미지 + 오디오완료됨
LiveAvatar2,3842025년 12월 8일이미지 + 오디오완료됨
SoulX-FlashTalk1,4762026년 1월 8일이미지 + 오디오완료됨
EchoMimicV3-Flash1,0252026년 1월 22일이미지 + 오디오완료됨
SoulX-FlashHead1,0062026년 2월 12일이미지 + 오디오완료됨

마감일 이전에 공개된 프로젝트는 별 개수와 상관없이 제외되었습니다.

동일한 공개 아바타, 동일한 남성 음성

모든 성공적인 실행은 무성 영상의이 프레임을 사용했습니다, AI-생성 Pexels 영상 AI25.Studio 제공, Pexels 라이선스. 원저작자는이 비교를 지지하지 않습니다.

아바타 모델에 제공된 공개 참조 프레임

3.63초 길이의 내레이션은 macOS에 포함된 중립적인 남성 시스템 음성인 다니엘을 사용했습니다:

오픈 소스 아바타 모델은 이제 한 장의 이미지로 설득력 있는 동영상을 생성할 수 있습니다.

우리는 공식 저장소와 가중치의 고정 버전을 배포했습니다. Modal. 측정된 시간은 생성 컨테이너가 시작될 때 시작되며 최종 MP4가 반환될 때 종료됩니다. 모델 가중치는 이미 영구적인 Modal 볼륨에 저장되어 있어 초기 인터넷 다운로드 시간은 제외되지만, 모델 로딩, 전처리, 생성, 디코딩 및 멀티플렉싱은 포함됩니다.

한눈에 보는 결과

모델GPU 테스트됨최소 항상 켜기 GPU/월최대 VRAM시간예상 계산모델 캐시출력
Wan2.2-S2V-14BH200$2,843 (H100)58,681 MiB780.29초$1.369245.76 GiB512 x 896, 16 fps
LTX-2.3 DubIt없음알 수 없음없음GPU 이전에 차단됨$0 GPU체크포인트 제한됨출력 없음
LongCat-Video-Avatar 1.5H200$2,843 (H100)46,827 MiB233.08초$0.401144.82 GB480 x 832, 25 fps
LiveAvatarH200$2,843 (H100)61,401 MiB181.44초$0.318447.03 GiB384 x 704, 25 fps
SoulX-FlashTalkH200$2,843 (H100)57,805 MiB331.93초$0.582551.07 GiB416 x 720, 25 fps
EchoMimicV3-FlashL40S$1,405 (L40S)33,726 MiB251.94초$0.212022.28 GiB480 x 848, 25 fps
SoulX-FlashHead LiteL40S$575 (L4)5,763 MiB235.31초$0.19807.60 GiB512 x 512, 25 fps

계산 추정치 사용 Modal의 2026년 8월 23일 정가 측정된 생성 기능 동안 요청된 GPU, CPU, 및 메모리를 위해. 여기에는 저장소, 인터넷 전송 및 일회성 가중치 다운로드가 제외됩니다.

월간 칼럼은 연속 운영을 위해 30일 월 동안 GPU 전용 용량 추정치입니다. 파이프라인을 재설계하지 않고 측정된 구성을 실행할 것으로 예상되는 가장 저렴한 Modal GPU 클래스를 사용합니다: 중량 모델에는 H100, EchoMimic에는 L40S, FlashHead Lite에는 L4를 사용합니다. CPU, 메모리, 볼륨 및 네트워크 비용은 별도입니다. Modal는 0까지 확장될 수 있으므로 실제 월간 최소 비용은 $0이며, 사용량 기반 배포는 항상 켜져 있는 추정보다 훨씬 저렴할 수 있습니다.

이것들은 배포 측정값이며, 완벽하게 통제된 모델 품질 벤치마크가 아닙니다. 공식 파이프라인은 서로 다른 해상도를 생성하고 다른 단계 수를 사용합니다. 이것이 결과의 일부입니다: 각 프로젝트의 권장 실행 경로가 제공하는 내용을 보여줍니다.

생성된 동영상

Wan2.2-S2V-14B

Wan은 정체성과 배경을 안정적으로 유지하며, 얼굴 움직임을 절제했습니다. 또한 3.8초 출력에 대해 가장 느린 성공 실행으로 13분이 걸렸습니다.

Wan은 무거운 영화 옵션입니다. 우리는 H200 한 대에서 공식 40단계 음성-영상 경로를 실행했습니다. 이는 깨끗하고 안정적인 인물 화면을 생성했지만, 움직임은 보수적이었고 16 fps 출력은 25 fps 모델보다 덜 부드러웠습니다. Peak VRAM는 58,681 MiB에 도달했고, 추정 계산 비용은 LiveAvatar의 4배 이상이었습니다.

공식 설정 또한 추론을 시작하기 전에 여러 의존성 수정이 필요했으며, 여기에는 오디오 및 동영상 리더에서 사용되는 패키지가 포함되었습니다. 이러한 실패한 시도 중 어느 것도 노이즈 제거에 도달하지 못했으므로 위의 시간 측정에 포함되지 않았습니다.

LongCat-Video-Avatar 1.5

LongCat은 참조 이미지에 없는 손 제스처를 포함하여 가장 눈에 띄는 머리 및 몸 동작을 생성했습니다.

LongCat은 가장 표현력이 풍부한 이미지-동영상 결과로 남았다. 8단계 INT8 경로는 아바타를 인식할 수 있도록 유지하면서 머리, 얼굴, 상체 움직임을 추가했다. 몇몇 입 프레임은 약간 과장되어 보였지만, 정지 이미지를 보다 보수적인 모델보다 완전한 퍼포먼스처럼 느끼게 만들었다.

공식 예제는 두 개의 GPU를 사용합니다. 우리는 컨텍스트 병렬성을 1로 설정하여 하나의 H200에서 실행했습니다. 최대 메모리는 46,827 MiB였으며, 프레임워크 오버헤드를 포함하면 일반적인 48 GB 카드에서 여유가 거의 없는 수준입니다.

LiveAvatar

LiveAvatar는 가장 날카로운 헤비급 결과물과 가장 빠른 성공적인 H200 작업을 만들어냈습니다.

LiveAvatar는 큰 모델 중에서 날카로운 정체성, 설득력 있는 입 모양, 깜박임, 절제된 표정의 최상의 조합을 제공했습니다. 그 4단계 FP8 파이프라인은 181.44초 만에 완료되었으며, LongCat, FlashTalk, Wan보다 빠릅니다.

그 속도 때문에 그것이 작은 모델인 것은 아닙니다. 최대 61,401 MiB에 도달했으며 마지막 VAE 디코드를 위해 모델 오프로딩에 의존했습니다. 업스트림 단일-GPU 러너 또한 분산 프로세스 환경 변수를 가정하며, 문서화된 일회성 경로는 컴파일이 비활성화된 상태에서 가장 잘 작동합니다. 공식 설정을 일치시킨 후 실행은 안정적으로 완료되었습니다.

SoulX-FlashTalk 14B

FlashTalk은 시각적으로 강력하며 청크 단위의 연속 생성을 위해 설계되었지만, 14B 냉각 시작은 비용이 많이 들었습니다.

FlashTalk은 안정적인 얼굴과 명확한 입 움직임을 생성했습니다. 첫 번째 생성된 청크는 TorchInductor가 그래프를 컴파일했기 때문에 119.58초가 걸렸습니다. 이후 청크는 각각 약 3.75초가 소요되었습니다. 이는 331.93초의 냉각 작업이 실제 온기 있는 스트리밍 배포에서 느껴지는 것보다 더 나쁘게 보이게 합니다.

트레이드오프는 인프라입니다. 최고 VRAM 사용량은 57,805 MiB였고, 지속 캐시는 이번 테스트에서 가장 큰 51.07 GiB였습니다. 보다 공격적인 오프로드나 양자화를 추가하지 않는 한, 이는 80 GB급 GPU에 있어야 합니다.

EchoMimicV3-Flash

EchoMimic은 저렴한 L40S에서도 깔끔한 얼굴 정체성과 입 모션의 최적 실용적 균형을 제공했습니다.

EchoMimicV3-Flash는 가장 매력적인 배포 후보였습니다. 1.3B, 8단계 파이프라인은 깨끗한 25 fps 영상을 생성했고, 얼굴을 잘 유지했으며, H200 대신 L40S에서 실행되었습니다. 입과 몸 동작은 LongCat보다 더 미묘했지만, 산만한 전체 프레임 변화는 적었습니다.

저희 768-영역 공식 구성은 최고 33,726 MiB에 도달했습니다. 이 프로젝트는 더 낮은 메모리 모드를 광고하고 있으므로, 이는 저희 설정에서 관찰된 사용량일 뿐 이론적 최소치에 대한 주장과는 다릅니다. 22.28 GiB 캐시는 14B 모델 크기의 절반에도 미치지 못했습니다.

SoulX-FlashHead 1.3B Lite

FlashHead는 훨씬 작았지만, 좁은 자르기, 부드러운 정체성, 약한 입 움직임 때문에 가장 설득력이 없는 결과를 보였습니다.

FlashHead Lite는 최대 5,763 MiB에 불과하여 대형 생성기보다 한 단계 낮았습니다. FlashTalk과 마찬가지로 냉각 타이밍은 첫 실행 컴파일이 지배적이었습니다. 첫 번째 청크는 155.7초가 걸린 반면 이후 청크는 각각 약 0.19초가 소요되었습니다.

항상 따뜻한 스트리밍 서비스에는 흥미롭고, 여기서 사용된 L40S보다 훨씬 저렴한 하드웨어에서도 실행될 수 있음을 시사합니다. 그러나 정교한 랜딩 페이지 클립의 경우에는 EchoMimic의 더 강력한 시각적 결과를 선택할 것입니다.

LTX-2.3 DubIt에서 여기에 동영상이 없는 이유

LTX-2.3 DubIt 위의 오디오 중심 모델과 다릅니다. 이는 음성 참조 동영상과 대상 텍스트를 가져와서, 화자의 음성 정체성을 유지하려고 시도하면서 일치하는 음성과 입 모션을 생성합니다.

코드는 공개되어 있지만 공식 Lightricks/LTX-2.3-22b-IC-LoRA-DubIt 체크포인트가 Hugging Face에서 인증 오류를 반환했습니다. 테스트 환경에 승인된 토큰이 없었기 때문에 CPU 전용 가중치 준비 중에 GPU가 할당되기 전에 작업이 중단되었습니다.

우리는 공식 접근 문을 우회하는 제3자 미러를 대신 사용하지 않았습니다. 재현 가능성과 접근은 오픈 소스 릴리스를 평가하는 데 포함됩니다. 공식 접근이 승인되면 준비된 Modal 실행기는 동일한 테스트를 공개 참조 동영상과 대상 문장으로 수행할 수 있습니다.

각 모델은 음성을 보존하거나 선택하나요?

대부분의 아바타 모델은 목소리를 선택하거나 복제하지 않습니다. 제공된 오디오 파일을 애니메이션화한 다음, 동일한 오디오를 최종 영상에 배치합니다. 음성 생성은 별도의 텍스트-투-스피치 또는 음성 복제 단계입니다.

모델내장 음성 선택기제공된 음성을 사용합니다참조 음성에서 학습우리가 관찰한 것
Wan2.2-S2V-14B아니요아니요입력 오디오 보존됨, 상관계수 0.999897
LTX-2.3 DubIt음성 메뉴 없음아니요, 대상 텍스트가 필요합니다.예, 음성 참조 동영상에서 가능합니다.가중치가 제한되어 실행되지 않음
LongCat-Video-Avatar 1.5아니요아니요입력 오디오 보존됨, 상관계수 0.999562
LiveAvatar아니요아니요입력 오디오 보존됨, 상관계수 0.999897
SoulX-FlashTalk아니요아니요입력 오디오 보존됨, 상관계수 0.999751
EchoMimicV3-Flash아니요아니요입력 오디오 보존됨, 상관계수 0.999198
SoulX-FlashHead아니요아니요입력 오디오 보존됨, 상관계수 0.999751

작은 차이는 다른 합성 음성이 아니라 재샘플링과 AAC 인코딩에서 발생합니다. 다시 말해, 여섯 개의 성공적인 모델은 실제 녹음, 다른 곳에서 제작된 동의된 클론, 또는 어떤 TTS 음성이든 사용할 수 있습니다. 이들은 스스로 목소리의 정체성을 변경하지 않습니다.

DubIt은 예외입니다. 그것의 목적은 참조 동영상의 목소리를 닮은 새로운 목표 언어나 목표 스크립트 음성을 만드는 것입니다. 이는 더빙에 유용하지만, 출력 오디오는 원본의 파형 복사가 아닙니다.

조정할 가치가 있는 매개변수

기본값이 모든 얼굴이나 배포에 항상 최적의 설정은 아닙니다. 모델 코드를 변경하기 전에 테스트할 가장 영향력 있는 제어 요소는 다음과 같습니다:

모델가장 중요한 매개변수가능성 있는 절충
Wan2.2-S2V-14B노이즈 제거 단계, 안내 수준, 출력 영역, 시드, 선택적 포즈 동영상단계와 픽셀이 늘어나면 지연 시간이 급격히 증가하며, 자세 제어는 신체 동작을 향상시킬 수 있습니다
LTX-2.3 DubIt프롬프트, 대상 텍스트, 참조 동영상 길이, LoRA 강도, 시드강화된 컨디셔닝은 정체성을 개선할 수 있으나 자연스러운 변화를 줄일 수 있음
LongCat-Video-Avatar 1.58단계 증류 vs 전체 경로, 양자화, 가이드, 시드, 컨텍스트 병렬 처리전체 정밀도 또는 더 많은 단계는 디테일을 개선할 수 있지만 더 많은 메모리와 시간이 필요함
LiveAvatar샘플 단계, 출력 영역, FP8, 모델 오프로드, 컴파일컴파일은 반복 작업에 도움이 됩니다. 오프로드는 메모리를 절약하지만 전송을 추가합니다
SoulX-FlashTalk청크 크기, 중첩, 컴파일, 오디오 안내, 시드더 큰 청크는 연속성을 향상시킬 수 있지만 지연 시간과 메모리가 증가함
EchoMimicV3-Flash추론 단계, 가이드 스케일, 오디오 가이드, 샘플 크기, 시드높은 오디오 안내는 입 움직임을 강화할 수 있지만 과장될 수 있음
SoulX-FlashHeadLite와 전체 체크포인트, 자르기, 청크 길이, 컴파일전체 모델은 더 높은 메모리 비용으로 품질을 향상시켜야 합니다. 자르기은 구성에 큰 영향을 미칩니다

공정한 제품 테스트를 위해서는 같은 초상화와 내레이션을 기준으로 한 번에 하나의 변수만 조정하세요. 가장 유용한 첫 번째 접근은 EchoMimic을 위한 오디오 가이드, LiveAvatar를 위한 샘플 단계, FlashHead를 위한 자르기과 전체 체크포인트 품질, 그리고 두 SoulX 모델을 위한 충분히 준비된 두 번째 요청입니다.

하드웨어의 실제 모습

성공적인 여섯 개의 발전기는 세 가지 실용적인 인프라 그룹으로 나뉩니다:

  • 16세 미만 GB: SoulX-FlashHead Lite는 명확하게 맞는 유일하게 테스트된 전체 생성기입니다. 그 5.8 GB 피크는 12 GB 또는 16 GB 카드를 위한 여유를 남기지만, 소비자 하드웨어에서 레이턴시와 프레임워크 지원은 여전히 검증이 필요합니다.
  • 48 GB 클래스: EchoMimicV3-Flash는 L40S에서 33.7 GB로 원활하게 실행되었습니다. LongCat의 46.8 GB 할당은 편안한 48 GB 배포에는 한계에 가까웠습니다.
  • 80 GB 클래스: Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk, 및 LongCat는 H100 또는 H200급 GPU에서 GB 80 이상을 사용할 때 가장 안전합니다.

지속적인 저장도 중요합니다. FlashHead와 EchoMimic는 각각 약 7.6 및 22.3 GiB를 사용합니다. 대형 모델은 각각 약 45에서 51 GiB가 필요합니다. 이 문서에 나오는 모든 캐시를 한 번에 호스팅하면 컨테이너 이미지, 출력물, 임시 파일을 제외하고도 200 GiB 이상을 소비하게 됩니다.

Modal는 컨테이너가 0으로 확장될 수 있지만 모델 캐시는 영구 볼륨에 유지되므로 실험에 적합합니다. 이 테스트 후 모든 Modal 앱은 실행 중인 작업이 0으로 보고되었고 GPU는 활성 상태로 남아 있지 않았습니다.

오늘 우리가 사용할 것

모든 아바타 워크플로에 대한 단일 승자는 없습니다:

  • LiveAvatar를 사용하세요 고품질 이미지-동영상 변환이 가장 중요하고 80 GB GPU를 사용할 수 있을 때. 이는 저희 가장 선명한 대형 모델 결과를 만들었으며 H200 차가운 작업에서 가장 빠른 속도를 보였습니다.
  • EchoMimicV3-Flash 사용 최적의 실용적 품질과 인프라 균형을 위해. 더 저렴한 L40S에서 실행했고, 훨씬 작은 캐시를 사용했으며, 깨끗한 결과를 만들어냈습니다.
  • LongCat-Video-Avatar 1.5를 사용하세요 표현적인 몸동작이 보수적인 정체성 보존보다 더 중요할 때.
  • soulx-flashhead lite 사용 낮은 VRAM와 빠른 스트리밍 속도가 품질보다 더 중요할 때.

가장 놀라운 결과는 가장 큰 모델이 가장 좋아 보였다는 것이 아니었습니다. 가장 놀라운 것은 더 저렴한 GPU를 사용하고 모델 저장 용량이 절반도 안 되는 상태에서 EchoMimic이 얼마나 근접하게 작업을 수행했는지였습니다. 오픈소스 아바타 생성은 이제 실용적이지만, 서빙 전략은 체크포인트만큼이나 중요합니다.

x에서 공유