TL;DR - Bảy mô hình avatar mã nguồn mở đáp ứng tiêu chí của chúng tôi: một bản phát hành công khai từ ngày 23 tháng 8 năm 2025 đến ngày 23 tháng 8 năm 2026, cộng thêm ít nhất 1.000 ngôi sao GitHub. Chúng tôi đã chạy tất cả. Sáu mô hình tạo ra video từ cùng một avatar công khai và lời thuyết minh nam. LTX-2.3 DubIt không thể khởi động vì điểm kiểm tra chính thức của nó yêu cầu sự phê duyệt từ Hugging Face. LiveAvatar cho kết quả nặng nề sắc nét nhất, EchoMimicV3-Flash mang lại cân bằng tốt nhất trên 48 GB GPU, và SoulX-FlashHead là nhẹ nhất với 5,8 GB của đỉnh VRAM.
Câu hỏi mà chúng tôi muốn trả lời
Các phiên bản avatar nói mã nguồn mở hiện nay ra mắt nhanh hơn hầu hết các bài so sánh có thể theo dõi chúng. Những tuyên bố như “thời gian thực,” “độ dài vô hạn,” và “giữ nguyên danh tính” khó so sánh vì các dự án sử dụng đầu vào, độ phân giải, GPU và định nghĩa về thời gian suy luận khác nhau.
Chúng tôi muốn có một câu trả lời cụ thể hơn và có thể tái hiện: những mô hình gần đây nào được cộng đồng chuyển động đáng kể có thể biến cùng một hình chân dung và phần thuyết minh thành video nói thuyết phục, và mỗi mô hình thực sự yêu cầu gì để chạy?
Đối với vòng này, một mô hình chỉ đủ điều kiện nếu nó đáp ứng cả hai quy tắc:
- Mã và trọng số có thể sử dụng chính thức đầu tiên của nó được phát hành từ ngày 23 tháng 8 năm 2025 đến ngày 23 tháng 8 năm 2026.
- Kho lưu trữ chính thức GitHub của nó có hơn 1.000 sao vào ngày 23 tháng 8 năm 2026.
Số sao của kho lưu trữ là thước đo về sự quan tâm, không phải chất lượng. Đối với Wan2.2 và LTX-2.3, số sao thuộc về dự án mẹ bởi vì khả năng avatar được phát hành bên trong kho lưu trữ đó.
Bảy mô hình đủ điều kiện
| Mô hình | Sao GitHub | Phát hành công khai | Đầu vào chính thức | Kết quả kiểm tra |
|---|---|---|---|---|
| Wan2.2-S2V-14B | 17,261 | 26 tháng 8, 2025 | Hình ảnh + âm thanh, video tạo dáng tùy chọn | Hoàn tất |
| LTX-2.3 DubIt | 9,226 | Ngày 11 tháng 5, 2026 | Video tham chiếu + văn bản mục tiêu | Bị chặn bởi điểm kiểm tra có kiểm soát |
| LongCat-Video-Avatar 1.5 | 7,515 | Ngày 21 tháng 5, 2026 | Hình ảnh + âm thanh | Hoàn tất |
| LiveAvatar | 2,384 | 8 tháng 12, 2025 | Hình ảnh + âm thanh | Hoàn tất |
| SoulX-FlashTalk | 1,476 | 8 tháng 1, 2026 | Hình ảnh + âm thanh | Hoàn tất |
| EchoMimicV3-Flash | 1,025 | 22 tháng 1, 2026 | Hình ảnh + âm thanh | Hoàn tất |
| SoulX-FlashHead | 1,006 | 12 tháng 2, 2026 | Hình ảnh + âm thanh | Hoàn tất |
Các dự án phát hành trước thời hạn đã bị loại trừ bất kể số lượng sao.
Cùng avatar công khai, cùng giọng nam
Mỗi lần chạy thành công đều sử dụng khung này từ một clip im lặng, Video Pexels được tạo bởi AI qua AI25.Studio, dưới Giấy phép Pexels. Người tạo nguồn không ủng hộ sự so sánh này.
![]()
Phần thuyết minh dài 3,63 giây sử dụng Daniel, giọng nam trung lập của hệ thống được bao gồm với macOS:
Các mô hình avatar mã nguồn mở hiện có thể tạo video thuyết phục từ một hình ảnh.
Chúng tôi đã triển khai các phiên bản cố định của các kho lưu trữ chính thức và trọng số trên Modal. Thời gian đo bắt đầu khi container tạo ra bắt đầu và kết thúc khi MP4 cuối cùng được trả về. Trọng số mô hình đã được lưu trong một volume Modal bền vững, vì vậy thời gian tải xuống ban đầu từ internet được loại trừ, nhưng việc tải mô hình, tiền xử lý, tạo, giải mã và ghép kết hợp được bao gồm.
Kết quả tổng quan
| Mô hình | GPU đã được thử nghiệm | Tối thiểu luôn bật GPU/tháng | Đỉnh điểm VRAM | Thời gian | Ước tính khả năng tính toán | Bộ nhớ đệm mô hình | Đầu ra |
|---|---|---|---|---|---|---|---|
| Wan2.2-S2V-14B | H200 | $2,843 (H100) | 58.681 MiB | 780.29s | $1.3692 | 45,76 GiB | 512 x 896, 16 fps |
| LTX-2.3 DubIt | Không có | Không xác định | Không có | Bị chặn trước GPU | $0 GPU | Điểm kiểm soát giới hạn | Không có đầu ra |
| LongCat-Video-Avatar 1.5 | H200 | $2,843 (H100) | 46.827 MiB | 233.08s | $0.4011 | 44.82 GB | 480 x 832, 25 khung hình/giây |
| LiveAvatar | H200 | $2,843 (H100) | 61.401 MiB | 181.44s | $0.3184 | 47,03 GiB | 384 x 704, 25 fps |
| SoulX-FlashTalk | H200 | $2,843 (H100) | 57.805 MiB | 331.93s | $0.5825 | 51,07 GiB | 416 x 720, 25 khung hình/giây |
| EchoMimicV3-Flash | L40S | $1,405 (L40S) | 33.726 MiB | 251.94s | $0.2120 | 22,28 GiB | 480 x 848, 25 khung hình/giây |
| SoulX-FlashHead Lite | L40S | $575 (L4) | 5.763 MiB | 235.31s | $0.1980 | 7,60 GiB | 512 x 512, 25 fps |
Ước tính toán sử dụng Giá niêm yết ngày 23 tháng 8 năm 2026 của Modal cho GPU, CPU và bộ nhớ được yêu cầu trong hàm sinh đã đo. Chúng không bao gồm lưu trữ, chuyển internet và tải trọng lượng một lần.
Cột hàng tháng là ước tính công suất chỉ dành cho GPU để vận hành liên tục trong 30 ngày của tháng. Nó sử dụng lớp GPU Modal rẻ nhất mà chúng tôi dự kiến sẽ chạy cấu hình đã đo lường mà không cần thiết kế lại quy trình làm việc: H100 cho các mô hình nặng, L40S cho EchoMimic và L4 cho FlashHead Lite. CPU, bộ nhớ, dung lượng lưu trữ và phí mạng là chi phí thêm. Modal có thể giảm xuống bằng không, vì vậy mức tối thiểu hàng tháng thực tế là 0 USD và việc triển khai theo mức sử dụng có thể tốn ít hơn nhiều so với ước tính luôn bật.
Đây là các phép đo triển khai, không phải là một chuẩn chất lượng mô hình được kiểm soát hoàn hảo. Các quy trình công việc chính thức tạo ra các độ phân giải khác nhau và sử dụng số bước khác nhau. Điều đó là một phần của kết quả: nó cho thấy con đường chạy được khuyến nghị bởi mỗi dự án mang lại những gì.
Các video được tạo ra
Wan2.2-S2V-14B
Wan giữ được danh tính và nền ổn định, với chuyển động khuôn mặt hạn chế. Nó cũng là lần chạy thành công chậm nhất với thời gian 13 phút cho đầu ra 3,8 giây.
Wan là tùy chọn điện ảnh hạng nặng. Chúng tôi đã chạy đường dẫn nói thành video 40 bước chính thức trên một H200. Nó tạo ra một bức chân dung sạch sẽ, ổn định, nhưng chuyển động khá hạn chế và đầu ra 16 fps kém mượt hơn so với các mẫu 25 fps. Đỉnh VRAM đạt 58.681 MiB, và chi phí tính toán ước tính cao gấp hơn bốn lần so với LiveAvatar.
Bản cài đặt chính thức cũng yêu cầu một số sửa lỗi phụ thuộc trước khi bắt đầu suy luận, bao gồm các gói được sử dụng bởi trình đọc âm thanh và video của nó. Không có nỗ lực thất bại nào trong số đó đạt đến giai đoạn khử nhiễu, vì vậy chúng không được bao gồm trong thời gian đã nêu ở trên.
LongCat-Video-Avatar 1.5
LongCat tạo ra phần trình diễn đầu và cơ thể dễ thấy nhất, bao gồm một cử chỉ tay không xuất hiện trong hình tham chiếu.
LongCat vẫn là một kết quả hình ảnh-thành-video biểu cảm nhất. Con đường INT8 8 bước của nó giữ cho avatar vẫn dễ nhận diện trong khi thêm các chuyển động ở đầu, khuôn mặt và phần thân trên. Một vài khung miệng trông hơi phóng đại, nhưng điều đó khiến hình ảnh tĩnh cảm giác như một buổi trình diễn hoàn chỉnh hơn so với các mô hình bảo thủ hơn.
Ví dụ chính thức sử dụng hai GPU. Chúng tôi đã chạy nó trên một H200 bằng cách đặt song ngữ cảnh thành một. Nó đạt đỉnh ở 46,827 MiB, khá sát so với thẻ GB tiêu chuẩn 48 khi bao gồm chi phí khung làm việc.
LiveAvatar
LiveAvatar tạo ra kết quả nặng rõ nét nhất và công việc H200 thành công nhanh nhất.
LiveAvatar đã mang đến cho chúng tôi sự kết hợp tốt nhất giữa nhận dạng sắc nét, hình dạng miệng thuyết phục, chớp mắt và biểu cảm tiết chế trong số các mô hình lớn. Quy trình FP8 bốn bước của nó hoàn thành trong 181,44 giây, nhanh hơn LongCat, FlashTalk và Wan.
Tốc độ đó không đồng nghĩa với việc đó là một mô hình nhỏ. Nó đạt đỉnh ở 61,401 MiB và phụ thuộc vào việc offload mô hình để giải mã VAE cuối cùng. Trình chạy đơn GPU upstream cũng giả định các biến môi trường quy trình phân tán, và đường dẫn một lần được tài liệu hóa hoạt động tốt nhất khi biên dịch bị tắt. Sau khi khớp với các cài đặt chính thức đó, quá trình chạy đã hoàn tất một cách đáng tin cậy.
SoulX-FlashTalk 14B
FlashTalk có hình ảnh mạnh mẽ và được thiết kế để tạo liên tục theo khối, nhưng khởi động lạnh 14B của nó rất tốn kém.
FlashTalk tạo ra khuôn mặt ổn định với chuyển động miệng rõ ràng. Khối đầu tiên mất 119,58 giây vì TorchInductor biên dịch đồ thị của nó. Các khối sau mất khoảng 3,75 giây mỗi khối. Điều này khiến công việc khởi động lạnh 331,93 giây có vẻ tệ hơn so với cảm giác khi triển khai truyền phát đã ấm.
Sự đánh đổi là hạ tầng. Đỉnh điểm VRAM là 57,805 MiB, và bộ nhớ đệm lâu dài là lớn nhất trong bài kiểm tra này với 51,07 GiB. Nó thuộc loại GB-lớp GPU 80 trừ khi triển khai bổ sung tải xuống hoặc lượng tử hóa mạnh hơn.
EchoMimicV3-Flash
EchoMimic cung cấp sự cân bằng thực tế tốt nhất: danh tính rõ ràng và chuyển động môi trên một L40S rẻ hơn.
EchoMimicV3-Flash là ứng cử viên triển khai thuyết phục nhất. Quy trình 1,3 tỷ điểm, 8 bước của nó đã tạo ra video 25 fps sạch, giữ nguyên khuôn mặt tốt và chạy trên L40S thay vì H200. Chuyển động miệng và cơ thể tinh tế hơn so với LongCat, nhưng có ít thay đổi toàn khung hình gây xao nhãng hơn.
Cấu hình chính thức 768 khu vực của chúng tôi đạt đỉnh ở 33.726 MiB. Dự án quảng bá các chế độ bộ nhớ thấp hơn, vì vậy đây là mức sử dụng quan sát được theo cài đặt của chúng tôi, chứ không phải tuyên bố về mức tối thiểu lý thuyết. Bộ nhớ đệm 22,28 GiB của nó nhỏ hơn một nửa so với kích thước của các mô hình 14B.
SoulX-FlashHead 1.3B Lite
FlashHead nhỏ hơn đáng kể, nhưng cắt gần, danh tính mờ nhạt, và chuyển động miệng yếu khiến nó là kết quả kém thuyết phục nhất.
FlashHead Lite đạt đỉnh chỉ 5.763 MiB, thấp hơn một bậc so với các bộ tạo lớn. Giống như FlashTalk, thời gian khởi động lạnh của nó bị chi phối bởi biên dịch lần đầu. Khối đầu tiên mất 155,7 giây, trong khi các khối sau mất khoảng 0,19 giây mỗi khối.
Điều đó thú vị đối với một dịch vụ streaming luôn ấm áp và gợi ý rằng nó có thể chạy trên phần cứng rẻ hơn nhiều so với L40S được sử dụng ở đây. Tuy nhiên, đối với một clip trang đích có vẻ chuyên nghiệp, chúng tôi sẽ chọn kết quả hình ảnh mạnh mẽ hơn của EchoMimic.
Tại sao LTX-2.3 DubIt không có video ở đây
LTX-2.3 DubIt khác với các mô hình dựa trên âm thanh ở trên. Nó lấy một video tham chiếu có giọng nói và văn bản mục tiêu, sau đó tạo ra giọng nói và chuyển động môi khớp với nhau trong khi cố gắng giữ nét đặc trưng giọng của người nói.
Mã của nó là công khai, nhưng chính thức Lightricks/LTX-2.3-22b-IC-LoRA-DubIt checkpoint trả về lỗi ủy quyền từ Hugging Face. Chúng tôi không có token được phê duyệt trong môi trường thử nghiệm, vì vậy công việc đã dừng lại trong quá trình chuẩn bị trọng số chỉ CPU trước khi bất kỳ GPU nào được cấp phát.
Chúng tôi không thay thế bằng một mirror bên thứ ba để vượt qua cổng truy cập chính thức. Khả năng tái tạo và truy cập là một phần của việc đánh giá một phiên bản mã nguồn mở. Khi truy cập chính thức được phê duyệt, trình chạy Modal đã chuẩn bị có thể thực hiện cùng một bài kiểm tra với video tham chiếu công khai và câu mục tiêu.
Có phải mỗi mô hình giữ nguyên hay chọn giọng nói không?
Hầu hết các mô hình avatar không chọn hay nhân bản giọng nói. Chúng hoạt hình hóa một tệp âm thanh được cung cấp, sau đó đặt cùng âm thanh đó vào video cuối cùng. Tạo giọng nói là một bước riêng biệt trong chuyển văn bản thành giọng nói hoặc nhân bản giọng nói.
| Mô hình | Bộ chọn giọng nói tích hợp sẵn | Sử dụng giọng nói được cung cấp | Học từ một giọng tham khảo | Những gì chúng tôi quan sát được |
|---|---|---|---|---|
| Wan2.2-S2V-14B | Không | Có | Không | Giữ nguyên âm thanh đầu vào, tương quan 0.999897 |
| LTX-2.3 DubIt | Không có menu giọng nói | Không, nó cần văn bản mục tiêu | Vâng, từ video tham khảo có giọng nói | Không thực hiện vì trọng số bị hạn chế |
| LongCat-Video-Avatar 1.5 | Không | Có | Không | Giữ nguyên âm thanh đầu vào, tương quan 0.999562 |
| LiveAvatar | Không | Có | Không | Giữ nguyên âm thanh đầu vào, tương quan 0.999897 |
| SoulX-FlashTalk | Không | Có | Không | Giữ nguyên âm thanh đầu vào, tương quan 0.999751 |
| EchoMimicV3-Flash | Không | Có | Không | Giữ nguyên âm thanh đầu vào, tương quan 0.999198 |
| SoulX-FlashHead | Không | Có | Không | Giữ nguyên âm thanh đầu vào, tương quan 0.999751 |
Những khác biệt nhỏ là do việc lấy mẫu lại và mã hóa AAC, không phải từ một người nói tổng hợp khác. Nói cách khác, sáu mô hình thành công có thể sử dụng một video thực tế được ghi lại, một bản sao có sự đồng ý được tạo ở nơi khác, hoặc bất kỳ giọng TTS nào. Chúng không thay đổi bản sắc giọng nói tự chúng.
DubIt là ngoại lệ. Mục đích của nó là tạo ra âm thanh bằng ngôn ngữ hoặc chữ viết mục tiêu giống giọng trong video tham chiếu. Điều đó làm cho nó hữu ích cho việc lồng tiếng, nhưng âm thanh đầu ra sẽ không phải là bản sao dạng sóng của bản gốc.
Các tham số đáng điều chỉnh
Các thiết lập mặc định không nhất thiết là tốt nhất cho mọi khuôn mặt hoặc môi trường triển khai. Đây là những điều khiển có tác động cao nhất cần thử trước khi thay đổi mã mô hình:
| Mô hình | Các tham số quan trọng nhất | Sự đánh đổi có khả năng xảy ra |
|---|---|---|
| Wan2.2-S2V-14B | Các bước lọc nhiễu, thang đo hướng dẫn, khu vực đầu ra, hạt giống, video tư thế tùy chọn | Nhiều bước và nhiều pixel làm tăng độ trễ một cách rõ rệt; điều khiển tư thế có thể cải thiện chuyển động cơ thể |
| LTX-2.3 DubIt | Lời nhắc, văn bản mục tiêu, độ dài video tham chiếu, độ mạnh LoRA, seed | Điều kiện mạnh hơn có thể cải thiện nhận dạng nhưng giảm sự biến đổi tự nhiên |
| LongCat-Video-Avatar 1.5 | 8 bước tóm tắt so với toàn bộ quá trình, lượng tử hóa, hướng dẫn, hạt giống, song ngữ cảnh | Độ chính xác đầy đủ hoặc nhiều bước hơn có thể cải thiện chi tiết nhưng cần nhiều bộ nhớ và thời gian hơn |
| LiveAvatar | Các bước mẫu, khu vực xuất, FP8, chuyển mô hình, biên dịch | Tổng hợp giúp các công việc lặp đi lặp lại; chuyển tải ngoài giúp tiết kiệm bộ nhớ nhưng thêm các lần truyền dữ liệu |
| SoulX-FlashTalk | Kích thước khối, chồng lấp, biên soạn, hướng dẫn âm thanh, hạt giống | Các đoạn lớn hơn có thể cải thiện tính liên tục nhưng làm tăng độ trễ và bộ nhớ |
| EchoMimicV3-Flash | Các bước suy luận, thang mức hướng dẫn, hướng dẫn âm thanh, kích thước mẫu, hạt giống | Hướng dẫn âm thanh cao hơn có thể làm mạnh chuyển động miệng nhưng có thể làm nó phóng đại |
| SoulX-FlashHead | Lite so với full checkpoint, cắt xén, độ dài phân đoạn, biên dịch | Mô hình đầy đủ nên cải thiện chất lượng với chi phí bộ nhớ cao hơn; crop ảnh hưởng mạnh đến thành phần |
Đối với một bài kiểm tra sản phẩm công bằng, điều chỉnh một biến tại một thời điểm so với cùng một chân dung và lời thuyết minh. Lần thử hữu ích đầu tiên nhất sẽ là hướng dẫn âm thanh cho EchoMimic, các bước mẫu cho LiveAvatar, chất lượng cắt và điểm kiểm tra đầy đủ cho FlashHead, và một yêu cầu thứ hai đã làm nóng cho cả hai mô hình SoulX.
Phần cứng thực sự trông như thế nào
Sáu bộ tạo thành công thuộc ba nhóm hạ tầng thực tiễn:
- Dưới 16 GB: SoulX-FlashHead Lite là bộ tạo đầy đủ duy nhất đã được thử nghiệm và phù hợp rõ ràng. Đỉnh 5.8 GB của nó vẫn để chỗ cho một thẻ 12 GB hoặc 16 GB, mặc dù độ trễ và hỗ trợ khung vẫn cần được kiểm chứng trên phần cứng tiêu dùng.
- 48 lớp GB: EchoMimicV3-Flash chạy thoải mái trên L40S ở mức 33,7 GB. Dung lượng 46,8 GB của LongCat quá gần giới hạn để triển khai 48 GB một cách thoải mái.
- Lớp GB 80 Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk và LongCat an toàn nhất trên GPU lớp H100 hoặc H200 với 80 GB trở lên.
Bộ nhớ lưu trữ bền cũng quan trọng. FlashHead và EchoMimic sử dụng khoảng 7,6 và 22,3 GiB, tương ứng. Các mô hình lớn cần khoảng 45 đến 51 GiB mỗi mô hình. Lưu trữ mọi bộ nhớ đệm trong bài viết này cùng lúc sẽ tiêu thụ hơn 200 GiB trước khi có hình ảnh container, kết quả đầu ra và các tệp tạm thời.
Modal phù hợp cho các thử nghiệm vì các container có thể mở rộng về 0 trong khi bộ nhớ đệm mô hình vẫn giữ trên các ổ lưu trữ bền. Sau thử nghiệm này, mọi ứng dụng Modal báo cáo không có tác vụ đang chạy và không còn GPU hoạt động.
Những gì chúng tôi sẽ sử dụng ngày hôm nay
Không có một người chiến thắng duy nhất cho mọi quy trình làm việc avatar:
- Sử dụng LiveAvatar khi chất lượng hình ảnh-đến-video quan trọng nhất và có sẵn một 80 GB GPU. Nó đã tạo ra kết quả mô hình lớn sắc nét nhất của chúng tôi và có công việc H200 lạnh nhanh nhất.
- Sử dụng EchoMimicV3-Flash cho sự cân bằng tốt nhất giữa chất lượng thực tế và hạ tầng. Nó đã chạy trên một L40S rẻ hơn, sử dụng bộ nhớ đệm nhỏ hơn nhiều, và tạo ra kết quả sạch sẽ.
- Sử dụng LongCat-Video-Avatar 1.5 khi chuyển động cơ thể biểu cảm quan trọng hơn việc giữ nguyên danh tính một cách thận trọng.
- Sử dụng soulx-flashhead lite khi tốc độ truyền ấm và VRAM thấp quan trọng hơn tinh chỉnh chuyên nghiệp.
Kết quả đáng ngạc nhiên nhất không phải là mô hình lớn nhất trông tốt nhất. Mà là mức độ gần gũi mà EchoMimic đạt được trong khi sử dụng một GPU rẻ hơn và bộ nhớ mô hình chưa đầy một nửa. Việc tạo avatar mã nguồn mở giờ đây đã khả thi, nhưng chiến lược phục vụ vẫn quan trọng không kém điểm kiểm tra.
