Chuyển đến bài viết
← Quay lại kỹ thuật

Chúng tôi đã thử nghiệm mọi mô hình avatar nguồn mở phổ biến được phát hành trong năm qua (tháng 8 năm 2026)

Minh họa bìa cho Chúng tôi đã thử nghiệm mọi mô hình avatar nguồn mở phổ biến được phát hành trong năm qua (Tháng 8 năm 2026)

TL;DR - Bảy mô hình avatar mã nguồn mở đáp ứng tiêu chí của chúng tôi: một bản phát hành công khai từ ngày 23 tháng 8 năm 2025 đến ngày 23 tháng 8 năm 2026, cộng thêm ít nhất 1.000 ngôi sao GitHub. Chúng tôi đã chạy tất cả. Sáu mô hình tạo ra video từ cùng một avatar công khai và lời thuyết minh nam. LTX-2.3 DubIt không thể khởi động vì điểm kiểm tra chính thức của nó yêu cầu sự phê duyệt từ Hugging Face. LiveAvatar cho kết quả nặng nề sắc nét nhất, EchoMimicV3-Flash mang lại cân bằng tốt nhất trên 48 GB GPU, và SoulX-FlashHead là nhẹ nhất với 5,8 GB của đỉnh VRAM.


Câu hỏi mà chúng tôi muốn trả lời

Các phiên bản avatar nói mã nguồn mở hiện nay ra mắt nhanh hơn hầu hết các bài so sánh có thể theo dõi chúng. Những tuyên bố như “thời gian thực,” “độ dài vô hạn,” và “giữ nguyên danh tính” khó so sánh vì các dự án sử dụng đầu vào, độ phân giải, GPU và định nghĩa về thời gian suy luận khác nhau.

Chúng tôi muốn có một câu trả lời cụ thể hơn và có thể tái hiện: những mô hình gần đây nào được cộng đồng chuyển động đáng kể có thể biến cùng một hình chân dung và phần thuyết minh thành video nói thuyết phục, và mỗi mô hình thực sự yêu cầu gì để chạy?

Đối với vòng này, một mô hình chỉ đủ điều kiện nếu nó đáp ứng cả hai quy tắc:

  • Mã và trọng số có thể sử dụng chính thức đầu tiên của nó được phát hành từ ngày 23 tháng 8 năm 2025 đến ngày 23 tháng 8 năm 2026.
  • Kho lưu trữ chính thức GitHub của nó có hơn 1.000 sao vào ngày 23 tháng 8 năm 2026.

Số sao của kho lưu trữ là thước đo về sự quan tâm, không phải chất lượng. Đối với Wan2.2 và LTX-2.3, số sao thuộc về dự án mẹ bởi vì khả năng avatar được phát hành bên trong kho lưu trữ đó.

Bảy mô hình đủ điều kiện

Mô hìnhSao GitHubPhát hành công khaiĐầu vào chính thứcKết quả kiểm tra
Wan2.2-S2V-14B17,26126 tháng 8, 2025Hình ảnh + âm thanh, video tạo dáng tùy chọnHoàn tất
LTX-2.3 DubIt9,226Ngày 11 tháng 5, 2026Video tham chiếu + văn bản mục tiêuBị chặn bởi điểm kiểm tra có kiểm soát
LongCat-Video-Avatar 1.57,515Ngày 21 tháng 5, 2026Hình ảnh + âm thanhHoàn tất
LiveAvatar2,3848 tháng 12, 2025Hình ảnh + âm thanhHoàn tất
SoulX-FlashTalk1,4768 tháng 1, 2026Hình ảnh + âm thanhHoàn tất
EchoMimicV3-Flash1,02522 tháng 1, 2026Hình ảnh + âm thanhHoàn tất
SoulX-FlashHead1,00612 tháng 2, 2026Hình ảnh + âm thanhHoàn tất

Các dự án phát hành trước thời hạn đã bị loại trừ bất kể số lượng sao.

Cùng avatar công khai, cùng giọng nam

Mỗi lần chạy thành công đều sử dụng khung này từ một clip im lặng, Video Pexels được tạo bởi AI qua AI25.Studio, dưới Giấy phép Pexels. Người tạo nguồn không ủng hộ sự so sánh này.

Khung tham chiếu công khai được cung cấp cho các mô hình avatar

Phần thuyết minh dài 3,63 giây sử dụng Daniel, giọng nam trung lập của hệ thống được bao gồm với macOS:

Các mô hình avatar mã nguồn mở hiện có thể tạo video thuyết phục từ một hình ảnh.

Chúng tôi đã triển khai các phiên bản cố định của các kho lưu trữ chính thức và trọng số trên Modal. Thời gian đo bắt đầu khi container tạo ra bắt đầu và kết thúc khi MP4 cuối cùng được trả về. Trọng số mô hình đã được lưu trong một volume Modal bền vững, vì vậy thời gian tải xuống ban đầu từ internet được loại trừ, nhưng việc tải mô hình, tiền xử lý, tạo, giải mã và ghép kết hợp được bao gồm.

Kết quả tổng quan

Mô hìnhGPU đã được thử nghiệmTối thiểu luôn bật GPU/thángĐỉnh điểm VRAMThời gianƯớc tính khả năng tính toánBộ nhớ đệm mô hìnhĐầu ra
Wan2.2-S2V-14BH200$2,843 (H100)58.681 MiB780.29s$1.369245,76 GiB512 x 896, 16 fps
LTX-2.3 DubItKhông cóKhông xác địnhKhông cóBị chặn trước GPU$0 GPUĐiểm kiểm soát giới hạnKhông có đầu ra
LongCat-Video-Avatar 1.5H200$2,843 (H100)46.827 MiB233.08s$0.401144.82 GB480 x 832, 25 khung hình/giây
LiveAvatarH200$2,843 (H100)61.401 MiB181.44s$0.318447,03 GiB384 x 704, 25 fps
SoulX-FlashTalkH200$2,843 (H100)57.805 MiB331.93s$0.582551,07 GiB416 x 720, 25 khung hình/giây
EchoMimicV3-FlashL40S$1,405 (L40S)33.726 MiB251.94s$0.212022,28 GiB480 x 848, 25 khung hình/giây
SoulX-FlashHead LiteL40S$575 (L4)5.763 MiB235.31s$0.19807,60 GiB512 x 512, 25 fps

Ước tính toán sử dụng Giá niêm yết ngày 23 tháng 8 năm 2026 của Modal cho GPU, CPU và bộ nhớ được yêu cầu trong hàm sinh đã đo. Chúng không bao gồm lưu trữ, chuyển internet và tải trọng lượng một lần.

Cột hàng tháng là ước tính công suất chỉ dành cho GPU để vận hành liên tục trong 30 ngày của tháng. Nó sử dụng lớp GPU Modal rẻ nhất mà chúng tôi dự kiến sẽ chạy cấu hình đã đo lường mà không cần thiết kế lại quy trình làm việc: H100 cho các mô hình nặng, L40S cho EchoMimic và L4 cho FlashHead Lite. CPU, bộ nhớ, dung lượng lưu trữ và phí mạng là chi phí thêm. Modal có thể giảm xuống bằng không, vì vậy mức tối thiểu hàng tháng thực tế là 0 USD và việc triển khai theo mức sử dụng có thể tốn ít hơn nhiều so với ước tính luôn bật.

Đây là các phép đo triển khai, không phải là một chuẩn chất lượng mô hình được kiểm soát hoàn hảo. Các quy trình công việc chính thức tạo ra các độ phân giải khác nhau và sử dụng số bước khác nhau. Điều đó là một phần của kết quả: nó cho thấy con đường chạy được khuyến nghị bởi mỗi dự án mang lại những gì.

Các video được tạo ra

Wan2.2-S2V-14B

Wan giữ được danh tính và nền ổn định, với chuyển động khuôn mặt hạn chế. Nó cũng là lần chạy thành công chậm nhất với thời gian 13 phút cho đầu ra 3,8 giây.

Wan là tùy chọn điện ảnh hạng nặng. Chúng tôi đã chạy đường dẫn nói thành video 40 bước chính thức trên một H200. Nó tạo ra một bức chân dung sạch sẽ, ổn định, nhưng chuyển động khá hạn chế và đầu ra 16 fps kém mượt hơn so với các mẫu 25 fps. Đỉnh VRAM đạt 58.681 MiB, và chi phí tính toán ước tính cao gấp hơn bốn lần so với LiveAvatar.

Bản cài đặt chính thức cũng yêu cầu một số sửa lỗi phụ thuộc trước khi bắt đầu suy luận, bao gồm các gói được sử dụng bởi trình đọc âm thanh và video của nó. Không có nỗ lực thất bại nào trong số đó đạt đến giai đoạn khử nhiễu, vì vậy chúng không được bao gồm trong thời gian đã nêu ở trên.

LongCat-Video-Avatar 1.5

LongCat tạo ra phần trình diễn đầu và cơ thể dễ thấy nhất, bao gồm một cử chỉ tay không xuất hiện trong hình tham chiếu.

LongCat vẫn là một kết quả hình ảnh-thành-video biểu cảm nhất. Con đường INT8 8 bước của nó giữ cho avatar vẫn dễ nhận diện trong khi thêm các chuyển động ở đầu, khuôn mặt và phần thân trên. Một vài khung miệng trông hơi phóng đại, nhưng điều đó khiến hình ảnh tĩnh cảm giác như một buổi trình diễn hoàn chỉnh hơn so với các mô hình bảo thủ hơn.

Ví dụ chính thức sử dụng hai GPU. Chúng tôi đã chạy nó trên một H200 bằng cách đặt song ngữ cảnh thành một. Nó đạt đỉnh ở 46,827 MiB, khá sát so với thẻ GB tiêu chuẩn 48 khi bao gồm chi phí khung làm việc.

LiveAvatar

LiveAvatar tạo ra kết quả nặng rõ nét nhất và công việc H200 thành công nhanh nhất.

LiveAvatar đã mang đến cho chúng tôi sự kết hợp tốt nhất giữa nhận dạng sắc nét, hình dạng miệng thuyết phục, chớp mắt và biểu cảm tiết chế trong số các mô hình lớn. Quy trình FP8 bốn bước của nó hoàn thành trong 181,44 giây, nhanh hơn LongCat, FlashTalk và Wan.

Tốc độ đó không đồng nghĩa với việc đó là một mô hình nhỏ. Nó đạt đỉnh ở 61,401 MiB và phụ thuộc vào việc offload mô hình để giải mã VAE cuối cùng. Trình chạy đơn GPU upstream cũng giả định các biến môi trường quy trình phân tán, và đường dẫn một lần được tài liệu hóa hoạt động tốt nhất khi biên dịch bị tắt. Sau khi khớp với các cài đặt chính thức đó, quá trình chạy đã hoàn tất một cách đáng tin cậy.

SoulX-FlashTalk 14B

FlashTalk có hình ảnh mạnh mẽ và được thiết kế để tạo liên tục theo khối, nhưng khởi động lạnh 14B của nó rất tốn kém.

FlashTalk tạo ra khuôn mặt ổn định với chuyển động miệng rõ ràng. Khối đầu tiên mất 119,58 giây vì TorchInductor biên dịch đồ thị của nó. Các khối sau mất khoảng 3,75 giây mỗi khối. Điều này khiến công việc khởi động lạnh 331,93 giây có vẻ tệ hơn so với cảm giác khi triển khai truyền phát đã ấm.

Sự đánh đổi là hạ tầng. Đỉnh điểm VRAM là 57,805 MiB, và bộ nhớ đệm lâu dài là lớn nhất trong bài kiểm tra này với 51,07 GiB. Nó thuộc loại GB-lớp GPU 80 trừ khi triển khai bổ sung tải xuống hoặc lượng tử hóa mạnh hơn.

EchoMimicV3-Flash

EchoMimic cung cấp sự cân bằng thực tế tốt nhất: danh tính rõ ràng và chuyển động môi trên một L40S rẻ hơn.

EchoMimicV3-Flash là ứng cử viên triển khai thuyết phục nhất. Quy trình 1,3 tỷ điểm, 8 bước của nó đã tạo ra video 25 fps sạch, giữ nguyên khuôn mặt tốt và chạy trên L40S thay vì H200. Chuyển động miệng và cơ thể tinh tế hơn so với LongCat, nhưng có ít thay đổi toàn khung hình gây xao nhãng hơn.

Cấu hình chính thức 768 khu vực của chúng tôi đạt đỉnh ở 33.726 MiB. Dự án quảng bá các chế độ bộ nhớ thấp hơn, vì vậy đây là mức sử dụng quan sát được theo cài đặt của chúng tôi, chứ không phải tuyên bố về mức tối thiểu lý thuyết. Bộ nhớ đệm 22,28 GiB của nó nhỏ hơn một nửa so với kích thước của các mô hình 14B.

SoulX-FlashHead 1.3B Lite

FlashHead nhỏ hơn đáng kể, nhưng cắt gần, danh tính mờ nhạt, và chuyển động miệng yếu khiến nó là kết quả kém thuyết phục nhất.

FlashHead Lite đạt đỉnh chỉ 5.763 MiB, thấp hơn một bậc so với các bộ tạo lớn. Giống như FlashTalk, thời gian khởi động lạnh của nó bị chi phối bởi biên dịch lần đầu. Khối đầu tiên mất 155,7 giây, trong khi các khối sau mất khoảng 0,19 giây mỗi khối.

Điều đó thú vị đối với một dịch vụ streaming luôn ấm áp và gợi ý rằng nó có thể chạy trên phần cứng rẻ hơn nhiều so với L40S được sử dụng ở đây. Tuy nhiên, đối với một clip trang đích có vẻ chuyên nghiệp, chúng tôi sẽ chọn kết quả hình ảnh mạnh mẽ hơn của EchoMimic.

Tại sao LTX-2.3 DubIt không có video ở đây

LTX-2.3 DubIt khác với các mô hình dựa trên âm thanh ở trên. Nó lấy một video tham chiếu có giọng nói và văn bản mục tiêu, sau đó tạo ra giọng nói và chuyển động môi khớp với nhau trong khi cố gắng giữ nét đặc trưng giọng của người nói.

Mã của nó là công khai, nhưng chính thức Lightricks/LTX-2.3-22b-IC-LoRA-DubIt checkpoint trả về lỗi ủy quyền từ Hugging Face. Chúng tôi không có token được phê duyệt trong môi trường thử nghiệm, vì vậy công việc đã dừng lại trong quá trình chuẩn bị trọng số chỉ CPU trước khi bất kỳ GPU nào được cấp phát.

Chúng tôi không thay thế bằng một mirror bên thứ ba để vượt qua cổng truy cập chính thức. Khả năng tái tạo và truy cập là một phần của việc đánh giá một phiên bản mã nguồn mở. Khi truy cập chính thức được phê duyệt, trình chạy Modal đã chuẩn bị có thể thực hiện cùng một bài kiểm tra với video tham chiếu công khai và câu mục tiêu.

Có phải mỗi mô hình giữ nguyên hay chọn giọng nói không?

Hầu hết các mô hình avatar không chọn hay nhân bản giọng nói. Chúng hoạt hình hóa một tệp âm thanh được cung cấp, sau đó đặt cùng âm thanh đó vào video cuối cùng. Tạo giọng nói là một bước riêng biệt trong chuyển văn bản thành giọng nói hoặc nhân bản giọng nói.

Mô hìnhBộ chọn giọng nói tích hợp sẵnSử dụng giọng nói được cung cấpHọc từ một giọng tham khảoNhững gì chúng tôi quan sát được
Wan2.2-S2V-14BKhôngKhôngGiữ nguyên âm thanh đầu vào, tương quan 0.999897
LTX-2.3 DubItKhông có menu giọng nóiKhông, nó cần văn bản mục tiêuVâng, từ video tham khảo có giọng nóiKhông thực hiện vì trọng số bị hạn chế
LongCat-Video-Avatar 1.5KhôngKhôngGiữ nguyên âm thanh đầu vào, tương quan 0.999562
LiveAvatarKhôngKhôngGiữ nguyên âm thanh đầu vào, tương quan 0.999897
SoulX-FlashTalkKhôngKhôngGiữ nguyên âm thanh đầu vào, tương quan 0.999751
EchoMimicV3-FlashKhôngKhôngGiữ nguyên âm thanh đầu vào, tương quan 0.999198
SoulX-FlashHeadKhôngKhôngGiữ nguyên âm thanh đầu vào, tương quan 0.999751

Những khác biệt nhỏ là do việc lấy mẫu lại và mã hóa AAC, không phải từ một người nói tổng hợp khác. Nói cách khác, sáu mô hình thành công có thể sử dụng một video thực tế được ghi lại, một bản sao có sự đồng ý được tạo ở nơi khác, hoặc bất kỳ giọng TTS nào. Chúng không thay đổi bản sắc giọng nói tự chúng.

DubIt là ngoại lệ. Mục đích của nó là tạo ra âm thanh bằng ngôn ngữ hoặc chữ viết mục tiêu giống giọng trong video tham chiếu. Điều đó làm cho nó hữu ích cho việc lồng tiếng, nhưng âm thanh đầu ra sẽ không phải là bản sao dạng sóng của bản gốc.

Các tham số đáng điều chỉnh

Các thiết lập mặc định không nhất thiết là tốt nhất cho mọi khuôn mặt hoặc môi trường triển khai. Đây là những điều khiển có tác động cao nhất cần thử trước khi thay đổi mã mô hình:

Mô hìnhCác tham số quan trọng nhấtSự đánh đổi có khả năng xảy ra
Wan2.2-S2V-14BCác bước lọc nhiễu, thang đo hướng dẫn, khu vực đầu ra, hạt giống, video tư thế tùy chọnNhiều bước và nhiều pixel làm tăng độ trễ một cách rõ rệt; điều khiển tư thế có thể cải thiện chuyển động cơ thể
LTX-2.3 DubItLời nhắc, văn bản mục tiêu, độ dài video tham chiếu, độ mạnh LoRA, seedĐiều kiện mạnh hơn có thể cải thiện nhận dạng nhưng giảm sự biến đổi tự nhiên
LongCat-Video-Avatar 1.58 bước tóm tắt so với toàn bộ quá trình, lượng tử hóa, hướng dẫn, hạt giống, song ngữ cảnhĐộ chính xác đầy đủ hoặc nhiều bước hơn có thể cải thiện chi tiết nhưng cần nhiều bộ nhớ và thời gian hơn
LiveAvatarCác bước mẫu, khu vực xuất, FP8, chuyển mô hình, biên dịchTổng hợp giúp các công việc lặp đi lặp lại; chuyển tải ngoài giúp tiết kiệm bộ nhớ nhưng thêm các lần truyền dữ liệu
SoulX-FlashTalkKích thước khối, chồng lấp, biên soạn, hướng dẫn âm thanh, hạt giốngCác đoạn lớn hơn có thể cải thiện tính liên tục nhưng làm tăng độ trễ và bộ nhớ
EchoMimicV3-FlashCác bước suy luận, thang mức hướng dẫn, hướng dẫn âm thanh, kích thước mẫu, hạt giốngHướng dẫn âm thanh cao hơn có thể làm mạnh chuyển động miệng nhưng có thể làm nó phóng đại
SoulX-FlashHeadLite so với full checkpoint, cắt xén, độ dài phân đoạn, biên dịchMô hình đầy đủ nên cải thiện chất lượng với chi phí bộ nhớ cao hơn; crop ảnh hưởng mạnh đến thành phần

Đối với một bài kiểm tra sản phẩm công bằng, điều chỉnh một biến tại một thời điểm so với cùng một chân dung và lời thuyết minh. Lần thử hữu ích đầu tiên nhất sẽ là hướng dẫn âm thanh cho EchoMimic, các bước mẫu cho LiveAvatar, chất lượng cắt và điểm kiểm tra đầy đủ cho FlashHead, và một yêu cầu thứ hai đã làm nóng cho cả hai mô hình SoulX.

Phần cứng thực sự trông như thế nào

Sáu bộ tạo thành công thuộc ba nhóm hạ tầng thực tiễn:

  • Dưới 16 GB: SoulX-FlashHead Lite là bộ tạo đầy đủ duy nhất đã được thử nghiệm và phù hợp rõ ràng. Đỉnh 5.8 GB của nó vẫn để chỗ cho một thẻ 12 GB hoặc 16 GB, mặc dù độ trễ và hỗ trợ khung vẫn cần được kiểm chứng trên phần cứng tiêu dùng.
  • 48 lớp GB: EchoMimicV3-Flash chạy thoải mái trên L40S ở mức 33,7 GB. Dung lượng 46,8 GB của LongCat quá gần giới hạn để triển khai 48 GB một cách thoải mái.
  • Lớp GB 80 Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk và LongCat an toàn nhất trên GPU lớp H100 hoặc H200 với 80 GB trở lên.

Bộ nhớ lưu trữ bền cũng quan trọng. FlashHead và EchoMimic sử dụng khoảng 7,6 và 22,3 GiB, tương ứng. Các mô hình lớn cần khoảng 45 đến 51 GiB mỗi mô hình. Lưu trữ mọi bộ nhớ đệm trong bài viết này cùng lúc sẽ tiêu thụ hơn 200 GiB trước khi có hình ảnh container, kết quả đầu ra và các tệp tạm thời.

Modal phù hợp cho các thử nghiệm vì các container có thể mở rộng về 0 trong khi bộ nhớ đệm mô hình vẫn giữ trên các ổ lưu trữ bền. Sau thử nghiệm này, mọi ứng dụng Modal báo cáo không có tác vụ đang chạy và không còn GPU hoạt động.

Những gì chúng tôi sẽ sử dụng ngày hôm nay

Không có một người chiến thắng duy nhất cho mọi quy trình làm việc avatar:

  • Sử dụng LiveAvatar khi chất lượng hình ảnh-đến-video quan trọng nhất và có sẵn một 80 GB GPU. Nó đã tạo ra kết quả mô hình lớn sắc nét nhất của chúng tôi và có công việc H200 lạnh nhanh nhất.
  • Sử dụng EchoMimicV3-Flash cho sự cân bằng tốt nhất giữa chất lượng thực tế và hạ tầng. Nó đã chạy trên một L40S rẻ hơn, sử dụng bộ nhớ đệm nhỏ hơn nhiều, và tạo ra kết quả sạch sẽ.
  • Sử dụng LongCat-Video-Avatar 1.5 khi chuyển động cơ thể biểu cảm quan trọng hơn việc giữ nguyên danh tính một cách thận trọng.
  • Sử dụng soulx-flashhead lite khi tốc độ truyền ấm và VRAM thấp quan trọng hơn tinh chỉnh chuyên nghiệp.

Kết quả đáng ngạc nhiên nhất không phải là mô hình lớn nhất trông tốt nhất. Mà là mức độ gần gũi mà EchoMimic đạt được trong khi sử dụng một GPU rẻ hơn và bộ nhớ mô hình chưa đầy một nửa. Việc tạo avatar mã nguồn mở giờ đây đã khả thi, nhưng chiến lược phục vụ vẫn quan trọng không kém điểm kiểm tra.

Chia sẻ trên x