跳至文章
← 返回工程

我們測試了過去一年(2026 年 8 月)發布的每個流行開源虛擬人像模型。

《我們測試了過去一年發布的每個流行開源虛擬人像模型(2026 年 8 月)》封面插圖

TL;DR - 七個開源虛擬人像模型滿足我們的篩選標準:公開發布日期在 2025 年 8 月 23 日至 2026 年 8 月 23 日之間,並且至少有 1,000 個 GitHub 星數。我們執行了每一個模型。六個模型產生了相同公開虛擬人像和男性旁白的影片。LTX-2.3 DubIt 無法啟動,因為其官方檢查點需要 Hugging Face 核准。LiveAvatar 產生了最清晰的重量級結果,EchoMimicV3-Flash 在 48 GB GPU 上提供了最佳平衡,而 SoulX-FlashHead 的峰值 VRAM 僅為 5.8 GB,是最輕的。


我們想要回答的問題

開源會說話的虛擬形象發布更新的速度現在比大多數對比貼文跟蹤它們的速度還快。諸如「即時」、「無限長度」和「保持身份」等說法難以比較,因為各專案使用的輸入、解析度、GPU 和推理時間的定義不同。

我們希望得到一個更狹窄、可重複的答案:哪些近期有實際社群採納的模型可以將相同的肖像和旁白轉換成令人信服的講話影片,每個模型實際上執行需要什麼?

在這一輪中,只有同時滿足以下兩個規則的模型才被視為合格:

  • 它的首個官方可用程式碼和權重於 2025 年 8 月 23 日至 2026 年 8 月 23 日發布。
  • 截至 2026 年 8 月 23 日,它的官方 GitHub 儲存庫擁有超過 1000 顆星。

儲存庫的顆星數量是關注度的衡量,而非品質。對於 Wan2.2 和 LTX-2.3,顆星數量屬於父專案,因為虛擬人像功能包含在該儲存庫中。

七種合格模型

模型GitHub 星數公開發布官方輸入。測試結果
Wan2.2-S2V-14B17,2612025 年 8 月 26 日圖片 + 音訊,可選姿勢影片已完成
LTX-2.3 DubIt9,2262026 年 5 月 11 日參考影片 + 目標文字。被受限檢查點阻止
LongCat-Video-Avatar 1.57,5152026 年 5 月 21 日圖片 + 音訊已完成
LiveAvatar2,3842025 年 12 月 8 日圖片 + 音訊已完成
SoulX-FlashTalk1,4762026 年 1 月 8 日圖片 + 音訊已完成
EchoMimicV3-Flash1,0252026 年 1 月 22 日圖片 + 音訊已完成
SoulX-FlashHead1,0062026 年 2 月 2 日圖片 + 音訊已完成

截止日期之前發布的專案都被排除在外,無論其星級多少。

相同的公開虛擬人像,相同的男性語音

每一次成功的操作都使用了這個來自無聲的影格, AI 產生的 Pexels 影片,由 AI25.Studio 製作,在 Pexels 許可。源創作者不支援此比較。

提供給虛擬形象模型的公開參考影格

這段 3.63 秒的旁白使用了 Daniel,一種 macOS 附帶的中性男性系統語音:

開源虛擬人像模型現在可以從一張圖片產生逼真的影片。

我們部署了官方儲存庫和權重的固定版本。 Modal。測量時間從產生容器啟動時開始,到返回最終 MP4 時結束。模型權重已儲存在持久的 Modal 卷中,因此不包括初始的網際網路下載時間,但包括模型載入、預處理、產生、解碼和複用。

一目瞭然的結果

模型GPU 已測試最低。持續開啟 GPU/月高峰 VRAM時間預計計算模型快取輸出
Wan2.2-S2V-14BH200$2,843 (H100)58,681 MiB780.29 秒$1.369245.76 GiB512 x 896,16 fps
LTX-2.3 DubIt未知在 GPU 之前被阻止$0 GPU檢查點受限無輸出
LongCat-Video-Avatar 1.5H200$2,843 (H100)46,827 MiB233.08 秒$0.401144.82 GB480 x 832,25 影格/秒
LiveAvatarH200$2,843 (H100)61,401 MiB181.44 秒$0.318447.03 GiB384 x 704, 25 fps
SoulX-FlashTalkH200$2,843 (H100)57,805 MiB331.93 秒$0.582551.07 GiB416 x 720,25 影格/秒
EchoMimicV3-FlashL40S$1,405(L40S)33,726 MiB251.94 秒$0.212022.28 吉比位元組480 x 848,25 影格/秒
SoulX-FlashHead LiteL40S$575 (L4)5,763 MiB235.31 秒$0.19807.60 吉位元組512 x 512,25 fps

計算估算使用 Modal 2026 年 8 月 23 日的標價 用於所請求的 GPU、CPU 和在測量產生函式期間的記憶體。它們不包括儲存、網際網路傳輸和一次性權重下載。

每月欄目是針對連續執行 30 天的 GPU 專用容量估算。它使用我們預計在不重新設計管道的情況下執行測量配置的最便宜的 Modal GPU 類:重型模型使用 H100,EchoMimic 使用 L40S,FlashHead Lite 使用 L4。CPU、記憶體、卷和網路費用需額外支付。Modal 可以縮放到零,因此實際每月最低費用為 $0,而按使用量計費的部署可能比始終開啟的估算費用低得多。

這些是部署測量,而不是完美控制的模型品質基準。官方流程會產生不同的解析度並使用不同數量的步驟。這也是結果的一部分:它顯示了每個專案推薦的可執行路徑所提供的內容。

產生的影片

Wan2.2-S2V-14B

Wan 保持了身份和背景的穩定,面部動作剋制。這也是成功執行中速度最慢的,一段 3.8 秒的輸出用了 13 分鐘。

Wan 是重量級的電影選項。我們在一臺 H200 上執行了官方的 40 步語音到影片流程。它產生了乾淨、穩定的虛擬人像,但動作較為保守,16 fps 的輸出比 25 fps 的模型流暢性差。VRAM 峰值達到 58,681 MiB,估算的計算成本是 LiveAvatar 的四倍多。

官方設定還要求在推理開始之前修復幾個相依套件,包括其音訊和影片讀取器使用的包。那些失敗的嘗試都沒有達到去噪階段,因此它們沒有包含在上面的計時中。

LongCat-Video-Avatar 1.5

LongCat 創造了最明顯的頭部和身體表演,包括參考圖片中沒有的手勢。

LongCat 仍然是最具表現力的圖片到影片結果。它的 8 步 INT8 路徑保持了虛擬人像的可識別性,同時增加了頭部、面部和上半身動作。一些嘴部影格看起來略顯誇張,但這使靜態圖片感覺更像完整表演,而不是那些更保守的模型。

官方範例使用了兩塊 GPU。我們透過將上下文並行度設定為一,在一塊 H200 上執行了它。峰值記憶體為 46,827 MiB,對於典型的 48 GB 顯示卡來說,一旦考慮到框架開銷,這個數值讓人有些擔心。

LiveAvatar

LiveAvatar 產生了最清晰的重量級結果,並且成功完成了速度最快的 H200 任務。

LiveAvatar 在大型模型中為我們提供了最好的組合,包括鮮明的身份特徵、逼真的口型、眨眼和剋制的表情。其四步 FP8 流程在 181.44 秒內完成,比 LongCat、FlashTalk 和 Wan 更快。

這種速度並不意味著它是一個小模型。它的峰值為 61,401 MiB,並且在最終 VAE 解碼時依賴模型解除安裝。上游的單 GPU 執行器也假設分散式程式環境變數,並且其檔案中的一次性路徑在禁用編譯時效果最佳。在匹配這些官方設定後,執行能夠可靠完成。

SoulX-FlashTalk 14B

FlashTalk 在視覺上很強大,並且設計用於分批、連續產生,但其 14B 冷啟動成本很高。

FlashTalk 產生了穩定的面部並具有清晰的口部動作。由於 TorchInductor 編譯了其圖形,第一產生塊耗時 119.58 秒。後續塊大約每塊 3.75 秒。這使得 331.93 秒的冷啟動任務看起來比熱啟動的流式部署要差。

權衡在於基礎設施。峰值 VRAM 為 57,805 MiB,而持久快取是本次測試中最大的,為 51.07 GiB。除非部署增加更激進的解除安裝或量化,否則它屬於 80 GB 類 GPU。

EchoMimicV3-Flash

EchoMimic 提供了最佳的實際平衡:在更便宜的 L40S 上實現乾淨的身份識別和唇動。

EchoMimicV3-Flash 是最有吸引力的部署候選。其 1.3B、8 步流水線產生了乾淨的 25 影格每秒影片,較好地保留了面部,並且執行在 L40S 而非 H200 上。嘴部和身體動作比 LongCat 的更細膩,但全影格變化幹擾較少。

我們的 768 區官方配置峰值為 33,726 MiB。該專案宣傳了低記憶體模式,因此這是我們設定下的觀察使用情況,而不是關於理論最小值的宣告。其 22.28 GiB 快取不到 14B 模型大小的一半。

SoulX-FlashHead 1.3B Lite

FlashHead 顯著更小,但較近的裁切、更柔和的身份特徵以及較弱的口部動作,使其成為最不逼真的結果。

FlashHead Lite 峰值僅為 5,763 MiB,遠低於大型產生器的數量級。與 FlashTalk 類似,它的冷啟動時間主要受首次執行編譯影響。第一塊耗時 155.7 秒,而後續塊大約每塊 0.19 秒。

對於一個始終線上的直播服務來說,這很有趣,並且表明它可以在比此處使用的 L40S 更便宜的硬體上執行。然而,對於一個精美的登陸頁剪輯,我們會選擇 EchoMimic 更強的視覺效果。

為什麼 LTX-2.3 DubIt 這裡沒有影片

LTX-2.3 DubIt 與上述基於音訊的模型不同。它接受有聲音的參考影片和目標文字,然後產生匹配的語音和唇部動作,同時嘗試保留說話者的聲音特徵。

它的程式碼是公開的,但官方 Lightricks/LTX-2.3-22b-IC-LoRA-DubIt 檢查點從 Hugging Face 返回授權錯誤。在測試環境中我們沒有核准的令牌,因此任務在任何 GPU 分配之前就在僅 CPU 權重準備階段停止。

我們沒有替換第三方鏡像來繞過官方存取門戶。可重複性和存取性是評估開源版本的一部分。一旦官方存取獲得核准,準備好的 Modal 執行器可以使用公開的參考影片和目標句子執行相同的測試。

每個模型會保留還是選擇一種聲音?

大多數虛擬人像模型不會選擇或複製聲音。它們會對提供的音訊檔案進行動畫處理,然後在最終影片中使用相同的音訊。聲音建立是一個單獨的文字轉語音或語音複製步驟。

模型內建語音選擇器使用提供的語音從參考語音中學習我們觀察到的內容
Wan2.2-S2V-14B保留輸入音訊,相關性 0.999897
LTX-2.3 DubIt沒有語音選單不行,它需要目標文字是的,根據帶聲音的參考影片未執行,因為權重被限制
LongCat-Video-Avatar 1.5保留輸入音訊,相關性 0.999562
LiveAvatar保留輸入音訊,相關性 0.999897
SoulX-FlashTalk保留輸入音訊,相關性 0.999751
EchoMimicV3-Flash保留輸入音訊,相關性 0.999198
SoulX-FlashHead保留輸入音訊,相關性 0.999751

微小的差異來自重取樣和 AAC 編碼,而不是不同的合成說話者。換句話說,這六個成功的模型可以使用真實錄音、在其他地方製作的獲許可複製,或任何 TTS 語音。它們本身不會改變聲音特徵。

DubIt 是個例外。它的目的是建立類似參考影片聲音的新目標語言或目標腳本語音。這使其在配音中非常有用,但輸出音訊不會是原始音訊的波形複製。

值得調整的引數

預設設定不一定適用於每張面孔或每種部署。這些是更改模型程式碼前需要測試的影響最大的控制項:

模型最重要的引數可能的權衡
Wan2.2-S2V-14B去噪步驟、引導尺度、輸出區域、種子、可選動作影片。更多步驟和像素會顯著增加延遲;姿勢控制可以改善身體動作
LTX-2.3 DubIt提示、目標文字、參考影片長度、LoRA 強度、種子更強的定向選擇可能有助於提升表型一致性,但會降低遺傳多樣性
LongCat-Video-Avatar 1.58 步蒸餾與完整路徑,量化,指導,種子,上下文並行全精度或更多步驟可提升細節,但需要更多記憶體和時間
LiveAvatar範例步驟、輸出區域、FP8、模型解除安裝、編譯編譯有助於重複工作;解除安裝可節省記憶體但會增加傳輸
SoulX-FlashTalk塊大小、重疊、編譯、音訊指導、種子較大的片段可以提高連續性,但會增加延遲和記憶體使用
EchoMimicV3-Flash推理步驟、引導比例、音訊引導、樣本大小、隨機種子增強音訊指導可以強化口型動作,但可能會誇張
SoulX-FlashHeadLite 與完整檢查點、裁切、塊長度、編譯完整模型在提高品質的同時會消耗更多記憶體;裁切對構圖影響很大。

對於公平的產品測試,每次僅調整一個變數,並使用相同的肖像和旁白。最有用的初步操作是為 EchoMimic 提供音訊指導,為 LiveAvatar 提供範例步驟,為 FlashHead 提供裁切和完整檢查點品質,併為兩個 SoulX 模型提交經過預熱的第二次請求。

硬體實際上是什麼樣子的

六種成功的產生器分為三類實用基礎設施群組:

  • 16 歲以下 GB: SoulX-FlashHead Lite 是經過驗證的唯一一款完全適配的全功能發生器。其 5.8 GB 的峰值為 12 GB 或 16 GB 顯示卡留出了空間,不過在消費級硬體上,延遲與驅動框架的支援仍有待驗證。
  • 48 GB 類別: EchoMimicV3-Flash 在 L40S 上以 33.7 GB 執行舒適。LongCat 的 46.8 GB 分配對於舒適的 48 GB 部署來說過於接近極限。
  • 80 GB 類: Wan2.2-S2V、LiveAvatar、SoulX-FlashTalk 和 LongCat 在 H100 或 H200 級 GPU 上最安全,且具有 80 個以上 GB。

持久儲存也很重要。FlashHead 和 EchoMimic 分別使用約 7.6 和 22.3 GiB。大型模型每個大約需要 45 到 51 GiB。一次性託管本文中的所有快取將消耗超過 200 GiB 的空間,尚不包括容器鏡像、輸出和臨時檔案。

Modal 非常適合實驗,因為容器可以縮放為零,而模型快取儲存在持久卷中。測試結束後,每個 Modal 應用報告執行任務為零且沒有 GPU 保持活動狀態。

我們今天會使用的內容

並沒有適用於所有虛擬人像工作流程的單一最佳方案:

  • 使用 LiveAvatar 當高品質的圖片到影片轉換最重要,並且提供 80 GB GPU 時。它產生了我們最清晰的大模型結果,並且在 H200 冷啟動任務中速度最快。
  • 使用 EchoMimicV3-Flash 適用於最佳的實際品質與基礎設施平衡。它可以在較便宜的 L40S 上執行,使用更小的快取,並產生乾淨的結果。
  • 使用 LongCat-Video-Avatar 1.5 當富有表現力的肢體動作比保守的身份保留更重要時。
  • 使用 SoulX-FlashHead Lite 當低 VRAM 和溫流傳輸速度比精細度更重要時。

最令人驚訝的結果並不是最大的模型看起來最好,而是使用更便宜的 GPU 並且不到一半的模型儲存時,EchoMimic 仍然表現得非常接近。開源虛擬人像產生現在已經變得可行,但服務策略仍然和檢查點一樣重要。

在 X 上分享