TL;DR - 七个开源头像模型满足我们的筛选标准:公开发布日期在2025 年8 月23 日至2026 年8 月23 日之间,并且至少有1,000 个 GitHub 星标。我们执行了每一个模型。六个模型生成了相同公共头像和男性旁白的视频。LTX-2.3 DubIt 无法启动,因为其官方检查点需要 Hugging Face 批准。LiveAvatar 生成了最清晰的重量级结果,EchoMimicV3-Flash 在48 GB GPU 上提供了最佳平衡,而 SoulX-FlashHead 的峰值 VRAM 仅为5.8 GB,是最轻的。
我们想要回答的问题
开源会说话的虚拟形象发布更新的速度现在比大多数对比帖子跟踪它们的速度还快。诸如“实时”、“无限长度”和“保持身份”等说法难以比较,因为各项目使用的输入、分辨率、GPU 和推理时间的定义不同。
我们希望得到一个更狭窄、可重复的答案:哪些近期有实际社区采纳的模型可以将相同的肖像和旁白转换成令人信服的讲话视频,每个模型实际上执行需要什么?
在这一轮中,只有同时满足以下两个规则的模型才被视为合格:
- 它的首个官方可用代码和权重于 2025 年 8 月 23 日至 2026 年 8 月 23 日发布。
- 截至2026 年8 月23 日,它的官方 GitHub 仓库拥有超过1000 颗星。
仓库的星标数量是关注度的衡量,而非质量。对于 Wan2.2 和 LTX-2.3,星标数量属于父项目,因为头像功能包含在该仓库中。
七种合格模型
| 模型 | GitHub 星标 | 公开发布 | 官方输入。 | 测试结果 |
|---|---|---|---|---|
| Wan2.2-S2V-14B | 17,261 | 2025 年8 月26 日 | 图片 + 音频,可选姿势视频 | 已完成 |
| LTX-2.3 DubIt | 9,226 | 2026 年5 月11 日 | 参考视频 + 目标文字。 | 被受限检查点阻止 |
| LongCat-Video-Avatar 1.5 | 7,515 | 2026 年5 月21 日 | 图片 + 音频 | 已完成 |
| LiveAvatar | 2,384 | 2025 年12 月8 日 | 图片 + 音频 | 已完成 |
| 灵魂 X- 闪聊 | 1,476 | 2026 年 1 月 8 日 | 图片 + 音频 | 已完成 |
| EchoMimicV3-Flash | 1,025 | 2026 年 1 月 22 日 | 图片 + 音频 | 已完成 |
| 灵魂 X- 闪光头 | 1,006 | 2026 年2 月2 日 | 图片 + 音频 | 已完成 |
截止日期之前发布的项目都被排除在外,无论其星级多少。
相同的公开头像,相同的男性声音
每一次成功的操作都使用了这个来自无声的帧, AI 生成的 Pexels 视频,由 AI25.Studio 制作,在 Pexels 许可。源创作者不支持此比较。
![]()
这段 3.63 秒的旁白使用了 Daniel,一种 macOS 附带的中性男性系统语音:
开源头像模型现在可以从一张图片生成逼真的视频。
我们部署了官方仓库和权重的固定版本。 Modal。测量时间从生成容器启动时开始,到返回最终 MP4 时结束。模型权重已保存在持久的 Modal 卷中,因此不包括初始的互联网下载时间,但包括模型加载、预处理、生成、解码和复用。
一目了然的结果
| 模型 | GPU 已测试 | 最低。持续打开 GPU/ 月 | 高峰 VRAM | 时间 | 预计计算 | 模型缓存 | 输出 |
|---|---|---|---|---|---|---|---|
| Wan2.2-S2V-14B | H200 | $2,843 (H100) | 58,681 MiB | 780.29 秒 | $1.3692 | 45.76 GiB | 512 x 896,16 fps |
| LTX-2.3 DubIt | 无 | 未知 | 无 | 在 GPU 之前被阻止 | $0 GPU | 检查点受限 | 无输出 |
| LongCat-Video-Avatar 1.5 | H200 | $2,843 (H100) | 46,827 MiB | 233.08 秒 | $0.4011 | 44.82 GB | 480 x 832,25 帧/ 秒 |
| LiveAvatar | H200 | $2,843 (H100) | 61,401 MiB | 181.44 秒 | $0.3184 | 47.03 GiB | 384 x 704, 25 fps |
| 灵魂 X- 闪聊 | H200 | $2,843 (H100) | 57,805 MiB | 331.93 秒 | $0.5825 | 51.07 GiB | 416 x 720,25 帧/ 秒 |
| EchoMimicV3-Flash | L40S | $1,405(L40S) | 33,726 MiB | 251.94 秒 | $0.2120 | 22.28 吉比字节 | 480 x 848,25 帧/ 秒 |
| 灵魂 X- 闪光头 Lite | L40S | $575 (L4) | 5,763 MiB | 235.31 秒 | $0.1980 | 7.60 吉字节 | 512 x 512,25 fps |
计算估算使用 Modal 2026 年 8 月 23 日的标价 用于所请求的 GPU、CPU 和在测量生成函数期间的内存。它们不包括保存、互联网传输和一次性权重下载。
每月栏目是针对连续执行 30 天的 GPU 专用容量估算。它使用我们预计在不重新设计管道的情况下执行测量配置的最便宜的 Modal GPU 类:重型模型使用 H100,EchoMimic 使用 L40S,FlashHead Lite 使用 L4。CPU、内存、卷和网络费用需额外支付。Modal 可以缩放到零,因此实际每月最低费用为 $0,而按使用量计费的部署可能比始终打开的估算费用低得多。
这些是部署测量,而不是完美控制的模型质量基准。官方流程会生成不同的分辨率并使用不同数量的步骤。这也是结果的一部分:它显示了每个项目推荐的可执行路径所提供的内容。
生成的视频
Wan2.2-S2V-14B
Wan 保持了身份和背景的稳定,面部动作克制。这也是成功执行中速度最慢的,一段 3.8 秒的输出用了 13 分钟。
Wan 是重量级的电影选项。我们在一台 H200 上执行了官方的 40 步语音到视频流程。它生成了干净、稳定的头像,但动作较为保守,16 fps 的输出比 25 fps 的模型流畅性差。VRAM 峰值达到 58,681 MiB,估算的计算成本是 LiveAvatar 的四倍多。
官方设置还要求在推理开始之前修复几个依赖项,包括其音频和视频读取器使用的包。那些失败的尝试都没有达到去噪阶段,因此它们没有包含在上面的计时中。
LongCat-Video-Avatar 1.5
LongCat 创造了最明显的头部和身体表演,包括参考图像中没有的手势。
LongCat 仍然是最具表现力的图像到视频结果。它的 8 步 INT8 路径保持了头像的可识别性,同时增加了头部、面部和上半身动作。一些嘴部帧看起来略显夸张,但这使静态图像感觉更像完整表演,而不是那些更保守的模型。
官方示例使用了两块 GPU。我们通过将上下文并行度设置为一,在一块 H200 上执行了它。峰值内存为 46,827 MiB,对于典型的 48 GB 显卡来说,一旦考虑到框架开销,这个数值让人有些担心。
LiveAvatar
LiveAvatar 生成了最清晰的重量级结果,并且成功完成了速度最快的 H200 任务。
LiveAvatar 在大型模型中为我们提供了最好的组合,包括鲜明的身份特征、逼真的口型、眨眼和克制的表情。其四步 FP8 流程在181.44 秒内完成,比 LongCat、FlashTalk 和 Wan 更快。
这种速度并不意味着它是一个小模型。它的峰值为61,401 MiB,并且在最终 VAE 解码时依赖模型解除安装。上游的单 GPU 执行器也假设分散式程序环境变量,并且其文件中的一次性路径在禁用编译时效果最佳。在匹配这些官方设置后,执行能够可靠完成。
灵魂 X- 闪谈14B
FlashTalk 在视觉上很强大,并且设计用于分批、连续生成,但其 14B 冷启动成本很高。
FlashTalk 生成了稳定的面部并具有清晰的口部动作。由于 TorchInductor 编译了其图形,第一生成块耗时 119.58 秒。后续块大约每块 3.75 秒。这使得 331.93 秒的冷启动任务看起来比热启动的流式部署要差。
权衡在于基础设施。峰值 VRAM 为 57,805 MiB,而持久缓存是本次测试中最大的,为 51.07 GiB。除非部署增加更激进的解除安装或量化,否则它属于 80 GB 类 GPU。
EchoMimicV3-Flash
EchoMimic 提供了最佳的实际平衡:在更便宜的 L40S 上实现干净的身份识别和唇动。
EchoMimicV3-Flash 是最有吸引力的部署候选。其1.3B、8 步流水线生成了干净的25 帧每秒视频,较好地保留了面部,并且执行在 L40S 而非 H200 上。嘴部和身体动作比 LongCat 的更细腻,但全帧变化干扰较少。
我们的 768 区官方配置峰值为 33,726 MiB。该项目宣传了低内存模式,因此这是我们设置下的观察使用情况,而不是关于理论最小值的声明。其 22.28 GiB 缓存不到 14B 模型大小的一半。
灵魂 X- 闪光头1.3B Lite
FlashHead 显著更小,但较近的裁剪、更柔和的身份特征以及较弱的口部动作,使其成为最不逼真的结果。
FlashHead Lite 峰值仅为 5,763 MiB,远低于大型生成器的数量级。与 FlashTalk 类似,它的冷启动时间主要受首次执行编译影响。第一块耗时 155.7 秒,而后续块大约每块 0.19 秒。
对于一个始终在线的流媒体服务来说,这很有趣,并且表明它可以在比此处使用的 L40S 更便宜的硬件上执行。然而,对于一个精美的落地页剪辑,我们会选择 EchoMimic 更强的视觉效果。
为什么 LTX-2.3 DubIt 这里没有视频
LTX-2.3 DubIt 与上述基于音频的模型不同。它接受有声音的参考视频和目标文字,然后生成匹配的语音和唇部动作,同时尝试保留说话者的声音特征。
它的代码是公开的,但官方 Lightricks/LTX-2.3-22b-IC-LoRA-DubIt 检查点从 Hugging Face 返回授权错误。在测试环境中我们没有批准的令牌,因此任务在任何 GPU 分配之前就在仅 CPU 权重准备阶段停止。
我们没有替换第三方镜像来绕过官方访问门户。可重复性和访问性是评估开源版本的一部分。一旦官方访问获得批准,准备好的 Modal 执行器可以使用公开的参考视频和目标句子执行相同的测试。
每个模型会保留还是选择一种声音?
大多数头像模型不会选择或克隆声音。它们会对提供的音频文件进行动画处理,然后在最终视频中使用相同的音频。声音创建是一个单独的文字转语音或语音克隆步骤。
| 模型 | 内置语音选择器 | 使用提供的语音 | 从参考语音中学习 | 我们观察到的内容 |
|---|---|---|---|---|
| Wan2.2-S2V-14B | 否 | 是 | 否 | 保留输入音频,相关性 0.999897 |
| LTX-2.3 DubIt | 没有语音菜单 | 不行,它需要目标文字 | 是的,根据带声音的参考视频 | 未执行,因为权重被限制 |
| LongCat-Video-Avatar 1.5 | 否 | 是 | 否 | 保留输入音频,相关性 0.999562 |
| LiveAvatar | 否 | 是 | 否 | 保留输入音频,相关性 0.999897 |
| 灵魂 X- 闪聊 | 否 | 是 | 否 | 保留输入音频,相关性 0.999751 |
| EchoMimicV3-Flash | 否 | 是 | 否 | 保留输入音频,相关性 0.999198 |
| 灵魂 X- 闪光头 | 否 | 是 | 否 | 保留输入音频,相关性 0.999751 |
微小的差异来自重取样和 AAC 编码,而不是不同的合成说话者。换句话说,这六个成功的模型可以使用真实录音、在其他地方制作的获许可克隆,或任何 TTS 语音。它们本身不会改变声音特征。
DubIt 是个例外。它的目的是创建类似参考视频声音的新目标语言或目标脚本语音。这使其在配音中非常有用,但输出音频不会是原始音频的波形复制。
值得调整的引数
预设设置不一定适用于每张面孔或每种部署。这些是更改模型代码前需要测试的影响最大的控制项:
| 模型 | 最重要的引数 | 可能的权衡 |
|---|---|---|
| Wan2.2-S2V-14B | 去噪步骤、引导尺度、输出区域、种子、可选动作视频。 | 更多步骤和像素会显著增加延迟;姿势控制可以改善身体动作 |
| LTX-2.3 DubIt | 提示、目标文字、参考视频长度、LoRA 强度、种子 | 更强的定向选择可能有助于提升表型一致性,但会降低遗传多样性 |
| LongCat-Video-Avatar 1.5 | 8 步蒸馏与完整路径,量化,指导,种子,上下文并行 | 全精度或更多步骤可提升细节,但需要更多内存和时间 |
| LiveAvatar | 示例步骤、输出区域、FP8、模型解除安装、编译 | 编译有助于重复工作;解除安装可节省内存但会增加传输 |
| 灵魂 X- 闪聊 | 块大小、重叠、编译、音频指导、种子 | 较大的片段可以提高连续性,但会增加延迟和内存使用 |
| EchoMimicV3-Flash | 推理步骤、引导比例、音频引导、样本大小、随机种子 | 增强音频指导可以强化口型动作,但可能会夸张 |
| 灵魂 X- 闪光头 | Lite 与完整检查点、裁剪、块长度、编译 | 完整模型在提高质量的同时会消耗更多内存;裁剪对构图影响很大。 |
对于公平的产品测试,每次仅调整一个变量,并使用相同的肖像和旁白。最有用的初步操作是为 EchoMimic 提供音频指导,为 LiveAvatar 提供示例步骤,为 FlashHead 提供裁剪和完整检查点质量,并为两个 SoulX 模型提交经过预热的第二次请求。
硬件实际上是什么样子的
六种成功的生成器分为三类实用基础设施群组:
- 16 岁以下 GB: SoulX-FlashHead Lite 是经过验证的唯一一款完全适配的全功能发生器。其5.8 GB 的峰值为12 GB 或16 GB 显卡留出了空间,不过在消费级硬件上,延迟与驱动框架的支持仍有待验证。
- 48 GB 类别: EchoMimicV3-Flash 在 L40S 上以33.7 GB 执行舒适。LongCat 的46.8 GB 分配对于舒适的48 GB 部署来说过于接近极限。
- 80 GB 类: Wan2.2-S2V、LiveAvatar、SoulX-FlashTalk 和 LongCat 在 H100 或 H200 级 GPU 上最安全,且具有 80 个以上 GB。
持久保存也很重要。FlashHead 和 EchoMimic 分别使用约7.6 和22.3 GiB。大型模型每个大约需要45 到51 GiB。一次性托管本文中的所有缓存将消耗超过200 GiB 的空间,尚不包括容器镜像、输出和临时文件。
Modal 非常适合实验,因为容器可以缩放为零,而模型缓存保存在持久卷中。测试结束后,每个 Modal 应用报告执行任务为零且没有 GPU 保持活动状态。
我们今天会使用的内容
并没有适用于所有头像工作流程的单一最佳方案:
- 使用 LiveAvatar 当高质量的图像到视频转换最重要,并且提供 80 GB GPU 时。它产生了我们最清晰的大模型结果,并且在 H200 冷启动任务中速度最快。
- 使用 EchoMimicV3-Flash 适用于最佳的实际质量与基础设施平衡。它可以在较便宜的 L40S 上执行,使用更小的缓存,并生成干净的结果。
- 使用 LongCat-Video-Avatar 1.5 当富有表现力的肢体动作比保守的身份保留更重要时。
- 使用 SoulX-FlashHead Lite 当低 VRAM 和温流传输速度比精细度更重要时。
最令人惊讶的结果并不是最大的模型看起来最好,而是使用更便宜的 GPU 并且不到一半的模型保存时,EchoMimic 仍然表现得非常接近。开源头像生成现在已经变得可行,但服务策略仍然和检查点一样重要。
