要約- 7つのオープンソースアバターモデルがカットオフを達成しました。2025年8月23日から2026年8月23日までの一般公開と、少なくとも1,000のGitHubスターです。すべてを実行しました。6モデルが同じ公開アバターと男性ナレーションから動画を作成しました。LTX-2.3 DubItは公式チェックポイントでHugging Faceの承認が必要なため起動できませんでした。LiveAvatarが最もシャープなヘビー級結果を出し、EchoMimicV3-Flashは48 GB GPUで最良のバランスを提供し、SoulX-FlashHeadはピークVRAMの5.8 GBで圧倒的に軽量でした。
私たちが答えたかった質問
オープンソースのトーキングアバターのリリースは、ほとんどの比較投稿が追跡できるよりも速く登場しています。「リアルタイム」、「無限長」、「アイデンティティ保持」といった主張は、プロジェクトごとに入力、解像度、GPU、推論時間の定義が異なるため、比較が難しいです。
より具体的で再現可能な答えを求めました:最近のモデルでコミュニティに意味のある採用があるものの中で、同じポートレートとナレーションを説得力のあるトーキング動画に変換できるのはどれか、そしてそれぞれを実行するのに実際に何が必要か?
このラウンドでは、モデルは両方のルールを満たした場合にのみ適格とされました:
- その最初の公式で使用可能なコードとウェイトは、2025年8月23日から2026年8月23日までにリリースされました。
- その公式GitHubリポジトリは、2026年8月23日時点で1,000以上のスターを持っていました。
リポジトリのスター数は注目度の指標であり、品質の指標ではありません。Wan2.2とLTX-2.3では、アバター機能がそのリポジトリ内で提供されるため、スター数は親プロジェクトに属します。
7つの資格モデル
| モデル | GitHubスター | 公開リリース | 公式入力 | テスト結果 |
|---|---|---|---|---|
| Wan2.2-S2V-14B | 17,261 | 2025年8月26日 | 画像+音声、任意のポーズ動画 | 完了 |
| LTX-2.3 DubIt | 9,226 | 2026年5月11日 | 参照動画 + 目標テキスト | ゲートチェックポイントでブロックされました |
| LongCat-Video-Avatar 1.5 | 7,515 | 2026年5月21日 | 画像+音声 | 完了 |
| ライブアバター | 2,384 | 2025年12月8日 | 画像+音声 | 完了 |
| SoulX-FlashTalk | 1,476 | 2026年1月8日 | 画像+音声 | 完了 |
| EchoMimicV3-Flash | 1,025 | 2026年1月22日 | 画像+音声 | 完了 |
| SoulX-FlashHead | 1,006 | 2026年2月12日 | 画像+音声 | 完了 |
カットオフ前にリリースされたプロジェクトは、星の数に関係なく除外されました。
同じ公開アバター、同じ男性の声
すべての成功した実行では、このサイレントのフレームが使用されました。AI生成のPexels動画by AI25.Studio、の下でPexelsライセンス。ソースのクリエイターはこの比較を推奨していません。
![]()
3.63秒のナレーションには、macOSに含まれるニュートラルな男性システム音声のDanielが使用されました:
オープンソースのアバターモデルは、1枚の画像から説得力のある動画を生成できるようになりました。
公式リポジトリとウェイトの固定バージョンを展開しましたModal。測定時間は生成コンテナが開始したときに始まり、最終MP4が返されると終了します。モデルの重みはすでに永続的なModalボリュームに保存されているため、初回のインターネットダウンロード時間は除外されますが、モデルの読み込み、前処理、生成、デコード、マルチプレックスは含まれます。
一目でわかる結果
| モデル | GPUテスト済み | 最小常時オンGPU/月 | VRAMのピーク | 時間 | 推定計算 | モデルキャッシュ | 出力 |
|---|---|---|---|---|---|---|---|
| Wan2.2-S2V-14B | H200 | $2,843(H100) | 58,681 MiB | 780.29秒 | $1.3692 | 45.76 GiB | 512 x 896, 16 fps |
| LTX-2.3 DubIt | なし | 不明 | なし | GPU以前にブロックされました | $0 GPU | チェックポイントゲート | 出力なし |
| LongCat-Video-Avatar 1.5 | H200 | $2,843(H100) | 46,827 MiB | 233.08秒 | $0.4011 | 44.82 GB | 480 x 832、25 fps |
| ライブアバター | H200 | $2,843(H100) | 61,401 MiB | 181.44秒 | $0.3184 | 47.03 GiB | 384 x 704, 25 fps |
| SoulX-FlashTalk | H200 | $2,843(H100) | 57,805 MiB | 331.93秒 | $0.5825 | 51.07 GiB | 416 x 720、25 fps |
| EchoMimicV3-Flash | L40S | $1,405(L40S) | 33,726 MiB | 251.94秒 | $0.2120 | 22.28 GiB | 480 x 848、25 fps |
| SoulX-FlashHead Lite | L40S | $575 (L4) | 5,763 MiB | 235.31秒 | $0.1980 | 7.60 GiB | 512 x 512, 25 fps |
見積もり計算の使用Modalの2026年8月23日リスト価格で要求されたGPU、CPU、および測定された生成機能中のメモリを確認できます。これには、ストレージ、インターネット転送、および一度きりの重みのダウンロードは含まれていません。音声ナレーションには
月間コラムは、30日間の連続稼働に対するGPU専用の容量見積もりです。パイプラインを再設計せずに測定された構成を実行すると予想される最も安価なModal GPUクラスを使用します:ヘビーウェイトモデルにはH100、EchoMimicにはL40S、FlashHead LiteにはL4です。CPU、メモリ、ボリューム、ネットワーク料金は別途かかります。Modalはゼロまでスケールするため、実際の月間最低料金は$0で、使用ベースのデプロイメントでは常時稼働見積もりよりもはるかに安くなる場合があります。
これは展開時の測定値であり、完全に制御されたモデル品質のベンチマークではありません。公式のパイプラインは異なる解像度を生成し、異なるステップ数を使用します。これは結果の一部であり、各プロジェクトの推奨される実行可能なパスがどのような成果を出すかを示しています。
生成された動画
Wan2.2-S2V-14B
Wanは、アイデンティティと背景を安定させ、顔の動きも控えめでした。また、3.8秒の出力に対して最も遅い成功ランは13分かかりました。
Wanはヘビー級の映画製作オプションです。私たちは公式の40ステップの音声から動画へのパスをH200で実行しました。クリーンで安定したポートレートを生成しましたが、動きは控えめで、16 fpsの出力は25 fpsモデルよりも滑らかさに欠けました。ピークVRAMは58,681 MiBに達し、推定計算コストはLiveAvatarの4倍以上でした。
公式のセットアップでは、推論を開始する前にいくつかの依存関係の修正が必要でした。これには、音声および動画リーダーで使用されるパッケージが含まれます。それらの失敗した試みのいずれもデノイジングには到達しなかったため、上記のタイミングには含まれていません。
LongCat-Video-Avatar 1.5
LongCatは、参照画像にはない手のジェスチャーを含む、最も目立つ頭と体のパフォーマンスを作成しました。
LongCatは、最も表現力のある画像から動画への結果を維持しました。その8ステップのINT8パスにより、アバターは認識可能なままで、頭、顔、上半身の動きが追加されました。いくつかの口のフレームはやや誇張されて見えることもありましたが、それにより静止画がより完全なパフォーマンスのように感じられ、より控えめなモデルよりも印象的でした。
公式の例では2つのGPUを使用しています。私たちはコンテキスト並列度を1に設定して1台のH200で実行しました。メモリ使用量は46,827 MiBまで達し、フレームワークのオーバーヘッドを含めると、通常の48 GBカードでは安心できる余裕はほとんどありません。
ライブアバター
LiveAvatarは、最も鮮明なヘビーウェイト結果と最速の成功したH200ジョブを生成しました。
LiveAvatarは、大規模モデルの中で、鮮明なアイデンティティ、説得力のある口の動き、まばたき、抑制された表情の最良の組み合わせを提供しました。その4ステップのFP8パイプラインは181.44秒で完了し、LongCat、FlashTalk、Wanよりも速かったです。
その速度は小さいモデルであることを意味しません。ピークは61,401 MiBに達し、最終的なVAEデコードにはモデルのオフロードに依存していました。上流のシングルGPUランナーも分散プロセスの環境変数を前提としています。また、公式に文書化された単発のパスは、コンパイルを無効にした状態で最も効果的に機能します。これらの公式設定を一致させた後、実行は安定して完了しました。
SoulX-FlashTalk 14B
FlashTalkは視覚的に強力で、チャンク化された連続生成向けに設計されているが、その14Bのコールドスタートは高コストであった。
FlashTalkは安定した顔と明確な口の動きを生成した。最初に生成されたチャンクには119.58秒かかったが、これはTorchInductorがそのグラフをコンパイルしたためである。その後のチャンクはそれぞれ約3.75秒かかった。これにより331.93秒のコールドジョブは、ウォーム状態でのストリーミングデプロイよりも悪く見える。
トレードオフはインフラストラクチャです。ピークVRAMは57,805 MiBで、永続キャッシュはこのテストで最大の51.07 GiBでした。より積極的なオフロードや量子化を追加しない限り、80 GBクラスのGPUに配置するのが適しています。
EchoMimicV3-Flash
EchoMimicは最適な実用的バランスを提供しました:安価なL40Sでも、クリーンなアイデンティティと口の動き。
EchoMimicV3-Flashは最も魅力的な展開候補でした。その13億パラメータ、8ステップのパイプラインはクリーンな25fps動画を生成し、顔の保持も良好で、H200ではなくL40Sで動作しました。口や体の動きはLongCatより控えめでしたが、気を散らす全フレームの変化が少なかったです。
私たちの768エリアの公式設定では最大33,726 MiBに達しました。プロジェクトは低メモリモードを宣伝しているため、これは理論上の最小値ではなく、私たちの設定での観測使用量です。その22.28 GiBのキャッシュは、14Bモデルのサイズの半分未満でした。
SoulX-FlashHead 1.3B Lite
FlashHeadは劇的に小さいが、クローズアップのトリミング、柔らかいアイデンティティ、弱い口の動きにより、最も説得力のない結果となった。
FlashHead Liteはわずか5,763 MiBまでしかピークに達せず、大型ジェネレーターよりも桁違いに少なかった。FlashTalkと同様に、コールドタイミングは最初の実行時コンパイルに支配されていた。最初のチャンクには155.7秒かかり、その後のチャンクはそれぞれ約0.19秒であった。
常に温かいストリーミングサービスにとって興味深いことであり、ここで使用されているL40Sよりもはるかに安価なハードウェアで動作する可能性があることを示唆しています。しかし、洗練されたランディングページ用のクリップでは、EchoMimicのより強力なビジュアル結果を選びます。
なぜLTX-2.3 DubItにはここに動画がありませんか?
LTX-2.3 DubItは、上記の音声駆動モデルとは異なります。声付きの参照動画とターゲットテキストを受け取り、話者の声の個性を保持しようとしながら、対応する音声と口の動きを生成します。
そのコードは公開されていますが、公式のLightricks/LTX-2.3-22b-IC-LoRA-DubItチェックポイントがHugging Faceから認証エラーを返しました。テスト環境で承認されたトークンがなかったため、CPU専用の重みの準備中にジョブが停止し、GPUは割り当てられませんでした。
正式なアクセスゲートを回避するサードパーティのミラーは使用しませんでした。再現性とアクセスはオープンソースリリースの評価の一部です。正式なアクセスが承認されると、準備済みのModalランナーは、公開リファレンス動画とターゲット文で同じテストを実行できます。
各モデルは声を保持しますか、それとも選択しますか?
ほとんどのアバターモデルは、声を選択したりクローンしたりしません。提供された音声ファイルをアニメートし、その同じ音声を最終動画に使用します。音声の作成は、別のテキスト読み上げや音声クローンのステップです。
| モデル | 内蔵音声セレクター | 提供された音声を使用します | 参照音声から学ぶ | 私たちが観察したこと |
|---|---|---|---|---|
| Wan2.2-S2V-14B | いいえ | はい | いいえ | 入力音声保持、相関0.999897 |
| LTX-2.3 DubIt | ボイスメニューはありません | いいえ、ターゲットテキストが必要です | はい、ボイスリファレンス動画からです | 重みが制限されているため実行されませんでした |
| LongCat-Video-Avatar 1.5 | いいえ | はい | いいえ | 入力音声保持、相関0.999562 |
| ライブアバター | いいえ | はい | いいえ | 入力音声保持、相関0.999897 |
| SoulX-FlashTalk | いいえ | はい | いいえ | 入力音声保持、相関0.999751 |
| EchoMimicV3-Flash | いいえ | はい | いいえ | 入力音声保持、相関0.999198 |
| SoulX-FlashHead | いいえ | はい | いいえ | 入力音声保持、相関0.999751 |
小さな違いはリサンプリングとAACエンコーディングによるもので、別の合成スピーカーによるものではありません。言い換えれば、6つの成功したモデルは、実際の収録、他で作成された同意済みクローン、または任意のTTSボイスを使用できます。これらは音声の識別自体を変えることはありません。
DubItは例外です。その目的は、参照動画の声に似せた新しいターゲット言語またはターゲット台本の音声を作成することです。これにより吹き替えに役立ちますが、出力音声は元の波形のコピーにはなりません。
調整する価値のあるパラメータ
デフォルト設定が必ずしもすべての環境や展開に最適とは限りません。モデルコードを変更する前にテストすべき、最も影響力のあるコントロールは次の通りです:
| モデル | 最も重要なパラメータ | ありそうなトレードオフ |
|---|---|---|
| Wan2.2-S2V-14B | ノイズ除去ステップ、ガイダンススケール、出力領域、シード、オプションのポーズ動画 | ステップ数とピクセルが増えると遅延が急増。ポーズ制御により体の動きを改善できる |
| LTX-2.3 DubIt | プロンプト、ターゲットテキスト、参照動画の長さ、LoRAの強さ、シード | 強化されたコンディショニングはアイデンティティを改善する可能性があるが、自然な変化を減らす可能性もある |
| LongCat-Video-Avatar 1.5 | 8ステップに精製されたパスvsフルパス、量子化、ガイダンス、シード、コンテキスト並列処理 | 精度のフル、または多くのステップで詳細が向上する可能性がありますが、より多くのメモリと時間が必要です |
| ライブアバター | サンプルステップ、出力エリア、FP8、モデルオフロード、コンパイル | コンパイルは繰り返し作業を助け、オフロードはメモリを節約するが転送が増える |
| SoulX-FlashTalk | チャンクサイズ、オーバーラップ、コンパイル、音声ガイダンス、シード | 大きなチャンクは連続性を向上させることがありますが、レイテンシとメモリを増加させます |
| EchoMimicV3-Flash | 推論ステップ、ガイダンススケール、音声ガイダンス、サンプルサイズ、シード | 高音声ガイダンスは口の動きを強化できますが、誇張されることがあります |
| SoulX-FlashHead | ライト版とフルチェックポイント、クロップ、チャンク長、コンパイル | フルモデルは、高いメモリコストで品質を向上させるはずです。トリミングは構図に強く影響します。 |
公正な製品テストのためには、同じポートレートとナレーションに対して、一度に1つの変数を調整してください。最も有用な最初の試行は、EchoMimicの音声ガイダンス、LiveAvatarのサンプルステップ、FlashHeadのクロップとフルチェックポイントの品質、およびSoulXモデル両方への温めた2回目のリクエストです。
ハードウェアの実際の見た目
成功した6つのジェネレーターは、3つの実用的なインフラストラクチャグループに分類されます:
- 16 GB未満:SoulX-FlashHead Liteは、明確に適合する唯一のテスト済みフルジェネレーターです。その5.8 GBピークは、12 GBまたは16 GBカードの余地を残しますが、消費者向けハードウェアでのレイテンシーとフレームワークのサポートはまだ確認が必要です。
- 48 GBクラス:EchoMimicV3-FlashはL40Sで33.7 GBの快適な動作をしました。LongCatの46.8 GBの割り当ては、快適な48 GB展開には限界に近すぎます。
- 80 GBクラス:Wan2.2-S2V、LiveAvatar、SoulX-FlashTalk、LongCatは、80 GB以上のH100またはH200クラスのGPUで最も安全です。
永続ストレージも重要です。FlashHeadとEchoMimicはそれぞれ約7.6 GiBと22.3 GiBを使用します。大きなモデルはそれぞれ約45から51 GiBが必要です。この記事で紹介するすべてのキャッシュを一度にホストすると、コンテナイメージ、出力ファイル、一時ファイルを含む前に200 GiBをはるかに超える容量を消費することになります。
Modalは、モデルキャッシュが永続ボリューム上に残る間、コンテナをゼロにスケールできるため、実験に適しています。このテスト後、すべてのModalアプリは実行中のタスクがゼロであり、GPUはアクティブな状態が残っていませんでした。
今日使用するもの
すべてのアバターワークフローにおいて、単一の勝者は存在しません。
- LiveAvatarを使用してください。高性能な画像から動画への品質が最も重要で、80 GB GPUが利用可能な場合。これにより、私たちは最もシャープな大規模モデルの結果を得られ、H200コールドジョブも最速でした。
- EchoMimicV3-Flashを使用してください。では、最適な実用的品質とインフラのバランスを示しています。より安価なL40Sで実行され、はるかに小さいキャッシュを使用し、クリーンな結果を生成しました。
- LongCat-Video-Avatar 1.5を使用してください。表現豊かな身体の動きが、保守的なアイデンティティ保持よりも重要な場合。
- SoulX-FlashHead Liteを使用します低VRAMと温かいストリーミング速度が、仕上げよりも重要な場合。
最も驚きだった結果は、最も大きなモデルが一番良く見えたことではありませんでした。より安価なGPUとモデルストレージの半分以下しか使わずに、EchoMimicがどれだけ近づけたかです。オープンソースのアバター生成は今や実用的ですが、サービング戦略はチェックポイントと同じくらい重要です。
