Перейти к статье
← назад к инженерии

Мы протестировали все популярные open-source модели аватаров, выпущенные за последний год (август 2026)

Обложка для тестирования всех популярных моделей открытых аватаров, выпущенных за последний год (август 2026)

TL;DR - Семь моделей аватаров с открытым исходным кодом соответствовали нашим критериям: публичный релиз с 23 августа 2025 года по 23 августа 2026 года, плюс не менее 1 000 звезд GitHub. Мы протестировали каждую. Шесть создали видео с одним и тем же публичным аватаром и мужским озвучиванием. LTX-2.3 DubIt не удалось запустить, так как его официальный контрольный пункт требует одобрения Hugging Face. LiveAvatar показал четкий результат с высокой нагрузкой, EchoMimicV3-Flash предложил лучший баланс на 48 ГБ GPU, а SoulX-FlashHead оказался самым легким — всего 5,8 ГБ пиковой VRAM.


Вопрос, на который мы хотели ответить

Релизы говорящих аватаров с открытым исходным кодом теперь появляются быстрее, чем большинство сравнительных публикаций успевают их отслеживать. Такие претензии, как «в реальном времени», «бесконечная длина» и «сохранение идентичности», сложно сравнивать, потому что проекты используют разные входные данные, разрешения, GPU и определения времени вывода.

Мы хотели получить более узкий, воспроизводимый ответ: какие недавние модели с значительным сообществом могут превратить один и тот же портрет и озвучку в убедительное «говорящее» видео и что на самом деле требуется для работы каждой из них?

Для этого раунда модель квалифицировалась только при выполнении обоих правил:

  • Его первый официальный, используемый код и веса были выпущены с 23 августа 2025 года по 23 августа 2026 года.
  • Её официальный репозиторий GitHub имел более 1000 звезд по состоянию на 23 августа 2026 года.

Количество звёзд в репозитории является мерой внимания, а не качества. Для Wan2.2 и LTX-2.3 количество звёзд относится к родительскому проекту, так как возможность аватара входит в этот репозиторий.

Семь квалификационных моделей

МодельЗвезды GitHubПубличный релизОфициальный вводРезультат теста
Wan2.2-S2V-14B17,26126 августа 2025Изображение + аудио, видео с позой по желаниюЗавершено
LTX-2.3 DubIt9,22611 мая 2026 г.Контрольное видео + целевой текстЗаблокировано на этапе контрольной точки
LongCat-Video-Avatar 1.57,51521 мая 2026 г.Изображение + аудиоЗавершено
LiveAvatar2,3848 декабря 2025 г.Изображение + аудиоЗавершено
SoulX-FlashTalk1,4768 января 2026Изображение + аудиоЗавершено
EchoMimicV3-Flash1,02522 января 2026Изображение + аудиоЗавершено
SoulX-FlashHead1,00612 февраля 2026 г.Изображение + аудиоЗавершено

Проекты, выпущенные до крайнего срока, были исключены независимо от их количества звезд.

Один и тот же публичный аватар, один и тот же мужской голос

Каждый успешный прого́н использовал этот кадр из беззвучного, Видео Pexels, сгенерированное ИИ через AI25.Studio, в разделе Лицензия Pexels. Автор исходного материала не поддерживает это сравнение.

Публичная система отсчета, предоставленная моделям аватаров

3,63-секундная озвучка использовала Daniel, нейтральный мужской системный голос, включенный в macOS:

Модели аватаров с открытым исходным кодом теперь могут создавать убедительные видео из одного изображения.

Мы развернули закрепленные версии официальных репозиториев и весов на Modal. Засекаемое время начинается с запуска контейнера генерации и заканчивается при возвращении окончательного MP4. Вес модели уже сохранен в постоянном томе Modal, поэтому начальное время загрузки из интернета не учитывается, но включены загрузка модели, предобработка, генерация, декодирование и мультиплексирование.

Результаты одним взглядом

МодельGPU протестированМин. всегда включен GPU/месПик VRAMВремяПриблизительное вычислениеКэш моделиВывод
Wan2.2-S2V-14BH200$2,843 (H100)58,681 МиБ780.29s$1.369245,76 ГиБ512 x 896, 16 fps
LTX-2.3 DubItНетНеизвестноНетЗаблокировано перед GPU$0 GPUКонтрольная точка защищенаНет выхода
LongCat-Video-Avatar 1.5H200$2,843 (H100)46 827 МиБ233.08s$0.401144.82 ГБ480 x 832, 25 fps
LiveAvatarH200$2,843 (H100)61,401 МиБ181.44s$0.318447,03 ГиБ384 x 704, 25 к/с
SoulX-FlashTalkH200$2,843 (H100)57,805 МиБ331.93s$0.582551,07 ГиБ416 x 720, 25 fps
EchoMimicV3-FlashL40S$1,405 (L40S)33 726 МиБ251.94s$0.212022,28 ГиБ480 x 848, 25 fps
SoulX-FlashHead LiteL40S$575 (L4)5 763 МиБ235.31s$0.19807,60 ГиБ512 x 512, 25 fps

Оценки вычислений используют Розничные цены Modal на 23 августа 2026 года для запрошенных GPU, CPU и памяти во время выполнения измеренной функции генерации. Они не включают хранилище, передачу по интернету и однократную загрузку весов.

Ежемесячная колонка представляет собой оценку мощности только для GPU при непрерывной работе в течение 30-дневного месяца. Она использует наименее дорогой класс Modal GPU, который мы ожидаем запустить в измеренной конфигурации без переработки конвейера: H100 для моделей тяжелого веса, L40S для EchoMimic и L4 для FlashHead Lite. CPU, память, тома и сетевые расходы оплачиваются дополнительно. Modal масштабируется до нуля, поэтому фактический минимальный ежемесячный расход составляет $0, а развертывание на основе использования может стоить намного меньше, чем оценка для постоянной работы.

Это показатели развертывания, а не эталон качества модели с идеальным контролем. Официальные конвейеры создают разные разрешения и используют разное количество шагов. Это часть результата: она показывает, что предоставляет рекомендуемый каждый проект путь выполнения.

Сгенерированные видео

Wan2.2-S2V-14B

Wan сохранял стабильность идентичности и фона, с сдержанными движениями лица. Это также был самый медленный успешный прогон — 13 минут для выхода длиной 3,8 секунды.

Wan — это тяжеловесное кинематографическое решение. Мы запустили официальный путь преобразования речи в видео из 40 шагов на одном H200. Он создал чистый, стабильный портрет, но движения были сдержанными, а вывод 16 fps был менее плавным, чем модели с 25 fps. Пиковое VRAM достигло 58 681 МиБ, а оценочная стоимость вычислений была более чем в четыре раза выше, чем у LiveAvatar.

Официальная установка также требовала нескольких исправлений зависимостей перед запуском инференса, включая пакеты, используемые его аудио- и видеочиталками. Ни одна из этих неудачных попыток не дошла до шумоподавления, поэтому они не включены в указанное выше время.

LongCat-Video-Avatar 1.5

LongCat создал наиболее заметное исполнение головы и тела, включая жест руки, отсутствующий на исходном изображении.

LongCat оставался самым выразительным результатом преобразования изображения в видео. Его 8-шаговый путь INT8 сохранял узнаваемость аватара, добавляя движения головы, лица и верхней части тела. Некоторые кадры рта выглядели немного преувеличенными, но это делало неподвижное изображение более похожим на полное выступление по сравнению с более консервативными моделями.

Официальный пример использует две GPU. Мы запускали его на одной H200, установив параллелизм контекста в один. Пик составил 46 827 МиБ, что слишком близко к пределу для типичной карты на 48 ГБ, учитывая накладные расходы фреймворка.

LiveAvatar

LiveAvatar продемонстрировал самый четкий результат в тяжелом весе и самую быструю успешную работу H200.

LiveAvatar предложил нам лучшую комбинацию четкой идентичности, правдоподобных форм рта, моргания и сдержанных выражений среди крупных моделей. Его четырехэтапный FP8 конвейер завершился за 181,44 секунды, что быстрее, чем у LongCat, FlashTalk и Wan.

Эта скорость не делает модель маленькой. Пиковое потребление составило 61,401 МиБ, и для окончательной декодировки VAE потребовалось выгрузка модели. Вышестоящий одно-GPU раннер также предполагает наличие переменных окружения для распределённых процессов, а его документированный одноразовый путь работает лучше всего при отключённой компиляции. После соответствия этим официальным настройкам запуск завершился надёжно.

SoulX-FlashTalk 14B

FlashTalk был визуально сильным и разработан для постраничной, непрерывной генерации, но его холодный запуск на 14B был дорогим.

FlashTalk создавал стабильное лицо с четким движением рта. Первый сгенерированный фрагмент занял 119,58 секунд, потому что TorchInductor компилировал его граф. Последующие фрагменты занимали около 3,75 секунд каждый. Это делает холодную задачу длительностью 331,93 секунды хуже, чем ощущалась бы разогретая потоковая реализация.

Компромисс заключается в инфраструктуре. Пиковое потребление VRAM составляло 57,805 МиБ, а постоянный кеш был самым большим в этом тесте — 51,07 ГиБ. Это требует использования GPU класса 80 ГБ, если развертывание не включает более агрессивное выгрузку или квантизацию.

EchoMimicV3-Flash

EchoMimic обеспечивал наилучший практический баланс: чистая идентичность и движения губ на более дешевой модели L40S.

EchoMimicV3-Flash был самым убедительным кандидатом для развёртывания. Его конвейер на 1,3 млрд с 8 шагами создавал чистое видео с частотой 25 кадров в секунду, хорошо сохранял лицо и работал на L40S вместо H200. Движения рта и тела были более сдержанными, чем у LongCat, но было меньше отвлекающих изменений на весь кадр.

Наша официальная конфигурация для области 768 достигла пика в 33 726 МиБ. Проект рекламирует режимы с меньшим объемом памяти, поэтому это наблюдаемое использование для наших настроек, а не утверждение о теоретическом минимуме. Ее кэш объемом 22,28 ГиБ был меньше половины размера моделей 14B.

SoulX-FlashHead 1.3B Lite

FlashHead был значительно меньше, но близкий кадр, мягкая идентичность и слабое движение рта делали его наименее убедительным результатом.

FlashHead Lite достиг пика всего в 5,763 МиБ, что на порядок меньше больших генераторов. Как и FlashTalk, его холодное время выполнения определялось компиляцией при первом запуске. Первый фрагмент занял 155,7 секунд, тогда как последующие фрагменты — около 0,19 секунды каждый.

Это интересно для постоянно работающего стримингового сервиса и указывает на то, что он может работать на гораздо более дешёвом оборудовании, чем L40S, используемый здесь. Однако для профессионального клипа на целевой странице мы бы выбрали более сильный визуальный результат EchoMimic.

Почему у LTX-2.3 DubIt здесь нет видео

LTX-2.3 DubIt отличается от вышеуказанных моделей, управляемых аудио. Он принимает видеоролик с озвучкой и целевой текст, затем генерирует подходящую речь и движения губ, пытаясь сохранить голосовую индивидуальность говорящего.

Его код является публичным, но официальный Lightricks/LTX-2.3-22b-IC-LoRA-DubIt контрольная точка вернула ошибку авторизации от Hugging Face. У нас не было одобренного токена в тестовой среде, поэтому задача остановилась во время подготовки только веса CPU перед выделением каких-либо GPU.

Мы не использовали зеркала сторонних разработчиков, чтобы обойти официальный доступ. Воспроизводимость и доступ являются частью оценки релиза с открытым исходным кодом. После утверждения официального доступа подготовленный запуск Modal сможет выполнить тот же тест с общественно доступным справочным видео и целевым предложением.

Сохраняет ли каждая модель голос или выбирает его?

Большинство моделей аватаров не выбирают и не клонируют голос. Они анимируют предоставленный аудиофайл, а затем помещают тот же аудиофайл в финальное видео. Создание голоса — это отдельный шаг преобразования текста в речь или клонирования голоса.

МодельВстроенный выбор голосаИспользует предоставленную речьУчится на эталонном голосеЧто мы наблюдали
Wan2.2-S2V-14BНетДаНетВходное аудио сохранено, корреляция 0.999897
LTX-2.3 DubItНет голосового менюНет, требуется целевой текстДа, из озвученного справочного видеоНе запущено, так как веса были ограничены
LongCat-Video-Avatar 1.5НетДаНетВходное аудио сохранено, корреляция 0.999562
LiveAvatarНетДаНетВходное аудио сохранено, корреляция 0.999897
SoulX-FlashTalkНетДаНетВходное аудио сохранено, корреляция 0.999751
EchoMimicV3-FlashНетДаНетВходное аудио сохранено, корреляция 0.999198
SoulX-FlashHeadНетДаНетВходное аудио сохранено, корреляция 0.999751

Незначительные различия возникают из-за ресемплинга и кодирования AAC, а не из-за другого синтезированного говорящего. Другими словами, шесть успешных моделей могут использовать реальную запись, согласованного клона, созданного в другом месте, или любой голос TTS. Они сами не изменяют вокальную идентичность.

DubIt является исключением. Его цель — создать новую речь на целевом языке или в целевом сценарии, напоминающую голос из исходного видео. Это делает его полезным для дубляжа, но его выходной звук не будет точной копией звуковой волны оригинала.

Параметры, которые стоит настраивать

Настройки по умолчанию не обязательно являются оптимальными для каждого лица или развертывания. Это элементы управления с наибольшим влиянием, которые следует протестировать перед изменением кода модели:

МодельНаиболее важные параметрыВероятная компромиссная ситуация
Wan2.2-S2V-14BШаги шумоподавления, масштаб руководства, область вывода, seed, необязательное видео с позойБольшее количество шагов и пикселей резко увеличивает задержку; управление позой может улучшить движение тела
LTX-2.3 DubItПодсказка, целевой текст, длина референсного видео, сила LoRA, зерноБолее сильная кондиция может улучшить идентичность, но уменьшить естественные вариации
LongCat-Video-Avatar 1.58-шаговая дистилляция против полного пути, квантование, руководство, семя, параллелизм контекстаПолная точность или больше шагов могут улучшить детализацию, но требуют больше памяти и времени
LiveAvatarПример шагов, область вывода, FP8, выгрузка модели, компиляцияКомпиляция помогает при повторяющихся задачах; выгрузка экономит память, но добавляет передачи
SoulX-FlashTalkРазмер фрагмента, перекрытие, компиляция, аудиоруководство, семяБолее крупные фрагменты могут улучшить непрерывность, но увеличивают задержку и использование памяти
EchoMimicV3-FlashШаги вывода, масштаб руководства, звуковое руководство, размер выборки, сидБолее сильное аудио руководство может усилить движения рта, но может их преувеличить
SoulX-FlashHeadЛёгкий и полный контрольные точки, обрезка, длина фрагмента, компиляцияПолная модель должна улучшать качество при более высоких затратах памяти; кадрировка сильно влияет на компоновку.

Для справедливого тестирования продукта настраивайте одну переменную за раз на одном и том же портрете и повествовании. Наиболее полезным первым шагом будет аудио руководство для EchoMimic, примерные шаги для LiveAvatar, качество обрезки и полного контрольного кадра для FlashHead, а также подогретый второй запрос для обеих моделей SoulX.

Как на самом деле выглядит оборудование

Шесть успешных генераторов делятся на три практические инфраструктурные группы:

  • До 16 ГБ: SoulX-FlashHead Lite — единственный протестированный полноценный генератор, который явно подходит. Его пиковое значение 5.8 ГБ оставляет место для карты 12 ГБ или 16 ГБ, хотя задержка и поддержка фреймворка всё ещё требуют проверки на потребительском оборудовании.
  • 48 ГБ класс: EchoMimicV3-Flash комфортно работал на L40S при 33,7 ГБ. Выделение 46,8 ГБ у LongCat слишком близко к пределу для комфортного развёртывания на 48 ГБ.
  • 80 ГБ класс: Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk и LongCat безопаснее всего работать на GPU класса H100 или H200 с 80 ГБ или больше.

Постоянное хранилище тоже имеет значение. FlashHead и EchoMimic используют примерно 7,6 и 22,3 ГиБ соответственно. Большие модели требуют примерно от 45 до 51 ГиБ каждая. Размещение всех кэшей, упомянутых в этой статье, одновременно потребляло бы более 200 ГиБ до учёта образов контейнеров, выводов и временных файлов.

Modal подходит для экспериментов, потому что контейнеры могут масштабироваться до нуля, в то время как кэши моделей остаются на постоянных томах. После этого теста каждое приложение Modal сообщало о нулевом количестве выполняемых задач, и никакой GPU не оставалось активным.

Что мы бы использовали сегодня

Нет одного победителя для всех рабочих процессов с аватарами:

  • Используйте LiveAvatar когда важнее всего качество тяжелых изображений-видео, и доступен 80 ГБ GPU. Он дал наш самый резкий результат большой модели и имел самую быструю холодную задачу H200.
  • Используйте EchoMimicV3-Flash для лучшего соотношения практического качества и инфраструктуры. Он работал на более дешевом L40S, использовал гораздо меньший кэш и дал чистый результат.
  • Используйте LongCat-Video-Avatar 1.5 когда выразительное движение тела важнее, чем консервативное сохранение идентичности.
  • использовать soulx-flashhead lite когда важнее низкий VRAM и скорость потоковой передачи на разогретом устройстве, чем полировка.

Наиболее удивительным результатом было не то, что самая большая модель выглядела лучше всего. А то, насколько близко EchoMimic подошёл, используя более дешевый GPU и меньше половины хранилища модели. Генерация аватаров с открытым исходным кодом теперь стала практичной, но стратегия обслуживания по-прежнему важна так же, как и контрольная точка.

поделиться на x