TL;DR - Семь моделей аватаров с открытым исходным кодом соответствовали нашим критериям: публичный релиз с 23 августа 2025 года по 23 августа 2026 года, плюс не менее 1 000 звезд GitHub. Мы протестировали каждую. Шесть создали видео с одним и тем же публичным аватаром и мужским озвучиванием. LTX-2.3 DubIt не удалось запустить, так как его официальный контрольный пункт требует одобрения Hugging Face. LiveAvatar показал четкий результат с высокой нагрузкой, EchoMimicV3-Flash предложил лучший баланс на 48 ГБ GPU, а SoulX-FlashHead оказался самым легким — всего 5,8 ГБ пиковой VRAM.
Вопрос, на который мы хотели ответить
Релизы говорящих аватаров с открытым исходным кодом теперь появляются быстрее, чем большинство сравнительных публикаций успевают их отслеживать. Такие претензии, как «в реальном времени», «бесконечная длина» и «сохранение идентичности», сложно сравнивать, потому что проекты используют разные входные данные, разрешения, GPU и определения времени вывода.
Мы хотели получить более узкий, воспроизводимый ответ: какие недавние модели с значительным сообществом могут превратить один и тот же портрет и озвучку в убедительное «говорящее» видео и что на самом деле требуется для работы каждой из них?
Для этого раунда модель квалифицировалась только при выполнении обоих правил:
- Его первый официальный, используемый код и веса были выпущены с 23 августа 2025 года по 23 августа 2026 года.
- Её официальный репозиторий GitHub имел более 1000 звезд по состоянию на 23 августа 2026 года.
Количество звёзд в репозитории является мерой внимания, а не качества. Для Wan2.2 и LTX-2.3 количество звёзд относится к родительскому проекту, так как возможность аватара входит в этот репозиторий.
Семь квалификационных моделей
| Модель | Звезды GitHub | Публичный релиз | Официальный ввод | Результат теста |
|---|---|---|---|---|
| Wan2.2-S2V-14B | 17,261 | 26 августа 2025 | Изображение + аудио, видео с позой по желанию | Завершено |
| LTX-2.3 DubIt | 9,226 | 11 мая 2026 г. | Контрольное видео + целевой текст | Заблокировано на этапе контрольной точки |
| LongCat-Video-Avatar 1.5 | 7,515 | 21 мая 2026 г. | Изображение + аудио | Завершено |
| LiveAvatar | 2,384 | 8 декабря 2025 г. | Изображение + аудио | Завершено |
| SoulX-FlashTalk | 1,476 | 8 января 2026 | Изображение + аудио | Завершено |
| EchoMimicV3-Flash | 1,025 | 22 января 2026 | Изображение + аудио | Завершено |
| SoulX-FlashHead | 1,006 | 12 февраля 2026 г. | Изображение + аудио | Завершено |
Проекты, выпущенные до крайнего срока, были исключены независимо от их количества звезд.
Один и тот же публичный аватар, один и тот же мужской голос
Каждый успешный прого́н использовал этот кадр из беззвучного, Видео Pexels, сгенерированное ИИ через AI25.Studio, в разделе Лицензия Pexels. Автор исходного материала не поддерживает это сравнение.
![]()
3,63-секундная озвучка использовала Daniel, нейтральный мужской системный голос, включенный в macOS:
Модели аватаров с открытым исходным кодом теперь могут создавать убедительные видео из одного изображения.
Мы развернули закрепленные версии официальных репозиториев и весов на Modal. Засекаемое время начинается с запуска контейнера генерации и заканчивается при возвращении окончательного MP4. Вес модели уже сохранен в постоянном томе Modal, поэтому начальное время загрузки из интернета не учитывается, но включены загрузка модели, предобработка, генерация, декодирование и мультиплексирование.
Результаты одним взглядом
| Модель | GPU протестирован | Мин. всегда включен GPU/мес | Пик VRAM | Время | Приблизительное вычисление | Кэш модели | Вывод |
|---|---|---|---|---|---|---|---|
| Wan2.2-S2V-14B | H200 | $2,843 (H100) | 58,681 МиБ | 780.29s | $1.3692 | 45,76 ГиБ | 512 x 896, 16 fps |
| LTX-2.3 DubIt | Нет | Неизвестно | Нет | Заблокировано перед GPU | $0 GPU | Контрольная точка защищена | Нет выхода |
| LongCat-Video-Avatar 1.5 | H200 | $2,843 (H100) | 46 827 МиБ | 233.08s | $0.4011 | 44.82 ГБ | 480 x 832, 25 fps |
| LiveAvatar | H200 | $2,843 (H100) | 61,401 МиБ | 181.44s | $0.3184 | 47,03 ГиБ | 384 x 704, 25 к/с |
| SoulX-FlashTalk | H200 | $2,843 (H100) | 57,805 МиБ | 331.93s | $0.5825 | 51,07 ГиБ | 416 x 720, 25 fps |
| EchoMimicV3-Flash | L40S | $1,405 (L40S) | 33 726 МиБ | 251.94s | $0.2120 | 22,28 ГиБ | 480 x 848, 25 fps |
| SoulX-FlashHead Lite | L40S | $575 (L4) | 5 763 МиБ | 235.31s | $0.1980 | 7,60 ГиБ | 512 x 512, 25 fps |
Оценки вычислений используют Розничные цены Modal на 23 августа 2026 года для запрошенных GPU, CPU и памяти во время выполнения измеренной функции генерации. Они не включают хранилище, передачу по интернету и однократную загрузку весов.
Ежемесячная колонка представляет собой оценку мощности только для GPU при непрерывной работе в течение 30-дневного месяца. Она использует наименее дорогой класс Modal GPU, который мы ожидаем запустить в измеренной конфигурации без переработки конвейера: H100 для моделей тяжелого веса, L40S для EchoMimic и L4 для FlashHead Lite. CPU, память, тома и сетевые расходы оплачиваются дополнительно. Modal масштабируется до нуля, поэтому фактический минимальный ежемесячный расход составляет $0, а развертывание на основе использования может стоить намного меньше, чем оценка для постоянной работы.
Это показатели развертывания, а не эталон качества модели с идеальным контролем. Официальные конвейеры создают разные разрешения и используют разное количество шагов. Это часть результата: она показывает, что предоставляет рекомендуемый каждый проект путь выполнения.
Сгенерированные видео
Wan2.2-S2V-14B
Wan сохранял стабильность идентичности и фона, с сдержанными движениями лица. Это также был самый медленный успешный прогон — 13 минут для выхода длиной 3,8 секунды.
Wan — это тяжеловесное кинематографическое решение. Мы запустили официальный путь преобразования речи в видео из 40 шагов на одном H200. Он создал чистый, стабильный портрет, но движения были сдержанными, а вывод 16 fps был менее плавным, чем модели с 25 fps. Пиковое VRAM достигло 58 681 МиБ, а оценочная стоимость вычислений была более чем в четыре раза выше, чем у LiveAvatar.
Официальная установка также требовала нескольких исправлений зависимостей перед запуском инференса, включая пакеты, используемые его аудио- и видеочиталками. Ни одна из этих неудачных попыток не дошла до шумоподавления, поэтому они не включены в указанное выше время.
LongCat-Video-Avatar 1.5
LongCat создал наиболее заметное исполнение головы и тела, включая жест руки, отсутствующий на исходном изображении.
LongCat оставался самым выразительным результатом преобразования изображения в видео. Его 8-шаговый путь INT8 сохранял узнаваемость аватара, добавляя движения головы, лица и верхней части тела. Некоторые кадры рта выглядели немного преувеличенными, но это делало неподвижное изображение более похожим на полное выступление по сравнению с более консервативными моделями.
Официальный пример использует две GPU. Мы запускали его на одной H200, установив параллелизм контекста в один. Пик составил 46 827 МиБ, что слишком близко к пределу для типичной карты на 48 ГБ, учитывая накладные расходы фреймворка.
LiveAvatar
LiveAvatar продемонстрировал самый четкий результат в тяжелом весе и самую быструю успешную работу H200.
LiveAvatar предложил нам лучшую комбинацию четкой идентичности, правдоподобных форм рта, моргания и сдержанных выражений среди крупных моделей. Его четырехэтапный FP8 конвейер завершился за 181,44 секунды, что быстрее, чем у LongCat, FlashTalk и Wan.
Эта скорость не делает модель маленькой. Пиковое потребление составило 61,401 МиБ, и для окончательной декодировки VAE потребовалось выгрузка модели. Вышестоящий одно-GPU раннер также предполагает наличие переменных окружения для распределённых процессов, а его документированный одноразовый путь работает лучше всего при отключённой компиляции. После соответствия этим официальным настройкам запуск завершился надёжно.
SoulX-FlashTalk 14B
FlashTalk был визуально сильным и разработан для постраничной, непрерывной генерации, но его холодный запуск на 14B был дорогим.
FlashTalk создавал стабильное лицо с четким движением рта. Первый сгенерированный фрагмент занял 119,58 секунд, потому что TorchInductor компилировал его граф. Последующие фрагменты занимали около 3,75 секунд каждый. Это делает холодную задачу длительностью 331,93 секунды хуже, чем ощущалась бы разогретая потоковая реализация.
Компромисс заключается в инфраструктуре. Пиковое потребление VRAM составляло 57,805 МиБ, а постоянный кеш был самым большим в этом тесте — 51,07 ГиБ. Это требует использования GPU класса 80 ГБ, если развертывание не включает более агрессивное выгрузку или квантизацию.
EchoMimicV3-Flash
EchoMimic обеспечивал наилучший практический баланс: чистая идентичность и движения губ на более дешевой модели L40S.
EchoMimicV3-Flash был самым убедительным кандидатом для развёртывания. Его конвейер на 1,3 млрд с 8 шагами создавал чистое видео с частотой 25 кадров в секунду, хорошо сохранял лицо и работал на L40S вместо H200. Движения рта и тела были более сдержанными, чем у LongCat, но было меньше отвлекающих изменений на весь кадр.
Наша официальная конфигурация для области 768 достигла пика в 33 726 МиБ. Проект рекламирует режимы с меньшим объемом памяти, поэтому это наблюдаемое использование для наших настроек, а не утверждение о теоретическом минимуме. Ее кэш объемом 22,28 ГиБ был меньше половины размера моделей 14B.
SoulX-FlashHead 1.3B Lite
FlashHead был значительно меньше, но близкий кадр, мягкая идентичность и слабое движение рта делали его наименее убедительным результатом.
FlashHead Lite достиг пика всего в 5,763 МиБ, что на порядок меньше больших генераторов. Как и FlashTalk, его холодное время выполнения определялось компиляцией при первом запуске. Первый фрагмент занял 155,7 секунд, тогда как последующие фрагменты — около 0,19 секунды каждый.
Это интересно для постоянно работающего стримингового сервиса и указывает на то, что он может работать на гораздо более дешёвом оборудовании, чем L40S, используемый здесь. Однако для профессионального клипа на целевой странице мы бы выбрали более сильный визуальный результат EchoMimic.
Почему у LTX-2.3 DubIt здесь нет видео
LTX-2.3 DubIt отличается от вышеуказанных моделей, управляемых аудио. Он принимает видеоролик с озвучкой и целевой текст, затем генерирует подходящую речь и движения губ, пытаясь сохранить голосовую индивидуальность говорящего.
Его код является публичным, но официальный Lightricks/LTX-2.3-22b-IC-LoRA-DubIt контрольная точка вернула ошибку авторизации от Hugging Face. У нас не было одобренного токена в тестовой среде, поэтому задача остановилась во время подготовки только веса CPU перед выделением каких-либо GPU.
Мы не использовали зеркала сторонних разработчиков, чтобы обойти официальный доступ. Воспроизводимость и доступ являются частью оценки релиза с открытым исходным кодом. После утверждения официального доступа подготовленный запуск Modal сможет выполнить тот же тест с общественно доступным справочным видео и целевым предложением.
Сохраняет ли каждая модель голос или выбирает его?
Большинство моделей аватаров не выбирают и не клонируют голос. Они анимируют предоставленный аудиофайл, а затем помещают тот же аудиофайл в финальное видео. Создание голоса — это отдельный шаг преобразования текста в речь или клонирования голоса.
| Модель | Встроенный выбор голоса | Использует предоставленную речь | Учится на эталонном голосе | Что мы наблюдали |
|---|---|---|---|---|
| Wan2.2-S2V-14B | Нет | Да | Нет | Входное аудио сохранено, корреляция 0.999897 |
| LTX-2.3 DubIt | Нет голосового меню | Нет, требуется целевой текст | Да, из озвученного справочного видео | Не запущено, так как веса были ограничены |
| LongCat-Video-Avatar 1.5 | Нет | Да | Нет | Входное аудио сохранено, корреляция 0.999562 |
| LiveAvatar | Нет | Да | Нет | Входное аудио сохранено, корреляция 0.999897 |
| SoulX-FlashTalk | Нет | Да | Нет | Входное аудио сохранено, корреляция 0.999751 |
| EchoMimicV3-Flash | Нет | Да | Нет | Входное аудио сохранено, корреляция 0.999198 |
| SoulX-FlashHead | Нет | Да | Нет | Входное аудио сохранено, корреляция 0.999751 |
Незначительные различия возникают из-за ресемплинга и кодирования AAC, а не из-за другого синтезированного говорящего. Другими словами, шесть успешных моделей могут использовать реальную запись, согласованного клона, созданного в другом месте, или любой голос TTS. Они сами не изменяют вокальную идентичность.
DubIt является исключением. Его цель — создать новую речь на целевом языке или в целевом сценарии, напоминающую голос из исходного видео. Это делает его полезным для дубляжа, но его выходной звук не будет точной копией звуковой волны оригинала.
Параметры, которые стоит настраивать
Настройки по умолчанию не обязательно являются оптимальными для каждого лица или развертывания. Это элементы управления с наибольшим влиянием, которые следует протестировать перед изменением кода модели:
| Модель | Наиболее важные параметры | Вероятная компромиссная ситуация |
|---|---|---|
| Wan2.2-S2V-14B | Шаги шумоподавления, масштаб руководства, область вывода, seed, необязательное видео с позой | Большее количество шагов и пикселей резко увеличивает задержку; управление позой может улучшить движение тела |
| LTX-2.3 DubIt | Подсказка, целевой текст, длина референсного видео, сила LoRA, зерно | Более сильная кондиция может улучшить идентичность, но уменьшить естественные вариации |
| LongCat-Video-Avatar 1.5 | 8-шаговая дистилляция против полного пути, квантование, руководство, семя, параллелизм контекста | Полная точность или больше шагов могут улучшить детализацию, но требуют больше памяти и времени |
| LiveAvatar | Пример шагов, область вывода, FP8, выгрузка модели, компиляция | Компиляция помогает при повторяющихся задачах; выгрузка экономит память, но добавляет передачи |
| SoulX-FlashTalk | Размер фрагмента, перекрытие, компиляция, аудиоруководство, семя | Более крупные фрагменты могут улучшить непрерывность, но увеличивают задержку и использование памяти |
| EchoMimicV3-Flash | Шаги вывода, масштаб руководства, звуковое руководство, размер выборки, сид | Более сильное аудио руководство может усилить движения рта, но может их преувеличить |
| SoulX-FlashHead | Лёгкий и полный контрольные точки, обрезка, длина фрагмента, компиляция | Полная модель должна улучшать качество при более высоких затратах памяти; кадрировка сильно влияет на компоновку. |
Для справедливого тестирования продукта настраивайте одну переменную за раз на одном и том же портрете и повествовании. Наиболее полезным первым шагом будет аудио руководство для EchoMimic, примерные шаги для LiveAvatar, качество обрезки и полного контрольного кадра для FlashHead, а также подогретый второй запрос для обеих моделей SoulX.
Как на самом деле выглядит оборудование
Шесть успешных генераторов делятся на три практические инфраструктурные группы:
- До 16 ГБ: SoulX-FlashHead Lite — единственный протестированный полноценный генератор, который явно подходит. Его пиковое значение 5.8 ГБ оставляет место для карты 12 ГБ или 16 ГБ, хотя задержка и поддержка фреймворка всё ещё требуют проверки на потребительском оборудовании.
- 48 ГБ класс: EchoMimicV3-Flash комфортно работал на L40S при 33,7 ГБ. Выделение 46,8 ГБ у LongCat слишком близко к пределу для комфортного развёртывания на 48 ГБ.
- 80 ГБ класс: Wan2.2-S2V, LiveAvatar, SoulX-FlashTalk и LongCat безопаснее всего работать на GPU класса H100 или H200 с 80 ГБ или больше.
Постоянное хранилище тоже имеет значение. FlashHead и EchoMimic используют примерно 7,6 и 22,3 ГиБ соответственно. Большие модели требуют примерно от 45 до 51 ГиБ каждая. Размещение всех кэшей, упомянутых в этой статье, одновременно потребляло бы более 200 ГиБ до учёта образов контейнеров, выводов и временных файлов.
Modal подходит для экспериментов, потому что контейнеры могут масштабироваться до нуля, в то время как кэши моделей остаются на постоянных томах. После этого теста каждое приложение Modal сообщало о нулевом количестве выполняемых задач, и никакой GPU не оставалось активным.
Что мы бы использовали сегодня
Нет одного победителя для всех рабочих процессов с аватарами:
- Используйте LiveAvatar когда важнее всего качество тяжелых изображений-видео, и доступен 80 ГБ GPU. Он дал наш самый резкий результат большой модели и имел самую быструю холодную задачу H200.
- Используйте EchoMimicV3-Flash для лучшего соотношения практического качества и инфраструктуры. Он работал на более дешевом L40S, использовал гораздо меньший кэш и дал чистый результат.
- Используйте LongCat-Video-Avatar 1.5 когда выразительное движение тела важнее, чем консервативное сохранение идентичности.
- использовать soulx-flashhead lite когда важнее низкий VRAM и скорость потоковой передачи на разогретом устройстве, чем полировка.
Наиболее удивительным результатом было не то, что самая большая модель выглядела лучше всего. А то, насколько близко EchoMimic подошёл, используя более дешевый GPU и меньше половины хранилища модели. Генерация аватаров с открытым исходным кодом теперь стала практичной, но стратегия обслуживания по-прежнему важна так же, как и контрольная точка.
