Meituan выложила в open-source LongCat-Video-Avatar 1.5 — и он делает ровно то, что лежит в основе VisionStory: превращает статичное фото плюс аудиодорожку в видео с говорящим аватаром. Нам стало достаточно интересно, чтобы реально его запустить. Это практический разбор: что это такое, насколько хорошо оно действительно работает, пять ловушек при установке, на которые мы наткнулись, и сколько стоит запускать всё у себя по сравнению с хостинговым инструментом. Источник: github.com/meituan-longcat/LongCat-Video (MIT).
Что такое LongCat-Video-Avatar и кто его сделал?
LongCat-Video-Avatar 1.5 — это модель audio-driven human video с открытыми весами от Meituan (команда LongCat). Она построена на базовой модели LongCat-Video и выпущена под либеральной лицензией MIT — по-настоящему бесплатно для коммерческого использования. По состоянию на 2026-07 репозиторий кода имеет примерно 5 200 звёзд на GitHub, а веса 1.5 — среди наиболее понравившихся недавних релизов на Hugging Face.
Поддерживаются три нативные задачи: Audio + Text to Video (AT2V, без референс-изображения), Audio + Text + Image to Video (ATI2V — референс-фото задаёт личность; это сценарий, который соответствует реальному аватарному воркфлоу), и video continuation — продолжение видео, чтобы удлинить клип за пределы одного сегмента. В версии 1.5 заменили аудиоэнкодер на Whisper-Large — именно он даёт движение губ. Важно: модель двигает губы и мимику по любому аудио, которое вы ей дадите — она не генерирует и не клонирует голос.
Мы реально запустили это (одна A800-40GB)
Без «примерно так» — мы прогнали все три задачи на одной NVIDIA A800-SXM4-40GB (torch 2.8+cu128, драйвер 550) в конфигурации модели INT8-quantized + 8-step distill — это то, что нужно, чтобы поместить видеодиффузионную модель такого размера на карту 40 GB. Ниже — честный разбор по шагам.
Пять ловушек, в которые мы попали
- Не хватало зависимости для разделения вокала. Аудиопайплайн требует модель Kim_Vocal_2 через
audio-separator, которой нет в дефолтных requirements — первый запуск упал, пока не сделалиpip install audio-separator==0.30.2. - Сломался видеописатель. Сохранение кадров падало с ошибкой
TiffWriter got an unexpected keyword argument fps, потому что imageio не находил writer для ffmpeg — исправилось установкойpip install imageio-ffmpeg==0.6.0. - Дедлоки на multi-GPU. Запуск одной задачи на нескольких картах (context-parallel size 2 или 8) зависал на рассинхроне NCCL collective — оба ранга ждали друг друга, пока таймаут 600s не прерывал запуск. Мы смогли работать только в режиме single-card. INT8-веса помещаются на одну карту 40 GB, так что multi-GPU было полезно лишь для параллельного запуска разных задач, а не для ускорения одной.
- Out-of-memory на втором сегменте. Длинные клипы строятся продолжением сегмент за сегментом, и на шаге продолжения в памяти оставался 48-слойный KV-cache. На карте 40 GB второй сегмент упирался в потолок и падал — не хватало примерно 160 MiB. Пришлось вывести и включить флаг
--offload_kv_cache(переносить кэш в RAM CPU и подкачивать обратно по шагам) плюс задатьPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Работает — ценой более медленных сегментов. - Выравнивание разрешения. 480p при параллелизме на нескольких картах наткнулось на требование кратности 64 по высоте и ширине; single-card этого избегает.
Скорость и память (измерено)
Вот цифра, которая важна: клип длиной 82 секунды занял 3 586 секунд — чуть меньше часа — на A800, то есть около 44 секунд вычислений на каждую 1 секунду готового видео (примерно 138s на сегмент при 26 сегментах). Короткий 10-секундный клип всё равно занял бы около 7 минут. И это далеко не лёгкая нагрузка: VRAM за секунды выросла и затем держалась на уровне 40 500 MiB — 98.9% от карты 40 GB — на протяжении всего рендера. Ниже — фактическое использование, которое мы снимали раз в секунду:
Примеры, которые мы отрендерили
Каждый клип ниже был отрендерен нами на A800, описанном выше. Чтобы протестировать модель в целевых сценариях, мы использовали официальные демо-входные данные проекта (референсные портреты и аудио), а не подбирали свои — поэтому это честные, не «отобранные вишенкой» результаты, а не подборка лучших моментов. Первые два клипа были сделаны каждый на основе своего референсного фото:
Слева: референс для клипа «фото + аудио». Справа: референс для клипа с несколькими говорящими (одно изображение, два человека). Третий клип ниже создавался по «текст + аудио» без референсного фото — модель придумывает человека, и именно здесь она проявляет себя слабее всего.
Отрендерено VisionStory с LongCat-Video-Avatar 1.5 на NVIDIA A800, 2026-07-15, в разрешении класса 480p (768×512 / 832×480), с использованием официальных demo-входов модели.
Честный вывод: сильна с фото, заметно грубее без него
Что нас реально впечатлило:
- Личность сохраняется. В клипе, управляемом фото, человек остаётся тем же человеком на протяжении всех 82 секунд — волосы, одежда, лицо — при этом рот следует аудио. Это главный сценарий для аватаров, и он работает.
- Режим multi-speaker действительно работает. Два человека в одной сцене, каждый с липсинком от своей аудиодорожки, оставались согласованными — это правда сложно сделать хорошо.
- MIT и качество на уровне коммерческого использования. Открытые веса, нет оплаты за каждый рендер, и качество, которое «проходит» в коротком клипе.
Где всё ломается — и это реально так:
- Генерация только по тексту «плывёт». Без референс-фото модель придумывает человека, и на длинном клипе лицо уходит в странный, «восковой» крупный план, а сцена смещается — это видно в третьем примере выше.
- Это медленно и тяжело. ~44s вычислений на 1s видео, при этом карта 40 GB занята под завязку всё время. 82 секунды клипа — это час.
- 40 GB — это нижний порог. Наш запуск потребовал INT8 + distill просто чтобы влезть, а много-сегментные клипы выжили только за счёт выгрузки KV-cache на CPU. Карты меньше — мимо.
- По сути — только single-card. Context-parallel на нескольких GPU у нас дедлочился, так что простого способа ускорить один клип добавлением карт нет.
- Без голоса. Модель двигает губы по вашему аудио — она не делает text-to-speech и не клонирует голос, поэтому вам всё равно нужен отдельный источник голоса.
- 480p на этом железе. То, что у нас реально запускалось на одной карте 40 GB, — это вывод класса 480p.
Самохостинг LongCat против хостингового инструмента: что выбрать?
Оба варианта дают один и тот же результат — фото плюс аудио превращаются в говорящий ролик. Разница целиком в том, сколько вам стоит добраться до этого результата. Хостинговый инструмент вроде VisionStory запускает модель за вас — вот честный размен.
| LongCat (самохостинг) | VisionStory (хостинг) | |
|---|---|---|
| Железо | A100/A800 на 40 GB (тысячи долларов) | Не нужно — работает в браузере |
| Установка | CUDA, flash-attn, INT8, фиксы зависимостей, настройка OOM | Войти и начать |
| Время на клип | ~44s вычислений на 1s видео (клип 82s ≈ 1 час) | Секунды, на хостинговых GPU |
| Разрешение (наш запуск) | класс 480p | HD и выше |
| Голос | Аудио даёте вы (без TTS/клонирования) | Встроенные голоса и клонирование голоса |
| Коммерческое использование | Да (MIT) | Да (зависит от плана) |
| Поддержка/обслуживание | Вы сами патчите зависимости, OOM, драйверы | Не требуется |
| Лучше всего, когда | У вас есть GPU и нужен самохостинг/офлайн/on-prem | Нужно готовое говорящее видео — быстро |
Выбирайте LongCat, если у вас есть железо и вам действительно нужно всё держать у себя — on-prem, офлайн или полностью под вашим контролем — и вам комфортно поддерживать CUDA-стек. Выбирайте хостинговый инструмент, если вы хотите то же говорящее видео «фото + аудио» без часа вычислений и GPU за пятизначную сумму.
Чему нас научил LongCat
Главный урок после запуска LongCat-Video-Avatar в том, что качество открытых аватар-видео уже пришло — с референс-фото эта бесплатная модель делает клипы, которые вполне годятся для реального использования. Модель — больше не самая сложная часть.
Сложнее всё вокруг: уместить видеодиффузионную модель на карту, которую вы можете себе позволить, пережить OOM на втором сегменте, ждать час ради 82 секунд и состыковать это с голосом. Этот разрыв — между сильным чекпойнтом и готовым говорящим видео, которое может сделать кто угодно, — ровно то, чем мы занимаемся. Если хотите увидеть «другую сторону», VisionStory превращает фото и сценарий в липсинкнутый говорящий аватар прямо в браузере за секунды; а если нужен и голос, наш разбор open-source TTS показывает, где сейчас находится эта половина задачи.
