Русский

Meituan выложила в open-source LongCat-Video-Avatar 1.5 — и он делает ровно то, что лежит в основе VisionStory: превращает статичное фото плюс аудиодорожку в видео с говорящим аватаром. Нам стало достаточно интересно, чтобы реально его запустить. Это практический разбор: что это такое, насколько хорошо оно действительно работает, пять ловушек при установке, на которые мы наткнулись, и сколько стоит запускать всё у себя по сравнению с хостинговым инструментом. Источник: github.com/meituan-longcat/LongCat-Video (MIT).

Что такое LongCat-Video-Avatar и кто его сделал?

LongCat-Video-Avatar 1.5 — это модель audio-driven human video с открытыми весами от Meituan (команда LongCat). Она построена на базовой модели LongCat-Video и выпущена под либеральной лицензией MIT — по-настоящему бесплатно для коммерческого использования. По состоянию на 2026-07 репозиторий кода имеет примерно 5 200 звёзд на GitHub, а веса 1.5 — среди наиболее понравившихся недавних релизов на Hugging Face.

Поддерживаются три нативные задачи: Audio + Text to Video (AT2V, без референс-изображения), Audio + Text + Image to Video (ATI2V — референс-фото задаёт личность; это сценарий, который соответствует реальному аватарному воркфлоу), и video continuation — продолжение видео, чтобы удлинить клип за пределы одного сегмента. В версии 1.5 заменили аудиоэнкодер на Whisper-Large — именно он даёт движение губ. Важно: модель двигает губы и мимику по любому аудио, которое вы ей дадите — она не генерирует и не клонирует голос.

Мы реально запустили это (одна A800-40GB)

Без «примерно так» — мы прогнали все три задачи на одной NVIDIA A800-SXM4-40GB (torch 2.8+cu128, драйвер 550) в конфигурации модели INT8-quantized + 8-step distill — это то, что нужно, чтобы поместить видеодиффузионную модель такого размера на карту 40 GB. Ниже — честный разбор по шагам.

Пять ловушек, в которые мы попали

  • Не хватало зависимости для разделения вокала. Аудиопайплайн требует модель Kim_Vocal_2 через audio-separator, которой нет в дефолтных requirements — первый запуск упал, пока не сделали pip install audio-separator==0.30.2.
  • Сломался видеописатель. Сохранение кадров падало с ошибкой TiffWriter got an unexpected keyword argument fps, потому что imageio не находил writer для ffmpeg — исправилось установкой pip install imageio-ffmpeg==0.6.0.
  • Дедлоки на multi-GPU. Запуск одной задачи на нескольких картах (context-parallel size 2 или 8) зависал на рассинхроне NCCL collective — оба ранга ждали друг друга, пока таймаут 600s не прерывал запуск. Мы смогли работать только в режиме single-card. INT8-веса помещаются на одну карту 40 GB, так что multi-GPU было полезно лишь для параллельного запуска разных задач, а не для ускорения одной.
  • Out-of-memory на втором сегменте. Длинные клипы строятся продолжением сегмент за сегментом, и на шаге продолжения в памяти оставался 48-слойный KV-cache. На карте 40 GB второй сегмент упирался в потолок и падал — не хватало примерно 160 MiB. Пришлось вывести и включить флаг --offload_kv_cache (переносить кэш в RAM CPU и подкачивать обратно по шагам) плюс задать PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Работает — ценой более медленных сегментов.
  • Выравнивание разрешения. 480p при параллелизме на нескольких картах наткнулось на требование кратности 64 по высоте и ширине; single-card этого избегает.

Скорость и память (измерено)

Вот цифра, которая важна: клип длиной 82 секунды занял 3 586 секунд — чуть меньше часа — на A800, то есть около 44 секунд вычислений на каждую 1 секунду готового видео (примерно 138s на сегмент при 26 сегментах). Короткий 10-секундный клип всё равно занял бы около 7 минут. И это далеко не лёгкая нагрузка: VRAM за секунды выросла и затем держалась на уровне 40 500 MiB — 98.9% от карты 40 GB — на протяжении всего рендера. Ниже — фактическое использование, которое мы снимали раз в секунду:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Примеры, которые мы отрендерили

Каждый клип ниже был отрендерен нами на A800, описанном выше. Чтобы протестировать модель в целевых сценариях, мы использовали официальные демо-входные данные проекта (референсные портреты и аудио), а не подбирали свои — поэтому это честные, не «отобранные вишенкой» результаты, а не подборка лучших моментов. Первые два клипа были сделаны каждый на основе своего референсного фото:

Два референсных фото: сольный певец для клипа «фото + аудио» и студийная сцена с двумя людьми для клипа с несколькими говорящими

Слева: референс для клипа «фото + аудио». Справа: референс для клипа с несколькими говорящими (одно изображение, два человека). Третий клип ниже создавался по «текст + аудио» без референсного фото — модель придумывает человека, и именно здесь она проявляет себя слабее всего.

Фото + аудио (ATI2V) — аватарный воркфлоу. Личность сохраняется, рот хорошо отслеживает пение.
Несколько спикеров — два человека, две аудиодорожки, каждый рот управляется независимо.
Только текст + аудио, без референс-фото (AT2V) — слабый сценарий: смотрите, как лицо деформируется и «плывёт».

Отрендерено VisionStory с LongCat-Video-Avatar 1.5 на NVIDIA A800, 2026-07-15, в разрешении класса 480p (768×512 / 832×480), с использованием официальных demo-входов модели.

Честный вывод: сильна с фото, заметно грубее без него

Что нас реально впечатлило:

  • Личность сохраняется. В клипе, управляемом фото, человек остаётся тем же человеком на протяжении всех 82 секунд — волосы, одежда, лицо — при этом рот следует аудио. Это главный сценарий для аватаров, и он работает.
  • Режим multi-speaker действительно работает. Два человека в одной сцене, каждый с липсинком от своей аудиодорожки, оставались согласованными — это правда сложно сделать хорошо.
  • MIT и качество на уровне коммерческого использования. Открытые веса, нет оплаты за каждый рендер, и качество, которое «проходит» в коротком клипе.

Где всё ломается — и это реально так:

  • Генерация только по тексту «плывёт». Без референс-фото модель придумывает человека, и на длинном клипе лицо уходит в странный, «восковой» крупный план, а сцена смещается — это видно в третьем примере выше.
  • Это медленно и тяжело. ~44s вычислений на 1s видео, при этом карта 40 GB занята под завязку всё время. 82 секунды клипа — это час.
  • 40 GB — это нижний порог. Наш запуск потребовал INT8 + distill просто чтобы влезть, а много-сегментные клипы выжили только за счёт выгрузки KV-cache на CPU. Карты меньше — мимо.
  • По сути — только single-card. Context-parallel на нескольких GPU у нас дедлочился, так что простого способа ускорить один клип добавлением карт нет.
  • Без голоса. Модель двигает губы по вашему аудио — она не делает text-to-speech и не клонирует голос, поэтому вам всё равно нужен отдельный источник голоса.
  • 480p на этом железе. То, что у нас реально запускалось на одной карте 40 GB, — это вывод класса 480p.

Самохостинг LongCat против хостингового инструмента: что выбрать?

Оба варианта дают один и тот же результат — фото плюс аудио превращаются в говорящий ролик. Разница целиком в том, сколько вам стоит добраться до этого результата. Хостинговый инструмент вроде VisionStory запускает модель за вас — вот честный размен.

 LongCat (самохостинг)VisionStory (хостинг)
ЖелезоA100/A800 на 40 GB (тысячи долларов)Не нужно — работает в браузере
УстановкаCUDA, flash-attn, INT8, фиксы зависимостей, настройка OOMВойти и начать
Время на клип~44s вычислений на 1s видео (клип 82s ≈ 1 час)Секунды, на хостинговых GPU
Разрешение (наш запуск)класс 480pHD и выше
ГолосАудио даёте вы (без TTS/клонирования)Встроенные голоса и клонирование голоса
Коммерческое использованиеДа (MIT)Да (зависит от плана)
Поддержка/обслуживаниеВы сами патчите зависимости, OOM, драйверыНе требуется
Лучше всего, когдаУ вас есть GPU и нужен самохостинг/офлайн/on-premНужно готовое говорящее видео — быстро

Выбирайте LongCat, если у вас есть железо и вам действительно нужно всё держать у себя — on-prem, офлайн или полностью под вашим контролем — и вам комфортно поддерживать CUDA-стек. Выбирайте хостинговый инструмент, если вы хотите то же говорящее видео «фото + аудио» без часа вычислений и GPU за пятизначную сумму.

Чему нас научил LongCat

Главный урок после запуска LongCat-Video-Avatar в том, что качество открытых аватар-видео уже пришло — с референс-фото эта бесплатная модель делает клипы, которые вполне годятся для реального использования. Модель — больше не самая сложная часть.

Сложнее всё вокруг: уместить видеодиффузионную модель на карту, которую вы можете себе позволить, пережить OOM на втором сегменте, ждать час ради 82 секунд и состыковать это с голосом. Этот разрыв — между сильным чекпойнтом и готовым говорящим видео, которое может сделать кто угодно, — ровно то, чем мы занимаемся. Если хотите увидеть «другую сторону», VisionStory превращает фото и сценарий в липсинкнутый говорящий аватар прямо в браузере за секунды; а если нужен и голос, наш разбор open-source TTS показывает, где сейчас находится эта половина задачи.

Часто задаваемые вопросы

  • Да. LongCat-Video-Avatar 1.5 выпущен под лицензией MIT, которая разрешает коммерческое использование, и здесь нет оплаты за каждый рендер. Вы платите только за GPU-вычисления, которые он потребляет.