Українська

Meituan відкрила вихідний код LongCat-Video-Avatar 1.5 — і він робить рівно те, що VisionStory робить у своїй основі: перетворює нерухоме фото плюс аудіодоріжку на відео з аватаром, що говорить. Нам стало настільки цікаво, що ми справді запустили його. Це практичний розбір: що це таке, як він насправді працює, п’ять пасток налаштування, в які ми влетіли, і скільки коштує запускати його самостійно порівняно з хостинговим інструментом. Джерело: github.com/meituan-longcat/LongCat-Video (MIT).

Що таке LongCat-Video-Avatar і хто його створив?

LongCat-Video-Avatar 1.5 — це модель відео людини, керованого аудіо з відкритими вагами від Meituan (команда LongCat). Вона побудована на foundation-моделі LongCat-Video і випущена під дозволяючою ліцензією MIT — справді безкоштовна для комерційного використання. Станом на 2026-07 репозиторій має приблизно 5 200 зірок на GitHub, а ваги 1.5 — серед найулюбленіших нещодавніх релізів на Hugging Face.

Підтримує три нативні задачі: Audio + Text to Video (AT2V, без референс-зображення), Audio + Text + Image to Video (ATI2V — референс-фото задає ідентичність, саме той випадок, що відповідає реальному аватар-воркфлоу), та продовження відео, щоб подовжувати кліп за межі одного сегмента. У версії 1.5 замінили аудіоенкодер на Whisper-Large — саме він дає рух губ. Важливо: вона керує губами й мімікою з будь-якого аудіо, яке ви їй дасте — вона не генерує і не клонує голос.

Ми реально запустили його (одна A800-40GB)

Без «магії словами» — ми прогнали всі три задачі на одній NVIDIA A800-SXM4-40GB (torch 2.8+cu128, драйвер 550) у конфігурації моделі INT8-квантизація + дистиляція на 8 кроків — саме так вдається вмістити відео-дифузійну модель такого розміру на карту 40 GB. Ось чесний покроковий звіт.

П’ять пасток, у які ми влетіли

  • Відсутня залежність для відділення вокалу. Аудіопайплайн потребує модель Kim_Vocal_2 через audio-separator, якої немає в дефолтних requirements — перший запуск упав, доки не зробили pip install audio-separator==0.30.2.
  • Зламався запис відео. Збереження кадрів падало з помилкою TiffWriter got an unexpected keyword argument fps, бо imageio не міг знайти ffmpeg writer — виправили через pip install imageio-ffmpeg==0.6.0.
  • Дедлоки на multi-GPU. Запуск одного джоба на кількох картах (context-parallel size 2 або 8) зависав на розсинхроні колективних операцій NCCL — обидва ранги чекали один одного, доки таймаут 600s не переривав прогін. У нас вийшло працювати лише в режимі однієї карти. Ваги INT8 вміщуються в одну карту 40 GB, тож multi-GPU було корисне лише для паралельних окремих запусків, а не для прискорення одного.
  • Out-of-memory на другому сегменті. Довгі кліпи будуються шляхом продовження сегмент за сегментом, і крок продовження тримав у пам’яті 48-шаровий KV-cache. На карті 40 GB другий сегмент упирався в межу й падав — не вистачало приблизно 160 MiB. Нам довелося відкрити й увімкнути прапорець --offload_kv_cache (перенести кеш у RAM CPU і підвантажувати назад на кожному кроці) плюс встановити PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Це працює, але сегменти стають повільнішими.
  • Вирівнювання роздільної здатності. 480p у режимі multi-card parallelism зачіпало обмеження «кратність 64» для висоти й ширини; single-card цього уникає.

Швидкість і пам’ять (виміряно)

Ось цифра, яка має значення: кліп на 82 секунди зайняв 3 586 секунд — трохи менше години — на A800, або приблизно 44 секунди обчислень на кожну 1 секунду готового відео (приблизно 138s на згенерований сегмент у 26 сегментах). Короткий кліп на 10 секунд усе одно був би близько 7 хвилин. І це не «легке» навантаження: VRAM за секунди злетіла і потім застигла на 40 500 MiB — 98,9% від карти 40 GB — на весь рендер. Ось реальне використання, яке ми знімали раз на секунду:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Приклади, які ми відрендерили

Кожен кліп нижче ми відрендерили на A800, описаному вище. Щоб протестувати модель у запланованих для неї сценаріях, ми запускали її на офіційних демо-вхідних даних самого проєкту (референсні портрети й аудіо), а не підбирали власні — тож це чесні, без «вибірки найкращого», результати, а не хайлайт-ролик. Перші два кліпи кожен працювали зі своїм референсним фото:

Два референсні фото: сольний співак для кліпу «фото + аудіо» та студійна сцена з двома людьми для кліпу з кількома спікерами

Ліворуч: референс для кліпу «фото + аудіо». Праворуч: референс для кліпу з кількома спікерами (одне зображення, дві людини). Третій кліп нижче запускав текст + аудіо без референсного фото — модель вигадує людину, і саме тут вона найслабша.

Фото + аудіо (ATI2V) — аватар-воркфлоу. Ідентичність тримається, рот синхронізується зі співом.
Кілька спікерів — дві людини, дві аудіодоріжки, кожен рот керується незалежно.
Лише текст + аудіо, без референс-фото (AT2V) — слабкий сценарій: подивіться, як обличчя деформується і «пливе».

Відрендерено VisionStory з LongCat-Video-Avatar 1.5 на NVIDIA A800, 2026-07-15, у роздільній здатності класу 480p (768×512 / 832×480), використовуючи офіційні демо-входи моделі.

Чесний висновок: сильний із фото, грубий без нього

Що нас щиро вразило:

  • Ідентичність тримається. У кліпі, керованому фото, людина лишається тією самою протягом усіх 82 секунд — волосся, одяг, обличчя — а рот відстежує аудіо. Для аватарів це головний сценарій, і він працює.
  • Multi-speaker справді працює. Дві людини з однієї сцени, кожна з синхронізацією губ від своєї аудіодоріжки, лишалися узгодженими — це реально складно зробити правильно.
  • MIT і рівень «для комерції». Відкриті ваги, без оплати за кожен рендер, і якість, яка пройде для короткого кліпу.

Де він просідає — і це по-справжньому:

  • Генерація лише з тексту «пливе». Без референс-фото модель вигадує людину, і на довгому кліпі обличчя деформується в моторошний, восковий крупний план, а сцена зсувається — це видно у третьому прикладі вище.
  • Він повільний і важкий. ~44s обчислень на 1s відео, причому карта 40 GB забита весь час. 82 секунди кліпу — це година.
  • 40 GB — це мінімум. Нам потрібні були INT8 + distill, щоб просто вміститися, а багатосегментні кліпи виживали лише після offload KV-cache на CPU. Менші карти — повз.
  • Фактично лише одна карта. Context-parallel на multi-GPU у нас дедлочився, тож простого способу прискорити один кліп додаванням карт немає.
  • Без голосу. Він керує губами з аудіо, яке ви даєте — але не робить Text to Speech і не клонує голос, тож вам усе одно потрібне окреме джерело голосу.
  • 480p на цьому залізі. Те, що ми змогли запускати на одній карті 40 GB, — це результат класу 480p.

Self-host LongCat vs хостинговий інструмент: що обрати?

Обидва дають одне й те саме — фото плюс аудіо перетворюються на відео, у якому аватар говорить. Різниця повністю в тому, скільки вам коштує дійти до цього. Хостинговий інструмент на кшталт VisionStory запускає модель за вас; ось чесний компроміс.

 LongCat (self-host)VisionStory (hosted)
ЗалізоA100/A800 на 40 GB (тисячі доларів)Не потрібно — працює в браузері
НалаштуванняCUDA, flash-attn, INT8, виправлення залежностей, OOM-тюнінгУвійшли — і вперед
Час на кліп~44s обчислень на 1s відео (кліп 82s ≈ 1 година)Секунди — на хостингових GPU
Роздільна здатність (наш запуск)клас 480pHD-відео і вище
ГолосВи надаєте аудіо (без TTS/клонування)Вбудовані голоси та клонування голосу
Комерційне використанняТак (MIT)Так (залежно від плану)
ПідтримкаВи самі патчите залежності, OOM, драйвериНе потрібна
Найкраще підходить, колиУ вас є GPU і потрібен self-host/offline/on-premВам потрібно готове відео з аватаром, що говорить — швидко

Обирайте LongCat, якщо у вас є залізо і робота справді має бути на власному хостингу — on-prem, офлайн або повністю під вашим контролем — і вам комфортно підтримувати CUDA-стек. Обирайте хостинговий інструмент, якщо ви хочете те саме «фото + аудіо» відео з аватаром, що говорить, без години обчислень і GPU за п’ятизначну суму.

Чого нас навчив LongCat

Головний урок із запуску LongCat-Video-Avatar такий: якість open-source аватар-відео вже прийшла — із референс-фото ця безкоштовна модель видає кліпи, достатньо хороші для реального використання. Модель більше не є найскладнішою частиною.

Найскладніше — все навколо: вмістити відео-дифузійну модель на карту, яку ви можете собі дозволити, пережити OOM на другому сегменті, чекати годину за 82 секунди, і поєднати це з голосом. Цей розрив — між здатним чекпойнтом і готовим відео з аватаром, що говорить, яке може зробити будь-хто — рівно те, над чим ми працюємо. Якщо хочете побачити інший бік, VisionStory перетворює фото й сценарій на аватар, що говорить із синхронізацією губ у вашому браузері за секунди, а якщо вам потрібен і голос, наш розбір open-source TTS показує, де зараз стоїть і ця половина.

Часті питання

  • Так. LongCat-Video-Avatar 1.5 випущено за ліцензією MIT, яка дозволяє комерційне використання, і тут немає оплати за кожен рендер. Ви платите лише за GPU-обчислення, які він споживає.