Meituan відкрила вихідний код LongCat-Video-Avatar 1.5 — і він робить рівно те, що VisionStory робить у своїй основі: перетворює нерухоме фото плюс аудіодоріжку на відео з аватаром, що говорить. Нам стало настільки цікаво, що ми справді запустили його. Це практичний розбір: що це таке, як він насправді працює, п’ять пасток налаштування, в які ми влетіли, і скільки коштує запускати його самостійно порівняно з хостинговим інструментом. Джерело: github.com/meituan-longcat/LongCat-Video (MIT).
Що таке LongCat-Video-Avatar і хто його створив?
LongCat-Video-Avatar 1.5 — це модель відео людини, керованого аудіо з відкритими вагами від Meituan (команда LongCat). Вона побудована на foundation-моделі LongCat-Video і випущена під дозволяючою ліцензією MIT — справді безкоштовна для комерційного використання. Станом на 2026-07 репозиторій має приблизно 5 200 зірок на GitHub, а ваги 1.5 — серед найулюбленіших нещодавніх релізів на Hugging Face.
Підтримує три нативні задачі: Audio + Text to Video (AT2V, без референс-зображення), Audio + Text + Image to Video (ATI2V — референс-фото задає ідентичність, саме той випадок, що відповідає реальному аватар-воркфлоу), та продовження відео, щоб подовжувати кліп за межі одного сегмента. У версії 1.5 замінили аудіоенкодер на Whisper-Large — саме він дає рух губ. Важливо: вона керує губами й мімікою з будь-якого аудіо, яке ви їй дасте — вона не генерує і не клонує голос.
Ми реально запустили його (одна A800-40GB)
Без «магії словами» — ми прогнали всі три задачі на одній NVIDIA A800-SXM4-40GB (torch 2.8+cu128, драйвер 550) у конфігурації моделі INT8-квантизація + дистиляція на 8 кроків — саме так вдається вмістити відео-дифузійну модель такого розміру на карту 40 GB. Ось чесний покроковий звіт.
П’ять пасток, у які ми влетіли
- Відсутня залежність для відділення вокалу. Аудіопайплайн потребує модель Kim_Vocal_2 через
audio-separator, якої немає в дефолтних requirements — перший запуск упав, доки не зробилиpip install audio-separator==0.30.2. - Зламався запис відео. Збереження кадрів падало з помилкою
TiffWriter got an unexpected keyword argument fps, бо imageio не міг знайти ffmpeg writer — виправили черезpip install imageio-ffmpeg==0.6.0. - Дедлоки на multi-GPU. Запуск одного джоба на кількох картах (context-parallel size 2 або 8) зависав на розсинхроні колективних операцій NCCL — обидва ранги чекали один одного, доки таймаут 600s не переривав прогін. У нас вийшло працювати лише в режимі однієї карти. Ваги INT8 вміщуються в одну карту 40 GB, тож multi-GPU було корисне лише для паралельних окремих запусків, а не для прискорення одного.
- Out-of-memory на другому сегменті. Довгі кліпи будуються шляхом продовження сегмент за сегментом, і крок продовження тримав у пам’яті 48-шаровий KV-cache. На карті 40 GB другий сегмент упирався в межу й падав — не вистачало приблизно 160 MiB. Нам довелося відкрити й увімкнути прапорець
--offload_kv_cache(перенести кеш у RAM CPU і підвантажувати назад на кожному кроці) плюс встановитиPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Це працює, але сегменти стають повільнішими. - Вирівнювання роздільної здатності. 480p у режимі multi-card parallelism зачіпало обмеження «кратність 64» для висоти й ширини; single-card цього уникає.
Швидкість і пам’ять (виміряно)
Ось цифра, яка має значення: кліп на 82 секунди зайняв 3 586 секунд — трохи менше години — на A800, або приблизно 44 секунди обчислень на кожну 1 секунду готового відео (приблизно 138s на згенерований сегмент у 26 сегментах). Короткий кліп на 10 секунд усе одно був би близько 7 хвилин. І це не «легке» навантаження: VRAM за секунди злетіла і потім застигла на 40 500 MiB — 98,9% від карти 40 GB — на весь рендер. Ось реальне використання, яке ми знімали раз на секунду:
Приклади, які ми відрендерили
Кожен кліп нижче ми відрендерили на A800, описаному вище. Щоб протестувати модель у запланованих для неї сценаріях, ми запускали її на офіційних демо-вхідних даних самого проєкту (референсні портрети й аудіо), а не підбирали власні — тож це чесні, без «вибірки найкращого», результати, а не хайлайт-ролик. Перші два кліпи кожен працювали зі своїм референсним фото:
Ліворуч: референс для кліпу «фото + аудіо». Праворуч: референс для кліпу з кількома спікерами (одне зображення, дві людини). Третій кліп нижче запускав текст + аудіо без референсного фото — модель вигадує людину, і саме тут вона найслабша.
Відрендерено VisionStory з LongCat-Video-Avatar 1.5 на NVIDIA A800, 2026-07-15, у роздільній здатності класу 480p (768×512 / 832×480), використовуючи офіційні демо-входи моделі.
Чесний висновок: сильний із фото, грубий без нього
Що нас щиро вразило:
- Ідентичність тримається. У кліпі, керованому фото, людина лишається тією самою протягом усіх 82 секунд — волосся, одяг, обличчя — а рот відстежує аудіо. Для аватарів це головний сценарій, і він працює.
- Multi-speaker справді працює. Дві людини з однієї сцени, кожна з синхронізацією губ від своєї аудіодоріжки, лишалися узгодженими — це реально складно зробити правильно.
- MIT і рівень «для комерції». Відкриті ваги, без оплати за кожен рендер, і якість, яка пройде для короткого кліпу.
Де він просідає — і це по-справжньому:
- Генерація лише з тексту «пливе». Без референс-фото модель вигадує людину, і на довгому кліпі обличчя деформується в моторошний, восковий крупний план, а сцена зсувається — це видно у третьому прикладі вище.
- Він повільний і важкий. ~44s обчислень на 1s відео, причому карта 40 GB забита весь час. 82 секунди кліпу — це година.
- 40 GB — це мінімум. Нам потрібні були INT8 + distill, щоб просто вміститися, а багатосегментні кліпи виживали лише після offload KV-cache на CPU. Менші карти — повз.
- Фактично лише одна карта. Context-parallel на multi-GPU у нас дедлочився, тож простого способу прискорити один кліп додаванням карт немає.
- Без голосу. Він керує губами з аудіо, яке ви даєте — але не робить Text to Speech і не клонує голос, тож вам усе одно потрібне окреме джерело голосу.
- 480p на цьому залізі. Те, що ми змогли запускати на одній карті 40 GB, — це результат класу 480p.
Self-host LongCat vs хостинговий інструмент: що обрати?
Обидва дають одне й те саме — фото плюс аудіо перетворюються на відео, у якому аватар говорить. Різниця повністю в тому, скільки вам коштує дійти до цього. Хостинговий інструмент на кшталт VisionStory запускає модель за вас; ось чесний компроміс.
| LongCat (self-host) | VisionStory (hosted) | |
|---|---|---|
| Залізо | A100/A800 на 40 GB (тисячі доларів) | Не потрібно — працює в браузері |
| Налаштування | CUDA, flash-attn, INT8, виправлення залежностей, OOM-тюнінг | Увійшли — і вперед |
| Час на кліп | ~44s обчислень на 1s відео (кліп 82s ≈ 1 година) | Секунди — на хостингових GPU |
| Роздільна здатність (наш запуск) | клас 480p | HD-відео і вище |
| Голос | Ви надаєте аудіо (без TTS/клонування) | Вбудовані голоси та клонування голосу |
| Комерційне використання | Так (MIT) | Так (залежно від плану) |
| Підтримка | Ви самі патчите залежності, OOM, драйвери | Не потрібна |
| Найкраще підходить, коли | У вас є GPU і потрібен self-host/offline/on-prem | Вам потрібно готове відео з аватаром, що говорить — швидко |
Обирайте LongCat, якщо у вас є залізо і робота справді має бути на власному хостингу — on-prem, офлайн або повністю під вашим контролем — і вам комфортно підтримувати CUDA-стек. Обирайте хостинговий інструмент, якщо ви хочете те саме «фото + аудіо» відео з аватаром, що говорить, без години обчислень і GPU за п’ятизначну суму.
Чого нас навчив LongCat
Головний урок із запуску LongCat-Video-Avatar такий: якість open-source аватар-відео вже прийшла — із референс-фото ця безкоштовна модель видає кліпи, достатньо хороші для реального використання. Модель більше не є найскладнішою частиною.
Найскладніше — все навколо: вмістити відео-дифузійну модель на карту, яку ви можете собі дозволити, пережити OOM на другому сегменті, чекати годину за 82 секунди, і поєднати це з голосом. Цей розрив — між здатним чекпойнтом і готовим відео з аватаром, що говорить, яке може зробити будь-хто — рівно те, над чим ми працюємо. Якщо хочете побачити інший бік, VisionStory перетворює фото й сценарій на аватар, що говорить із синхронізацією губ у вашому браузері за секунди, а якщо вам потрібен і голос, наш розбір open-source TTS показує, де зараз стоїть і ця половина.
