Български

Meituan направи LongCat-Video-Avatar 1.5 open-source и той прави точно това, което VisionStory прави в основата си — превръща статична снимка плюс аудио трак във видео с говорещ аватар. Това ни направи достатъчно любопитни, за да го пуснем реално. Това е практическо разнищване: какво е, колко добре наистина се представя, петте капана в настройката, в които попаднахме, и колко струва да го пускате сами спрямо хостван инструмент. Източник: github.com/meituan-longcat/LongCat-Video (MIT).

Какво е LongCat-Video-Avatar и кой го е направил?

LongCat-Video-Avatar 1.5 е модел с отворени тегла за аудио-управлявано видео с човек от Meituan (екипа LongCat). Той е изграден върху базовия модел LongCat-Video и е пуснат под либералния лиценз MIT — реално безплатен за търговска употреба. Към 2026-07 кодовото repo има приблизително 5 200 звезди в GitHub, а теглата за версия 1.5 са сред по-харесваните скорошни релийзи в Hugging Face.

Поддържа три основни задачи: Audio + Text to Video (AT2V, без референтно изображение), Audio + Text + Image to Video (ATI2V — референтна снимка управлява идентичността; случаят, който съвпада с реален workflow за аватари) и продължаване на видео, за да се удължи клипът отвъд един сегмент. Версия 1.5 замени аудио енкодера с Whisper-Large, което е и причината да има движение на устните. Важно: той управлява устните и изражението от каквото аудио му дадете — не генерира и не клонира глас.

Ние наистина го пуснахме (една A800-40GB)

Без увъртане — пуснахме и трите задачи на една NVIDIA A800-SXM4-40GB (torch 2.8+cu128, драйвер 550), в конфигурацията на модела INT8 квантизация + 8-стъпкова дестилация, което е нужно, за да се побере видео-дифузионен модел от този размер върху карта с 40 GB. Ето честния разказ стъпка по стъпка.

Петте капана, в които попаднахме

  • Липсваща зависимост за отделяне на вокал. Аудио pipeline-ът има нужда от модел Kim_Vocal_2 през audio-separator, който не е в стандартните requirements — първото пускане умря, докато не направихме pip install audio-separator==0.30.2.
  • Видео writer-ът се счупи. Записването на кадри се провали с грешка TiffWriter got an unexpected keyword argument fps, защото imageio не можа да намери ffmpeg writer — оправи се с pip install imageio-ffmpeg==0.6.0.
  • Multi-GPU deadlock. Пускането на една задача през няколко карти (context-parallel size 2 или 8) увисваше при NCCL collective desync — и двата ранка чакаха един друг, докато 600s timeout прекъсне изпълнението. Успяхме да работим само с една карта. INT8 теглата се побират на една карта с 40 GB, така че multi-GPU беше полезно само за паралелно пускане на отделни задачи, не за ускоряване на една задача.
  • Недостиг на памет на втория сегмент. Дългите клипове се правят чрез продължаване сегмент след сегмент, а стъпката за продължаване държеше резидентен 48-слоен KV-cache. На карта с 40 GB вторият сегмент стигаше пика и крашваше — не му достигаха около 160 MiB. Трябваше да изкараме и включим флаг --offload_kv_cache (мести кеша в CPU RAM и го връща на стъпка по стъпка), плюс да зададем PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Работи, за сметка на по-бавни сегменти.
  • Подравняване на резолюцията. 480p при multi-card parallelism удари ограничение височината и ширината да са делими на 64; single-card го избягва.

Скорост и памет (измерени)

Ето числото, което има значение: клип с 82 секунди отне 3 586 секунди — малко под час — на A800, или около 44 секунди изчисления за всяка 1 секунда готово видео (приблизително 138s на генериран сегмент при 26 сегмента). Къс клип от 10 секунди пак би бил около 7 минути. И натоварването не е леко: VRAM се вдигна за секунди и после се закова на 40 500 MiB — 98.9% от картата с 40 GB — за целия рендър. Ето реалната употреба, която семплирахме веднъж в секунда:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Примери, които рендирахме

Всеки клип по-долу беше рендериран от нас на описания по-горе A800. За да тестваме модела в предназначените за него сценарии, използвахме официалните демо входни данни на проекта (референтни портрети и аудио), вместо да подбираме наши — така че това са честни, неподбрани резултати, а не „най-доброто от“. Първите два клипа бяха генерирани всеки със своя собствена референтна снимка:

Двете референтни снимки: солов певец за клипа със снимка + аудио и студийна сцена с двама души за клипа с няколко говорители

Вляво: референцията за клипа със снимка + аудио. Вдясно: референцията за клипа с няколко говорители (едно изображение, двама души). Третият клип по-долу използва текст + аудио без референтна снимка — моделът измисля човека, което е и мястото, където е най-слаб.

Снимка + аудио (ATI2V) — workflow-ът за аватар. Идентичността се запазва, устата следи пеенето.
Multi-speaker — двама души, два аудио трака, всяка уста се управлява независимо.
Само текст + аудио, без референтна снимка (AT2V) — слабият случай: вижте как лицето се изкривява и „плува“.

Рендирано от VisionStory с LongCat-Video-Avatar 1.5 на NVIDIA A800, 2026-07-15, при 480p-клас резолюция (768×512 / 832×480), с официалните demo входове на модела.

Честна присъда: силен със снимка, груб без такава

Какво наистина ни впечатли:

  • Идентичността се запазва. В клипа, воден от снимка, човекът остава същият през всичките 82 секунди — коса, дрехи, лице — докато устата следи аудиото. Това е случаят, който има значение за аватари, и работи.
  • Multi-speaker реално работи. Двама души от една сцена, всеки с устни, управлявани от собствен аудио трак, останаха последователни — наистина трудно за изпипване.
  • MIT и търговско качество. Отворени тегла, без таксуване на рендър, и качество на резултата, което би минало за кратък клип.

Къде се проваля — и това са реални проблеми:

  • Генерацията само по текст „плува“. Без референтна снимка моделът измисля човека и в дълъг клип лицето се деформира в зловещ, восъчен близък план, а сцената се измества — вижда се в третия пример по-горе.
  • Бавен е и тежък. ~44s изчисления за 1s видео, като заковава 40 GB карта през цялото време. Клип от 82 секунди е час.
  • 40 GB е минимумът. Нашето изпълнение искаше INT8 + дестилация само за да се побере, а multi-segment клиповете оцеляха само с offload на KV-cache към CPU. По-малките карти отпадат.
  • На практика — само една карта. Multi-GPU context-parallel deadlock-ваше на нашата машина, така че няма лесен начин да ускорите един клип, като добавите карти.
  • Няма глас. Управлява устните от аудиото, което подавате — не прави text-to-speech или voice cloning, така че пак ви трябва отделен източник на глас.
  • 480p на този хардуер. Това, което успяхме да пуснем на една карта с 40 GB, беше 480p-клас output.

Self-host LongCat срещу хостван инструмент: кое да изберете?

И двете произвеждат едно и също — снимка плюс аудио става говорещо видео. Разликата е изцяло в това колко ви струва да стигнете дотам. Хостван инструмент като VisionStory пуска модела вместо вас; ето честния компромис.

 LongCat (self-host)VisionStory (хоствано)
ХардуерA100/A800 с 40 GB (хиляди долари)Никакъв — работи в браузъра
НастройкаCUDA, flash-attn, INT8, поправки по deps, OOM tuningВлизате и започвате
Време за клип~44s изчисления за 1s видео (клип 82s ≈ 1 час)Секунди, на хоствани GPU
Резолюция (нашият тест)480p-класHD и нагоре
ГласВие подавате аудиото (без TTS/клониране)Вградени гласове и клониране на глас
Търговска употребаДа (MIT)Да (според плана)
ПоддръжкаВие пачвате deps, OOM, драйвериНяма
Най-подходящо, когатоИмате GPU и ви трябва self-host/offline/on-premИскате готово говорещо видео — бързо

Изберете LongCat, ако имате хардуера и работата наистина трябва да е self-host — on-prem, офлайн или напълно под ваш контрол — и ви е комфортно да поддържате CUDA stack. Изберете хостван инструмент, ако искате същото говорещо видео от снимка + аудио, без час изчисления и GPU за петцифрена сума.

Какво ни научи LongCat

Истинският урок от пускането на LongCat-Video-Avatar е, че качеството на open avatar-video вече е тук — с референтна снимка този безплатен модел прави клипове, достатъчно добри за реална употреба. Моделът вече не е трудната част.

Трудната част е всичко около него: да поберете видео-дифузионен модел на карта, която можете да си позволите, да преживеете OOM на втория сегмент, да чакате час за 82 секунди и да го съчетаете с глас. Тази пропаст — между способен checkpoint и завършено говорещо видео, което всеки може да направи — е точно работата, която вършим. Ако искате да видите другата страна, VisionStory превръща снимка и сценарий в lip-synced говорещ аватар в браузъра ви за секунди, а ако ви трябва и гласът, нашият teardown на open-source TTS показва къде е стигнала и тази половина.

Често задавани въпроси

  • Да. LongCat-Video-Avatar 1.5 е пуснат под MIT лиценз, който позволява комерсиална употреба, и няма таксуване на рендер. Плащате само за GPU изчисленията, които използва.