Meituan open-sourcoval LongCat-Video-Avatar 1.5 a ten dělá přesně to, co VisionStory v jádru — vezme statickou fotku a zvukovou stopu a promění je v video s mluvícím avatarem. To nás zaujalo natolik, že jsme ho opravdu spustili. Tohle je praktická pitva: co to je, jak dobře to doopravdy funguje, pět pastí při nastavení, na které jsme narazili, a kolik stojí provoz u vás oproti hostovanému nástroji. Zdroj: github.com/meituan-longcat/LongCat-Video (MIT).

Co je LongCat-Video-Avatar a kdo ho vytvořil?

LongCat-Video-Avatar 1.5 je open-weight model pro audio-řízené video člověka od Meituan (tým LongCat). Je postavený na základním modelu LongCat-Video a vydaný pod benevolentní licencí MIT — reálně zdarma i pro komerční použití. K 2026-07 má repozitář zhruba 5 200 hvězdiček na GitHubu a váhy 1.5 patří mezi oblíbenější nedávná vydání na Hugging Face.

Podporuje tři nativní úlohy: Audio + Text to Video (AT2V, bez referenčního obrázku), Audio + Text + Image to Video (ATI2V — referenční fotka určuje identitu, tedy případ odpovídající reálnému avatar workflow) a pokračování videa, které prodlouží klip za jeden segment. Verze 1.5 vyměnila audio encoder za Whisper-Large, díky čemuž má pohyb rtů. Důležité je, že řídí rty a výraz podle jakéhokoli audia, které mu dáte — hlas negeneruje ani neklonuje.

Opravdu jsme ho spustili (jedna A800-40GB)

Žádné mlžení — spustili jsme všechny tři úlohy na jedné NVIDIA A800-SXM4-40GB (torch 2.8+cu128, ovladač 550) v konfiguraci INT8 kvantizace + 8kroková distilace, což je minimum, aby se video-diffusion model téhle velikosti vešel na 40 GB kartu. Tady je upřímný průběh krok za krokem.

Pět pastí, na které jsme narazili

  • Chybějící závislost pro separaci vokálů. Audio pipeline potřebuje model Kim_Vocal_2 přes audio-separator, který není ve výchozích požadavcích — první spuštění spadlo, dokud jsme nedali pip install audio-separator==0.30.2.
  • Spadl zapisovač videa. Ukládání snímků selhalo s chybou TiffWriter got an unexpected keyword argument fps, protože imageio nenašlo ffmpeg writer — opraveno přes pip install imageio-ffmpeg==0.6.0.
  • Deadlock na multi-GPU. Spuštění jedné úlohy napříč více kartami (context-parallel size 2 nebo 8) se zaseklo na rozjeté NCCL kolektivní operaci — oba ranky na sebe čekaly, dokud timeout 600 s běh neukončil. Dokázali jsme běžet jen na jedné kartě. INT8 váhy se na jednu 40 GB kartu vejdou, takže multi-GPU bylo užitečné jen pro paralelní běh více úloh, ne pro zrychlení jedné.
  • Nedostatek paměti u druhého segmentu. Dlouhé klipy se skládají pokračováním segment po segmentu a krok pokračování držel v paměti 48vrstvou KV-cache. Na 40 GB kartě druhý segment vyčerpal VRAM a spadl — chybělo asi 160 MiB. Museli jsme odhalit a zapnout přepínač --offload_kv_cache (přesun cache do RAM na CPU a stránkování zpět po krocích) a navíc nastavit PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funguje to, za cenu pomalejších segmentů.
  • Zarovnání rozlišení. 480p při paralelismu na více kartách narazilo na podmínku dělitelnosti 64 pro výšku a šířku; běh na jedné kartě se tomu vyhne.

Rychlost a paměť (měřeno)

Tohle je číslo, na kterém záleží: klip o délce 82 sekund trval na A800 3 586 sekund — těsně pod hodinu — tedy zhruba 44 sekund výpočtu na každou 1 sekundu hotového videa (cca 138 s na vygenerovaný segment napříč 26 segmenty). Krátký 10sekundový klip by i tak vyšel zhruba na 7 minut. A není to žádná drobnost: VRAM vyletěla během pár sekund a pak byla přilepená na 40 500 MiB — 98,9 % 40 GB karty — po celý render. Tady je reálné využití, které jsme vzorkovali jednou za sekundu:

Využití VRAM během 82sekundového renderu LongCat-Video-Avatar, téměř na limitu 40 GB po celou hodinu

Ukázky, které jsme vyrenderovali

Každý klip níže jsme vyrenderovali my na A800 popsaném výše. Abychom model otestovali v zamýšlených scénářích, použili jsme oficiální demo vstupy projektu (referenční portréty a zvuk) místo toho, abychom si připravovali vlastní — takže jde o poctivé, nevybírané „třešničky“, ale skutečné výstupy, ne o sestřih těch nejlepších momentů. První dva klipy byly každý řízený vlastní referenční fotkou:

Dvě referenční fotky: sólový zpěvák pro klip s fotkou a zvukem a studiová scéna se dvěma lidmi pro klip s více mluvčími

Vlevo: reference pro klip s fotkou + zvukem. Vpravo: reference pro klip s více mluvčími (jeden obrázek, dva lidé). Třetí klip níže používal text + zvuk bez referenční fotky — model si osobu vymyslí, a právě tam je nejslabší.

Fotka + audio (ATI2V) — avatar workflow. Identita drží, pusa sleduje zpěv.
Více mluvčích — dva lidé, dvě audio stopy, každá pusa řízená nezávisle.
Jen text + audio, bez referenční fotky (AT2V) — slabý případ: sledujte, jak se obličej deformuje a ujíždí.

Vyrenderováno týmem VisionStory pomocí LongCat-Video-Avatar 1.5 na NVIDIA A800, 2026-07-15, v rozlišení třídy 480p (768×512 / 832×480), s použitím oficiálních demo vstupů modelu.

Upřímný verdikt: s fotkou silné, bez fotky drsné

Co nás upřímně nadchlo:

  • Identita drží. V klipu řízeném fotkou zůstává člověk stejný po celých 82 sekund — vlasy, oblečení, obličej — zatímco pusa sleduje audio. To je přesně ten případ, který u avatarů rozhoduje, a funguje to.
  • Více mluvčích opravdu funguje. Dva lidé z jedné scény, každý synchronizovaný podle své audio stopy, zůstali konzistentní — a to je opravdu těžké udělat dobře.
  • MIT a kvalita pro komerční použití. Otevřené váhy, žádné účtování za každý render a kvalita výstupu, která v krátkém klipu obstojí.

Kde to padá — a tohle jsou reálné věci:

  • Generování jen z textu ujíždí. Bez referenční fotky model člověka vymyslí a v dlouhém klipu se tvář deformuje do nepříjemného, voskového detailu a mění se i scéna — je to vidět ve třetí ukázce výše.
  • Je to pomalé a těžké. ~44 s výpočtu na 1 s videa, po celou dobu vytížení 40 GB karty. 82 sekund klipu = hodina.
  • 40 GB je minimum. Potřebovali jsme INT8 + distilaci jen proto, aby se to vešlo, a vícesegmentové klipy přežily jen díky offloadu KV-cache na CPU. Menší karty jsou mimo hru.
  • V praxi jen jedna karta. Multi-GPU context-parallel se nám na stroji deadlocknul, takže není jednoduché zrychlit jeden klip přidáním dalších karet.
  • Bez hlasu. Rty řídí podle audia, které dodáte — neumí text-to-speech ani klonování hlasu, takže pořád potřebujete samostatný zdroj hlasu.
  • 480p na tomhle hardwaru. Na jedné 40 GB kartě jsme zvládli výstup třídy 480p.

Self-host LongCat vs hostovaný nástroj: co vybrat?

Obojí vyrobí to samé — fotka + audio se promění v mluvící video. Rozdíl je čistě v tom, kolik vás stojí se k tomu dostat. Hostovaný nástroj jako VisionStory spustí model za vás; tady je upřímné srovnání.

 LongCat (self-host)VisionStory (hostované)
Hardware40 GB A100/A800 (tisíce dolarů)Žádný — běží v prohlížeči
NastaveníCUDA, flash-attn, INT8, opravy závislostí, ladění OOMPřihlaste se a jedete
Čas na klip~44 s výpočtu na 1 s videa (82 s klip ≈ 1 hodina)Sekundy na hostovaných GPU
Rozlišení (náš běh)třída 480pHD a výš
HlasAudio dodáte vy (bez TTS/klonu)Vestavěné hlasy a klonování hlasu
Komerční použitíAno (MIT)Ano (podle tarifu)
ÚdržbaVy opravujete závislosti, OOM, ovladačeŽádná
Nejlepší kdyžMáte GPU a potřebujete self-host / offline / on-premChcete hotové mluvící video rychle

Zvolte LongCat, pokud máte hardware a práce opravdu musí běžet u vás — on-prem, offline nebo plně pod vaší kontrolou — a jste v pohodě s údržbou CUDA stacku. Zvolte hostovaný nástroj, pokud chcete stejné mluvící video z fotky a audia bez hodiny výpočtu a bez GPU za pětimístnou částku.

Co nás LongCat naučil

Skutečná lekce z běhu LongCat-Video-Avatar je, že kvalita open avatar videí dorazila — s referenční fotkou tenhle bezplatný model produkuje klipy dost dobré pro reálné použití. Model už není ta těžká část.

Těžká je všechno okolo: narvat video-diffusion model na kartu, kterou si můžete dovolit, přežít OOM u druhého segmentu, čekat hodinu na 82 sekund a spárovat to s hlasem. Ta mezera — mezi schopným checkpointem a hotovým mluvícím videem, které zvládne vytvořit kdokoli — je přesně práce, kterou děláme. Pokud chcete vidět druhou stranu, VisionStory promění fotku a scénář na synchronizovaného mluvícího avatara v prohlížeči během pár sekund, a pokud potřebujete i hlas, naše pitva open-source TTS ukazuje, kde je dnes tahle polovina.

Často kladené otázky

  • Ano. LongCat-Video-Avatar 1.5 je vydán pod licencí MIT, která umožňuje komerční použití, a neúčtuje se za jednotlivé rendery. Platíte jen za GPU výpočetní výkon, který spotřebuje.