Meituan open-sourcoval LongCat-Video-Avatar 1.5 a ten dělá přesně to, co VisionStory v jádru — vezme statickou fotku a zvukovou stopu a promění je v video s mluvícím avatarem. To nás zaujalo natolik, že jsme ho opravdu spustili. Tohle je praktická pitva: co to je, jak dobře to doopravdy funguje, pět pastí při nastavení, na které jsme narazili, a kolik stojí provoz u vás oproti hostovanému nástroji. Zdroj: github.com/meituan-longcat/LongCat-Video (MIT).
Co je LongCat-Video-Avatar a kdo ho vytvořil?
LongCat-Video-Avatar 1.5 je open-weight model pro audio-řízené video člověka od Meituan (tým LongCat). Je postavený na základním modelu LongCat-Video a vydaný pod benevolentní licencí MIT — reálně zdarma i pro komerční použití. K 2026-07 má repozitář zhruba 5 200 hvězdiček na GitHubu a váhy 1.5 patří mezi oblíbenější nedávná vydání na Hugging Face.
Podporuje tři nativní úlohy: Audio + Text to Video (AT2V, bez referenčního obrázku), Audio + Text + Image to Video (ATI2V — referenční fotka určuje identitu, tedy případ odpovídající reálnému avatar workflow) a pokračování videa, které prodlouží klip za jeden segment. Verze 1.5 vyměnila audio encoder za Whisper-Large, díky čemuž má pohyb rtů. Důležité je, že řídí rty a výraz podle jakéhokoli audia, které mu dáte — hlas negeneruje ani neklonuje.
Opravdu jsme ho spustili (jedna A800-40GB)
Žádné mlžení — spustili jsme všechny tři úlohy na jedné NVIDIA A800-SXM4-40GB (torch 2.8+cu128, ovladač 550) v konfiguraci INT8 kvantizace + 8kroková distilace, což je minimum, aby se video-diffusion model téhle velikosti vešel na 40 GB kartu. Tady je upřímný průběh krok za krokem.
Pět pastí, na které jsme narazili
- Chybějící závislost pro separaci vokálů. Audio pipeline potřebuje model Kim_Vocal_2 přes
audio-separator, který není ve výchozích požadavcích — první spuštění spadlo, dokud jsme nedalipip install audio-separator==0.30.2. - Spadl zapisovač videa. Ukládání snímků selhalo s chybou
TiffWriter got an unexpected keyword argument fps, protože imageio nenašlo ffmpeg writer — opraveno přespip install imageio-ffmpeg==0.6.0. - Deadlock na multi-GPU. Spuštění jedné úlohy napříč více kartami (context-parallel size 2 nebo 8) se zaseklo na rozjeté NCCL kolektivní operaci — oba ranky na sebe čekaly, dokud timeout 600 s běh neukončil. Dokázali jsme běžet jen na jedné kartě. INT8 váhy se na jednu 40 GB kartu vejdou, takže multi-GPU bylo užitečné jen pro paralelní běh více úloh, ne pro zrychlení jedné.
- Nedostatek paměti u druhého segmentu. Dlouhé klipy se skládají pokračováním segment po segmentu a krok pokračování držel v paměti 48vrstvou KV-cache. Na 40 GB kartě druhý segment vyčerpal VRAM a spadl — chybělo asi 160 MiB. Museli jsme odhalit a zapnout přepínač
--offload_kv_cache(přesun cache do RAM na CPU a stránkování zpět po krocích) a navíc nastavitPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funguje to, za cenu pomalejších segmentů. - Zarovnání rozlišení. 480p při paralelismu na více kartách narazilo na podmínku dělitelnosti 64 pro výšku a šířku; běh na jedné kartě se tomu vyhne.
Rychlost a paměť (měřeno)
Tohle je číslo, na kterém záleží: klip o délce 82 sekund trval na A800 3 586 sekund — těsně pod hodinu — tedy zhruba 44 sekund výpočtu na každou 1 sekundu hotového videa (cca 138 s na vygenerovaný segment napříč 26 segmenty). Krátký 10sekundový klip by i tak vyšel zhruba na 7 minut. A není to žádná drobnost: VRAM vyletěla během pár sekund a pak byla přilepená na 40 500 MiB — 98,9 % 40 GB karty — po celý render. Tady je reálné využití, které jsme vzorkovali jednou za sekundu:
Ukázky, které jsme vyrenderovali
Každý klip níže jsme vyrenderovali my na A800 popsaném výše. Abychom model otestovali v zamýšlených scénářích, použili jsme oficiální demo vstupy projektu (referenční portréty a zvuk) místo toho, abychom si připravovali vlastní — takže jde o poctivé, nevybírané „třešničky“, ale skutečné výstupy, ne o sestřih těch nejlepších momentů. První dva klipy byly každý řízený vlastní referenční fotkou:
Vlevo: reference pro klip s fotkou + zvukem. Vpravo: reference pro klip s více mluvčími (jeden obrázek, dva lidé). Třetí klip níže používal text + zvuk bez referenční fotky — model si osobu vymyslí, a právě tam je nejslabší.
Vyrenderováno týmem VisionStory pomocí LongCat-Video-Avatar 1.5 na NVIDIA A800, 2026-07-15, v rozlišení třídy 480p (768×512 / 832×480), s použitím oficiálních demo vstupů modelu.
Upřímný verdikt: s fotkou silné, bez fotky drsné
Co nás upřímně nadchlo:
- Identita drží. V klipu řízeném fotkou zůstává člověk stejný po celých 82 sekund — vlasy, oblečení, obličej — zatímco pusa sleduje audio. To je přesně ten případ, který u avatarů rozhoduje, a funguje to.
- Více mluvčích opravdu funguje. Dva lidé z jedné scény, každý synchronizovaný podle své audio stopy, zůstali konzistentní — a to je opravdu těžké udělat dobře.
- MIT a kvalita pro komerční použití. Otevřené váhy, žádné účtování za každý render a kvalita výstupu, která v krátkém klipu obstojí.
Kde to padá — a tohle jsou reálné věci:
- Generování jen z textu ujíždí. Bez referenční fotky model člověka vymyslí a v dlouhém klipu se tvář deformuje do nepříjemného, voskového detailu a mění se i scéna — je to vidět ve třetí ukázce výše.
- Je to pomalé a těžké. ~44 s výpočtu na 1 s videa, po celou dobu vytížení 40 GB karty. 82 sekund klipu = hodina.
- 40 GB je minimum. Potřebovali jsme INT8 + distilaci jen proto, aby se to vešlo, a vícesegmentové klipy přežily jen díky offloadu KV-cache na CPU. Menší karty jsou mimo hru.
- V praxi jen jedna karta. Multi-GPU context-parallel se nám na stroji deadlocknul, takže není jednoduché zrychlit jeden klip přidáním dalších karet.
- Bez hlasu. Rty řídí podle audia, které dodáte — neumí text-to-speech ani klonování hlasu, takže pořád potřebujete samostatný zdroj hlasu.
- 480p na tomhle hardwaru. Na jedné 40 GB kartě jsme zvládli výstup třídy 480p.
Self-host LongCat vs hostovaný nástroj: co vybrat?
Obojí vyrobí to samé — fotka + audio se promění v mluvící video. Rozdíl je čistě v tom, kolik vás stojí se k tomu dostat. Hostovaný nástroj jako VisionStory spustí model za vás; tady je upřímné srovnání.
| LongCat (self-host) | VisionStory (hostované) | |
|---|---|---|
| Hardware | 40 GB A100/A800 (tisíce dolarů) | Žádný — běží v prohlížeči |
| Nastavení | CUDA, flash-attn, INT8, opravy závislostí, ladění OOM | Přihlaste se a jedete |
| Čas na klip | ~44 s výpočtu na 1 s videa (82 s klip ≈ 1 hodina) | Sekundy na hostovaných GPU |
| Rozlišení (náš běh) | třída 480p | HD a výš |
| Hlas | Audio dodáte vy (bez TTS/klonu) | Vestavěné hlasy a klonování hlasu |
| Komerční použití | Ano (MIT) | Ano (podle tarifu) |
| Údržba | Vy opravujete závislosti, OOM, ovladače | Žádná |
| Nejlepší když | Máte GPU a potřebujete self-host / offline / on-prem | Chcete hotové mluvící video rychle |
Zvolte LongCat, pokud máte hardware a práce opravdu musí běžet u vás — on-prem, offline nebo plně pod vaší kontrolou — a jste v pohodě s údržbou CUDA stacku. Zvolte hostovaný nástroj, pokud chcete stejné mluvící video z fotky a audia bez hodiny výpočtu a bez GPU za pětimístnou částku.
Co nás LongCat naučil
Skutečná lekce z běhu LongCat-Video-Avatar je, že kvalita open avatar videí dorazila — s referenční fotkou tenhle bezplatný model produkuje klipy dost dobré pro reálné použití. Model už není ta těžká část.
Těžká je všechno okolo: narvat video-diffusion model na kartu, kterou si můžete dovolit, přežít OOM u druhého segmentu, čekat hodinu na 82 sekund a spárovat to s hlasem. Ta mezera — mezi schopným checkpointem a hotovým mluvícím videem, které zvládne vytvořit kdokoli — je přesně práce, kterou děláme. Pokud chcete vidět druhou stranu, VisionStory promění fotku a scénář na synchronizovaného mluvícího avatara v prohlížeči během pár sekund, a pokud potřebujete i hlas, naše pitva open-source TTS ukazuje, kde je dnes tahle polovina.
