A Meituan nyílt forráskódúvá tette a LongCat-Video-Avatar 1.5-öt, és pontosan azt csinálja, amit a VisionStory a lényege szerint — egy álló fotót és egy hangsávot beszélőavatar-videóvá alakít. Ez elég volt ahhoz, hogy tényleg lefuttassuk. Ez egy gyakorlati szétszedés: mi ez, mennyire teljesít valójában, az 5 telepítési csapda, amibe belefutottunk, és mennyibe kerül saját magadnak futtatni egy hosztolt eszközhöz képest. Forrás: github.com/meituan-longcat/LongCat-Video (MIT).
Mi a LongCat-Video-Avatar, és ki készítette?
A LongCat-Video-Avatar 1.5 egy nyílt súlyú hangvezérelt ember-videó modell a Meituantól (a LongCat csapat). A LongCat-Video alapmodellre épül, és a megengedő MIT licenc alatt jelent meg — tényleg ingyenes kereskedelmi felhasználásra is. 2026-07 állapot szerint a kódtárnak nagyjából 5 200 GitHub csillaga van, és az 1.5-ös súlyok a közelmúlt kedveltebb Hugging Face megjelenései közé tartoznak.
Három natív feladatot támogat: Hang + Szöveg videóvá (AT2V, referencia kép nélkül), Hang + Szöveg + Kép videóvá (ATI2V — a referenciafotó vezérli az identitást, ez illeszkedik a valódi avatar-workflowhoz), valamint videó folytatása egy klip meghosszabbításához egyetlen szegmens után. Az 1.5-ös verzió Whisper-Large hangkódolóra váltott, ez adja az ajakmozgást. Fontos: az ajkakat és a mimikát abból a hangból vezérli, amit adsz neki — nem generál és nem klónoz hangot.
Tényleg lefuttattuk (egy darab A800-40GB)
Semmi mellébeszélés — mindhárom feladatot lefuttattuk egyetlen NVIDIA A800-SXM4-40GB-n (torch 2.8+cu128, driver 550), a modell INT8-kvantált + 8 lépéses distill konfigurációjában, ami ahhoz kell, hogy egy ekkora videó-diffúziós modell beférjen egy 40 GB-os kártyára. Íme a kendőzetlen, lépésről lépésre beszámoló.
Az 5 csapda, amibe belefutottunk
- Hiányzó vokál-szeparáló függőség. A hang pipeline-nak kell egy Kim_Vocal_2 modell az
audio-separatorcsomagon keresztül, ami nincs a default requirements-ben — az első futás elhasalt, míg nem ment apip install audio-separator==0.30.2. - Felrobbant a videóíró. A képkockák mentése
TiffWriter got an unexpected keyword argument fpshibával elbukott, mert az imageio nem talált ffmpeg writert — javítás:pip install imageio-ffmpeg==0.6.0. - Több-GPU-s holtpontok. Egy feladat több kártyán (context-parallel size 2 vagy 8) NCCL collective desync miatt beragadt — mindkét rank a másikra várt, míg a 600s timeout le nem állította a futást. Csak egy kártyán tudtuk futtatni. Az INT8 súlyok beférnek egy 40 GB-os kártyára, így a multi-GPU nálunk csak arra volt jó, hogy több külön feladat fusson párhuzamosan, nem arra, hogy egy feladat gyorsabb legyen.
- Elfogyott a memória a 2. szegmensnél. A hosszú klipek szegmensről szegmensre folytatással épülnek, és a continuation lépés egy 48 rétegű KV-cache-t tartott rezidensen. 40 GB-on a második szegmensnél tetőzött és elszállt — kb. 160 MiB hiányzott a beféréshez. Ki kellett vezetnünk és bekapcsolnunk egy
--offload_kv_cacheflaget (a cache átrakása CPU RAM-ba, majd lépésenkénti visszalapozás), plusz beállítani aPYTORCH_CUDA_ALLOC_CONF=expandable_segments:Trueértéket. Működik, cserébe a szegmensek lassabbak. - Felbontás-igazítás. A 480p többkártyás párhuzamosítás mellett beleütközött egy 64-gyel oszthatósági megkötésbe a szélességre és magasságra; egykártyás módban ez elkerülhető.
Sebesség és memória (mért)
Ez az a szám, ami számít: egy 82 másodperces klip 3 586 másodpercet — alig kevesebb mint egy órát — vett igénybe az A800-on, azaz nagyjából 44 másodpercnyi számítás minden 1 másodpercnyi kész videóra (kb. 138 s szegmensenként 26 szegmensen át). Egy rövid, 10 másodperces klip is kb. 7 perc lenne. És ez nem könnyű terhelés: a VRAM másodpercek alatt felkúszott, majd 40 500 MiB-on — a 40 GB-os kártya 98,9%-án — végig plafonon maradt a teljes render alatt. Íme a tényleges használat, amit másodpercenként egyszer mintavételeztünk:
Minták, amiket kirendereltünk
Az alábbi klipek mindegyikét mi rendereltük a fentebb bemutatott A800-on. Hogy a modellt a tervezett felhasználási helyzeteiben mérjük össze, a projekt saját hivatalos demóbemeneteit (referencia portrékat és hangot) használtuk, ahelyett hogy mi válogattunk volna — vagyis ezek őszinte, nem „csemegézett” kimenetek, nem egy válogatott csúcspont-összeállítás. Az első két klipet mindkettőnél a saját referenciafotója vezérelte:
Balra: a fotó + hang klip referenciája. Jobbra: a többbeszélős klip referenciája (egy kép, két ember). Az alábbi harmadik klipben a szöveg + hang referenciafotó nélkül vezérelte a modellt — ilyenkor a modell kitalálja a személyt, és itt a leggyengébb.
A VisionStory renderelte LongCat-Video-Avatar 1.5-tel NVIDIA A800-on, 2026-07-15-én, 480p-kategóriás felbontáson (768×512 / 832×480), a modell hivatalos demo bemeneteivel.
Őszinte verdikt: fotóval erős, nélküle döcögős
Ami tényleg lenyűgözött:
- Az identitás megmarad. A fotóvezérelt klipben ugyanaz az ember marad végig mind a 82 másodpercben — haj, ruha, arc — miközben a száj követi a hangot. Ez az az eset, ami az avataroknál számít, és működik.
- A több beszélős mód tényleg működik. Két ember egy jelenetből, mindkettő ajakmozgása a saját hangsávjával vezérelve, koherens maradt — ezt valóban nehéz jól megcsinálni.
- MIT és kereskedelmi szint. Nyílt súlyok, nincs renderenkénti számlázás, és olyan minőség, ami egy rövid klipben simán megállná a helyét.
Ahol elvérzik — és ezek valós problémák:
- A csak szöveges generálás elúszik. Referenciafotó nélkül a modell kitalálja a személyt, és hosszú klipben az arc bizarr, viaszos közeli felvétellé torzul, a jelenet pedig elcsúszik — ez látszik a harmadik mintán.
- Lassú és nehéz. ~44 s számítás 1 s videónként, miközben végig plafonon tart egy 40 GB-os kártyát. Egy 82 másodperces klip egy óra.
- A 40 GB az alsó határ. A futásunkhoz INT8 + distill kellett, csak hogy beférjen, és a több szegmensből álló klipek is csak úgy élték túl, hogy a KV-cache-t CPU-ra offloadoltuk. Kisebb kártyák kiesnek.
- Gyakorlatban csak egykártyás. A több-GPU-s context-parallel nálunk holtpontba futott, így nincs egyszerű mód egy klip gyorsítására több kártya hozzáadásával.
- Nincs Hang. Az ajkakat a te általad adott hangból vezérli — nem csinál szövegfelolvasást és hangklónozást, így külön hangforrásra továbbra is szükség van.
- 480p, ezen a hardveren. Egyetlen 40 GB-os kártyán nálunk 480p-kategóriás kimenet ment.
LongCat önhostolás vs hosztolt eszköz: melyiket válaszd?
Mindkettő ugyanazt adja — egy fotóból és hangból beszélő videó lesz. A különbség teljes egészében abban van, mennyibe kerül eljutni oda. Egy hosztolt eszköz, például a VisionStory, helyetted futtatja a modellt; íme az őszinte csereüzlet.
| LongCat (önhost) | VisionStory (hosztolt) | |
|---|---|---|
| Hardver | Egy 40 GB-os A100/A800 (több ezer dollár) | Semmi — böngészőben fut |
| Beüzemelés | CUDA, flash-attn, INT8, dep javítások, OOM hangolás | Jelentkezz be, és mehet |
| Idő klipenként | ~44 s számítás 1 s videóra (82 s klip ≈ 1 óra) | Másodpercek, hosztolt GPU-kon |
| Felbontás (nálunk) | 480p-kategória | HD videó és afölött |
| Hang | Te adod a hangot (nincs TTS/klónozás) | Beépített hangok és hangklónozás |
| Kereskedelmi felhasználás | Igen (MIT) | Igen (csomagtól függ) |
| Karbantartás | Te patcheled a függőségeket, OOM-ot, drivereket | Semmi |
| Legjobb, ha | Van GPU-d, és önhostolt/offline/on-prem kell | Kész beszélő videót akarsz gyorsan |
A LongCatet válaszd, ha megvan a hardver, és a munkának tényleg önhostoltnak kell lennie — on-prem, offline, vagy teljesen a te kontrollod alatt — és kényelmesen karbantartasz egy CUDA stacket. Hosztolt eszközt válassz, ha ugyanazt a fotó+hang beszélő videót szeretnéd egy óra számítás és egy öt számjegyű GPU nélkül.
Amit a LongCat tanított nekünk
A LongCat-Video-Avatar futtatásának igazi tanulsága az, hogy megérkezett a nyílt avatar-videó minőség — referenciafotóval ez az ingyenes modell olyan klipeket ad, amelyek már valós használatra is elég jók. Már nem a modell a nehéz rész.
A nehéz rész minden, ami körülötte van: bepréselni egy videó-diffúziós modellt egy megfizethető kártyára, túlélni az OOM-ot a 2. szegmensnél, kivárni egy órát 82 másodpercért, és mellé párosítani egy Hangot. Ez a szakadék — egy kompetens checkpoint és egy kész beszélő videó között, amit bárki el tud készíteni — pontosan az a munka, amit mi végzünk. Ha kíváncsi vagy a másik oldalra: a VisionStory másodpercek alatt, a böngésződben csinál egy fotóból és szövegből ajakszinkronos beszélő avatart, és ha a Hang is kell, az open-source TTS szétszedésünk bemutatja, hol tart most az a fél.
