A Meituan nyílt forráskódúvá tette a LongCat-Video-Avatar 1.5-öt, és pontosan azt csinálja, amit a VisionStory a lényege szerint — egy álló fotót és egy hangsávot beszélőavatar-videóvá alakít. Ez elég volt ahhoz, hogy tényleg lefuttassuk. Ez egy gyakorlati szétszedés: mi ez, mennyire teljesít valójában, az 5 telepítési csapda, amibe belefutottunk, és mennyibe kerül saját magadnak futtatni egy hosztolt eszközhöz képest. Forrás: github.com/meituan-longcat/LongCat-Video (MIT).

Mi a LongCat-Video-Avatar, és ki készítette?

A LongCat-Video-Avatar 1.5 egy nyílt súlyú hangvezérelt ember-videó modell a Meituantól (a LongCat csapat). A LongCat-Video alapmodellre épül, és a megengedő MIT licenc alatt jelent meg — tényleg ingyenes kereskedelmi felhasználásra is. 2026-07 állapot szerint a kódtárnak nagyjából 5 200 GitHub csillaga van, és az 1.5-ös súlyok a közelmúlt kedveltebb Hugging Face megjelenései közé tartoznak.

Három natív feladatot támogat: Hang + Szöveg videóvá (AT2V, referencia kép nélkül), Hang + Szöveg + Kép videóvá (ATI2V — a referenciafotó vezérli az identitást, ez illeszkedik a valódi avatar-workflowhoz), valamint videó folytatása egy klip meghosszabbításához egyetlen szegmens után. Az 1.5-ös verzió Whisper-Large hangkódolóra váltott, ez adja az ajakmozgást. Fontos: az ajkakat és a mimikát abból a hangból vezérli, amit adsz neki — nem generál és nem klónoz hangot.

Tényleg lefuttattuk (egy darab A800-40GB)

Semmi mellébeszélés — mindhárom feladatot lefuttattuk egyetlen NVIDIA A800-SXM4-40GB-n (torch 2.8+cu128, driver 550), a modell INT8-kvantált + 8 lépéses distill konfigurációjában, ami ahhoz kell, hogy egy ekkora videó-diffúziós modell beférjen egy 40 GB-os kártyára. Íme a kendőzetlen, lépésről lépésre beszámoló.

Az 5 csapda, amibe belefutottunk

  • Hiányzó vokál-szeparáló függőség. A hang pipeline-nak kell egy Kim_Vocal_2 modell az audio-separator csomagon keresztül, ami nincs a default requirements-ben — az első futás elhasalt, míg nem ment a pip install audio-separator==0.30.2.
  • Felrobbant a videóíró. A képkockák mentése TiffWriter got an unexpected keyword argument fps hibával elbukott, mert az imageio nem talált ffmpeg writert — javítás: pip install imageio-ffmpeg==0.6.0.
  • Több-GPU-s holtpontok. Egy feladat több kártyán (context-parallel size 2 vagy 8) NCCL collective desync miatt beragadt — mindkét rank a másikra várt, míg a 600s timeout le nem állította a futást. Csak egy kártyán tudtuk futtatni. Az INT8 súlyok beférnek egy 40 GB-os kártyára, így a multi-GPU nálunk csak arra volt jó, hogy több külön feladat fusson párhuzamosan, nem arra, hogy egy feladat gyorsabb legyen.
  • Elfogyott a memória a 2. szegmensnél. A hosszú klipek szegmensről szegmensre folytatással épülnek, és a continuation lépés egy 48 rétegű KV-cache-t tartott rezidensen. 40 GB-on a második szegmensnél tetőzött és elszállt — kb. 160 MiB hiányzott a beféréshez. Ki kellett vezetnünk és bekapcsolnunk egy --offload_kv_cache flaget (a cache átrakása CPU RAM-ba, majd lépésenkénti visszalapozás), plusz beállítani a PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True értéket. Működik, cserébe a szegmensek lassabbak.
  • Felbontás-igazítás. A 480p többkártyás párhuzamosítás mellett beleütközött egy 64-gyel oszthatósági megkötésbe a szélességre és magasságra; egykártyás módban ez elkerülhető.

Sebesség és memória (mért)

Ez az a szám, ami számít: egy 82 másodperces klip 3 586 másodpercet — alig kevesebb mint egy órát — vett igénybe az A800-on, azaz nagyjából 44 másodpercnyi számítás minden 1 másodpercnyi kész videóra (kb. 138 s szegmensenként 26 szegmensen át). Egy rövid, 10 másodperces klip is kb. 7 perc lenne. És ez nem könnyű terhelés: a VRAM másodpercek alatt felkúszott, majd 40 500 MiB-on — a 40 GB-os kártya 98,9%-án — végig plafonon maradt a teljes render alatt. Íme a tényleges használat, amit másodpercenként egyszer mintavételeztünk:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Minták, amiket kirendereltünk

Az alábbi klipek mindegyikét mi rendereltük a fentebb bemutatott A800-on. Hogy a modellt a tervezett felhasználási helyzeteiben mérjük össze, a projekt saját hivatalos demóbemeneteit (referencia portrékat és hangot) használtuk, ahelyett hogy mi válogattunk volna — vagyis ezek őszinte, nem „csemegézett” kimenetek, nem egy válogatott csúcspont-összeállítás. Az első két klipet mindkettőnél a saját referenciafotója vezérelte:

A két referenciafotó: egy szólóénekes a fotó+hang kliphez, és egy kétszereplős stúdiójelenet a többbeszélős kliphez

Balra: a fotó + hang klip referenciája. Jobbra: a többbeszélős klip referenciája (egy kép, két ember). Az alábbi harmadik klipben a szöveg + hang referenciafotó nélkül vezérelte a modellt — ilyenkor a modell kitalálja a személyt, és itt a leggyengébb.

Fotó + hang (ATI2V) — az avatar-workflow. Az identitás megmarad, a száj követi az éneket.
Több beszélő — két ember, két hangsáv, mindkét száj külön-külön vezérelve.
Csak szöveg + hang, referenciafotó nélkül (AT2V) — a gyenge eset: figyeld, ahogy az arc torzul és elcsúszik.

A VisionStory renderelte LongCat-Video-Avatar 1.5-tel NVIDIA A800-on, 2026-07-15-én, 480p-kategóriás felbontáson (768×512 / 832×480), a modell hivatalos demo bemeneteivel.

Őszinte verdikt: fotóval erős, nélküle döcögős

Ami tényleg lenyűgözött:

  • Az identitás megmarad. A fotóvezérelt klipben ugyanaz az ember marad végig mind a 82 másodpercben — haj, ruha, arc — miközben a száj követi a hangot. Ez az az eset, ami az avataroknál számít, és működik.
  • A több beszélős mód tényleg működik. Két ember egy jelenetből, mindkettő ajakmozgása a saját hangsávjával vezérelve, koherens maradt — ezt valóban nehéz jól megcsinálni.
  • MIT és kereskedelmi szint. Nyílt súlyok, nincs renderenkénti számlázás, és olyan minőség, ami egy rövid klipben simán megállná a helyét.

Ahol elvérzik — és ezek valós problémák:

  • A csak szöveges generálás elúszik. Referenciafotó nélkül a modell kitalálja a személyt, és hosszú klipben az arc bizarr, viaszos közeli felvétellé torzul, a jelenet pedig elcsúszik — ez látszik a harmadik mintán.
  • Lassú és nehéz. ~44 s számítás 1 s videónként, miközben végig plafonon tart egy 40 GB-os kártyát. Egy 82 másodperces klip egy óra.
  • A 40 GB az alsó határ. A futásunkhoz INT8 + distill kellett, csak hogy beférjen, és a több szegmensből álló klipek is csak úgy élték túl, hogy a KV-cache-t CPU-ra offloadoltuk. Kisebb kártyák kiesnek.
  • Gyakorlatban csak egykártyás. A több-GPU-s context-parallel nálunk holtpontba futott, így nincs egyszerű mód egy klip gyorsítására több kártya hozzáadásával.
  • Nincs Hang. Az ajkakat a te általad adott hangból vezérli — nem csinál szövegfelolvasást és hangklónozást, így külön hangforrásra továbbra is szükség van.
  • 480p, ezen a hardveren. Egyetlen 40 GB-os kártyán nálunk 480p-kategóriás kimenet ment.

LongCat önhostolás vs hosztolt eszköz: melyiket válaszd?

Mindkettő ugyanazt adja — egy fotóból és hangból beszélő videó lesz. A különbség teljes egészében abban van, mennyibe kerül eljutni oda. Egy hosztolt eszköz, például a VisionStory, helyetted futtatja a modellt; íme az őszinte csereüzlet.

 LongCat (önhost)VisionStory (hosztolt)
HardverEgy 40 GB-os A100/A800 (több ezer dollár)Semmi — böngészőben fut
BeüzemelésCUDA, flash-attn, INT8, dep javítások, OOM hangolásJelentkezz be, és mehet
Idő klipenként~44 s számítás 1 s videóra (82 s klip ≈ 1 óra)Másodpercek, hosztolt GPU-kon
Felbontás (nálunk)480p-kategóriaHD videó és afölött
HangTe adod a hangot (nincs TTS/klónozás)Beépített hangok és hangklónozás
Kereskedelmi felhasználásIgen (MIT)Igen (csomagtól függ)
KarbantartásTe patcheled a függőségeket, OOM-ot, drivereketSemmi
Legjobb, haVan GPU-d, és önhostolt/offline/on-prem kellKész beszélő videót akarsz gyorsan

A LongCatet válaszd, ha megvan a hardver, és a munkának tényleg önhostoltnak kell lennie — on-prem, offline, vagy teljesen a te kontrollod alatt — és kényelmesen karbantartasz egy CUDA stacket. Hosztolt eszközt válassz, ha ugyanazt a fotó+hang beszélő videót szeretnéd egy óra számítás és egy öt számjegyű GPU nélkül.

Amit a LongCat tanított nekünk

A LongCat-Video-Avatar futtatásának igazi tanulsága az, hogy megérkezett a nyílt avatar-videó minőség — referenciafotóval ez az ingyenes modell olyan klipeket ad, amelyek már valós használatra is elég jók. Már nem a modell a nehéz rész.

A nehéz rész minden, ami körülötte van: bepréselni egy videó-diffúziós modellt egy megfizethető kártyára, túlélni az OOM-ot a 2. szegmensnél, kivárni egy órát 82 másodpercért, és mellé párosítani egy Hangot. Ez a szakadék — egy kompetens checkpoint és egy kész beszélő videó között, amit bárki el tud készíteni — pontosan az a munka, amit mi végzünk. Ha kíváncsi vagy a másik oldalra: a VisionStory másodpercek alatt, a böngésződben csinál egy fotóból és szövegből ajakszinkronos beszélő avatart, és ha a Hang is kell, az open-source TTS szétszedésünk bemutatja, hol tart most az a fél.

Gyakran ismételt kérdések

  • Igen. A LongCat-Video-Avatar 1.5 MIT licenc alatt érhető el, ami engedélyezi a kereskedelmi felhasználást, és nincs renderenkénti díjazás. Csak az általa felhasznált GPU-számítás költségét fizeted.