Meituan a publicat open-source LongCat-Video-Avatar 1.5 și face exact ceea ce face VisionStory în esență — transformă o fotografie statică plus o pistă audio într-un video cu avatar vorbitor. Asta ne-a făcut suficient de curioși încât să-l rulăm pe bune. Acesta este un teardown practic: ce este, cât de bine performează în realitate, cele cinci capcane de instalare de care ne-am lovit și cât te costă să-l rulezi singur versus un instrument găzduit. Sursă: github.com/meituan-longcat/LongCat-Video (MIT).
Ce este LongCat-Video-Avatar și cine l-a creat?
LongCat-Video-Avatar 1.5 este un model video uman condus de audio, cu greutăți deschise, de la Meituan (echipa LongCat). Este construit pe modelul de bază LongCat-Video și este lansat sub licența permisivă MIT — cu adevărat gratuit pentru utilizare comercială. La 2026-07, repo-ul de cod are aproximativ 5 200 de stele pe GitHub, iar greutățile 1.5 sunt printre lansările recente mai apreciate pe Hugging Face.
Suportă trei sarcini native: Audio + Text to Video (AT2V, fără imagine de referință), Audio + Text + Image to Video (ATI2V — o fotografie de referință conduce identitatea, cazul care se potrivește unui flux real de lucru cu avataruri) și continuare video pentru a extinde un clip dincolo de un singur segment. Versiunea 1.5 a înlocuit encoderul audio cu Whisper-Large, ceea ce îi dă mișcarea buzelor. Important, conduce buzele și expresia din orice audio îi dai — nu generează și nu clonează o Voce.
Noi chiar l-am rulat (un singur A800-40GB)
Fără povești — am rulat toate cele trei sarcini pe un singur NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), în configurația modelului cuantizată INT8 + distill în 8 pași, adică exact ce-ți trebuie ca un model de difuzie video de dimensiunea asta să încapă pe o placă de 40 GB. Iată relatarea sinceră, pas cu pas.
Cele cinci capcane de care ne-am lovit
- Lipsă dependență pentru separarea vocii. Pipeline-ul audio are nevoie de un model Kim_Vocal_2 prin
audio-separator, care nu este în cerințele implicite — prima rulare a crăpat până când am datpip install audio-separator==0.30.2. - Writer-ul video a cedat. Salvarea cadrelor a eșuat cu eroarea
TiffWriter got an unexpected keyword argument fps, pentru că imageio nu găsea un writer ffmpeg — rezolvat cupip install imageio-ffmpeg==0.6.0. - Blocaje pe multi-GPU. Rularea unui job pe mai multe plăci (context-parallel size 2 sau 8) s-a blocat din cauza unei desincronizări NCCL collective — ambele rank-uri se așteptau unul pe altul până când un timeout de 600 s a oprit rularea. Am putut rula doar pe o singură placă. Greutățile INT8 încap pe o placă de 40 GB, așa că multi-GPU era util doar pentru a rula joburi separate în paralel, nu pentru a accelera un singur job.
- Lipsă memorie la al doilea segment. Clipurile lungi se construiesc continuând segment după segment, iar pasul de continuare ținea rezident un KV-cache cu 48 de straturi. Pe o placă de 40 GB, al doilea segment a atins vârful și a crăpat — îi lipseau cam 160 MiB ca să încapă. A trebuit să expunem și să activăm un flag
--offload_kv_cache(mută cache-ul în RAM-ul CPU și îl repaginează la fiecare pas), plus să setămPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funcționează, cu prețul unor segmente mai lente. - Alinierea rezoluției. 480p sub paralelism multi-placă a declanșat o constrângere „divizibil cu 64” pe înălțime și lățime; pe o singură placă o eviți.
Viteză și memorie (măsurate)
Acesta este numărul care contează: un clip de 82 de secunde a durat 3 586 de secunde — puțin sub o oră — pe A800, adică aproximativ 44 de secunde de calcul pentru fiecare 1 secundă de video final (cam 138 s pe segment generat, pe parcursul a 26 de segmente). Un clip scurt de 10 secunde ar fi tot pe la 7 minute. Și nu e o sarcină ușoară: VRAM a urcat în câteva secunde și apoi a rămas lipit la 40 500 MiB — 98,9% din placa de 40 GB — pe tot parcursul randării. Iată utilizarea reală pe care am eșantionat-o o dată pe secundă:
Mostrele pe care le-am randat
Fiecare clip de mai jos a fost randat de noi pe A800 descris mai sus. Pentru a evalua modelul în scenariile pentru care a fost conceput, le-am rulat folosind inputurile oficiale de demo ale proiectului (portrete de referință și audio), în loc să ne selectăm noi materialele — așadar, acestea sunt rezultate oneste, fără selecție „pe sprânceană”, nu un montaj cu cele mai bune momente. Primele două clipuri au fost fiecare generate pe baza propriei fotografii de referință:
Stânga: referința pentru clipul cu fotografie + audio. Dreapta: referința pentru clipul cu mai mulți vorbitori (o imagine, două persoane). Al treilea clip de mai jos folosește text + audio fără nicio fotografie de referință — modelul inventează persoana, iar aici este cel mai slab.
Randat de VisionStory cu LongCat-Video-Avatar 1.5 pe un NVIDIA A800, 2026-07-15, la rezoluție de clasă 480p (768×512 / 832×480), folosind input-urile oficiale de demo ale modelului.
Verdict sincer: foarte bun cu fotografie, cam dur fără
Ce ne-a impresionat cu adevărat:
- Identitatea se păstrează. În clipul condus de fotografie, persoana rămâne aceeași pe tot parcursul celor 82 de secunde — păr, haine, față — în timp ce gura urmărește audio-ul. Acesta este cazul care contează pentru avataruri, și funcționează.
- Multi-speaker chiar funcționează. Două persoane din aceeași scenă, fiecare cu buzele conduse de propria pistă audio, au rămas coerente — un lucru cu adevărat greu de făcut bine.
- MIT și suficient de bun pentru uz comercial. Greutăți deschise, fără facturare per randare și o calitate a rezultatului care ar trece într-un clip scurt.
Unde se împiedică — și sunt probleme reale:
- Generarea doar din text „derapează”. Fără o fotografie de referință, modelul inventează persoana, iar într-un clip lung fața se deformează într-un close-up straniu, ceros, iar scena se schimbă — se vede în a treia mostră de mai sus.
- Este lent și greu. ~44 s de calcul per 1 s de video, ținând o placă de 40 GB la limită tot timpul. Un clip de 82 de secunde înseamnă o oră.
- 40 GB este minimul. Rularea noastră a avut nevoie de INT8 + distill doar ca să încapă, iar clipurile multi-segment au supraviețuit doar mutând KV-cache-ul pe CPU. Plăcile mai mici ies din discuție.
- Doar o singură placă, în practică. Context-parallel pe multi-GPU s-a blocat la noi, deci nu există o metodă simplă să faci un clip mai rapid adăugând plăci.
- Fără Voce. Conduce buzele din audio-ul pe care îl furnizezi — nu face text-to-speech și nu clonează vocea, deci tot ai nevoie de o sursă separată de voce.
- 480p, pe acest hardware. Ce am putut rula pe o singură placă de 40 GB a fost ieșire de clasă 480p.
Self-host LongCat vs un instrument găzduit: pe care ar trebui să-l alegi?
Ambele produc același lucru — o fotografie plus audio devin un video vorbit. Diferența este în întregime în cât te costă să ajungi acolo. Un instrument găzduit precum VisionStory rulează modelul pentru tine; iată compromisul, spus pe bune.
| LongCat (self-host) | VisionStory (hosted) | |
|---|---|---|
| Hardware | Un A100/A800 de 40 GB (mii de dolari) | Niciunul — rulează în browser |
| Instalare | CUDA, flash-attn, INT8, remedieri de dependențe, reglaje OOM | Te autentifici și pornești |
| Timp per clip | ~44 s de calcul per 1 s de video (clip de 82 s ≈ 1 oră) | Secunde, pe GPU-uri găzduite |
| Rezoluție (rularea noastră) | Clasă 480p | Video HD și mai mult |
| Voce | Tu furnizezi audio-ul (fără TTS/clonare) | Voci integrate și clonare de voce |
| Utilizare comercială | Da (MIT) | Da (în funcție de plan) |
| Mentenanță | Tu repari dependențe, OOM, drivere | Niciuna |
| Cel mai potrivit când | Ai GPU-uri și ai nevoie de self-host/offline/on-prem | Vrei rapid un video vorbit finalizat |
Alege LongCat dacă ai hardware-ul și munca chiar trebuie să fie self-host — on-prem, offline sau complet sub controlul tău — și ești ok să întreții un stack CUDA. Alege un instrument găzduit dacă vrei același video vorbit foto-plus-audio fără o oră de calcul și un GPU de cinci cifre.
Ce ne-a învățat LongCat
Adevărata lecție din rularea LongCat-Video-Avatar este că a sosit calitatea video-urilor cu avatar open — cu o fotografie de referință, acest model gratuit produce clipuri suficient de bune pentru uz real. Modelul nu mai este partea grea.
Partea grea este tot ce e în jur: să faci un model de difuzie video să încapă pe o placă pe care ți-o permiți, să supraviețuiești OOM la al doilea segment, să aștepți o oră pentru 82 de secunde și să-l combini cu o Voce. Acel gol — dintre un checkpoint capabil și un video vorbit final pe care îl poate face oricine — este exact munca pe care o facem noi. Dacă vrei să vezi cealaltă parte, VisionStory transformă o fotografie și un scenariu într-un avatar vorbitor sincronizat pe buze în browser, în câteva secunde, iar dacă ai nevoie și de voce, teardown-ul nostru despre TTS open-source acoperă unde se află acum acea jumătate.
