Meituan a publicat open-source LongCat-Video-Avatar 1.5 și face exact ceea ce face VisionStory în esență — transformă o fotografie statică plus o pistă audio într-un video cu avatar vorbitor. Asta ne-a făcut suficient de curioși încât să-l rulăm pe bune. Acesta este un teardown practic: ce este, cât de bine performează în realitate, cele cinci capcane de instalare de care ne-am lovit și cât te costă să-l rulezi singur versus un instrument găzduit. Sursă: github.com/meituan-longcat/LongCat-Video (MIT).

Ce este LongCat-Video-Avatar și cine l-a creat?

LongCat-Video-Avatar 1.5 este un model video uman condus de audio, cu greutăți deschise, de la Meituan (echipa LongCat). Este construit pe modelul de bază LongCat-Video și este lansat sub licența permisivă MIT — cu adevărat gratuit pentru utilizare comercială. La 2026-07, repo-ul de cod are aproximativ 5 200 de stele pe GitHub, iar greutățile 1.5 sunt printre lansările recente mai apreciate pe Hugging Face.

Suportă trei sarcini native: Audio + Text to Video (AT2V, fără imagine de referință), Audio + Text + Image to Video (ATI2V — o fotografie de referință conduce identitatea, cazul care se potrivește unui flux real de lucru cu avataruri) și continuare video pentru a extinde un clip dincolo de un singur segment. Versiunea 1.5 a înlocuit encoderul audio cu Whisper-Large, ceea ce îi dă mișcarea buzelor. Important, conduce buzele și expresia din orice audio îi dai — nu generează și nu clonează o Voce.

Noi chiar l-am rulat (un singur A800-40GB)

Fără povești — am rulat toate cele trei sarcini pe un singur NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), în configurația modelului cuantizată INT8 + distill în 8 pași, adică exact ce-ți trebuie ca un model de difuzie video de dimensiunea asta să încapă pe o placă de 40 GB. Iată relatarea sinceră, pas cu pas.

Cele cinci capcane de care ne-am lovit

  • Lipsă dependență pentru separarea vocii. Pipeline-ul audio are nevoie de un model Kim_Vocal_2 prin audio-separator, care nu este în cerințele implicite — prima rulare a crăpat până când am dat pip install audio-separator==0.30.2.
  • Writer-ul video a cedat. Salvarea cadrelor a eșuat cu eroarea TiffWriter got an unexpected keyword argument fps, pentru că imageio nu găsea un writer ffmpeg — rezolvat cu pip install imageio-ffmpeg==0.6.0.
  • Blocaje pe multi-GPU. Rularea unui job pe mai multe plăci (context-parallel size 2 sau 8) s-a blocat din cauza unei desincronizări NCCL collective — ambele rank-uri se așteptau unul pe altul până când un timeout de 600 s a oprit rularea. Am putut rula doar pe o singură placă. Greutățile INT8 încap pe o placă de 40 GB, așa că multi-GPU era util doar pentru a rula joburi separate în paralel, nu pentru a accelera un singur job.
  • Lipsă memorie la al doilea segment. Clipurile lungi se construiesc continuând segment după segment, iar pasul de continuare ținea rezident un KV-cache cu 48 de straturi. Pe o placă de 40 GB, al doilea segment a atins vârful și a crăpat — îi lipseau cam 160 MiB ca să încapă. A trebuit să expunem și să activăm un flag --offload_kv_cache (mută cache-ul în RAM-ul CPU și îl repaginează la fiecare pas), plus să setăm PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funcționează, cu prețul unor segmente mai lente.
  • Alinierea rezoluției. 480p sub paralelism multi-placă a declanșat o constrângere „divizibil cu 64” pe înălțime și lățime; pe o singură placă o eviți.

Viteză și memorie (măsurate)

Acesta este numărul care contează: un clip de 82 de secunde a durat 3 586 de secunde — puțin sub o oră — pe A800, adică aproximativ 44 de secunde de calcul pentru fiecare 1 secundă de video final (cam 138 s pe segment generat, pe parcursul a 26 de segmente). Un clip scurt de 10 secunde ar fi tot pe la 7 minute. Și nu e o sarcină ușoară: VRAM a urcat în câteva secunde și apoi a rămas lipit la 40 500 MiB — 98,9% din placa de 40 GB — pe tot parcursul randării. Iată utilizarea reală pe care am eșantionat-o o dată pe secundă:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Mostrele pe care le-am randat

Fiecare clip de mai jos a fost randat de noi pe A800 descris mai sus. Pentru a evalua modelul în scenariile pentru care a fost conceput, le-am rulat folosind inputurile oficiale de demo ale proiectului (portrete de referință și audio), în loc să ne selectăm noi materialele — așadar, acestea sunt rezultate oneste, fără selecție „pe sprânceană”, nu un montaj cu cele mai bune momente. Primele două clipuri au fost fiecare generate pe baza propriei fotografii de referință:

Cele două fotografii de referință: un cântăreț solo pentru clipul cu fotografie + audio și o scenă de studio cu două persoane pentru clipul cu mai mulți vorbitori

Stânga: referința pentru clipul cu fotografie + audio. Dreapta: referința pentru clipul cu mai mulți vorbitori (o imagine, două persoane). Al treilea clip de mai jos folosește text + audio fără nicio fotografie de referință — modelul inventează persoana, iar aici este cel mai slab.

Foto + audio (ATI2V) — fluxul de lucru cu avatar. Identitatea se păstrează, gura urmărește cântatul.
Mai mulți vorbitori — două persoane, două piste audio, fiecare gură condusă independent.
Doar text + audio, fără fotografie de referință (AT2V) — cazul slab: urmărește cum fața se deformează și „o ia la vale”.

Randat de VisionStory cu LongCat-Video-Avatar 1.5 pe un NVIDIA A800, 2026-07-15, la rezoluție de clasă 480p (768×512 / 832×480), folosind input-urile oficiale de demo ale modelului.

Verdict sincer: foarte bun cu fotografie, cam dur fără

Ce ne-a impresionat cu adevărat:

  • Identitatea se păstrează. În clipul condus de fotografie, persoana rămâne aceeași pe tot parcursul celor 82 de secunde — păr, haine, față — în timp ce gura urmărește audio-ul. Acesta este cazul care contează pentru avataruri, și funcționează.
  • Multi-speaker chiar funcționează. Două persoane din aceeași scenă, fiecare cu buzele conduse de propria pistă audio, au rămas coerente — un lucru cu adevărat greu de făcut bine.
  • MIT și suficient de bun pentru uz comercial. Greutăți deschise, fără facturare per randare și o calitate a rezultatului care ar trece într-un clip scurt.

Unde se împiedică — și sunt probleme reale:

  • Generarea doar din text „derapează”. Fără o fotografie de referință, modelul inventează persoana, iar într-un clip lung fața se deformează într-un close-up straniu, ceros, iar scena se schimbă — se vede în a treia mostră de mai sus.
  • Este lent și greu. ~44 s de calcul per 1 s de video, ținând o placă de 40 GB la limită tot timpul. Un clip de 82 de secunde înseamnă o oră.
  • 40 GB este minimul. Rularea noastră a avut nevoie de INT8 + distill doar ca să încapă, iar clipurile multi-segment au supraviețuit doar mutând KV-cache-ul pe CPU. Plăcile mai mici ies din discuție.
  • Doar o singură placă, în practică. Context-parallel pe multi-GPU s-a blocat la noi, deci nu există o metodă simplă să faci un clip mai rapid adăugând plăci.
  • Fără Voce. Conduce buzele din audio-ul pe care îl furnizezi — nu face text-to-speech și nu clonează vocea, deci tot ai nevoie de o sursă separată de voce.
  • 480p, pe acest hardware. Ce am putut rula pe o singură placă de 40 GB a fost ieșire de clasă 480p.

Self-host LongCat vs un instrument găzduit: pe care ar trebui să-l alegi?

Ambele produc același lucru — o fotografie plus audio devin un video vorbit. Diferența este în întregime în cât te costă să ajungi acolo. Un instrument găzduit precum VisionStory rulează modelul pentru tine; iată compromisul, spus pe bune.

 LongCat (self-host)VisionStory (hosted)
HardwareUn A100/A800 de 40 GB (mii de dolari)Niciunul — rulează în browser
InstalareCUDA, flash-attn, INT8, remedieri de dependențe, reglaje OOMTe autentifici și pornești
Timp per clip~44 s de calcul per 1 s de video (clip de 82 s ≈ 1 oră)Secunde, pe GPU-uri găzduite
Rezoluție (rularea noastră)Clasă 480pVideo HD și mai mult
VoceTu furnizezi audio-ul (fără TTS/clonare)Voci integrate și clonare de voce
Utilizare comercialăDa (MIT)Da (în funcție de plan)
MentenanțăTu repari dependențe, OOM, drivereNiciuna
Cel mai potrivit cândAi GPU-uri și ai nevoie de self-host/offline/on-premVrei rapid un video vorbit finalizat

Alege LongCat dacă ai hardware-ul și munca chiar trebuie să fie self-host — on-prem, offline sau complet sub controlul tău — și ești ok să întreții un stack CUDA. Alege un instrument găzduit dacă vrei același video vorbit foto-plus-audio fără o oră de calcul și un GPU de cinci cifre.

Ce ne-a învățat LongCat

Adevărata lecție din rularea LongCat-Video-Avatar este că a sosit calitatea video-urilor cu avatar open — cu o fotografie de referință, acest model gratuit produce clipuri suficient de bune pentru uz real. Modelul nu mai este partea grea.

Partea grea este tot ce e în jur: să faci un model de difuzie video să încapă pe o placă pe care ți-o permiți, să supraviețuiești OOM la al doilea segment, să aștepți o oră pentru 82 de secunde și să-l combini cu o Voce. Acel gol — dintre un checkpoint capabil și un video vorbit final pe care îl poate face oricine — este exact munca pe care o facem noi. Dacă vrei să vezi cealaltă parte, VisionStory transformă o fotografie și un scenariu într-un avatar vorbitor sincronizat pe buze în browser, în câteva secunde, iar dacă ai nevoie și de voce, teardown-ul nostru despre TTS open-source acoperă unde se află acum acea jumătate.

Întrebări frecvente

  • Da. LongCat-Video-Avatar 1.5 este publicat sub licența MIT, care permite utilizarea comercială, și nu există facturare per randare. Plătești doar pentru resursele de calcul GPU pe care le consumă.