Meituan heeft LongCat-Video-Avatar 1.5 open-sourced, en het doet in de kern precies wat VisionStory doet — een stilstaande foto plus een audiotrack omzetten in een talking-avatarvideo. Dat maakte ons nieuwsgierig genoeg om het echt te draaien. Dit is een hands-on teardown: wat het is, hoe goed het in de praktijk presteert, de vijf installatiestrikken waar we tegenaan liepen, en wat het kost om het zelf te draaien versus een gehoste tool. Bron: github.com/meituan-longcat/LongCat-Video (MIT).

Wat is LongCat-Video-Avatar, en wie heeft het gemaakt?

LongCat-Video-Avatar 1.5 is een open-weight audio-gedreven human video-model van Meituan (het LongCat-team). Het is gebouwd op het LongCat-Video foundation model en uitgebracht onder de permissieve MIT-licentie — echt gratis voor commercieel gebruik. Per 2026-07 heeft de coderepo grofweg 5.200 GitHub-stars en behoren de 1.5-weights tot de beter gewaardeerde recente releases op Hugging Face.

Het ondersteunt drie native taken: Audio + Text to Video (AT2V, geen referentieafbeelding), Audio + Text + Image to Video (ATI2V — een referentiefoto stuurt de identiteit aan, het scenario dat overeenkomt met een echte avatarworkflow), en video continuation om een clip voorbij één segment te verlengen. Versie 1.5 heeft een Whisper-Large audio-encoder gekregen, en die zorgt voor de lipbeweging. Belangrijk: het stuurt lippen en expressie aan op basis van welke audio je ook aanlevert — het genereert of kloont geen stem.

We hebben het echt gedraaid (één A800-40GB)

Geen handgewaai — we hebben alle drie de taken gedraaid op één NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), in de INT8-gekwantiseerde + 8-staps distill-configuratie van het model, want dat is wat je nodig hebt om een video-diffusion model van deze omvang op een kaart van 40 GB te laten passen. Dit is de eerlijke play-by-play.

De vijf valkuilen waar we tegenaan liepen

  • Ontbrekende dependency voor vocal separation. De audiopipeline heeft een Kim_Vocal_2-model nodig via audio-separator, maar dat staat niet in de standaard requirements — de eerste run crashte tot pip install audio-separator==0.30.2.
  • Video writer klapte eruit. Het opslaan van frames faalde met TiffWriter got an unexpected keyword argument fps, omdat imageio geen ffmpeg-writer kon vinden — opgelost met pip install imageio-ffmpeg==0.6.0.
  • Multi-GPU deadlocks. Eén job over meerdere kaarten draaien (context-parallel size 2 of 8) bleef hangen op een NCCL collective desync — beide ranks wachtten op elkaar tot een timeout van 600s de run afbrak. We konden alleen single-card draaien. De INT8-weights passen wel op één kaart van 40 GB, dus multi-GPU was alleen nuttig om losse jobs parallel te draaien, niet om één job te versnellen.
  • Out-of-memory bij het tweede segment. Lange clips worden gebouwd door segment na segment door te trekken, en de continuation-stap hield een 48-layer KV-cache resident. Op een kaart van 40 GB piekte het tweede segment de kaart en crashte — ongeveer 160 MiB te weinig om te passen. We moesten een --offload_kv_cache-flag zichtbaar maken en inschakelen (cache naar CPU-RAM verplaatsen en per stap terug pagineren) plus PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True zetten. Het werkt, maar de segmenten worden trager.
  • Resolutie-alignment. 480p onder multi-card parallelism liep tegen een deelbaar-door-64-constraint aan op hoogte en breedte; single-card vermijdt dit.

Snelheid en geheugen (gemeten)

Dit is het getal dat ertoe doet: een clip van 82 seconden duurde 3.586 seconden — net geen uur — op de A800, oftewel ongeveer 44 seconden rekenwerk voor elke 1 seconde afgewerkte video (ongeveer 138s per gegenereerd segment over 26 segmenten). Een korte clip van 10 seconden zou nog steeds rond de 7 minuten zitten. En het is geen lichte belasting: VRAM schoot in seconden omhoog en bleef daarna vastgeklemd op 40.500 MiB — 98,9% van de kaart van 40 GB — gedurende de hele render. Dit is het daadwerkelijke gebruik dat we 1 keer per seconde hebben gesampled:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Samples die we hebben gerenderd

Elke clip hieronder is door ons gerenderd op de A800 die hierboven is beschreven. Om het model te benchmarken in de scenario’s waarvoor het bedoeld is, hebben we ze aangestuurd met de officiële demo-inputs van het project zelf (referentieportretten en audio), in plaats van onze eigen inputs samen te stellen — dit zijn dus eerlijke, niet-‘cherry-picked’ outputs, geen highlight-reel. De eerste twee clips zijn elk aangestuurd met hun eigen referentiefoto:

De twee referentiefoto’s: een solo zanger voor de foto-plus-audio-clip en een studioscène met twee personen voor de multi-speaker-clip

Links: de referentie voor de foto + audio-clip. Rechts: de referentie voor de multi-speaker-clip (één afbeelding, twee personen). De derde clip hieronder gebruikte tekst + audio zonder referentiefoto — het model verzint de persoon, en daar is het het zwakst.

Foto + audio (ATI2V) — de avatarworkflow. De identiteit blijft staan, de mond volgt het zingen.
Multi-speaker — twee mensen, twee audiotracks, elke mond onafhankelijk aangestuurd.
Alleen tekst + audio, geen referentiefoto (AT2V) — het zwakke scenario: let op hoe het gezicht vervormt en wegdrijft.

Gerenderd door VisionStory met LongCat-Video-Avatar 1.5 op een NVIDIA A800, 2026-07-15, op 480p-klasse resolutie (768×512 / 832×480), met de officiële demo-inputs van het model.

Eerlijk oordeel: sterk met een foto, rommelig zonder

Wat ons echt indruk maakte:

  • Identiteit blijft staan. In de foto-gestuurde clip blijft de persoon dezelfde persoon gedurende de hele 82 seconden — haar, kleding, gezicht — terwijl de mond de audio volgt. Dit is het scenario dat telt voor avatars, en het werkt.
  • Multi-speaker werkt echt. Twee mensen uit één scène, elk lip-gestuurd door zijn eigen audiotrack, bleven coherent — echt lastig om goed te krijgen.
  • MIT en commercieel bruikbaar. Open weights, geen kosten per render, en outputkwaliteit die in een korte clip zou slagen.

Waar het onderuitgaat — en dit is echt:

  • Text-only generatie drijft weg. Zonder referentiefoto verzint het model de persoon, en over een lange clip vervormt het gezicht tot een uncanny, wasachtige close-up en verschuift de scène — zichtbaar in de derde sample hierboven.
  • Het is traag en zwaar. ~44s rekenwerk per 1s video, waarbij een kaart van 40 GB de hele tijd volgeprikt staat. Een clip van 82 seconden is een uur.
  • 40 GB is het minimum. Onze run had INT8 + distill nodig om überhaupt te passen, en multi-segment clips overleefden alleen door de KV-cache naar de CPU te offloaden. Kleinere kaarten vallen af.
  • In de praktijk alleen single-card. Multi-GPU context-parallel liep bij ons vast, dus er is geen makkelijke manier om één clip sneller te maken door kaarten toe te voegen.
  • Geen stem. Het stuurt lippen aan op basis van audio die jij aanlevert — het doet geen tekst-naar-spraak of stemklonen, dus je hebt nog steeds een aparte stembron nodig.
  • 480p, met deze hardware. Wat we op één kaart van 40 GB konden draaien, was output in 480p-klasse.

LongCat self-hosten vs een gehoste tool: wat kies je?

Beide maken hetzelfde — een foto plus audio wordt een talking video. Het verschil zit volledig in wat het je kost om daar te komen. Een gehoste tool zoals VisionStory draait het model voor je; dit is de eerlijke afweging.

 LongCat (self-host)VisionStory (hosted)
HardwareEen A100/A800 van 40 GB (duizenden dollars)Geen — draait in de browser
InstallatieCUDA, flash-attn, INT8, dep-fixes, OOM-tuningInloggen en gaan
Tijd per clip~44s rekenwerk per 1s video (82s clip ≈ 1 uur)Seconden, op gehoste GPU’s
Resolutie (onze run)480p-klasseHD-video en hoger
StemJij levert de audio aan (geen TTS/kloon)Ingebouwde stemmen en stemklonen
Commercieel gebruikJa (MIT)Ja (per plan)
OnderhoudJij patcht deps, OOM, driversGeen
Beste wanneerJe hebt GPU’s en hebt self-hosted/offline/on-prem nodigJe wilt snel een afgewerkte talking video

Kies LongCat als je de hardware hebt en het werk echt self-hosted moet zijn — on-prem, offline of volledig onder jouw controle — en je het prima vindt om een CUDA-stack te onderhouden. Kies een gehoste tool als je dezelfde foto-plus-audio talking video wilt zonder een uur rekenwerk en een vijfcijferige GPU.

Wat LongCat ons leerde

De echte les van het draaien van LongCat-Video-Avatar is dat open avatar-video-kwaliteit er nu is — met een referentiefoto maakt dit gratis model clips die goed genoeg zijn voor echt gebruik. Het model is niet langer het moeilijke deel.

Het moeilijke deel is alles eromheen: een video-diffusion model passend krijgen op een kaart die je kunt betalen, OOM overleven bij het tweede segment, een uur wachten voor 82 seconden, en het koppelen aan een stem. Die kloof — tussen een capabele checkpoint en een afgewerkte talking video die iedereen kan maken — is precies het werk dat wij doen. Als je de andere kant ervan wilt zien: VisionStory zet in je browser in seconden een foto en een script om in een lip-gesynchroniseerde talking avatar, en als je de stem ook nodig hebt, laat onze teardown van open-source TTS zien waar die helft nu staat.

Veelgestelde vragen

  • Ja. LongCat-Video-Avatar 1.5 is uitgebracht onder de MIT-licentie, die commercieel gebruik toestaat, en er is geen facturatie per render. Je betaalt alleen voor de GPU-rekenkracht die het verbruikt.