Meituan ha rilasciato in open source LongCat-Video-Avatar 1.5, e fa esattamente ciò che VisionStory fa nel suo nucleo — trasformare una foto statica più una traccia audio in un video con un avatar parlante. La cosa ci ha incuriositi al punto da eseguirlo davvero. Questo è uno smontaggio pratico: cos’è, quanto rende davvero, le cinque trappole di setup in cui siamo incappati e quanto costa eseguirlo da soli rispetto a uno strumento in hosting. Fonte: github.com/meituan-longcat/LongCat-Video (MIT).
Cos’è LongCat-Video-Avatar e chi l’ha creato?
LongCat-Video-Avatar 1.5 è un modello audio-driven human video a pesi aperti di Meituan (il team LongCat). È costruito sul foundation model LongCat-Video e rilasciato con la permissiva licenza MIT — davvero gratuito per l’uso commerciale. A luglio 2026 il repo del codice ha circa 5 200 stelle su GitHub e i pesi 1.5 sono tra le release recenti più apprezzate su Hugging Face.
Supporta tre task nativi: Audio + Text to Video (AT2V, nessuna immagine di riferimento), Audio + Text + Image to Video (ATI2V — una foto di riferimento guida l’identità, il caso che corrisponde a un vero workflow da avatar) e video continuation per estendere una clip oltre un singolo segmento. La versione 1.5 ha sostituito l’encoder audio con Whisper-Large, che è ciò che gli dà il movimento delle labbra. Importante: guida labbra ed espressione a partire da qualunque audio tu gli dia — non genera né clona una voce.
L’abbiamo eseguito davvero (una sola A800-40GB)
Niente fumo — abbiamo eseguito tutti e tre i task su una singola NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), nella configurazione del modello quantizzata INT8 + distillazione in 8 step, che è ciò che serve per far entrare un modello di video-diffusion di queste dimensioni su una scheda da 40 GB. Ecco il resoconto onesto, passo per passo.
Le cinque trappole in cui siamo incappati
- Dipendenza mancante per la separazione vocale. La pipeline audio richiede un modello Kim_Vocal_2 tramite
audio-separator, che non è nelle dipendenze predefinite — il primo avvio è fallito finché non abbiamo fattopip install audio-separator==0.30.2. - Il writer video è esploso. Il salvataggio dei frame falliva con l’errore
TiffWriter got an unexpected keyword argument fpsperché imageio non trovava un writer ffmpeg — risolto conpip install imageio-ffmpeg==0.6.0. - Deadlock multi-GPU. L’esecuzione di un job su più schede (context-parallel size 2 o 8) si bloccava su un desync di collective NCCL — entrambi i rank aspettavano l’uno l’altro finché un timeout di 600s non interrompeva l’esecuzione. Abbiamo potuto usare solo la singola scheda. I pesi INT8 entrano su una sola scheda da 40 GB, quindi la multi-GPU era utile solo per eseguire job separati in parallelo, non per accelerare un singolo job.
- Out-of-memory sul secondo segmento. Le clip lunghe si costruiscono continuando segmento dopo segmento e lo step di continuation teneva residente una KV-cache a 48 layer. Su una scheda da 40 GB il secondo segmento saturava la scheda e crashava — mancavano circa 160 MiB per farlo entrare. Abbiamo dovuto esporre e abilitare un flag
--offload_kv_cache(spostare la cache sulla RAM della CPU e ripaginarla a ogni step) più impostarePYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funziona, al costo di segmenti più lenti. - Allineamento della Risoluzione. Il 480p in parallelismo multi-scheda faceva scattare un vincolo di divisibilità per 64 su altezza e larghezza; la singola scheda lo evita.
Velocità e memoria (misurate)
Questo è il numero che conta: una clip di 82 secondi ha richiesto 3 586 secondi — poco meno di un’ora — sulla A800, ovvero circa 44 secondi di calcolo per ogni 1 secondo di video finale (circa 138s per segmento generato su 26 segmenti). Anche una clip breve da 10 secondi sarebbe comunque intorno ai 7 minuti. E non è un carico leggero: la VRAM è salita in pochi secondi e poi è rimasta inchiodata a 40 500 MiB — 98,9% della scheda da 40 GB — per tutta la renderizzazione. Ecco l’uso effettivo che abbiamo campionato una volta al secondo:
Campioni che abbiamo renderizzato
Ogni clip qui sotto è stata renderizzata da noi sulla A800 descritta sopra. Per fare benchmark del modello nei suoi scenari previsti, le abbiamo guidate con gli input demo ufficiali del progetto (ritratti di riferimento e audio) invece di selezionare i nostri — quindi sono output onesti, senza cherry-picking, non un video “best of”. Le prime due clip sono state guidate ciascuna dalla propria foto di riferimento:
A sinistra: il riferimento per la clip foto + audio. A destra: il riferimento per la clip multi-speaker (una immagine, due persone). La terza clip sotto ha usato testo + audio con nessuna foto di riferimento — il modello inventa la persona, ed è lì che risulta più debole.
Renderizzato da VisionStory con LongCat-Video-Avatar 1.5 su una NVIDIA A800, 2026-07-15, a Risoluzione di classe 480p (768×512 / 832×480), usando gli input demo ufficiali del modello.
Verdetto onesto: forte con una foto, difficile senza
Cosa ci ha davvero impressionato:
- L’identità regge. Nella clip guidata dalla foto la persona rimane la stessa per tutti gli 82 secondi — capelli, abbigliamento, volto — mentre la bocca segue l’audio. È il caso che conta per gli avatar, e funziona.
- Il multi-speaker funziona davvero. Due persone nella stessa scena, ciascuna con lip-sync guidato dalla propria traccia audio, sono rimaste coerenti — una cosa davvero difficile da fare bene.
- MIT e livello commerciale. Pesi aperti, nessuna fatturazione per render, e una qualità dell’output che passerebbe in una clip breve.
Dove crolla — e sono problemi reali:
- La generazione solo testo deriva. Senza una foto di riferimento il modello inventa la persona e, su una clip lunga, il volto si deforma in un primo piano inquietante e “ceroso” e la scena cambia — visibile nel terzo campione sopra.
- È lento e pesante. ~44s di calcolo per 1s di video, con una scheda da 40 GB inchiodata per tutto il tempo. Una clip da 82 secondi è un’ora.
- 40 GB è il minimo. La nostra esecuzione ha richiesto INT8 + distillazione solo per entrare, e le clip multi-segmento sono sopravvissute solo scaricando la KV-cache sulla CPU. Le schede più piccole sono escluse.
- Di fatto, solo singola scheda. Il context-parallel multi-GPU è andato in deadlock sulla nostra macchina, quindi non c’è un modo semplice per rendere più veloce una clip aggiungendo schede.
- Niente Voce. Guida le labbra dall’audio che fornisci — non fa text-to-speech né clonazione vocale, quindi ti serve comunque una fonte Voce separata.
- 480p, su questo hardware. Ciò che siamo riusciti a far girare su una singola scheda da 40 GB era output di classe 480p.
Self-host di LongCat vs uno strumento in hosting: cosa scegliere?
Entrambi producono la stessa cosa — una foto più un audio diventano un video parlante. La differenza sta interamente in quanto ti costa arrivarci. Uno strumento in hosting come VisionStory esegue il modello per te; ecco il trade-off, senza filtri.
| LongCat (self-host) | VisionStory (hosted) | |
|---|---|---|
| Hardware | Una A100/A800 da 40 GB (migliaia di dollari) | Nessuno — gira nel browser |
| Setup | CUDA, flash-attn, INT8, fix dipendenze, tuning OOM | Accedi e parti |
| Tempo per clip | ~44s di calcolo per 1s di video (clip da 82s ≈ 1 ora) | Secondi, su GPU in hosting |
| Risoluzione (la nostra esecuzione) | Classe 480p | Video HD e oltre |
| Voce | Fornisci tu l’audio (niente TTS/clonazione) | Voci integrate e clonazione vocale |
| Uso commerciale | Sì (MIT) | Sì (in base al piano) |
| Manutenzione | Tu gestisci patch dipendenze, OOM, driver | Nessuna |
| Ideale quando | Hai GPU e ti serve self-host/offline/on-prem | Vuoi un video parlante finito, velocemente |
Scegli LongCat se hai l’hardware e il lavoro deve davvero essere in self-host — on-prem, offline o completamente sotto il tuo controllo — e ti senti a tuo agio nel mantenere uno stack CUDA. Scegli uno strumento in hosting se vuoi lo stesso video parlante foto + audio senza un’ora di calcolo e una GPU a cinque cifre.
Cosa ci ha insegnato LongCat
La vera lezione dall’esecuzione di LongCat-Video-Avatar è che la qualità open dei video avatar è arrivata — con una foto di riferimento, questo modello gratuito produce clip abbastanza buone per un uso reale. Il modello non è più la parte difficile.
La parte difficile è tutto ciò che gli sta attorno: far entrare un modello di video-diffusion su una scheda che puoi permetterti, sopravvivere agli OOM sul secondo segmento, aspettare un’ora per 82 secondi e abbinarlo a una voce. Quel divario — tra un checkpoint capace e un video parlante finito che chiunque possa creare — è esattamente il lavoro che facciamo. Se vuoi vedere l’altra faccia della medaglia, VisionStory trasforma una foto e un copione in un avatar parlante con lip-sync nel tuo browser in pochi secondi e, se ti serve anche la voce, la nostra analisi di TTS open-source racconta a che punto è arrivata anche quell’altra metà.
