Meituan liberó como open source LongCat-Video-Avatar 1.5, y hace exactamente lo que VisionStory hace en su núcleo — convertir una foto fija más una pista de audio en un video de avatar parlante. Eso nos dio la curiosidad suficiente como para correrlo de verdad. Esto es un teardown práctico: qué es, qué tan bien rinde realmente, las cinco trampas de instalación con las que nos chocamos y cuánto cuesta correrlo por tu cuenta versus una herramienta alojada. Fuente: github.com/meituan-longcat/LongCat-Video (MIT).
¿Qué es LongCat-Video-Avatar y quién lo hizo?
LongCat-Video-Avatar 1.5 es un modelo de video humano guiado por audio con pesos abiertos de Meituan (el equipo LongCat). Está construido sobre el modelo fundacional LongCat-Video y se publicó bajo la licencia permisiva MIT — realmente gratis para uso comercial. A 2026-07, el repo de código tiene aproximadamente 5,200 estrellas en GitHub y los pesos 1.5 están entre los lanzamientos recientes con más "me gusta" en Hugging Face.
Soporta tres tareas nativas: Audio + Text to Video (AT2V, sin imagen de referencia), Audio + Text + Image to Video (ATI2V — una foto de referencia define la identidad, el caso que coincide con un flujo real de avatares) y continuación de video para extender un clip más allá de un solo segmento. La versión 1.5 cambió a un encoder de audio Whisper-Large, que es lo que le da el movimiento de labios. Y, algo importante, mueve labios y expresión a partir del audio que le des — no genera ni clona una voz.
Lo corrimos de verdad (una sola A800-40GB)
Sin chamuyo — ejecutamos las tres tareas en una sola NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), en la configuración del modelo cuantizada en INT8 + destilación de 8 pasos, que es lo que hace falta para que un modelo de difusión de video de este tamaño entre en una placa de 40 GB. Acá va el paso a paso, sin filtro.
Las cinco trampas con las que nos chocamos
- Faltaba una dependencia para separar voces. El pipeline de audio necesita un modelo Kim_Vocal_2 vía
audio-separator, que no está en los requirements por defecto — la primera ejecución se murió hasta que hicimospip install audio-separator==0.30.2. - Explotó el escritor de video. Guardar frames falló con el error
TiffWriter got an unexpected keyword argument fpsporque imageio no encontraba un writer de ffmpeg — se arregló conpip install imageio-ffmpeg==0.6.0. - Deadlocks en multi-GPU. Correr un trabajo en varias placas (context-parallel size 2 u 8) quedó colgado por un desync colectivo de NCCL — ambos ranks se esperaban entre sí hasta que un timeout de 600s abortó la corrida. Solo pudimos correr en una sola placa. Los pesos INT8 sí entran en una placa de 40 GB, así que multi-GPU solo sirvió para correr trabajos separados en paralelo, no para acelerar un solo trabajo.
- Sin memoria en el segundo segmento. Los clips largos se construyen continuando segmento tras segmento, y el paso de continuación dejaba residente una KV-cache de 48 capas. En una placa de 40 GB, el segundo segmento llevó la placa al límite y crasheó — quedaban unos 160 MiB para que entre. Tuvimos que exponer y habilitar el flag
--offload_kv_cache(mover el cache a RAM de CPU y paginarlo de vuelta por paso) y además setearPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funciona, a costa de segmentos más lentos. - Alineación de resolución. 480p con paralelismo multi-placa activó una restricción de divisibilidad por 64 en alto y ancho; en una sola placa se evita.
Velocidad y memoria (medido)
Este es el número que importa: un clip de 82 segundos tardó 3,586 segundos — apenas menos de una hora — en la A800, o sea, alrededor de 44 segundos de cómputo por cada 1 segundo de video terminado (aprox. 138s por segmento generado a lo largo de 26 segmentos). Un clip corto de 10 segundos igual estaría cerca de 7 minutos. Y no es una carga liviana: la VRAM subió en segundos y después quedó clavada en 40,500 MiB — 98.9% de la placa de 40 GB — durante todo el render. Este es el uso real que muestreamos una vez por segundo:
Muestras que renderizamos
Cada clip de abajo lo generamos nosotros en la A800 mencionada arriba. Para evaluar el modelo en los escenarios para los que fue pensado, los hicimos con los insumos oficiales de demo del propio proyecto (retratos de referencia y audio) en vez de armar los nuestros — así que estos son resultados honestos, sin selección a dedo, no un compilado de “lo mejor”. Los primeros dos clips se hicieron cada uno con su propia foto de referencia:
Izquierda: la referencia para el clip de foto + audio. Derecha: la referencia para el clip con múltiples hablantes (una imagen, dos personas). El tercer clip de abajo usa texto + audio sin foto de referencia — el modelo inventa a la persona, que es donde más flojea.
Renderizado por VisionStory con LongCat-Video-Avatar 1.5 en una NVIDIA A800, 2026-07-15, a una resolución tipo 480p (768×512 / 832×480), usando los inputs oficiales de demo del modelo.
Veredicto honesto: fuerte con foto, áspero sin ella
Lo que de verdad nos impresionó:
- La identidad se mantiene. En el clip guiado por foto, la persona sigue siendo la misma durante los 82 segundos — pelo, ropa, cara — mientras la boca sigue el audio. Este es el caso que importa para avatares, y funciona.
- Varios hablantes funciona de verdad. Dos personas de una misma escena, cada una con labios guiados por su propia pista de audio, se mantuvieron coherentes — algo realmente difícil de lograr.
- MIT y nivel comercial. Pesos abiertos, sin cobro por render, y una calidad de salida que pasa en un clip corto.
Dónde se cae — y es real:
- La generación solo con texto deriva. Sin una foto de referencia, el modelo inventa a la persona, y en un clip largo la cara se deforma hacia un primer plano inquietante, como de cera, y la escena cambia — se ve en la tercera muestra de arriba.
- Es lento y pesado. ~44s de cómputo por 1s de video, clavando una placa de 40 GB todo el tiempo. Un clip de 82 segundos es una hora.
- 40 GB es el mínimo. Nuestra corrida necesitó INT8 + destilación solo para entrar, y los clips de varios segmentos solo sobrevivieron descargando la KV-cache a CPU. Con placas más chicas, no hay chance.
- En la práctica, solo una placa. El context-parallel multi-GPU se deadlockeó en nuestra máquina, así que no hay una forma simple de acelerar un clip sumando placas.
- Sin voz. Mueve los labios con el audio que le das — no hace texto a voz ni clonación de voz, así que igual necesitás una fuente de voz aparte.
- 480p, con este hardware. Lo que pudimos correr en una sola placa de 40 GB fue salida tipo 480p.
Autoalojar LongCat vs una herramienta alojada: ¿cuál conviene?
Ambos producen lo mismo — una foto más audio se convierte en un video parlante. La diferencia está totalmente en lo que te cuesta llegar ahí. Una herramienta alojada como VisionStory corre el modelo por vos; este es el trade-off, sin vueltas.
| LongCat (autoalojado) | VisionStory (alojado) | |
|---|---|---|
| Hardware | Una A100/A800 de 40 GB (miles de dólares) | Nada — corre en el navegador |
| Configuración | CUDA, flash-attn, INT8, arreglos de deps, tuning de OOM | Iniciás sesión y listo |
| Tiempo por clip | ~44s de cómputo por 1s de video (clip de 82s ≈ 1 hora) | Segundos, en GPUs alojadas |
| Resolución (nuestra corrida) | Tipo 480p | HD y más |
| Voz | Vos aportás el audio (sin TTS/clonación) | Voces integradas y clonación de voz |
| Uso comercial | Sí (MIT) | Sí (según el plan) |
| Mantenimiento | Vos parcheás deps, OOM, drivers | Ninguno |
| Mejor cuando | Tenés GPUs y necesitás autoalojado/offline/on-prem | Querés un video parlante terminado, rápido |
Elegí LongCat si tenés el hardware y el trabajo realmente tiene que ser autoalojado — on-prem, offline o totalmente bajo tu control — y te sentís cómodo manteniendo un stack CUDA. Elegí una herramienta alojada si querés el mismo video parlante de foto + audio sin una hora de cómputo y una GPU de cinco cifras.
Qué nos enseñó LongCat
La lección real de correr LongCat-Video-Avatar es que la calidad de video de avatares abiertos ya llegó — con una foto de referencia, este modelo gratis produce clips lo suficientemente buenos para uso real. El modelo ya no es la parte difícil.
Lo difícil es todo lo que lo rodea: hacer que un modelo de difusión de video entre en una placa que puedas pagar, sobrevivir a un OOM en el segundo segmento, esperar una hora para 82 segundos, y emparejarlo con una voz. Esa brecha — entre un checkpoint capaz y un video parlante terminado que cualquiera pueda hacer — es exactamente el trabajo que hacemos. Si querés ver el otro lado, VisionStory convierte una foto y un guion en un avatar parlante con sincronización labial en tu navegador en segundos, y si además necesitás la voz, nuestro teardown de TTS open source cubre en qué estado está hoy esa mitad.
