Meituan liberó LongCat-Video-Avatar 1.5 como código abierto, y hace exactamente lo que VisionStory hace en su esencia — convertir una foto fija más una pista de audio en un video de avatar parlante. Eso nos dio la curiosidad suficiente como para ejecutarlo de verdad. Este es un desmontaje práctico: qué es, qué tan bien rinde en realidad, las cinco trampas de instalación con las que nos topamos y cuánto cuesta ejecutarlo tú mismo frente a una herramienta alojada. Fuente: github.com/meituan-longcat/LongCat-Video (MIT).

¿Qué es LongCat-Video-Avatar y quién lo hizo?

LongCat-Video-Avatar 1.5 es un modelo de video humano impulsado por audio con pesos abiertos de Meituan (el equipo LongCat). Está construido sobre el modelo base LongCat-Video y se publica bajo la licencia permisiva MIT — realmente gratis para uso comercial. A fecha de 2026-07, el repositorio de código tiene aproximadamente 5,200 estrellas en GitHub y los pesos 1.5 están entre los lanzamientos recientes mejor valorados en Hugging Face.

Admite tres tareas nativas: Audio + Texto a Video (AT2V, sin imagen de referencia), Audio + Texto + Imagen a Video (ATI2V — una foto de referencia define la identidad, el caso que coincide con un flujo de trabajo real de avatares) y continuación de video para extender un clip más allá de un solo segmento. La versión 1.5 cambió a un codificador de audio Whisper-Large, que es lo que le da el movimiento de labios. Y, lo más importante, mueve labios y expresión a partir del audio que le des — no genera ni clona una voz.

De hecho lo ejecutamos (una sola A800-40GB)

Sin rodeos — ejecutamos las tres tareas en una sola NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), con la configuración del modelo cuantizada en INT8 + destilación de 8 pasos, que es lo necesario para que un modelo de difusión de video de este tamaño quepa en una tarjeta de 40 GB. Aquí va el relato honesto, paso a paso.

Las cinco trampas con las que nos topamos

  • Dependencia faltante para separación vocal. La canalización de audio necesita un modelo Kim_Vocal_2 vía audio-separator, que no está en los requisitos por defecto — la primera ejecución murió hasta que hicimos pip install audio-separator==0.30.2.
  • El escritor de video explotó. Guardar fotogramas falló con un error TiffWriter got an unexpected keyword argument fps porque imageio no pudo encontrar un writer de ffmpeg — se arregló con pip install imageio-ffmpeg==0.6.0.
  • Bloqueos con multi-GPU. Ejecutar un trabajo en varias tarjetas (tamaño de paralelismo de contexto 2 u 8) se colgó por una desincronización colectiva de NCCL — ambos ranks se esperaban entre sí hasta que un timeout de 600s abortó la ejecución. Solo pudimos correr en una sola tarjeta. Los pesos INT8 sí caben en una tarjeta de 40 GB, así que multi-GPU solo fue útil para ejecutar trabajos separados en paralelo, no para acelerar un solo trabajo.
  • Falta de memoria en el segundo segmento. Los clips largos se construyen continuando segmento tras segmento, y el paso de continuación mantenía residente una KV-cache de 48 capas. En una tarjeta de 40 GB, el segundo segmento llevó la tarjeta al pico y se cayó — faltaban unos 160 MiB para que entrara. Tuvimos que exponer y habilitar un flag --offload_kv_cache (mover la cache a RAM de CPU y paginarla de vuelta por paso) además de configurar PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funciona, a costa de segmentos más lentos.
  • Alineación de resolución. 480p bajo paralelismo multi-tarjeta activó una restricción de divisibilidad por 64 en alto y ancho; en una sola tarjeta se evita.

Velocidad y memoria (medidas)

Este es el número que importa: un clip de 82 segundos tomó 3,586 segundos — apenas menos de una hora — en la A800, o cerca de 44 segundos de cómputo por cada 1 segundo de video final (aprox. 138s por segmento generado a lo largo de 26 segmentos). Un clip corto de 10 segundos igual estaría alrededor de 7 minutos. Y no es una carga ligera: la VRAM subió en segundos y luego quedó clavada en 40,500 MiB — 98.9% de la tarjeta de 40 GB — durante todo el render. Este es el uso real que muestreamos una vez por segundo:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Muestras que renderizamos

Cada clip a continuación fue renderizado por nosotros en la A800 descrita arriba. Para evaluar el modelo en sus escenarios previstos, los generamos usando las entradas oficiales de demostración del propio proyecto (retratos de referencia y audio), en lugar de seleccionar las nuestras — así que estos son resultados honestos, sin selección sesgada, no un video de momentos destacados. Los dos primeros clips se generaron cada uno con su propia foto de referencia:

Las dos fotos de referencia: un cantante solista para el clip de foto + audio y una escena de estudio con dos personas para el clip de múltiples hablantes

Izquierda: la referencia para el clip de foto + audio. Derecha: la referencia para el clip de múltiples hablantes (una imagen, dos personas). El tercer clip de abajo generó texto + audio sin foto de referencia — el modelo inventa a la persona, que es donde más flaquea.

Foto + audio (ATI2V) — el flujo de trabajo de avatar. La identidad se mantiene y la boca sigue el canto.
Multi-hablante — dos personas, dos pistas de audio, cada boca impulsada de forma independiente.
Solo texto + audio, sin foto de referencia (AT2V) — el caso débil: mira cómo el rostro se deforma y deriva.

Renderizado por VisionStory con LongCat-Video-Avatar 1.5 en una NVIDIA A800, 2026-07-15, a resolución de clase 480p (768×512 / 832×480), usando las entradas oficiales de demo del modelo.

Veredicto honesto: fuerte con una foto, flojo sin ella

Lo que de verdad nos impresionó:

  • La identidad se mantiene. En el clip impulsado por foto, la persona sigue siendo la misma durante los 82 segundos — cabello, vestuario, rostro — mientras la boca sigue el audio. Este es el caso que importa para avatares, y funciona.
  • Multi-hablante sí funciona. Dos personas en una misma escena, cada una con labios impulsados por su propia pista de audio, se mantuvieron coherentes — algo realmente difícil de lograr.
  • MIT y apto para uso comercial. Pesos abiertos, sin cobro por render, y una calidad de salida que pasaría en un clip corto.

Dónde falla — y esto es real:

  • La generación solo con texto deriva. Sin una foto de referencia el modelo inventa a la persona y, a lo largo de un clip largo, el rostro se deforma hacia un primer plano inquietante y ceroso, y la escena cambia — visible en la tercera muestra de arriba.
  • Es lento y pesado. ~44s de cómputo por 1s de video, manteniendo una tarjeta de 40 GB al límite todo el tiempo. Un clip de 82 segundos es una hora.
  • 40 GB es el mínimo. Nuestra ejecución necesitó INT8 + destilación solo para que cupiera, y los clips multisegmento solo sobrevivieron descargando la KV-cache a CPU. Tarjetas más pequeñas, descartadas.
  • En la práctica, solo una tarjeta. El paralelismo de contexto multi-GPU se quedó bloqueado en nuestra máquina, así que no hay una manera fácil de hacer un clip más rápido añadiendo tarjetas.
  • Sin voz. Mueve los labios a partir del audio que le proporcionas — no hace texto a voz ni clonación de voz, así que igual necesitas una fuente de voz aparte.
  • 480p, con este hardware. Lo que pudimos ejecutar en una sola tarjeta de 40 GB fue salida de clase 480p.

Autoalojar LongCat vs una herramienta alojada: ¿cuál deberías elegir?

Ambos producen lo mismo — una foto más audio se convierte en un video parlante. La diferencia está completamente en lo que te cuesta llegar ahí. Una herramienta alojada como VisionStory ejecuta el modelo por ti; este es el intercambio honesto.

 LongCat (self-host)VisionStory (hosted)
HardwareUna A100/A800 de 40 GB (miles de dólares)Ninguno — corre en el navegador
ConfiguraciónCUDA, flash-attn, INT8, arreglos de deps, ajuste de OOMInicia sesión y listo
Tiempo por clip~44s de cómputo por 1s de video (clip de 82s ≈ 1 hora)Segundos, en GPUs alojadas
Resolución (nuestra ejecución)Clase 480pVideo en HD y superior
VozTú aportas el audio (sin TTS/clonación)Voces integradas y clonación de voz
Uso comercialSí (MIT)Sí (según el plan)
MantenimientoTú parcheas deps, OOM y driversNinguno
Mejor cuandoTienes GPUs y necesitas self-host/offline/on-premQuieres un video parlante terminado, rápido

Elige LongCat si tienes el hardware y el trabajo realmente debe ser autoalojado — on-prem, offline o totalmente bajo tu control — y te sientes cómodo manteniendo un stack CUDA. Elige una herramienta alojada si quieres el mismo video parlante de foto + audio sin una hora de cómputo y una GPU de cinco cifras.

Lo que LongCat nos enseñó

La verdadera lección de ejecutar LongCat-Video-Avatar es que la calidad de video de avatares open-weight ya llegó — con una foto de referencia, este modelo gratis produce clips lo bastante buenos para uso real. El modelo ya no es la parte difícil.

La parte difícil es todo lo que lo rodea: hacer que un modelo de difusión de video quepa en una tarjeta que puedas pagar, sobrevivir a OOM en el segundo segmento, esperar una hora por 82 segundos y emparejarlo con una voz. Esa brecha — entre un checkpoint capaz y un video parlante terminado que cualquiera puede crear — es exactamente el trabajo que hacemos. Si quieres ver el otro lado, VisionStory convierte una foto y un guion en un avatar parlante con sincronización labial en tu navegador en segundos, y si además necesitas la voz, nuestro desmontaje de TTS de código abierto muestra en qué punto está esa otra mitad hoy.

Preguntas frecuentes

  • Sí. LongCat-Video-Avatar 1.5 se publica bajo la licencia MIT, que permite el uso comercial, y no hay cobro por render. Solo pagas por el cómputo de GPU que consume.