Español (España)

Meituan liberó como open source LongCat-Video-Avatar 1.5, y hace exactamente lo que VisionStory hace en su núcleo: convertir una foto fija más una pista de audio en un vídeo de avatar parlante. Eso nos dio la suficiente curiosidad como para ejecutarlo de verdad. Este es un desmontaje práctico: qué es, qué tal rinde realmente, las cinco trampas de configuración con las que nos topamos y cuánto cuesta ejecutarlo por tu cuenta frente a una herramienta alojada. Fuente: github.com/meituan-longcat/LongCat-Video (MIT).

¿Qué es LongCat-Video-Avatar y quién lo creó?

LongCat-Video-Avatar 1.5 es un modelo de vídeo humano impulsado por audio con pesos abiertos de Meituan (el equipo LongCat). Está construido sobre el modelo fundacional LongCat-Video y se publica bajo la permisiva licencia MIT: realmente gratis para uso comercial. A fecha de 2026-07, el repo de código tiene aproximadamente 5.200 estrellas en GitHub y los pesos 1.5 están entre los lanzamientos recientes más populares en Hugging Face.

Admite tres tareas nativas: Audio + Texto a vídeo (AT2V, sin imagen de referencia), Audio + Texto + Imagen a vídeo (ATI2V — una foto de referencia define la identidad, el caso que encaja con un flujo real de avatares) y continuación de vídeo para ampliar un clip más allá de un solo segmento. La versión 1.5 cambió a un codificador de audio Whisper-Large, que es lo que le da el movimiento de labios. Y, lo importante: mueve labios y expresión a partir del audio que le des; no genera ni clona una voz.

Lo ejecutamos de verdad (una sola A800-40GB)

Sin humo: ejecutamos las tres tareas en una sola NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), en la configuración del modelo cuantizada a INT8 + destilación de 8 pasos, que es lo necesario para que un modelo de difusión de vídeo de este tamaño quepa en una tarjeta de 40 GB. Aquí va el relato, tal cual.

Las cinco trampas con las que nos topamos

  • Faltaba una dependencia de separación vocal. El pipeline de audio necesita un modelo Kim_Vocal_2 vía audio-separator, que no está en los requisitos por defecto: la primera ejecución murió hasta que hicimos pip install audio-separator==0.30.2.
  • Se rompió el escritor de vídeo. Guardar frames fallaba con el error TiffWriter got an unexpected keyword argument fps porque imageio no encontraba un writer de ffmpeg: se arregló con pip install imageio-ffmpeg==0.6.0.
  • Bloqueos en multi-GPU. Ejecutar un trabajo en varias tarjetas (tamaño de paralelismo de contexto 2 u 8) se quedaba colgado por una desincronización de una colectiva NCCL: ambos ranks esperaban al otro hasta que un timeout de 600 s abortaba la ejecución. Solo pudimos ejecutar en una sola tarjeta. Los pesos INT8 sí caben en una tarjeta de 40 GB, así que el multi-GPU solo servía para lanzar trabajos separados en paralelo, no para acelerar un único trabajo.
  • Sin memoria en el segundo segmento. Los clips largos se construyen continuando segmento tras segmento, y el paso de continuación mantenía residente una KV-cache de 48 capas. En una tarjeta de 40 GB el segundo segmento alcanzaba el pico y se caía: se quedaba a unos 160 MiB de encajar. Tuvimos que exponer y activar un flag --offload_kv_cache (mover la cache a RAM de CPU y paginarla de vuelta en cada paso) y además configurar PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funciona, a costa de segmentos más lentos.
  • Alineación de resolución. 480p bajo paralelismo multi-tarjeta disparaba una restricción de “divisible por 64” en alto y ancho; con una sola tarjeta se evita.

Velocidad y memoria (medidas)

Este es el número que importa: un clip de 82 segundos tardó 3.586 segundos — algo menos de una hora en la A800, es decir, alrededor de 44 segundos de cómputo por cada 1 segundo de vídeo terminado (aprox. 138 s por segmento generado a lo largo de 26 segmentos). Un clip corto de 10 segundos seguiría siendo de unos 7 minutos. Y no es una carga ligera: la VRAM subió en cuestión de segundos y luego quedó clavada en 40.500 MiB — el 98,9% de una tarjeta de 40 GB — durante todo el render. Este es el uso real que muestreamos una vez por segundo:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Muestras que renderizamos

Cada clip de abajo lo renderizamos nosotros en la A800 descrita arriba. Para evaluar el modelo en sus escenarios previstos, los generamos con las entradas oficiales de demostración del propio proyecto (retratos de referencia y audio) en lugar de seleccionar las nuestras — así que estos son resultados honestos, sin selección interesada, no un vídeo de mejores momentos. Los dos primeros clips se generaron cada uno con su propia foto de referencia:

Las dos fotos de referencia: una cantante en solitario para el clip de foto + audio y una escena de estudio con dos personas para el clip de varios hablantes

Izquierda: la referencia para el clip de foto + audio. Derecha: la referencia para el clip de varios hablantes (una imagen, dos personas). El tercer clip de abajo generó texto + audio sin foto de referencia — el modelo inventa a la persona, y ahí es donde más flojea.

Foto + audio (ATI2V) — el flujo de avatares. La identidad se mantiene; la boca sigue el canto.
Multi-hablante — dos personas, dos pistas de audio, cada boca impulsada de forma independiente.
Solo texto + audio, sin foto de referencia (AT2V) — el caso flojo: fíjate en cómo la cara se deforma y deriva.

Renderizado por VisionStory con LongCat-Video-Avatar 1.5 en una NVIDIA A800, el 2026-07-15, a resolución de clase 480p (768×512 / 832×480), usando las entradas oficiales de demo del modelo.

Veredicto honesto: fuerte con foto, flojo sin ella

Lo que de verdad nos impresionó:

  • La identidad se mantiene. En el clip impulsado por foto, la persona sigue siendo la misma a lo largo de los 82 segundos (pelo, ropa, cara) mientras la boca sigue el audio. Este es el caso que importa para avatares, y funciona.
  • El modo multi-hablante funciona de verdad. Dos personas de una misma escena, cada una con labios impulsados por su propia pista de audio, se mantuvieron coherentes: algo realmente difícil de clavar.
  • MIT y nivel comercial. Pesos abiertos, sin cobro por render, y una calidad que pasaría en un clip corto.

Donde se cae — y esto es real:

  • La generación solo con texto deriva. Sin una foto de referencia, el modelo inventa a la persona y, en un clip largo, la cara se deforma hacia un primer plano extraño, ceroso, y la escena cambia: se ve en la tercera muestra de arriba.
  • Es lento y pesado. ~44 s de cómputo por 1 s de vídeo, manteniendo una tarjeta de 40 GB al máximo todo el tiempo. Un clip de 82 segundos es una hora.
  • 40 GB es el mínimo. Nuestra ejecución necesitó INT8 + destilación solo para encajar, y los clips multi-segmento solo sobrevivieron descargando la KV-cache a la CPU. Las tarjetas más pequeñas quedan descartadas.
  • En la práctica, solo una tarjeta. El paralelismo de contexto en multi-GPU se bloqueó en nuestra máquina, así que no hay una forma sencilla de acelerar un clip añadiendo tarjetas.
  • Sin voz. Mueve los labios a partir del audio que tú aportas; no hace texto a voz ni clonación de voz, así que sigues necesitando una fuente de voz aparte.
  • 480p, con este hardware. Lo que pudimos ejecutar en una sola tarjeta de 40 GB fue salida de clase 480p.

LongCat en self-host vs una herramienta alojada: ¿cuál elegir?

Ambos producen lo mismo: una foto más audio se convierte en un vídeo de avatar parlante. La diferencia está por completo en lo que te cuesta llegar ahí. Una herramienta alojada como VisionStory ejecuta el modelo por ti; este es el intercambio real.

 LongCat (self-host)VisionStory (alojado)
HardwareUna A100/A800 de 40 GB (miles de dólares)Ninguno — funciona en el navegador
ConfiguraciónCUDA, flash-attn, INT8, arreglos de dependencias, ajuste por OOMInicia sesión y listo
Tiempo por clip~44 s de cómputo por 1 s de vídeo (clip de 82 s ≈ 1 hora)Segundos, en GPUs alojadas
Resolución (nuestra ejecución)Clase 480pHD y superior
VozTú aportas el audio (sin TTS/clonación)Voces integradas y clonación de voz
Uso comercialSí (MIT)Sí (según el plan)
MantenimientoTú parcheas dependencias, OOM, driversNinguno
Mejor cuandoTienes GPUs y necesitas self-host/offline/on-premQuieres un vídeo de avatar parlante ya, rápido

Elige LongCat si tienes el hardware y el trabajo de verdad debe ser self-host (on-prem, offline o totalmente bajo tu control) y te ves manteniendo un stack de CUDA. Elige una herramienta alojada si quieres el mismo vídeo de avatar parlante a partir de foto + audio sin una hora de cómputo y una GPU de cinco cifras.

Lo que nos enseñó LongCat

La lección real de ejecutar LongCat-Video-Avatar es que la calidad open de vídeo de avatares ya ha llegado: con una foto de referencia, este modelo gratuito produce clips suficientemente buenos para un uso real. El modelo ya no es la parte difícil.

Lo difícil es todo lo que hay alrededor: hacer que un modelo de difusión de vídeo quepa en una tarjeta que te puedas permitir, sobrevivir a un OOM en el segundo segmento, esperar una hora para 82 segundos y combinarlo con una voz. Esa brecha — entre un checkpoint capaz y un vídeo de avatar parlante terminado que cualquiera puede hacer — es exactamente el trabajo que hacemos. Si quieres ver el otro lado, VisionStory convierte una foto y un guion en un avatar parlante con sincronización labial en tu navegador en cuestión de segundos; y si también necesitas la voz, nuestro desmontaje de TTS open source cubre en qué punto está ahora esa mitad.

Preguntas frecuentes

  • Sí. LongCat-Video-Avatar 1.5 se publica bajo la licencia MIT, que permite el uso comercial, y no hay cobro por renderizado. Solo pagas por el cómputo de GPU que consuma.