Español (México)

Meituan liberó como open source LongCat-Video-Avatar 1.5, y hace exactamente lo que VisionStory hace en su núcleo — convertir una foto fija más una pista de audio en un video de avatar parlante. Eso nos dio la curiosidad suficiente como para correrlo de verdad. Este es un desglose práctico: qué es, qué tan bien rinde en realidad, las cinco trampas de configuración con las que nos topamos y cuánto cuesta correrlo por tu cuenta versus una herramienta alojada. Fuente: github.com/meituan-longcat/LongCat-Video (MIT).

¿Qué es LongCat-Video-Avatar y quién lo hizo?

LongCat-Video-Avatar 1.5 es un modelo de video humano impulsado por audio con pesos abiertos de Meituan (el equipo LongCat). Está construido sobre el modelo base LongCat-Video y se publica bajo la licencia permisiva MIT — realmente gratis para uso comercial. A 2026-07, el repo de código tiene aproximadamente 5,200 estrellas en GitHub y los pesos 1.5 están entre los lanzamientos recientes con más “me gusta” en Hugging Face.

Soporta tres tareas nativas: Audio + Texto a video (AT2V, sin imagen de referencia), Audio + Texto + Imagen a video (ATI2V — una foto de referencia define la identidad, el caso que coincide con un flujo real de avatares), y continuación de video para extender un clip más allá de un solo segmento. La versión 1.5 cambió a un codificador de audio Whisper-Large, que es lo que le da el movimiento de labios. Y algo importante: mueve labios y expresión a partir del audio que le des — no genera ni clona una voz.

De hecho lo corrimos (una sola A800-40GB)

Sin cuentos — corrimos las tres tareas en una sola NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), con la configuración del modelo cuantizada a INT8 + distill de 8 pasos, que es lo necesario para que un modelo de difusión de video de este tamaño quepa en una tarjeta de 40 GB. Aquí va el relato honesto, paso a paso.

Las cinco trampas con las que nos topamos

  • Faltaba una dependencia para separación vocal. El pipeline de audio necesita un modelo Kim_Vocal_2 vía audio-separator, que no viene en los requirements por defecto — la primera corrida tronó hasta que hicimos pip install audio-separator==0.30.2.
  • Se rompió el writer de video. Guardar frames falló con el error TiffWriter got an unexpected keyword argument fps porque imageio no podía encontrar un writer de ffmpeg — se arregló con pip install imageio-ffmpeg==0.6.0.
  • Deadlocks en multi-GPU. Correr un trabajo en varias tarjetas (tamaño de paralelismo de contexto 2 u 8) se colgó por un desync colectivo de NCCL — ambos ranks se quedaron esperando hasta que un timeout de 600s abortó la corrida. Solo pudimos correr en una sola tarjeta. Los pesos INT8 sí caben en una tarjeta de 40 GB, así que multi-GPU solo sirvió para correr trabajos separados en paralelo, no para acelerar un solo trabajo.
  • Sin memoria en el segundo segmento. Los clips largos se construyen continuando segmento tras segmento, y el paso de continuación mantuvo residente un KV-cache de 48 capas. En una tarjeta de 40 GB, el segundo segmento llegó al tope y se cayó — se quedó como a 160 MiB de alcanzar a caber. Tuvimos que exponer y habilitar un flag --offload_kv_cache (mover el cache a RAM del CPU y paginarlo de regreso por paso) además de configurar PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funciona, a costa de segmentos más lentos.
  • Alineación de resolución. 480p bajo paralelismo multi-tarjeta disparó una restricción de “divisible entre 64” en alto y ancho; en una sola tarjeta se evita.

Velocidad y memoria (medidas)

Este es el número que importa: un clip de 82 segundos tardó 3,586 segundos — apenas menos de una hora — en la A800, o alrededor de 44 segundos de cómputo por cada 1 segundo de video final (aprox. 138s por segmento generado a lo largo de 26 segmentos). Un clip corto de 10 segundos todavía sería de alrededor de 7 minutos. Y no es una carga ligera: la VRAM subió en segundos y luego se quedó clavada en 40,500 MiB — 98.9% de la tarjeta de 40 GB — durante todo el render. Este fue el uso real que muestreamos una vez por segundo:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Muestras que renderizamos

Cada clip a continuación fue renderizado por nosotros en la A800 descrita arriba. Para evaluar el modelo en los escenarios previstos, los generamos con las entradas oficiales de demostración del propio proyecto (retratos de referencia y audio), en lugar de crear las nuestras — así que estos son resultados honestos, sin selección intencional, no un reel de lo mejor. Los primeros dos clips se generaron cada uno con su propia foto de referencia:

Las dos fotos de referencia: un cantante en solitario para el clip de foto + audio y una escena de estudio con dos personas para el clip de varios hablantes

Izquierda: la referencia para el clip de foto + audio. Derecha: la referencia para el clip de varios hablantes (una imagen, dos personas). El tercer clip de abajo usa texto + audio sin foto de referencia — el modelo inventa a la persona, y es donde más flojea.

Foto + audio (ATI2V) — el flujo de avatar. La identidad se mantiene; la boca sigue el canto.
Multi-hablante — dos personas, dos pistas de audio, cada boca impulsada de forma independiente.
Solo texto + audio, sin foto de referencia (AT2V) — el caso débil: fíjate cómo la cara se deforma y se va “derivando”.

Renderizado por VisionStory con LongCat-Video-Avatar 1.5 en una NVIDIA A800, el 2026-07-15, a resolución tipo 480p (768×512 / 832×480), usando los inputs oficiales del demo del modelo.

Veredicto honesto: fuerte con foto, flojo sin ella

Lo que de verdad nos impresionó:

  • La identidad se mantiene. En el clip impulsado por foto, la persona se mantiene igual durante los 82 segundos — cabello, ropa, cara — mientras la boca sigue el audio. Este es el caso que importa para avatares, y funciona.
  • Multi-hablante sí funciona. Dos personas en una sola escena, cada una con lipsync a partir de su propia pista de audio, se mantuvieron coherentes — algo realmente difícil de hacer bien.
  • MIT y nivel comercial. Pesos abiertos, sin cobro por render, y una calidad de salida que pasa en un clip corto.

Donde se cae — y esto es real:

  • La generación solo con texto se va. Sin foto de referencia el modelo inventa a la persona, y en un clip largo la cara se deforma hacia un close-up extraño, como de cera, y la escena cambia — se ve en la tercera muestra de arriba.
  • Es lento y pesado. ~44s de cómputo por 1s de video, con una tarjeta de 40 GB clavada todo el tiempo. Un clip de 82 segundos es una hora.
  • 40 GB es el mínimo. Nuestra corrida necesitó INT8 + distill solo para que cupiera, y los clips de varios segmentos sobrevivieron únicamente descargando el KV-cache al CPU. Tarjetas más pequeñas, ni hablar.
  • En la práctica, solo una tarjeta. El paralelismo de contexto multi-GPU se deadlockeó en nuestra máquina, así que no hay una forma fácil de hacer un clip más rápido agregando tarjetas.
  • Sin Voz. Mueve los labios con el audio que tú le das — no hace texto a voz ni clonación de voz, así que igual necesitas una fuente de voz aparte.
  • 480p, con este hardware. Lo que pudimos correr en una sola tarjeta de 40 GB fue salida tipo 480p.

Self-host de LongCat vs una herramienta alojada: ¿cuál te conviene?

Ambos producen lo mismo — una foto más audio se convierte en un video parlante. La diferencia está por completo en lo que te cuesta llegar ahí. Una herramienta alojada como VisionStory corre el modelo por ti; aquí va el trade-off honesto.

 LongCat (self-host)VisionStory (alojado)
HardwareUna A100/A800 de 40 GB (miles de dólares)Ninguno — corre en el navegador
ConfiguraciónCUDA, flash-attn, INT8, arreglos de deps, tuning de OOMInicia sesión y listo
Tiempo por clip~44s de cómputo por 1s de video (clip de 82s ≈ 1 hora)Segundos, en GPUs alojadas
Resolución (nuestra corrida)Tipo 480pVideo en HD y más
VozTú pones el audio (sin TTS/clonación)Voces integradas y clonación de voz
Uso comercialSí (MIT)Sí (según el plan)
MantenimientoTú parcheas deps, OOM, driversNinguno
Mejor cuandoTienes GPUs y necesitas self-host/offline/on-premQuieres un video parlante terminado, rápido

Elige LongCat si tienes el hardware y el trabajo de verdad debe ser self-host — on-prem, offline o totalmente bajo tu control — y te sientes cómodo manteniendo un stack de CUDA. Elige una herramienta alojada si quieres el mismo video parlante de foto + audio sin una hora de cómputo y una GPU de cinco cifras.

Lo que LongCat nos enseñó

La lección real de correr LongCat-Video-Avatar es que la calidad open de video de avatares ya llegó — con una foto de referencia, este modelo gratis produce clips lo suficientemente buenos para uso real. El modelo ya no es la parte difícil.

Lo difícil es todo lo que lo rodea: hacer que un modelo de difusión de video quepa en una tarjeta que puedas pagar, sobrevivir a OOM en el segundo segmento, esperar una hora por 82 segundos, y empatarlo con una Voz. Ese gap — entre un checkpoint capaz y un video parlante terminado que cualquiera puede hacer — es exactamente el trabajo que hacemos. Si quieres ver el otro lado, VisionStory convierte una foto y un guion en un avatar parlante con sincronización labial en tu navegador en segundos; y si también necesitas la Voz, nuestro teardown de TTS open-source cubre en qué punto está esa mitad hoy.

Preguntas frecuentes

  • Sí. LongCat-Video-Avatar 1.5 se publica bajo la licencia MIT, que permite el uso comercial, y no hay cobro por render. Solo pagas el cómputo de GPU que consuma.