Español (Estados Unidos)

Meituan liberó como open source LongCat-Video-Avatar 1.5, y hace exactamente lo que VisionStory hace en su esencia: convertir una foto fija más una pista de audio en un video de avatar parlante. Eso nos dio la suficiente curiosidad como para ejecutarlo de verdad. Este es un desglose práctico: qué es, qué tan bien rinde realmente, las cinco trampas de configuración con las que nos topamos y cuánto cuesta ejecutarlo tú mismo frente a una herramienta alojada. Fuente: github.com/meituan-longcat/LongCat-Video (MIT).

¿Qué es LongCat-Video-Avatar y quién lo hizo?

LongCat-Video-Avatar 1.5 es un modelo de video humano impulsado por audio con pesos abiertos de Meituan (el equipo LongCat). Está construido sobre el modelo fundacional LongCat-Video y se publica bajo la licencia permisiva MIT, verdaderamente gratis para uso comercial. A fecha de 2026-07, el repositorio de código tiene aproximadamente 5,200 estrellas en GitHub y los pesos 1.5 están entre los lanzamientos recientes más populares en Hugging Face.

Admite tres tareas nativas: Audio + Text to Video (AT2V, sin imagen de referencia), Audio + Text + Image to Video (ATI2V — una foto de referencia define la identidad, el caso que coincide con un flujo real de avatares) y continuación de video para extender un clip más allá de un solo segmento. La versión 1.5 cambió a un codificador de audio Whisper-Large, que es lo que le da el movimiento de labios. Y, lo más importante, mueve labios y expresión a partir del audio que le des: no genera ni clona una voz.

De hecho lo ejecutamos (una sola A800-40GB)

Sin rodeos: ejecutamos las tres tareas en una sola NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), en la configuración del modelo cuantizada en INT8 + destilación de 8 pasos, que es lo necesario para que un modelo de difusión de video de este tamaño quepa en una tarjeta de 40 GB. Aquí va el recuento honesto, paso a paso.

Las cinco trampas con las que nos topamos

  • Dependencia faltante de separación vocal. El pipeline de audio necesita un modelo Kim_Vocal_2 mediante audio-separator, que no está en los requisitos predeterminados: la primera ejecución murió hasta que hicimos pip install audio-separator==0.30.2.
  • El escritor de video falló. Guardar frames falló con el error TiffWriter got an unexpected keyword argument fps porque imageio no pudo encontrar un writer de ffmpeg: se arregló con pip install imageio-ffmpeg==0.6.0.
  • Bloqueos en multi-GPU. Ejecutar un trabajo en varias tarjetas (tamaño de paralelismo de contexto 2 u 8) se colgó por una desincronización colectiva de NCCL: ambos ranks se esperaron entre sí hasta que un timeout de 600 s abortó la ejecución. Solo pudimos correr en una sola tarjeta. Los pesos INT8 sí caben en una tarjeta de 40 GB, así que el multi-GPU solo servía para ejecutar trabajos separados en paralelo, no para acelerar un solo trabajo.
  • Sin memoria en el segundo segmento. Los clips largos se construyen continuando segmento tras segmento, y el paso de continuación mantuvo residente un KV-cache de 48 capas. En una tarjeta de 40 GB, el segundo segmento llevó la tarjeta al límite y se cayó: le faltaban unos 160 MiB para caber. Tuvimos que exponer y habilitar un flag --offload_kv_cache (mover el cache a la RAM de CPU y paginarlo de vuelta por paso) y además configurar PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funciona, a costa de segmentos más lentos.
  • Alineación de resolución. 480p bajo paralelismo multi-tarjeta activó una restricción de divisibilidad por 64 en alto y ancho; con una sola tarjeta se evita.

Velocidad y memoria (medidas)

Este es el número que importa: un clip de 82 segundos tardó 3,586 segundos — apenas menos de una hora — en la A800, o alrededor de 44 segundos de cómputo por cada 1 segundo de video final (aprox. 138 s por segmento generado a lo largo de 26 segmentos). Un clip corto de 10 segundos aun así sería de alrededor de 7 minutos. Y no es una carga ligera: la VRAM subió en cuestión de segundos y luego se mantuvo fijada en 40,500 MiB — 98.9% de la tarjeta de 40 GB — durante todo el render. Este es el uso real que muestreamos una vez por segundo:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Muestras que renderizamos

Cada clip a continuación fue renderizado por nosotros en la A800 descrita arriba. Para evaluar el modelo en los escenarios para los que fue diseñado, los generamos con las entradas oficiales de demostración del propio proyecto (retratos de referencia y audio), en lugar de seleccionar las nuestras — así que estos son resultados honestos, sin "cherry-picking", no un video de mejores momentos. Los primeros dos clips se generaron cada uno con su propia foto de referencia:

Las dos fotos de referencia: un cantante solista para el clip de foto + audio y una escena de estudio con dos personas para el clip de varios hablantes

Izquierda: la referencia para el clip de foto + audio. Derecha: la referencia para el clip de varios hablantes (una imagen, dos personas). El tercer clip de abajo se generó con texto + audio sin foto de referencia — el modelo inventa a la persona, y es donde más flojea.

Foto + audio (ATI2V) — el flujo de avatares. La identidad se mantiene; la boca sigue el canto.
Múltiples hablantes — dos personas, dos pistas de audio, y cada boca se controla de forma independiente.
Solo texto + audio, sin foto de referencia (AT2V) — el caso débil: mira cómo la cara se deforma y se desplaza.

Renderizado por VisionStory con LongCat-Video-Avatar 1.5 en una NVIDIA A800, 2026-07-15, a resolución de clase 480p (768×512 / 832×480), usando las entradas oficiales de demo del modelo.

Veredicto honesto: sólido con una foto, flojo sin una

Lo que de verdad nos impresionó:

  • La identidad se mantiene. En el clip impulsado por foto, la persona sigue siendo la misma a lo largo de los 82 segundos — cabello, ropa, rostro — mientras la boca sigue el audio. Este es el caso que importa para avatares, y funciona.
  • Multi-hablante sí funciona. Dos personas de una misma escena, cada una con sincronización labial impulsada por su propia pista de audio, se mantuvieron coherentes: algo realmente difícil de lograr.
  • MIT y nivel comercial. Pesos abiertos, sin cobro por render, y una calidad de salida que pasa sin problema en un clip corto.

Donde se cae — y esto es real:

  • La generación solo con texto se va. Sin una foto de referencia, el modelo inventa a la persona y, en un clip largo, la cara se deforma hacia un primer plano inquietante y ceroso y la escena cambia: se ve en la tercera muestra de arriba.
  • Es lento y pesado. ~44 s de cómputo por 1 s de video, manteniendo una tarjeta de 40 GB al máximo todo el tiempo. Un clip de 82 segundos es una hora.
  • 40 GB es el mínimo. Nuestra ejecución necesitó INT8 + destilación solo para caber, y los clips de varios segmentos solo sobrevivieron descargando el KV-cache a la CPU. Las tarjetas más pequeñas no entran.
  • En la práctica, solo una tarjeta. El paralelismo de contexto multi-GPU se quedó bloqueado en nuestra máquina, así que no hay una forma fácil de hacer un clip más rápido agregando tarjetas.
  • Sin voz. Mueve los labios a partir del audio que tú proporcionas: no hace texto a voz ni clonación de voz, así que aún necesitas una fuente de voz aparte.
  • 480p, con este hardware. Lo que pudimos ejecutar en una sola tarjeta de 40 GB fue salida de clase 480p.

Autoalojar LongCat vs una herramienta alojada: ¿cuál deberías elegir?

Ambos producen lo mismo: una foto más audio se convierte en un video parlante. La diferencia está por completo en lo que te cuesta llegar ahí. Una herramienta alojada como VisionStory ejecuta el modelo por ti; este es el intercambio honesto.

 LongCat (autoalojado)VisionStory (alojado)
HardwareUna A100/A800 de 40 GB (miles de dólares)Ninguno — corre en el navegador
ConfiguraciónCUDA, flash-attn, INT8, arreglos de dependencias, ajuste de OOMInicia sesión y listo
Tiempo por clip~44 s de cómputo por 1 s de video (clip de 82 s ≈ 1 hora)Segundos, en GPUs alojadas
Resolución (nuestra ejecución)Clase 480pHD y más
VozTú proporcionas el audio (sin TTS/clon)Voces integradas y clonación de voz
Uso comercialSí (MIT)Sí (según el plan)
MantenimientoTú corriges dependencias, OOM, driversNinguno
Ideal cuandoTienes GPUs y necesitas autoalojado/sin conexión/on-premQuieres un video parlante terminado, rápido

Elige LongCat si tienes el hardware y el trabajo realmente debe ser autoalojado — on-prem, sin conexión o totalmente bajo tu control — y te sientes cómodo manteniendo una pila CUDA. Elige una herramienta alojada si quieres el mismo video parlante de foto + audio sin una hora de cómputo y una GPU de cinco cifras.

Lo que LongCat nos enseñó

La verdadera lección de ejecutar LongCat-Video-Avatar es que ya llegó la calidad de video de avatar open: con una foto de referencia, este modelo gratis produce clips lo suficientemente buenos para uso real. El modelo ya no es la parte difícil.

Lo difícil es todo lo que lo rodea: hacer que un modelo de difusión de video quepa en una tarjeta que puedas pagar, sobrevivir a OOM en el segundo segmento, esperar una hora por 82 segundos y emparejarlo con una Voz. Esa brecha — entre un checkpoint capaz y un video parlante terminado que cualquiera pueda hacer — es exactamente el trabajo que hacemos. Si quieres ver la otra cara, VisionStory convierte una foto y un guion en un avatar parlante con sincronización labial en tu navegador en segundos, y si también necesitas la Voz, nuestro análisis de TTS de código abierto explica en qué punto está esa mitad hoy.

Preguntas frecuentes

  • Sí. LongCat-Video-Avatar 1.5 se publica bajo la licencia MIT, que permite el uso comercial, y no hay cobro por renderizado. Solo pagas el cómputo de GPU que consume.