A Meituan disponibilizou em open-source o LongCat-Video-Avatar 1.5, e ele faz exatamente o que a VisionStory faz no seu núcleo — transformar uma foto estática mais uma faixa de áudio num vídeo de avatar falante. Isso deixou-nos curiosos o suficiente para o executarmos de facto. Isto é uma análise prática e detalhada: o que é, quão bem realmente funciona, as cinco armadilhas de configuração em que caímos e quanto custa executar por conta própria versus uma ferramenta alojada. Fonte: github.com/meituan-longcat/LongCat-Video (MIT).
O que é o LongCat-Video-Avatar, e quem o fez?
LongCat-Video-Avatar 1.5 é um modelo de vídeo humano guiado por áudio, com pesos abertos, da Meituan (a equipa LongCat). É construído sobre o modelo base LongCat-Video e lançado sob a licença permissiva MIT — verdadeiramente gratuito para uso comercial. Em 2026-07, o repositório de código tinha cerca de 5.200 estrelas no GitHub, e os pesos da versão 1.5 estão entre os lançamentos recentes mais apreciados no Hugging Face.
Suporta três tarefas nativas: Áudio + Texto para Vídeo (AT2V, sem imagem de referência), Áudio + Texto + Imagem para Vídeo (ATI2V — uma foto de referência define a identidade, o caso que corresponde a um fluxo real de avatares) e continuação de vídeo para prolongar um clip para lá de um único segmento. A versão 1.5 trocou para um codificador de áudio Whisper-Large, que é o que lhe dá o movimento labial. Importante: gera os lábios e a expressão a partir de qualquer áudio que lhe dê — não gera nem clona uma voz.
Nós executámo-lo mesmo (um único A800-40GB)
Sem conversa fiada — executámos as três tarefas num único NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), na configuração quantizada em INT8 + destilação de 8 passos do modelo, que é o necessário para fazer caber um modelo de difusão de vídeo deste tamanho numa placa de 40 GB. Aqui vai o relato honesto, passo a passo.
As cinco armadilhas em que caímos
- Dependência em falta para separação vocal. O pipeline de áudio precisa de um modelo Kim_Vocal_2 via
audio-separator, que não está nos requisitos por defeito — a primeira execução morreu até fazermospip install audio-separator==0.30.2. - O writer de vídeo rebentou. Guardar frames falhou com o erro
TiffWriter got an unexpected keyword argument fpsporque o imageio não conseguiu encontrar um writer ffmpeg — resolveu-se compip install imageio-ffmpeg==0.6.0. - Deadlocks em multi-GPU. Executar um job através de várias placas (context-parallel size 2 ou 8) bloqueou num desync de collective do NCCL — ambos os ranks ficaram à espera um do outro até um timeout de 600s abortar a execução. Só conseguimos correr em uma única placa. Os pesos INT8 cabem numa placa de 40 GB, por isso o multi-GPU só era útil para executar jobs separados em paralelo, não para acelerar um job.
- Falta de memória no segundo segmento. Clips longos são construídos continuando segmento após segmento, e o passo de continuação manteve residente uma KV-cache de 48 camadas. Numa placa de 40 GB, o segundo segmento levou a placa ao limite e crashou — faltavam cerca de 160 MiB para caber. Tivemos de expor e ativar uma flag
--offload_kv_cache(mover a cache para RAM do CPU e paginá-la de volta por passo) e definirPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funciona, com o custo de segmentos mais lentos. - Alinhamento de Resolução. 480p sob paralelismo multi-placa disparou uma restrição “divisível por 64” na altura e largura; em placa única evita-se.
Velocidade e memória (medidas)
Este é o número que interessa: um clip de 82 segundos demorou 3.586 segundos — pouco menos de uma hora — no A800, ou cerca de 44 segundos de computação por cada 1 segundo de vídeo final (aprox. 138s por segmento gerado ao longo de 26 segmentos). Um clip curto de 10 segundos ainda ficaria por volta de 7 minutos. E não é uma carga leve: a VRAM subiu em segundos e depois ficou presa em 40.500 MiB — 98,9% da placa de 40 GB — durante todo o render. Aqui está o uso real que amostramos uma vez por segundo:
Amostras que renderizámos
Cada clip abaixo foi renderizado por nós no A800 descrito acima. Para avaliar o modelo nos cenários a que se destina, usámo-los com os próprios inputs oficiais de demonstração do projeto (retratos de referência e áudio), em vez de selecionarmos os nossos — por isso, estes são resultados honestos, sem “cherry-picking”, e não uma compilação de melhores momentos. Os primeiros dois clips foram gerados, cada um, com a sua própria foto de referência:
À esquerda: a referência para o clip de foto + áudio. À direita: a referência para o clip com vários oradores (uma imagem, duas pessoas). O terceiro clip abaixo usa texto + áudio sem foto de referência — o modelo inventa a pessoa, e é aí que fica mais fraco.
Renderizado pela VisionStory com LongCat-Video-Avatar 1.5 num NVIDIA A800, em 2026-07-15, a uma resolução de classe 480p (768×512 / 832×480), usando os inputs oficiais de demo do modelo.
Veredito honesto: forte com uma foto, fraco sem ela
O que nos impressionou a sério:
- A identidade mantém-se. No clip guiado por foto, a pessoa mantém-se a mesma ao longo de todos os 82 segundos — cabelo, roupa, rosto — enquanto a boca acompanha o áudio. Este é o caso que importa para avatares, e funciona.
- Multi-orador funciona mesmo. Duas pessoas numa só cena, cada uma com sincronização labial guiada pela sua própria faixa de áudio, manteve-se coerente — algo genuinamente difícil de acertar.
- MIT e com qualidade “comercial”. Pesos abertos, sem faturação por render e qualidade de saída que passaria num clip curto.
Onde falha — e isto é real:
- A geração só com texto deriva. Sem uma foto de referência, o modelo inventa a pessoa e, num clip longo, o rosto deforma-se numa aproximação estranha e cerosa e a cena muda — visível na terceira amostra acima.
- É lento e pesado. ~44s de computação por 1s de vídeo, a fixar uma placa de 40 GB o tempo todo. Um clip de 82 segundos é uma hora.
- 40 GB é o mínimo. O nosso teste precisou de INT8 + distil só para caber, e clips multi-segmento só sobreviveram ao descarregar a KV-cache para o CPU. Placas mais pequenas não dão.
- Na prática, só uma placa. O context-parallel multi-GPU entrou em deadlock na nossa máquina, por isso não há forma simples de tornar um clip mais rápido só por adicionar placas.
- Sem voz. Ele guia os lábios a partir do áudio que fornece — não faz texto para fala nem clonagem de voz, por isso continua a precisar de uma fonte de voz separada.
- 480p, neste hardware. O que conseguimos executar numa única placa de 40 GB foi saída de classe 480p.
Alojar LongCat vs uma ferramenta alojada: qual deve escolher?
Ambos produzem a mesma coisa — uma foto mais áudio transforma-se num vídeo falado. A diferença está inteiramente no que lhe custa chegar lá. Uma ferramenta alojada como a VisionStory executa o modelo por si; aqui vai o trade-off honesto.
| LongCat (autoalojado) | VisionStory (alojado) | |
|---|---|---|
| Hardware | Um A100/A800 de 40 GB (milhares de dólares) | Nenhum — corre no browser |
| Configuração | CUDA, flash-attn, INT8, correções de deps, afinação de OOM | Inicie sessão e siga |
| Tempo por clip | ~44s de computação por 1s de vídeo (clip de 82s ≈ 1 hora) | Segundos, em GPUs alojadas |
| Resolução (o nosso teste) | Classe 480p | Vídeo em HD e acima |
| Voz | Fornece o áudio (sem TTS/clonagem) | Vozes integradas e clonagem de voz |
| Uso comercial | Sim (MIT) | Sim (consoante o plano) |
| Manutenção | Você corrige deps, OOM, drivers | Nenhuma |
| Melhor quando | Tem GPUs e precisa de autoalojamento/offline/on-prem | Quer um vídeo falado pronto, rápido |
Escolha LongCat se tem o hardware e o trabalho tem mesmo de ser autoalojado — on-prem, offline, ou totalmente sob o seu controlo — e sente-se à vontade a manter uma stack CUDA. Escolha uma ferramenta alojada se quer o mesmo vídeo falado de foto+áudio sem uma hora de computação e uma GPU de cinco dígitos.
O que o LongCat nos ensinou
A verdadeira lição de correr o LongCat-Video-Avatar é que a qualidade de vídeo de avatar open já chegou — com uma foto de referência, este modelo gratuito produz clips bons o suficiente para uso real. O modelo já não é a parte difícil.
A parte difícil é tudo o resto à volta: fazer caber um modelo de difusão de vídeo numa placa que possa pagar, sobreviver a OOM no segundo segmento, esperar uma hora por 82 segundos e combiná-lo com uma Voz. Essa lacuna — entre um checkpoint capaz e um vídeo falado final que qualquer pessoa consegue criar — é exatamente o trabalho que fazemos. Se quiser ver o outro lado disto, a VisionStory transforma uma foto e um guião num avatar falante com sincronização labial no seu browser em segundos e, se precisar também da Voz, a nossa análise de TTS open-source mostra em que ponto está agora essa metade.
