A Meituan abriu o código do LongCat-Video-Avatar 1.5, e ele faz exatamente o que o VisionStory faz no núcleo — transformar uma foto estática mais uma faixa de áudio em um vídeo de avatar falante. Isso nos deixou curiosos o bastante para realmente rodá-lo. Este é um desmonte prático: o que ele é, o quão bem ele performa de verdade, as cinco armadilhas de configuração que encontramos e quanto custa rodar você mesmo versus usar uma ferramenta hospedada. Fonte: github.com/meituan-longcat/LongCat-Video (MIT).
O que é o LongCat-Video-Avatar, e quem o criou?
LongCat-Video-Avatar 1.5 é um modelo de vídeo humano guiado por áudio com pesos abertos da Meituan (a equipe LongCat). Ele é construído sobre o modelo base LongCat-Video e lançado sob a licença permissiva MIT — realmente gratuito para uso comercial. Em 2026-07, o repositório de código tem cerca de 5 200 estrelas no GitHub e os pesos 1.5 estão entre os lançamentos recentes mais curtidos no Hugging Face.
Ele suporta três tarefas nativas: Áudio + Texto para Vídeo (AT2V, sem imagem de referência), Áudio + Texto + Imagem para Vídeo (ATI2V — uma foto de referência define a identidade, o caso que corresponde a um fluxo real de avatar) e continuação de vídeo para estender um clipe além de um único segmento. A versão 1.5 trocou para um codificador de áudio Whisper-Large, que é o que dá o movimento labial. Importante: ele move lábios e expressão a partir de qualquer áudio que você fornecer — não gera nem clona uma voz.
Nós realmente rodamos (uma única A800-40GB)
Sem conversa fiada — rodamos as três tarefas em uma única NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), na configuração do modelo quantizada em INT8 + distill de 8 passos, que é o necessário para encaixar um modelo de difusão de vídeo deste tamanho em uma placa de 40 GB. Aqui vai o relato honesto, passo a passo.
As cinco armadilhas que encontramos
- Dependência faltando para separação vocal. O pipeline de áudio precisa de um modelo Kim_Vocal_2 via
audio-separator, que não está nos requisitos padrão — a primeira execução morreu atépip install audio-separator==0.30.2. - O gravador de vídeo quebrou. Salvar frames falhou com o erro
TiffWriter got an unexpected keyword argument fpsporque o imageio não conseguiu encontrar um writer de ffmpeg — resolvido compip install imageio-ffmpeg==0.6.0. - Deadlocks em multi-GPU. Rodar um job em múltiplas placas (context-parallel size 2 ou 8) travou em uma desincronia de coletivas NCCL — ambos os ranks ficaram esperando um ao outro até o timeout de 600s abortar a execução. Só conseguimos rodar em uma única placa. Os pesos INT8 cabem em uma placa de 40 GB, então multi-GPU só foi útil para rodar jobs separados em paralelo, não para acelerar um único job.
- Falta de memória no segundo segmento. Clipes longos são construídos continuando segmento após segmento, e o passo de continuação manteve um KV-cache de 48 camadas residente. Em uma placa de 40 GB, o segundo segmento levou a placa ao pico e caiu — faltando cerca de 160 MiB para caber. Precisamos expor e habilitar a flag
--offload_kv_cache(mover o cache para RAM da CPU e paginá-lo de volta a cada passo) e também definirPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Funciona, ao custo de segmentos mais lentos. - Alinhamento de resolução. 480p sob paralelismo multi-placa acionou uma restrição de altura e largura divisíveis por 64; em placa única isso não acontece.
Velocidade e memória (medidas)
Este é o número que importa: um clipe de 82 segundos levou 3 586 segundos — pouco menos de uma hora — na A800, ou cerca de 44 segundos de computação para cada 1 segundo de vídeo finalizado (aproximadamente 138s por segmento gerado, ao longo de 26 segmentos). Um clipe curto de 10 segundos ainda ficaria em torno de 7 minutos. E não é leve: a VRAM subiu em segundos e depois ficou cravada em 40 500 MiB — 98,9% da placa de 40 GB — durante toda a renderização. Aqui está o uso real que amostramos uma vez por segundo:
Amostras que renderizamos
Cada clipe abaixo foi renderizado por nós no A800 descrito acima. Para avaliar o modelo nos cenários para os quais ele foi pensado, nós os geramos usando as entradas oficiais de demonstração do próprio projeto (retratos de referência e áudio), em vez de selecionar as nossas próprias — portanto, estes são resultados honestos, sem seleção tendenciosa, e não um vídeo de melhores momentos. Os dois primeiros clipes foram gerados cada um com sua própria foto de referência:
À esquerda: a referência para o clipe de foto + áudio. À direita: a referência para o clipe com vários locutores (uma imagem, duas pessoas). O terceiro clipe abaixo gerou texto + áudio sem foto de referência — o modelo inventa a pessoa, e é aí que ele fica mais fraco.
Renderizado pelo VisionStory com LongCat-Video-Avatar 1.5 em uma NVIDIA A800, em 2026-07-15, em resolução de classe 480p (768×512 / 832×480), usando as entradas oficiais de demonstração do modelo.
Veredito honesto: forte com foto, fraco sem ela
O que realmente nos impressionou:
- A identidade se mantém. No clipe guiado por foto, a pessoa continua sendo a mesma pessoa ao longo de todos os 82 segundos — cabelo, roupa, rosto — enquanto a boca acompanha o áudio. Este é o caso que importa para avatares, e funciona.
- Múltiplos falantes realmente funciona. Duas pessoas na mesma cena, cada uma com sincronização labial guiada pela sua própria faixa de áudio, permaneceu coerente — algo realmente difícil de acertar.
- MIT e nível comercial. Pesos abertos, sem cobrança por renderização, e uma qualidade de saída que passa em um clipe curto.
Onde ele falha — e isso é real:
- A geração só com texto deriva. Sem uma foto de referência, o modelo inventa a pessoa, e ao longo de um clipe longo o rosto se deforma em um close estranho, com aspecto ceroso, e a cena muda — visível na terceira amostra acima.
- É lento e pesado. ~44s de computação por 1s de vídeo, ocupando uma placa de 40 GB o tempo todo. Um clipe de 82 segundos é uma hora.
- 40 GB é o mínimo. Nossa execução precisou de INT8 + distill só para caber, e clipes com múltiplos segmentos só sobreviveram descarregando o KV-cache para a CPU. Placas menores estão fora.
- Na prática, só placa única. O context-parallel em multi-GPU entrou em deadlock na nossa máquina, então não há um jeito fácil de deixar um clipe mais rápido adicionando placas.
- Sem voz. Ele move os lábios a partir do áudio que você fornece — não faz text-to-speech nem clonagem de voz, então você ainda precisa de uma fonte de voz separada.
- 480p, neste hardware. O que conseguimos rodar em uma única placa de 40 GB foi saída de classe 480p.
Auto-hospedar LongCat vs uma ferramenta hospedada: qual escolher?
Ambos produzem a mesma coisa — uma foto mais áudio vira um vídeo falado. A diferença está totalmente em quanto isso custa para você chegar lá. Uma ferramenta hospedada como o VisionStory roda o modelo por você; aqui está a troca honesta.
| LongCat (auto-hospedado) | VisionStory (hospedado) | |
|---|---|---|
| Hardware | Uma A100/A800 de 40 GB (milhares de dólares) | Nenhum — roda no navegador |
| Configuração | CUDA, flash-attn, INT8, correções de deps, ajuste de OOM | Entre e comece |
| Tempo por clipe | ~44s de computação por 1s de vídeo (clipe de 82s ≈ 1 hora) | Segundos, em GPUs hospedadas |
| Resolução (nosso teste) | Classe 480p | Vídeo em HD e acima |
| Voz | Você fornece o áudio (sem TTS/clonagem) | Vozes integradas e clonagem de voz |
| Uso comercial | Sim (MIT) | Sim (por plano) |
| Manutenção | Você corrige deps, OOM, drivers | Nenhuma |
| Melhor quando | Você tem GPUs e precisa de auto-hospedagem/offline/on-prem | Você quer um vídeo de avatar falante pronto, rápido |
Escolha o LongCat se você tem o hardware e o trabalho realmente precisa ser auto-hospedado — on-prem, offline ou totalmente sob seu controle — e você se sente à vontade para manter uma stack CUDA. Escolha uma ferramenta hospedada se você quer o mesmo vídeo falado de foto + áudio sem uma hora de computação e sem uma GPU de cinco dígitos.
O que o LongCat nos ensinou
A verdadeira lição de rodar o LongCat-Video-Avatar é que a qualidade de vídeo de avatar open chegou — com uma foto de referência, este modelo gratuito produz clipes bons o suficiente para uso real. O modelo não é mais a parte difícil.
A parte difícil é tudo ao redor: encaixar um modelo de difusão de vídeo em uma placa que você consegue pagar, sobreviver ao OOM no segundo segmento, esperar uma hora por 82 segundos e combiná-lo com uma voz. Essa lacuna — entre um checkpoint capaz e um vídeo falado finalizado que qualquer pessoa consegue fazer — é exatamente o trabalho que fazemos. Se você quiser ver o outro lado disso, o VisionStory transforma uma foto e um roteiro em um avatar falante com sincronização labial no seu navegador em segundos e, se você também precisar da voz, nosso teardown de TTS open-source cobre onde essa metade está agora.
