Código Aberto

Projetos de Vídeo com IA e Avatares de Código Aberto

Guias em linguagem simples sobre os modelos e ferramentas de IA de código aberto por trás de avatares falantes, geração de vídeo e voz — o que eles fazem, como executá-los e quando uma ferramenta hospedada é mais rápida.

OpenMontage: O Agente de vídeo com IA Open Source, Explicado

OpenMontage: O Agente de vídeo com IA Open Source, Explicado

Um guia prático sobre o OpenMontage, o agente de vídeo com IA open source que transforma seu assistente de programação com IA em um estúdio de vídeo completo — o que ele faz, como configurar, quanto custa e quando uma ferramenta hospedada como o VisionStory é a escolha mais rápida.

LongCat-Video-Avatar 1.5: Testamos o Modelo Open Source de Vídeo de Avatar Falante

LongCat-Video-Avatar 1.5: Testamos o Modelo Open Source de Vídeo de Avatar Falante

Um teardown prático do LongCat-Video-Avatar 1.5, o modelo open source da Meituan licenciado sob MIT que transforma uma foto e áudio em um vídeo de avatar falante. Executamos as três tarefas em uma GPU A800, medimos a velocidade real e a VRAM, esbarramos em cinco armadilhas de configuração e explicamos com transparência quando faz sentido hospedar por conta própria e quando uma ferramenta hospedada sai ganhando.

Kokoro TTS: Rodamos o Modelo de voz Open Source de 82M em uma CPU de Notebook

Kokoro TTS: Rodamos o Modelo de voz Open Source de 82M em uma CPU de Notebook

Uma desmontagem prática do Kokoro, o modelo open source de Texto para Fala com 82 milhões de parâmetros. Nós o rodamos em uma CPU Apple M3 Pro, geramos amostras reais de voz que você pode reproduzir, trombamos com o bug de empacotamento do espeak-ng (e corrigimos) e explicamos, com sinceridade, quando o Kokoro dá conta do recado e quando você precisa de uma ferramenta hospedada de vídeo falante.

LivePortrait: O Modelo Open Source de Animação de Retratos, Explicado

LivePortrait: O Modelo Open Source de Animação de Retratos, Explicado

Um guia prático do LivePortrait, o modelo de IA open source que anima um retrato estático a partir de um vídeo ou áudio de referência — o que ele faz, como executar e quando uma ferramenta hospedada de avatar falante como o VisionStory é a opção mais rápida.