O MiniMax H3 é um modelo de geração multimodal de uso geral criado pela MiniMax. Aceita contexto criativo em texto, imagens, vídeo e áudio, compreende as relações entre essas entradas e gera vídeo com som estéreo nativo sincronizado. A MiniMax anunciou resultados até 15 segundos em resolução 2K, posicionando o H3 para publicidade, branding, e-commerce, cinema, design de produto, UI, gaming e outros trabalhos criativos comerciais.
Ao contrário de sistemas de vídeo divididos em modelos separados de texto-para-vídeo, imagem-para-vídeo, referência de movimento, referência de sujeito, áudio e edição, o H3 foi concebido para executar essas tarefas através de instruções em linguagem natural dentro de um único sistema generalizado. Os fluxos de trabalho suportados incluem texto-para-áudio-vídeo, geração do primeiro e último fotograma, referência-para-áudio-vídeo, edição multimodal, transferência de movimento, modelação nativa com vários planos e geração conjunta de voz, efeitos sonoros e música.
A MiniMax lançou os pesos H3-Base sob a MiniMax H3 Community License. O model card oficial descreve um H3-Omni Transformer denso de 33B, VAEs visuais e de áudio do H3 e checkpoints separados para tarefas de primeiro-ou-último-fotograma e de referência-para-áudio-vídeo. Esta página da VisionStory é um perfil de modelo independente: a MiniMax construiu o H3, enquanto a VisionStory ajuda os criadores a explorar fluxos de trabalho de vídeo com IA e a comparar os principais modelos de vídeo.








