O MiniMax H3 é um modelo multimodal de geração de propósito geral criado pela MiniMax. Ele recebe contexto criativo em texto, imagens, vídeo e áudio, entende as relações entre essas entradas e gera vídeo com som estéreo nativo sincronizado. A MiniMax anunciou saída de até 15 segundos em resolução 2K, posicionando o H3 para publicidade, branding, e-commerce, cinema, design de produto, UI, games e outros trabalhos criativos comerciais.
Ao contrário de sistemas de vídeo divididos em modelos separados de texto para vídeo, imagem para vídeo, referência de movimento, referência de sujeito, áudio e edição, o H3 foi projetado para executar essas tarefas por meio de instruções em linguagem natural dentro de um único sistema generalista. Entre os fluxos compatíveis estão texto-para-áudio-vídeo, geração de primeiro e último frame, referência-para-áudio-vídeo, edição multimodal, transferência de movimento, modelagem nativa com múltiplas tomadas e geração conjunta de voz, efeitos sonoros e música.
A MiniMax lançou os pesos do H3-Base sob a MiniMax H3 Community License. O model card oficial descreve um H3-Omni Transformer denso de 33B, VAEs visuais e de áudio do H3 e checkpoints separados para tarefas de primeiro ou último frame e de referência-para-áudio-vídeo. Esta página do VisionStory é um perfil de modelo independente: a MiniMax desenvolveu o H3, enquanto o VisionStory ajuda criadores a explorar fluxos de Vídeo com IA e comparar os principais modelos de vídeo.








