O MiniMax H3 é um modelo de geração multimodal de propósito geral criado pela MiniMax. Ele aceita contexto criativo em texto, imagens, vídeo e áudio, entende as relações entre essas entradas e gera vídeo com som estéreo nativo sincronizado. A MiniMax anunciou saída de até 15 segundos em resolução 2K, posicionando o H3 para publicidade, branding, e-commerce, cinema, design de produto, UI, games e outros trabalhos criativos comerciais.
Diferente de sistemas de vídeo divididos em modelos separados de texto-para-vídeo, imagem-para-vídeo, referência de movimento, referência de assunto, áudio e edição, o H3 foi projetado para expressar essas tarefas por meio de instruções em linguagem natural dentro de um único sistema generalizado. Os fluxos de trabalho suportados incluem texto-para-áudio-vídeo, geração de primeiro e último frame, referência-para-áudio-vídeo, edição multimodal, transferência de movimento, modelagem nativa com múltiplos takes e geração conjunta de voz, efeitos sonoros e música.
A MiniMax lançou os pesos do H3-Base sob a MiniMax H3 Community License. O model card oficial descreve um H3-Omni Transformer denso de 33B, VAEs visuais e de áudio do H3 e checkpoints separados para tarefas de primeiro ou último frame e de referência-para-áudio-vídeo. Esta página do VisionStory é um perfil independente do modelo: a MiniMax criou o H3, enquanto o VisionStory ajuda creators a explorar fluxos de Vídeo com IA e a comparar os principais modelos de vídeo.








