MiniMax H3 est un modèle de génération multimodale polyvalent créé par MiniMax. Il accepte du contexte créatif via du texte, des images, de la vidéo et de l’audio, comprend les relations entre ces entrées et génère de la vidéo avec un son stéréo natif synchronisé. MiniMax annonce une sortie jusqu’à 15 secondes en résolution 2K, positionnant H3 pour la publicité, le branding, l’e-commerce, le film, le design produit, l’UI, le jeu vidéo et d’autres usages créatifs commerciaux.
Contrairement aux systèmes vidéo divisés en modèles séparés (texte vers vidéo, image vers vidéo, référence de mouvement, référence de sujet, audio et édition), H3 est conçu pour exprimer ces tâches via des instructions en langage naturel au sein d’un seul système généralisé. Les workflows pris en charge incluent texte-vers-audio-vidéo, génération de première et dernière image, référence-vers-audio-vidéo, édition multimodale, transfert de mouvement, modélisation multi-plans native, ainsi que la génération conjointe de voix, d’effets sonores et de musique.
MiniMax a publié les poids H3-Base sous la MiniMax H3 Community License. La fiche officielle du modèle décrit un Transformer H3-Omni dense de 33B, des VAE visuels et audio H3, ainsi que des checkpoints séparés pour les tâches de première ou dernière image et de référence-vers-audio-vidéo. Cette page VisionStory est un profil de modèle indépendant : MiniMax a créé H3, tandis que VisionStory aide les créateurs à explorer des workflows de Vidéo IA et à comparer les principaux modèles vidéo.








