MiniMax H3 是 MiniMax 開發的通用型多模態生成模型。它可接收文字、圖片、影片與音訊等創作脈絡,理解各種輸入之間的關係,並生成帶有原生立體聲同步音效的影片。MiniMax 公布其可輸出最高 15 秒、2K 解析度的片段,定位適用於廣告、品牌、電商、影視、產品設計、UI、遊戲等各類商業創作工作。
不同於把文字轉影片、圖片轉影片、動作參考、主體參考、音訊與編輯拆成多個模型的影片系統,H3 的設計目標是把這些任務都放進同一個通用系統,並用自然語言指令來完成。其支援的工作流程包括:文字轉音訊影片、首尾幀生成、參考素材轉音訊影片、多模態編輯、動作轉移、原生多鏡頭建模,以及人聲、音效與音樂的聯合生成。
MiniMax 已在 MiniMax H3 Community License 下釋出 H3-Base 權重。官方模型卡描述了 33B dense 的 H3-Omni Transformer、H3 視覺與音訊 VAE,以及針對首幀或尾幀、以及參考素材轉音訊影片等任務的獨立 checkpoint。本 VisionStory 頁面為獨立模型介紹:H3 由 MiniMax 開發,而 VisionStory 則協助創作者探索 AI 影片工作流程並比較領先的影片模型。








