MiniMax H3 係由 MiniMax 開發嘅通用型多模態生成模型。佢可以接收文字、圖片、影片同音訊等創作上下文,理解各種輸入之間嘅關係,並生成附帶同步原生立體聲嘅影片。MiniMax 公布 H3 可輸出最長 15 秒、2K 解像度片段,定位用於廣告、品牌、電商、電影、產品設計、UI、遊戲等各類商業創作工作。
同將文字轉影片、圖片轉影片、動作參考、主體參考、音訊同編輯拆分成多個模型嘅影片系統唔同,H3 旨在用一個通用系統,透過自然語言指令表達並完成以上任務。佢支援嘅工作流程包括:文字轉音訊+影片、首尾幀生成、參考轉音訊+影片、多模態編輯、動作轉移、原生多鏡頭建模,以及同步生成人聲、音效同音樂。
MiniMax 已喺 MiniMax H3 Community License 之下釋出 H3-Base 權重。官方 model card 提到 33B dense 嘅 H3-Omni Transformer、H3 視覺同音訊 VAE,以及針對首幀/尾幀同參考轉音訊+影片任務嘅獨立 checkpoint。本頁係 VisionStory 嘅獨立模型介紹:H3 由 MiniMax 開發,而 VisionStory 則協助創作者探索 AI 影片工作流程,並比較業界頂尖影片模型。








