MiniMax H3開放權重
多模態 AI 影片,配備原生立體聲音訊

探索 MiniMax H3:一款通用型開放權重影片模型,可理解文字、圖片、影片同音訊,並以 2K 解像度生成最長 15 秒片段,同步輸出立體聲音效。

立即試用 MiniMax H3

乜嘢係 MiniMax H3 AI 影片模型?

MiniMax H3 係由 MiniMax 開發嘅通用型多模態生成模型。佢可以接收文字、圖片、影片同音訊等創作上下文,理解各種輸入之間嘅關係,並生成附帶同步原生立體聲嘅影片。MiniMax 公布 H3 可輸出最長 15 秒、2K 解像度片段,定位用於廣告、品牌、電商、電影、產品設計、UI、遊戲等各類商業創作工作。

同將文字轉影片、圖片轉影片、動作參考、主體參考、音訊同編輯拆分成多個模型嘅影片系統唔同,H3 旨在用一個通用系統,透過自然語言指令表達並完成以上任務。佢支援嘅工作流程包括:文字轉音訊+影片、首尾幀生成、參考轉音訊+影片、多模態編輯、動作轉移、原生多鏡頭建模,以及同步生成人聲、音效同音樂。

MiniMax 已喺 MiniMax H3 Community License 之下釋出 H3-Base 權重。官方 model card 提到 33B dense 嘅 H3-Omni Transformer、H3 視覺同音訊 VAE,以及針對首幀/尾幀同參考轉音訊+影片任務嘅獨立 checkpoint。本頁係 VisionStory 嘅獨立模型介紹:H3 由 MiniMax 開發,而 VisionStory 則協助創作者探索 AI 影片工作流程,並比較業界頂尖影片模型。

歸屬備註:MiniMax H3 由 MiniMax 開發並發佈。本 VisionStory 頁面屬於獨立模型介紹——VisionStory 與 MiniMax 並無關聯,亦唔會聲稱自己係模型開發者。

最長 15 秒 2K 影片

H3 目標係輸出高細節畫面,最高可達 2K 解像度、最長 15 秒片段,並可透過 in-context regeneration 補回細緻紋理同細小文字。

原生立體聲音訊

影片、對白、環境音、音效同音樂會一併建模,令生成場景入面嘅動作同聲音可以保持同步。

33B 開放權重模型

MiniMax 發佈完整 H3-Base 權重供開發同微調使用,並提供適用於幀條件(frame-conditioned)同多模態參考工作流程嘅任務 checkpoint。

同一個上下文理解文字、圖片、影片同音訊

描述你希望各種參考素材點樣協同運作,而唔係逼每個素材分開做一個任務。H3 可以將角色圖片、影片動作、音訊演出同文字指示,整合成同一份多模態簡報,用於目標片段。

由參考素材開始
同一個上下文理解文字、圖片、影片同音訊

用 H3 in-context regeneration 生成 2K 細節

H3-VAE 可以高效壓縮較長嘅視覺序列,而 H3 會對照原本嘅多模態上下文,將較低解像度嘅結果重新生成為 2K 輸出。呢種做法有助還原材質紋理、產品細節、字體排版等資訊——而傳統超解像可能只係「估」出嚟。

生成 2K
用 H3 in-context regeneration 生成 2K 細節

用 MiniMax H3 open weights 開發

你可以透過官方 MiniMax 模型倉庫取得 H3-Base,用於本機研究、推理、自訂同微調。本機 H3-Base 支援 768p 驗證;而 MiniMax 完整嘅 2K 工作流程,則會將本機 base model 同官方 Context-IR 及 Regenerate-2K API 結合使用。

立即試用 MiniMax H3
用 MiniMax H3 open weights 開發

MiniMax H3 官方影片示例

睇下 MiniMax 點樣用 H3 呈現電影感片頭字幕、互動式產品體驗,同直向廣告概念——結合生成動作、清晰可讀文字,同視聽同步嘅敘事效果。

自己整一個

電影感片頭字幕

多鏡頭片頭序列示範風格化構圖、場景連貫性、圖像文字、鏡頭運動、由音樂帶動嘅節奏,以及協調一致嘅聲音設計。

動態產品網站及 UI

H3 將角色、介面面板、游標動作、字體排版同產品風格轉場整合成一個連貫一致嘅互動概念。

直向廣告及電商

人像直向格式嘅產品短片,以特寫細節、可控燈光、品牌化造型同適合社交平台嘅構圖,打造高級感廣告概念。

  • 文字轉影片
  • 圖片轉影片
  • 影片轉影片
  • 原生立體聲音訊
  • 2K 影片
  • 15 秒片段

用 MiniMax H3 可以創作啲乜?

H3 係為「整合多種參考素材」嘅創意簡報而設,特別適合需要影片、聲音、文字、動作同品牌細節互相配合嘅製作。

01

廣告及電商影片

製作產品揭曉、直向社交廣告、品牌影片、動態海報同活動概念,並強化文字呈現同產品細節渲染。

02

以參考素材主導嘅敘事與剪輯

轉移動作、保留主體、跟隨視覺或音訊參考、重新生成場景,並用自然語言描述複雜嘅剪輯關係。

03

Open-weight 研究與部署

運行 H3-Base checkpoints、研究架構、建立自訂推理工作流程,或者為特定創作任務微調已發佈嘅模型。

MiniMax H3 模型常見問題

  • MiniMax H3 係 MiniMax 推出嘅通用多模態 AI 影片生成模型。佢可以喺同一個上下文理解文字、圖片、影片同音訊,並生成最長 15 秒、2K 解像度嘅片段,同步輸出原生立體聲音訊。