MiniMax H3開放權重
具原生立體聲音訊的多模態 AI 影片

探索 MiniMax H3:通用型、開放權重的影片模型,可理解文字、圖片、影片與音訊,並生成最高 15 秒、2K 解析度且立體聲同步的片段。

立即體驗 MiniMax H3

MiniMax H3 AI 影片模型是什麼?

MiniMax H3 是 MiniMax 開發的通用型多模態生成模型。它可接收文字、圖片、影片與音訊等創作脈絡,理解各種輸入之間的關係,並生成帶有原生立體聲同步音效的影片。MiniMax 公布其可輸出最高 15 秒、2K 解析度的片段,定位適用於廣告、品牌、電商、影視、產品設計、UI、遊戲等各類商業創作工作。

不同於把文字轉影片、圖片轉影片、動作參考、主體參考、音訊與編輯拆成多個模型的影片系統,H3 的設計目標是把這些任務都放進同一個通用系統,並用自然語言指令來完成。其支援的工作流程包括:文字轉音訊影片、首尾幀生成、參考素材轉音訊影片、多模態編輯、動作轉移、原生多鏡頭建模,以及人聲、音效與音樂的聯合生成。

MiniMax 已在 MiniMax H3 Community License 下釋出 H3-Base 權重。官方模型卡描述了 33B dense 的 H3-Omni Transformer、H3 視覺與音訊 VAE,以及針對首幀或尾幀、以及參考素材轉音訊影片等任務的獨立 checkpoint。本 VisionStory 頁面為獨立模型介紹:H3 由 MiniMax 開發,而 VisionStory 則協助創作者探索 AI 影片工作流程並比較領先的影片模型。

署名說明:MiniMax H3 由 MiniMax 開發並發布。本 VisionStory 頁面為獨立模型介紹——VisionStory 與 MiniMax 無關聯,也不主張為該模型的開發者。

最高 15 秒的 2K 影片

H3 主打最高 2K 解析度、最長 15 秒的高細節輸出,並可透過情境內再生成來補回精細細節與小字內容。

原生立體聲音訊

影片、對白、環境音、音效與音樂會一起建模,讓生成場景中的動作與聲音能保持同步。

33B 開放權重模型

MiniMax 公開完整的 H3-Base 權重,供開發與微調使用,並提供適用於幀條件與多模態參考工作流程的任務 checkpoint。

在同一個上下文中理解文字、圖片、影片與音訊

描述你的參考素材該如何彼此配合,而不是把每個素材硬拆成各自獨立的任務。H3 能把角色圖片、影片中的動作、音訊表演,以及文字指示整合成一份多模態需求簡述,直接用於目標片段。

從參考素材開始
在同一個上下文中理解文字、圖片、影片與音訊

用 H3 的情境內再生成,產出 2K 細節

H3-VAE 能高效率壓縮長段的視覺序列;接著 H3 會在原始多模態情境的基礎上,對低解析度結果進行情境內再生成,輸出 2K。這種做法能更好地還原紋理、產品細節、字體排版等資訊,而傳統超解析度往往只能「猜」。

生成 2K
用 H3 的情境內再生成,產出 2K 細節

用 MiniMax H3 開放權重開發

你可以透過官方 MiniMax 模型倉庫取得 H3-Base,用於本地研究、推理、自訂與微調。本地 H3-Base 支援 768p 驗證;而 MiniMax 的完整 2K 工作流程,則是把本地 base model 與官方 Context-IR 與 Regenerate-2K API 結合使用。

立即試用 MiniMax H3
用 MiniMax H3 開放權重開發

官方 MiniMax H3 影片範例

看看 MiniMax 如何用 H3 呈現電影感片頭字幕、互動式產品體驗,以及直式廣告概念:包含生成動作、清晰可讀的文字,以及影音同步的敘事呈現。

自己做一支

電影感片頭字幕

多鏡頭的字幕片頭展示了風格化構圖、場景連貫性、圖像化文字、鏡頭運動、音樂帶動的節奏,以及協調一致的聲音設計。

動態產品網站與 UI

H3 能把角色、介面面板、游標動作、字體排版與產品風格轉場整合在一起,變成一致且完整的互動概念。

直式廣告與電商

以直式畫面呈現的產品短片,運用特寫細節、可控打光、品牌化造型風格與適合社群投放的構圖,打造高質感的廣告概念。

  • 文字轉影片
  • 圖片轉影片
  • 影片轉影片
  • 原生立體聲音訊
  • 2K 影片
  • 15 秒片段

用 MiniMax H3 能做出什麼?

H3 專為需要整合多種參考素材的創意需求而生,讓影片、聲音、文字、動作與品牌細節能在同一支作品裡協同運作。

01

廣告與電商影片

製作產品揭露、直式社群廣告、品牌形象影片、動態海報與活動概念,並帶來更強的文字呈現與產品細節還原。

02

以參考引導的敘事與剪輯

轉移動作、保留主體、跟隨視覺或音訊參考、重新生成場景,並用自然語言描述複雜的剪輯關係。

03

開放權重研究與部署

執行 H3-Base checkpoints、研究模型架構、打造自訂推理工作流程,或針對特定創作任務微調已釋出的模型。

MiniMax H3 模型常見問題

  • MiniMax H3 是 MiniMax 推出的通用型多模態 AI 影片生成模型。它能在同一個情境中理解文字、圖片、影片與音訊,並生成最長 15 秒、2K 解析度的片段,同時輸出同步的原生立體聲音訊。