MiniMax H3は、MiniMaxが開発した汎用マルチモーダル生成モデルです。テキスト・画像・動画・音声にまたがるクリエイティブな文脈を受け取り、それら入力同士の関係を理解して、同期したネイティブのステレオ音声付き動画を生成します。MiniMaxは、最大15秒・2K解像度での出力を発表しており、H3は広告、ブランディング、EC、映像制作、プロダクトデザイン、UI、ゲームなど、商用クリエイティブ領域での活用を想定しています。
テキストから動画、画像から動画、モーション参照、被写体参照、音声、編集といった別々のモデルに分割された動画システムとは異なり、H3は1つの汎用システムの中で自然言語の指示によってそれらのタスクを表現できるよう設計されています。対応ワークフローには、text-to-audio-video、最初と最後のフレーム生成、reference-to-audio-video、マルチモーダル編集、モーショントランスファー、ネイティブのマルチショットモデリング、音声・効果音・音楽の同時生成が含まれます。
MiniMaxはMiniMax H3 Community Licenseの下で、H3-Baseの重みを公開しました。公式のモデルカードでは、33BのDenseなH3-Omni Transformer、H3のビジュアルおよび音声VAE、さらにfirst-or-last-frameとreference-to-audio-videoタスク向けの個別チェックポイントが説明されています。このVisionStoryページは独立したモデルプロフィールです。H3を開発したのはMiniMaxで、VisionStoryはクリエイターがAI動画ワークフローを探求し、有力な動画モデルを比較できるよう支援します。








