日本語

MiniMax H3オープンウェイト
ネイティブのステレオ音声を備えたマルチモーダルAI動画

MiniMax H3は、テキスト・画像・動画・音声を理解し、同期したステレオ音声付きで最大15秒・2K解像度のクリップを生成できる、汎用のオープンウェイト動画モデルです。

MiniMax H3を今すぐ試す

MiniMax H3 AI動画モデルとは?

MiniMax H3は、MiniMaxが開発した汎用マルチモーダル生成モデルです。テキスト・画像・動画・音声にまたがるクリエイティブな文脈を受け取り、それら入力同士の関係を理解して、同期したネイティブのステレオ音声付き動画を生成します。MiniMaxは、最大15秒・2K解像度での出力を発表しており、H3は広告、ブランディング、EC、映像制作、プロダクトデザイン、UI、ゲームなど、商用クリエイティブ領域での活用を想定しています。

テキストから動画、画像から動画、モーション参照、被写体参照、音声、編集といった別々のモデルに分割された動画システムとは異なり、H3は1つの汎用システムの中で自然言語の指示によってそれらのタスクを表現できるよう設計されています。対応ワークフローには、text-to-audio-video、最初と最後のフレーム生成、reference-to-audio-video、マルチモーダル編集、モーショントランスファー、ネイティブのマルチショットモデリング、音声・効果音・音楽の同時生成が含まれます。

MiniMaxはMiniMax H3 Community Licenseの下で、H3-Baseの重みを公開しました。公式のモデルカードでは、33BのDenseなH3-Omni Transformer、H3のビジュアルおよび音声VAE、さらにfirst-or-last-frameとreference-to-audio-videoタスク向けの個別チェックポイントが説明されています。このVisionStoryページは独立したモデルプロフィールです。H3を開発したのはMiniMaxで、VisionStoryはクリエイターがAI動画ワークフローを探求し、有力な動画モデルを比較できるよう支援します。

帰属に関する注記:MiniMax H3はMiniMaxが開発・公開したモデルです。本VisionStoryページは独立したモデルプロフィールであり、VisionStoryはMiniMaxと提携関係になく、モデルの開発元であると主張するものではありません。

最大15秒の2K動画

H3は最大2K解像度・最大15秒の高精細出力を狙い、in-context regenerationによって細部や小さな文字のディテールを復元できます。

ネイティブのステレオ音声

動画、会話、環境音、効果音、音楽をまとめてモデリングすることで、生成されたシーン全体で動きと音が同期した状態を保てます。

33Bのオープンウェイトモデル

MiniMaxは開発・ファインチューニング向けにH3-Baseの完全な重みを公開しており、フレーム条件付きおよびマルチモーダル参照ワークフロー向けのタスクチェックポイントも提供しています。

1つの文脈でテキスト・画像・動画・音声を理解

各参照素材を別々のタスクに分けて無理に扱うのではなく、「どう組み合わせて機能させたいか」をまとめて指示できます。H3はキャラクター画像、動画からの動き、音声パフォーマンス、文章による指示を、ターゲットクリップのための1つのマルチモーダルなブリーフとして扱えます。

参照素材から始める
1つの文脈でテキスト・画像・動画・音声を理解

H3のコンテキスト内再生成で2Kのディテールを生成

H3-VAEは長いビジュアルシーケンスを効率よく圧縮し、H3は低解像度の生成結果を元のマルチモーダルなコンテキストに照らして再生成し、2K出力へ仕上げます。この手法により、従来の超解像が“推測”に頼りがちなテクスチャ、製品ディテール、タイポグラフィ、その他の情報を復元しやすくなります。

2Kで生成
H3のコンテキスト内再生成で2Kのディテールを生成

MiniMax H3のオープンウェイトで構築

H3-Baseは、公式のMiniMaxモデルリポジトリを通じて、ローカルでの研究・推論・カスタマイズ・ファインチューニングに利用できます。ローカルのH3-Baseは768pの検証に対応し、MiniMaxのフル2Kワークフローでは、ローカルのベースモデルに公式のContext-IRおよびRegenerate-2K APIを組み合わせます。

MiniMax H3を今すぐ試す
MiniMax H3のオープンウェイトで構築

公式MiniMax H3の動画例

MiniMaxがH3を使って、映画風のタイトル、インタラクティブな製品体験、縦型広告コンセプトをどのように表現しているかをご覧ください。生成された動き、読みやすいテキスト、音と映像が同期したストーリーテリングが特長です。

自分で作る

映画風のオープニングタイトル

マルチショットのタイトルシーケンスで、スタイライズされた構図、シーンの連続性、グラフィックテキスト、カメラワーク、音楽主導のテンポ、統一されたサウンドデザインを表現しています。

アニメーションする商品サイト&UI

H3はキャラクター、UIパネル、ポインターの動き、タイポグラフィ、プロダクトらしいトランジションを組み合わせ、統一感のあるインタラクティブなコンセプトに仕上げます。

縦型広告&EC

ポートレート(縦)形式のプロダクト映像で、クローズアップのディテール、コントロールされたライティング、ブランドらしいスタイリング、SNS向けのフレーミングを活かし、プレミアムな広告コンセプトを実現します。

  • テキストから動画
  • 画像から動画
  • 動画から動画
  • ネイティブのステレオ音声
  • 2K動画
  • 15秒クリップ

MiniMax H3で何が作れますか?

H3は、複数種類の参照素材を組み合わせ、映像・音・テキスト・動き・ブランドの細部までを一体として機能させる必要があるクリエイティブブリーフ向けに設計されています。

01

広告・EC動画

プロダクトの“見せ場”動画、縦型SNS広告、ブランドフィルム、アニメーションポスター、キャンペーンコンセプトを、より強いテキスト表現と製品ディテールの描写で作成できます。

02

参照主導のストーリー&編集

動きの転写、被写体の保持、ビジュアル/音声参照の追従、シーンの再生成、複雑な編集関係の自然文での指示まで対応します。

03

オープンウェイトの研究・運用

H3-Baseのチェックポイントを実行し、アーキテクチャを研究し、独自の推論ワークフローを構築したり、公開モデルを特化したクリエイティブタスク向けにファインチューニングしたりできます。

MiniMax H3モデルFAQ

  • MiniMax H3はMiniMaxが提供する汎用のマルチモーダルAI動画生成モデルです。テキスト・画像・動画・音声を1つのコンテキストとして理解し、同期したネイティブのステレオ音声付きで、2K解像度・最大15秒のクリップを生成できます。