MiniMax H3 ialah model penjanaan multimodal serbaguna yang dicipta oleh MiniMax. Ia menerima konteks kreatif merentas teks, imej, video, dan audio, memahami hubungan antara input tersebut, dan menjana video dengan bunyi stereo natif yang disegerakkan. MiniMax mengumumkan output sehingga 15 saat pada resolusi 2K, menjadikan H3 sesuai untuk pengiklanan, penjenamaan, e-dagang, filem, reka bentuk produk, UI, permainan, dan kerja kreatif komersial lain.
Tidak seperti sistem video yang dibahagikan kepada model berasingan untuk teks-ke-video, imej-ke-video, rujukan pergerakan, rujukan subjek, audio, dan penyuntingan, H3 direka untuk melaksanakan tugasan tersebut melalui arahan bahasa semula jadi dalam satu sistem umum. Aliran kerja yang disokong termasuk teks-ke-audio-video, penjanaan bingkai pertama-dan-terakhir, rujukan-ke-audio-video, penyuntingan multimodal, pemindahan pergerakan, pemodelan berbilang shot natif, serta penjanaan bersama suara, kesan bunyi, dan muzik.
MiniMax mengeluarkan weights H3-Base di bawah MiniMax H3 Community License. Kad model rasmi menerangkan H3-Omni Transformer dense 33B, VAE visual dan audio H3, serta checkpoint berasingan untuk tugasan bingkai pertama-atau-terakhir dan rujukan-ke-audio-video. Halaman VisionStory ini ialah profil model yang berdikari: MiniMax membina H3, manakala VisionStory membantu pencipta meneroka aliran kerja Video AI dan membandingkan model video terkemuka.








