MiniMax H3 adalah model generasi multimodal serbaguna yang dibuat oleh MiniMax. Model ini menerima konteks kreatif dari teks, gambar, video, dan audio, memahami hubungan di antara input tersebut, lalu menghasilkan video dengan suara stereo native yang tersinkron. MiniMax mengumumkan output hingga 15 detik dalam resolusi 2K, sehingga H3 diposisikan untuk periklanan, branding, ecommerce, film, desain produk, UI, gaming, dan pekerjaan kreatif komersial lainnya.
Tidak seperti sistem video yang dipisah menjadi model text-to-video, image-to-video, motion-reference, subject-reference, audio, dan editing yang terpisah, H3 dirancang agar tugas-tugas tersebut bisa diekspresikan lewat instruksi bahasa natural dalam satu sistem general. Alur kerja yang didukung mencakup text-to-audio-video, generasi frame pertama-dan-terakhir, reference-to-audio-video, editing multimodal, motion transfer, pemodelan multi-shot native, serta generasi gabungan untuk suara, efek suara, dan musik.
MiniMax merilis bobot H3-Base di bawah MiniMax H3 Community License. Model card resmi menjelaskan H3-Omni Transformer dense 33B, VAE visual dan audio H3, serta checkpoint terpisah untuk tugas first-or-last-frame dan reference-to-audio-video. Halaman VisionStory ini adalah profil model independen: MiniMax membangun H3, sementara VisionStory membantu kreator mengeksplor alur kerja Video AI dan membandingkan model video terdepan.








