MiniMax H3 ist ein universelles multimodales Generierungsmodell von MiniMax. Es nimmt kreativen Kontext aus Text, Bildern, Video und Audio auf, versteht die Zusammenhänge zwischen diesen Inputs und erzeugt Video mit synchronisiertem nativem Stereo-Sound. MiniMax hat Output von bis zu 15 Sekunden in 2K-Auflösung angekündigt und positioniert H3 für Werbung, Branding, E-Commerce, Film, Produktdesign, UI, Gaming und andere kommerzielle Kreativarbeit.
Im Gegensatz zu Videosystemen, die in separate Text-zu-Video-, Bild-zu-Video-, Motion-Reference-, Subject-Reference-, Audio- und Editing-Modelle aufgeteilt sind, ist H3 dafür ausgelegt, diese Aufgaben über Natural-Language-Instructions innerhalb eines einzigen, generalisierten Systems auszudrücken. Zu den unterstützten Workflows gehören Text-zu-Audio-Video, First-and-Last-Frame-Generierung, Referenz-zu-Audio-Video, multimodales Editing, Motion Transfer, natives Multi-Shot-Modeling sowie die gemeinsame Generierung von Stimme, Soundeffekten und Musik.
MiniMax hat die H3-Base-Weights unter der MiniMax H3 Community License veröffentlicht. Die offizielle Model Card beschreibt einen dichten 33B H3-Omni-Transformer, visuelle und Audio-VAEs von H3 sowie separate Checkpoints für First-or-Last-Frame- und Referenz-zu-Audio-Video-Aufgaben. Diese VisionStory-Seite ist ein unabhängiges Modellprofil: MiniMax hat H3 entwickelt, während VisionStory Creators dabei hilft, KI-Video-Workflows zu erkunden und führende Videomodelle zu vergleichen.








