A MiniMax H3 egy általános célú, multimodális generatív modell, amelyet a MiniMax készített. Kreatív kontextust fogad szövegből, képekből, videóból és hangból, megérti ezek kapcsolatát, majd szinkronizált, natív sztereó hanggal készít videót. A MiniMax legfeljebb 15 másodperces, 2K felbontású kimenetet jelentett be, így a H3-at hirdetésekhez, brandanyagokhoz, e-kereskedelemhez, filmhez, termékdizájnhoz, UI-hoz, játékokhoz és más kereskedelmi kreatív munkákhoz pozicionálják.
A különálló szövegből videó, képből videó, mozgásreferencia-, alanyreferencia-, hang- és szerkesztőmodellekre bontott videórendszerekkel szemben a H3-at úgy tervezték, hogy ezeket a feladatokat természetes nyelvű utasításokkal, egyetlen általános rendszerben lehessen megfogalmazni. A támogatott munkafolyamatok közé tartozik a szövegből hangos videó, az első és utolsó képkocka alapú generálás, a referenciából hangos videó, a multimodális szerkesztés, a mozgásátvitel, a natív több snittes modellezés, valamint a hang, a hangeffektek és a zene közös generálása.
A MiniMax a MiniMax H3 Community License alatt tette közzé a H3-Base súlyokat. A hivatalos modellkártya egy 33B dense H3-Omni Transformert, H3 vizuális és audió VAE-ket, valamint külön checkpointokat ír le az első vagy utolsó képkocka, illetve a referencia-hang-videóvá feladatokhoz. Ez a VisionStory oldal egy független modellprofil: a H3-at a MiniMax készítette, a VisionStory pedig abban segít az alkotóknak, hogy felfedezzék az AI videós munkafolyamatokat és összehasonlítsák a vezető videómodelleket.








