MiniMax H3 je univerzální multimodální generativní model vytvořený společností MiniMax. Přijímá kreativní kontext napříč textem, obrázky, videem i audiem, chápe vztahy mezi těmito vstupy a generuje video se synchronizovaným nativním stereo zvukem. MiniMax oznámil výstup až do 15 sekund v rozlišení 2K, čímž H3 míří na reklamu, branding, e‑commerce, film, produktový design, UI, hry a další komerční kreativní tvorbu.
Na rozdíl od video systémů rozdělených na samostatné modely pro text na video, obrázek na video, motion-reference, subject-reference, audio a střih je H3 navržen tak, aby tyto úlohy vyjádřil pomocí instrukcí v přirozeném jazyce v rámci jednoho zobecněného systému. Mezi podporované workflow patří text-to-audio-video, generování prvního a posledního snímku, reference-to-audio-video, multimodální úpravy, přenos pohybu, nativní modelování více záběrů a společné generování hlasu, zvukových efektů a hudby.
MiniMax vydal váhy H3-Base pod licencí MiniMax H3 Community License. Oficiální karta modelu popisuje 33B dense H3-Omni Transformer, vizuální a audio VAE pro H3 a samostatné checkpointy pro úlohy prvního nebo posledního snímku a reference-to-audio-video. Tato stránka na VisionStory je nezávislý profil modelu: H3 vytvořil MiniMax, zatímco VisionStory pomáhá tvůrcům objevovat AI video workflow a porovnávat špičkové video modely.








