MiniMax H3 to multimodalny model generatywny ogólnego przeznaczenia stworzony przez MiniMax. Przyjmuje kontekst kreatywny z tekstu, obrazów, wideo i audio, rozumie zależności między tymi danymi wejściowymi i generuje wideo z natywnym, zsynchronizowanym dźwiękiem stereo. MiniMax zapowiedział materiał wyjściowy o długości do 15 sekund w rozdzielczości 2K, pozycjonując H3 pod reklamy, branding, e-commerce, film, projektowanie produktów, UI, gry oraz inne komercyjne zastosowania kreatywne.
W przeciwieństwie do systemów wideo podzielonych na osobne modele: text-to-video, image-to-video, motion-reference, subject-reference, audio i edycję, H3 został zaprojektowany tak, aby realizować te zadania poprzez instrukcje w naturalnym języku w ramach jednego uogólnionego systemu. Obsługiwane workflow obejmują m.in. text-to-audio-video, generowanie pierwszej i ostatniej klatki, reference-to-audio-video, edycję multimodalną, transfer ruchu, natywne modelowanie wieloujęciowe oraz wspólne generowanie głosu, efektów dźwiękowych i muzyki.
MiniMax opublikował wagi H3-Base na licencji MiniMax H3 Community License. Oficjalna karta modelu opisuje gęsty model H3-Omni Transformer 33B, wizualne i audio VAE H3 oraz osobne checkpointy dla zadań first-or-last-frame i reference-to-audio-video. Ta strona VisionStory to niezależny profil modelu: H3 stworzył MiniMax, a VisionStory pomaga twórcom poznawać workflowy Wideo AI i porównywać czołowe modele wideo.








