MiniMax H3 este un model multimodal de generare, generalist, creat de MiniMax. Acceptă context creativ din text, imagini, video și audio, înțelege relațiile dintre aceste intrări și generează video cu sunet stereo nativ sincronizat. MiniMax a anunțat output de până la 15 secunde la rezoluție 2K, poziționând H3 pentru publicitate, branding, ecommerce, film, design de produs, UI, gaming și alte tipuri de creație comercială.
Spre deosebire de sistemele video împărțite în modele separate pentru text-to-video, image-to-video, motion-reference, subject-reference, audio și editare, H3 este conceput să exprime aceste sarcini prin instrucțiuni în limbaj natural, într-un singur sistem generalizat. Fluxurile acceptate includ text-to-audio-video, generare cu primul și ultimul cadru, reference-to-audio-video, editare multimodală, transfer de mișcare, modelare nativă cu mai multe cadre și generarea împreună a vocii, efectelor sonore și muzicii.
MiniMax a lansat weights-urile H3-Base sub licența MiniMax H3 Community License. Model card-ul oficial descrie un H3-Omni Transformer dens de 33B, VAE-uri vizuale și audio H3 și checkpoint-uri separate pentru sarcini de tip first-or-last-frame și reference-to-audio-video. Această pagină VisionStory este un profil independent al modelului: MiniMax a construit H3, iar VisionStory îi ajută pe creatori să exploreze fluxuri de lucru video AI și să compare modelele video de top.








