MiniMax H3 is een general-purpose multimodaal generatiemodel gemaakt door MiniMax. Het accepteert creatieve context via tekst, afbeeldingen, video en audio, begrijpt de relaties tussen die inputs en genereert video met gesynchroniseerd native stereo-geluid. MiniMax kondigde output aan tot 15 seconden in 2K-resolutie, waarmee H3 is gepositioneerd voor advertising, branding, e-commerce, film, productdesign, UI, gaming en ander commercieel creatief werk.
In tegenstelling tot videosystemen die zijn opgesplitst in losse modellen voor tekst-naar-video, afbeelding-naar-video, motion reference, subject reference, audio en bewerking, is H3 ontworpen om die taken uit te drukken via natural-language instructies binnen één gegeneraliseerd systeem. Ondersteunde workflows zijn onder andere text-to-audio-video, first-and-last-frame-generatie, reference-to-audio-video, multimodale bewerking, motion transfer, native multi-shot modeling en gezamenlijke generatie van stem, geluidseffecten en muziek.
MiniMax heeft de H3-Base weights uitgebracht onder de MiniMax H3 Community License. De officiële model card beschrijft een 33B dense H3-Omni Transformer, H3 visual- en audio-VAEs en aparte checkpoints voor first-or-last-frame- en reference-to-audio-video-taken. Deze VisionStory-pagina is een onafhankelijk modelprofiel: MiniMax bouwde H3, terwijl VisionStory creators helpt AI-videoworkflows te verkennen en toonaangevende videomodellen te vergelijken.








