MiniMax H3는 MiniMax가 만든 범용 멀티모달 생성 모델입니다. 텍스트, 이미지, 비디오, 오디오 전반의 크리에이티브 컨텍스트를 받아 입력 간의 관계를 이해하고, 동기화된 기본 스테레오 사운드가 포함된 비디오를 생성합니다. MiniMax는 2K 해상도에서 최대 15초 출력이 가능하다고 발표했으며, H3를 광고, 브랜딩, 이커머스, 영화, 제품 디자인, UI, 게임 등 다양한 상업용 크리에이티브 작업에 적합한 모델로 포지셔닝하고 있습니다.
텍스트→비디오, 이미지→비디오, 모션 레퍼런스, 피사체 레퍼런스, 오디오, 편집 모델이 각각 분리된 비디오 시스템과 달리, H3는 하나의 범용 시스템 안에서 자연어 지시로 이런 작업들을 표현하도록 설계되었습니다. 지원 워크플로에는 텍스트→오디오·비디오, 첫/마지막 프레임 생성, 레퍼런스→오디오·비디오, 멀티모달 편집, 모션 트랜스퍼, 기본 멀티샷 모델링, 그리고 음성·효과음·음악의 공동 생성이 포함됩니다.
MiniMax는 MiniMax H3 Community License로 H3-Base 웨이트를 공개했습니다. 공식 모델 카드에는 33B 밀집형 H3-Omni Transformer, H3 비주얼 및 오디오 VAE, 그리고 첫/마지막 프레임 및 레퍼런스→오디오·비디오 작업을 위한 별도 체크포인트가 소개되어 있습니다. 이 VisionStory 페이지는 독립적인 모델 프로필이며, H3는 MiniMax가 만들었고 VisionStory는 크리에이터가 AI 비디오 워크플로를 탐색하고 주요 비디오 모델을 비교할 수 있도록 돕습니다.








