MiniMax H3 是 MiniMax 推出的通用型多模态生成模型。它可接收文本、图片、视频与音频等创作上下文,理解这些输入之间的关联,并生成带原生同步立体声音频的视频。MiniMax 宣布其输出最高可达 2K 分辨率、最长 15 秒,使 H3 适用于广告、品牌、电商、影视、产品设计、UI、游戏等商业创作场景。
不同于将文生视频、图生视频、运动参考、主体参考、音频与编辑拆分为多个模型的视频系统,H3 旨在用一个通用系统,通过自然语言指令来完成这些任务。它支持的工作流包括:文生音频视频、首尾帧生成、参考生成音频视频、多模态编辑、动作迁移、原生多镜头建模,以及人声、音效与音乐的联合生成。
MiniMax 在 MiniMax H3 Community License 下发布了 H3-Base 权重。官方模型卡介绍了 33B 的稠密 H3-Omni Transformer、H3 视觉与音频 VAE,以及用于“首帧或尾帧”与“参考生成音频视频”等任务的独立检查点。本 VisionStory 页面为独立模型介绍:H3 由 MiniMax 构建;VisionStory 帮助创作者探索 AI 视频工作流并对比领先的视频模型。








