MiniMax H3 是 MiniMax 开发的通用型多模态生成模型。它可接收来自文本、图片、视频与音频的创意上下文,理解这些输入之间的关系,并生成带原生立体声同步的画面。MiniMax 宣布其输出可达 2K 分辨率、最长 15 秒,使 H3 适用于广告、品牌、电商、影视、产品设计、UI、游戏等商业创意工作。
不同于将文本转视频、图片转视频、动作参考、主体参考、音频与编辑拆成多个模型的视频系统,H3 旨在用一个通用系统,通过自然语言指令来完成这些任务。它支持的工作流包括:文本转音频视频、首尾帧生成、参考素材转音频视频、多模态编辑、动作迁移、原生多镜头建模,以及语音、音效与音乐的联合生成。
MiniMax 已在 MiniMax H3 Community License 下发布 H3-Base 权重。官方模型卡介绍了 33B dense 的 H3-Omni Transformer、H3 视觉与音频 VAE,以及用于首/尾帧与参考素材转音频视频任务的独立 checkpoint。本 VisionStory 页面为独立的模型简介:H3 由 MiniMax 开发,而 VisionStory 帮助创作者探索 AI 视频工作流并对比领先的视频模型。








