MiniMax H3开放权重
原生立体声音频的多模态 AI 视频

探索 MiniMax H3:一款通用型开放权重视频模型,理解文本、图片、视频与音频,并生成最长 15 秒、2K 分辨率的片段,且立体声同步输出。

立即试用 MiniMax H3

什么是 MiniMax H3 AI 视频模型?

MiniMax H3 是 MiniMax 推出的通用型多模态生成模型。它可接收文本、图片、视频与音频等创作上下文,理解这些输入之间的关联,并生成带原生同步立体声音频的视频。MiniMax 宣布其输出最高可达 2K 分辨率、最长 15 秒,使 H3 适用于广告、品牌、电商、影视、产品设计、UI、游戏等商业创作场景。

不同于将文生视频、图生视频、运动参考、主体参考、音频与编辑拆分为多个模型的视频系统,H3 旨在用一个通用系统,通过自然语言指令来完成这些任务。它支持的工作流包括:文生音频视频、首尾帧生成、参考生成音频视频、多模态编辑、动作迁移、原生多镜头建模,以及人声、音效与音乐的联合生成。

MiniMax 在 MiniMax H3 Community License 下发布了 H3-Base 权重。官方模型卡介绍了 33B 的稠密 H3-Omni Transformer、H3 视觉与音频 VAE,以及用于“首帧或尾帧”与“参考生成音频视频”等任务的独立检查点。本 VisionStory 页面为独立模型介绍:H3 由 MiniMax 构建;VisionStory 帮助创作者探索 AI 视频工作流并对比领先的视频模型。

归属说明:MiniMax H3 由 MiniMax 构建并发布。本 VisionStory 页面为独立模型介绍——VisionStory 与 MiniMax 无隶属关系,也不声明自己是该模型的创建方。

最高 15 秒的 2K 视频

H3 目标是输出高细节画面:最高 2K 分辨率、最长 15 秒片段,并可通过上下文内重生成来恢复精细细节与小字号文本。

原生立体声音频

视频、对白、环境声、音效与音乐会被一起建模,从而让画面动作与声音在生成的场景中保持同步。

33B 开放权重模型

MiniMax 发布了完整的 H3-Base 权重,便于开发与微调,并提供面向帧条件与多模态参考工作流的任务检查点。

在同一上下文中理解文本、图片、视频与音频

描述你的参考素材该如何协同,而不是把每个素材硬拆成单独任务。H3 可将角色图片、视频中的动作、音频表演与文字指令整合为一份多模态需求,用于生成目标片段。

从参考素材开始
在同一上下文中理解文本、图片、视频与音频

用 H3 上下文再生成,输出 2K 细节

H3-VAE 可高效压缩长视觉序列;而 H3 会基于原始多模态上下文,对低分辨率结果进行再生成,输出 2K 成片。这样能更好还原纹理、产品细节、字体排版等信息,而传统超分往往只能“猜”。

生成 2K
用 H3 上下文再生成,输出 2K 细节

用 MiniMax H3 开放权重构建

H3-Base 已通过 MiniMax 官方模型仓库开放,可用于本地研究、推理、自定义与微调。本地 H3-Base 支持 768p 验证;而 MiniMax 的完整 2K 工作流则将本地 base 模型与官方 Context-IR 和 Regenerate-2K API 结合使用。

立即试用 MiniMax H3
用 MiniMax H3 开放权重构建

MiniMax H3 官方视频示例

看看 MiniMax 如何用 H3 打造电影感片头字幕、可交互的产品体验与竖版广告创意:生成动作、清晰可读的文字,以及音画同步的叙事。

创建你的版本

电影感片头字幕

多镜头片头序列,展示风格化构图、场景连贯性、图形文字、镜头运动、由音乐带动的节奏,以及协同一致的声音设计。

动态产品网站与 UI

H3 将角色、界面面板、指针运动、字体排版与产品风格转场融合在一起,形成统一的交互概念。

竖版广告与电商

竖屏产品短片以特写细节、可控光线、品牌化造型与适配社媒投放的构图,打造高质感广告概念。

  • 文生视频
  • 图生视频
  • 视频转视频
  • 原生立体声音频
  • 2K 视频
  • 15 秒片段

用 MiniMax H3 能创作什么?

H3 面向需要多种参考素材协同的创意需求而生,让视频、声音、文字、动作与品牌细节在同一条工作流中共同发挥作用。

01

广告与电商视频

制作产品揭示、竖版社媒广告、品牌影片、动态海报与活动创意,并带来更强的文字与产品细节呈现。

02

参考驱动的叙事与剪辑

迁移动作、保留主体、跟随视觉或音频参考、再生成场景,并用自然语言描述复杂的剪辑关系。

03

开放权重研究与部署

运行 H3-Base checkpoints、研究模型架构、搭建自定义推理工作流,或对已发布模型进行微调,以完成更专业的创意任务。

MiniMax H3 模型常见问题

  • MiniMax H3 是 MiniMax 推出的通用多模态 AI 视频生成模型。它能在同一上下文中理解文本、图片、视频与音频,并可生成最长 15 秒、2K 分辨率的片段,且原生立体声音频与画面同步。