MiniMax H3开放权重
原生立体声音频的多模态 AI 视频

探索 MiniMax H3:一款通用型开源权重视频模型,可理解文本、图片、视频与音频,并生成最长 15 秒、2K 分辨率且立体声同步的片段。

立即试试 MiniMax H3

什么是 MiniMax H3 AI 视频模型?

MiniMax H3 是 MiniMax 开发的通用型多模态生成模型。它可接收来自文本、图片、视频与音频的创意上下文,理解这些输入之间的关系,并生成带原生立体声同步的画面。MiniMax 宣布其输出可达 2K 分辨率、最长 15 秒,使 H3 适用于广告、品牌、电商、影视、产品设计、UI、游戏等商业创意工作。

不同于将文本转视频、图片转视频、动作参考、主体参考、音频与编辑拆成多个模型的视频系统,H3 旨在用一个通用系统,通过自然语言指令来完成这些任务。它支持的工作流包括:文本转音频视频、首尾帧生成、参考素材转音频视频、多模态编辑、动作迁移、原生多镜头建模,以及语音、音效与音乐的联合生成。

MiniMax 已在 MiniMax H3 Community License 下发布 H3-Base 权重。官方模型卡介绍了 33B dense 的 H3-Omni Transformer、H3 视觉与音频 VAE,以及用于首/尾帧与参考素材转音频视频任务的独立 checkpoint。本 VisionStory 页面为独立的模型简介:H3 由 MiniMax 开发,而 VisionStory 帮助创作者探索 AI 视频工作流并对比领先的视频模型。

归属说明:MiniMax 开发并发布了 MiniMax H3。本 VisionStory 页面为独立的模型简介——VisionStory 与 MiniMax 无关联,也不宣称自己是该模型的开发方。

最长 15 秒的 2K 视频

H3 面向高细节输出:最高 2K 分辨率、最长 15 秒片段,并可通过上下文内重生成来补回精细细节与小字号文字。

原生立体声音频

将画面、对白、环境声、音效与音乐一并建模,让生成场景中的动作与声音始终保持同步。

33B 开源权重模型

MiniMax 发布完整的 H3-Base 权重,便于开发与微调,并提供用于帧条件与多模态参考工作流的任务 checkpoint。

在同一上下文中理解文本、图片、视频与音频

描述你的参考素材该如何协同,而不是把每个素材硬拆成独立任务。H3 可将角色图片、来自视频的动作、音频演绎与文字指令整合为同一份多模态需求,用于生成目标片段。

从参考素材开始
在同一上下文中理解文本、图片、视频与音频

用 H3 上下文再生成,输出 2K 细节

H3-VAE 能高效压缩长视觉序列;同时,H3 会基于原始多模态上下文,对其低分辨率结果进行再生成,以输出 2K 成片。该方法有助于还原纹理、产品细节、字体排版等信息——这些往往是传统超分辨率只能“猜”的部分。

生成 2K
用 H3 上下文再生成,输出 2K 细节

用 MiniMax H3 开放权重进行构建

你可通过 MiniMax 官方模型仓库获取 H3-Base,用于本地研究、推理、自定义与微调。本地 H3-Base 支持 768p 验证;而 MiniMax 的完整 2K 工作流则会将本地基础模型与官方 Context-IR 和 Regenerate-2K API 结合使用。

立即试用 MiniMax H3
用 MiniMax H3 开放权重进行构建

MiniMax H3 官方视频示例

看看 MiniMax 如何用 H3 呈现电影感片头、交互式产品体验与竖版广告概念:包含生成动作、清晰可读的文字,以及音画同步的叙事。

制作你自己的视频

电影感片头字幕

多镜头片头序列,展示风格化构图、场景连贯性、图形文字、镜头运动、由音乐驱动的节奏,以及协调一致的声音设计。

动态产品网站与 UI

H3 将角色、界面面板、指针动作、字体排版与产品风格转场融为一体,形成连贯的交互概念。

竖版广告与电商

竖屏产品短片以特写细节、可控光线、品牌化造型与适配社媒的画面构图,打造高端广告概念。

  • 文本转视频
  • 图片转视频
  • 视频转视频
  • 原生立体声音频
  • 2K 视频
  • 15 秒片段

用 MiniMax H3 能创作什么?

H3 专为“多参考素材组合”的创意需求而设计,让视频、声音、文字、动作与品牌细节在同一目标中协同工作。

01

广告与电商视频

制作产品揭晓视频、竖版社媒广告、品牌短片、动态海报与活动概念,并获得更强的文字呈现与产品细节还原。

02

参考驱动的叙事与剪辑

迁移动作、保持主体一致、跟随视觉或音频参考、再生成场景,并用自然语言描述复杂的剪辑关系。

03

开放权重研究与部署

运行 H3-Base checkpoints、研究模型架构、搭建自定义推理工作流,或为特定创作任务微调已发布的模型。

MiniMax H3 模型常见问题

  • MiniMax H3 是 MiniMax 推出的通用多模态 AI 视频生成模型。它能在同一上下文中理解文本、图片、视频与音频,并可生成最长 15 秒、2K 分辨率的片段,同时输出音画同步的原生立体声音频。