MiniMax H3 یک مدل تولید چندوجهیِ عمومی است که توسط MiniMax ساخته شده. این مدل زمینه خلاقانه را از متن، تصویر، ویدیو و صوت دریافت میکند، روابط بین این ورودیها را میفهمد و ویدیو را همراه با صدای استریوی بومیِ همگام تولید میکند. MiniMax خروجی تا 15 ثانیه با وضوح 2K را اعلام کرده و H3 را برای تبلیغات، برندینگ، تجارت الکترونیک، فیلم، طراحی محصول، UI، بازیسازی و دیگر کارهای خلاقانه تجاری جایگاهگذاری کرده است.
برخلاف سیستمهای ویدیویی که به مدلهای جداگانه برای متنبهویدیو، تصویربهویدیو، رفرنس حرکت، رفرنس سوژه، صوت و ویرایش تقسیم شدهاند، H3 طوری طراحی شده که این کارها را با دستورهای زبان طبیعی در یک سیستم عمومی بیان کند. گردشکارهای پشتیبانیشده شامل text-to-audio-video، تولید فریم اول و آخر، reference-to-audio-video، ویرایش چندوجهی، انتقال حرکت، مدلسازی چندنمای بومی و تولید همزمان صدا، افکتهای صوتی و موسیقی است.
MiniMax وزنهای H3-Base را تحت مجوز MiniMax H3 Community License منتشر کرده است. در مدلکارت رسمی، یک H3-Omni Transformer متراکمِ 33B، VAEهای بصری و صوتی H3 و چکپوینتهای جداگانه برای وظایف first-or-last-frame و reference-to-audio-video توضیح داده شدهاند. این صفحه VisionStory یک پروفایل مستقل از مدل است: H3 را MiniMax ساخته و VisionStory به کریتورها کمک میکند گردشکارهای ویدیوی هوش مصنوعی را بررسی کنند و مدلهای ویدیویی برتر را با هم مقایسه کنند.








