MiniMax H3 คือโมเดลสร้างคอนเทนต์แบบมัลติโหมดสำหรับงานทั่วไปที่พัฒนาโดย MiniMax โดยรับบริบทงานครีเอทีฟได้ทั้งข้อความ รูปภาพ วิดีโอ และเสียง เข้าใจความสัมพันธ์ระหว่างอินพุตเหล่านั้น และสร้างวิดีโอพร้อมเสียงสเตอริโอแบบเนทีฟที่ซิงค์ตรง MiniMax ระบุว่าสามารถสร้างเอาต์พุตได้ยาวสูงสุด 15 วินาทีที่ความละเอียด 2K ทำให้ H3 เหมาะกับงานโฆษณา แบรนดิ้ง อีคอมเมิร์ซ ภาพยนตร์ การออกแบบสินค้า UI เกม และงานครีเอทีฟเชิงพาณิชย์อื่นๆ
ต่างจากระบบวิดีโอที่แยกเป็นโมเดลคนละตัวสำหรับแปลงข้อความเป็นวิดีโอ ภาพเป็นวิดีโอ อ้างอิงการเคลื่อนไหว อ้างอิงตัวแบบ เสียง และการแก้ไข H3 ถูกออกแบบมาให้สั่งงานเหล่านี้ได้ด้วยคำสั่งภาษาธรรมชาติภายในระบบทั่วไปตัวเดียว เวิร์กโฟลว์ที่รองรับ ได้แก่ text-to-audio-video, การสร้างแบบเฟรมแรกและเฟรมท้าย, reference-to-audio-video, การแก้ไขแบบมัลติโหมด, การถ่ายโอนการเคลื่อนไหว, การทำโมเดลแบบหลายช็อตในตัว และการสร้างร่วมกันของเสียงพูด ซาวด์เอฟเฟกต์ และดนตรี
MiniMax เผยแพร่ weights ของ H3-Base ภายใต้ MiniMax H3 Community License โดย model card อย่างเป็นทางการระบุถึง H3-Omni Transformer แบบ dense ขนาด 33B, VAE สำหรับภาพและเสียงของ H3 และมีเช็กพอยต์แยกสำหรับงานเฟรมแรกหรือเฟรมท้าย และงาน reference-to-audio-video หน้านี้บน VisionStory เป็นโปรไฟล์โมเดลแบบอิสระ: MiniMax เป็นผู้สร้าง H3 ส่วน VisionStory ช่วยครีเอเตอร์สำรวจเวิร์กโฟลว์วิดีโอ AI และเปรียบเทียบโมเดลวิดีโอชั้นนำ








