MiniMax H3 — це універсальна мультимодальна генеративна модель, створена MiniMax. Вона приймає креативний контекст у вигляді тексту, зображень, відео та аудіо, розуміє взаємозв’язки між цими вхідними даними й генерує відео із синхронізованим вбудованим стереозвуком. MiniMax заявив результат до 15 секунд у роздільній здатності 2K, позиціонуючи H3 для реклами, брендингу, ecommerce, кіно, дизайну продуктів, UI, геймінгу та іншої комерційної креативної роботи.
На відміну від відеосистем, розділених на окремі моделі для «текст у відео», «зображення у відео», motion-reference, subject-reference, аудіо та редагування, H3 задуманий так, щоб виконувати ці завдання через інструкції природною мовою в межах однієї узагальненої системи. Підтримувані робочі процеси включають text-to-audio-video, генерацію першого й останнього кадру, reference-to-audio-video, мультимодальне редагування, перенесення руху, вбудоване моделювання з кількома шотами та спільну генерацію голосу, звукових ефектів і музики.
MiniMax випустив ваги H3-Base під ліцензією MiniMax H3 Community License. В офіційному model card описано щільний (dense) H3-Omni Transformer на 33B, візуальні та аудіо VAE для H3, а також окремі чекпойнти для завдань first-or-last-frame і reference-to-audio-video. Ця сторінка VisionStory — незалежний профіль моделі: H3 створив MiniMax, а VisionStory допомагає креаторам досліджувати робочі процеси AI-відео та порівнювати провідні відеомоделі.








