MiniMax H3 — универсальная мультимодальная генеративная модель, созданная MiniMax. Она принимает креативный контекст в виде текста, изображений, видео и аудио, понимает связи между этими входными данными и генерирует видео с синхронизированным нативным стереозвуком. MiniMax заявляет о выводе длительностью до 15 секунд в разрешении 2K, позиционируя H3 для рекламы, брендинга, e-commerce, кино, продуктового дизайна, UI, гейминга и других коммерческих креативных задач.
В отличие от видеосистем, разделённых на отдельные модели для text-to-video, image-to-video, motion-reference, subject-reference, аудио и редактирования, H3 спроектирована так, чтобы решать эти задачи через инструкции на естественном языке внутри одной универсальной системы. Поддерживаемые воркфлоу включают text-to-audio-video, генерацию по первому и последнему кадру, reference-to-audio-video, мультимодальное редактирование, перенос движения, нативное моделирование нескольких планов и совместную генерацию голоса, звуковых эффектов и музыки.
MiniMax выпустила веса H3-Base по лицензии MiniMax H3 Community License. В официальной карточке модели описаны плотный 33B H3-Omni Transformer, визуальные и аудио VAE для H3, а также отдельные чекпойнты для задач first-or-last-frame и reference-to-audio-video. Эта страница VisionStory — независимый профиль модели: H3 создала MiniMax, а VisionStory помогает креаторам изучать воркфлоу ИИ-видео и сравнивать ведущие видеомодели.








