MiniMax H3 е универсален мултимодален генеративен модел, създаден от MiniMax. Той приема творчески контекст чрез текст, изображения, видео и аудио, разбира връзките между тези входове и генерира видео със синхронизиран вграден стерео звук. MiniMax обяви изход до 15 секунди при 2K резолюция, позиционирайки H3 за реклама, брандинг, ecommerce, филм, продуктов дизайн, UI, гейминг и други комерсиални творчески проекти.
За разлика от видео системите, разделени на отделни модели за текст към видео, изображение към видео, motion-reference, subject-reference, аудио и редактиране, H3 е проектиран да изразява тези задачи чрез инструкции на естествен език в една обобщена система. Поддържаните работни процеси включват text-to-audio-video, генериране по първи и последен кадър, reference-to-audio-video, мултимодално редактиране, прехвърляне на движение, нативно multi-shot моделиране и съвместно генериране на глас, звукови ефекти и музика.
MiniMax пусна теглата на H3-Base под MiniMax H3 Community License. Официалната моделна карта описва 33B dense H3-Omni Transformer, H3 визуални и аудио VAE и отделни checkpoints за задачи по първи-или-последен-кадър и reference-to-audio-video. Тази страница на VisionStory е независим профил на модела: MiniMax създава H3, а VisionStory помага на създателите да изследват работни процеси за AI видео и да сравняват водещи видео модели.








