MiniMax H3 es un modelo de generación multimodal de propósito general creado por MiniMax. Acepta contexto creativo en texto, imágenes, video y audio, entiende las relaciones entre esas entradas y genera video con sonido estéreo nativo sincronizado. MiniMax anunció salida de hasta 15 segundos a resolución 2K, posicionando H3 para publicidad, branding, ecommerce, cine, diseño de producto, UI, gaming y otros trabajos creativos comerciales.
A diferencia de los sistemas de video divididos en modelos separados de texto a video, imagen a video, referencia de movimiento, referencia de sujeto, audio y edición, H3 está diseñado para expresar esas tareas mediante instrucciones en lenguaje natural dentro de un sistema generalizado. Sus flujos de trabajo compatibles incluyen texto-a-audio-video, generación del primer y último fotograma, referencia-a-audio-video, edición multimodal, transferencia de movimiento, modelado nativo de múltiples tomas y generación conjunta de voz, efectos de sonido y música.
MiniMax lanzó los pesos H3-Base bajo la MiniMax H3 Community License. La ficha oficial del modelo describe un H3-Omni Transformer denso de 33B, VAEs visuales y de audio de H3, y checkpoints separados para tareas de primer-o-último-fotograma y referencia-a-audio-video. Esta página de VisionStory es un perfil de modelo independiente: MiniMax creó H3, mientras VisionStory ayuda a los creadores a explorar flujos de trabajo de video de IA y comparar los principales modelos de video.








