MiniMax H3 es un modelo de generación multimodal de propósito general creado por MiniMax. Acepta contexto creativo en texto, imágenes, vídeo y audio, entiende las relaciones entre esas entradas y genera vídeo con sonido estéreo nativo sincronizado. MiniMax anunció resultados de hasta 15 segundos en resolución 2K, posicionando H3 para publicidad, branding, ecommerce, cine, diseño de producto, UI, videojuegos y otros trabajos creativos comerciales.
A diferencia de los sistemas de vídeo divididos en modelos separados de texto a vídeo, imagen a vídeo, referencia de movimiento, referencia de sujeto, audio y edición, H3 está diseñado para expresar esas tareas mediante instrucciones en lenguaje natural dentro de un único sistema generalizado. Sus flujos compatibles incluyen texto a audio-vídeo, generación de primer y último fotograma, de referencia a audio-vídeo, edición multimodal, transferencia de movimiento, modelado nativo de múltiples planos y generación conjunta de voz, efectos de sonido y música.
MiniMax publicó los pesos H3-Base bajo la MiniMax H3 Community License. La ficha oficial del modelo describe un H3-Omni Transformer denso de 33B, VAEs visuales y de audio de H3, y checkpoints separados para las tareas de primer o último fotograma y de referencia a audio-vídeo. Esta página de VisionStory es un perfil independiente del modelo: MiniMax creó H3, mientras que VisionStory ayuda a los creadores a explorar flujos de trabajo de vídeo con IA y a comparar los principales modelos de vídeo.








