MiniMax H3 es un modelo de generación multimodal de propósito general creado por MiniMax. Acepta contexto creativo en texto, imágenes, video y audio, entiende las relaciones entre esas entradas y genera video con sonido estéreo nativo sincronizado. MiniMax anunció salida de hasta 15 segundos en resolución 2K, posicionando a H3 para publicidad, branding, ecommerce, cine, diseño de producto, UI, videojuegos y otros trabajos creativos comerciales.
A diferencia de los sistemas de video divididos en modelos separados de texto a video, imagen a video, referencia de movimiento, referencia de sujeto, audio y edición, H3 está diseñado para expresar esas tareas mediante instrucciones en lenguaje natural dentro de un solo sistema generalizado. Sus flujos de trabajo compatibles incluyen texto a audio y video, generación de primer y último cuadro, referencia a audio y video, edición multimodal, transferencia de movimiento, modelado nativo de múltiples tomas y generación conjunta de voz, efectos de sonido y música.
MiniMax publicó los pesos de H3-Base bajo la MiniMax H3 Community License. La ficha oficial del modelo describe un H3-Omni Transformer denso de 33B, VAEs visuales y de audio de H3, y checkpoints separados para tareas de primer o último cuadro y de referencia a audio y video. Esta página de VisionStory es un perfil independiente del modelo: MiniMax creó H3, mientras que VisionStory ayuda a los creadores a explorar flujos de trabajo de video con IA y comparar los principales modelos de video.








