MiniMax H3 es un modelo de generación multimodal de propósito general creado por MiniMax. Acepta contexto creativo en texto, imágenes, video y audio, entiende las relaciones entre esas entradas y genera video con sonido estéreo nativo sincronizado. MiniMax anunció una salida de hasta 15 segundos en resolución 2K, posicionando a H3 para publicidad, branding, ecommerce, cine, diseño de producto, UI, gaming y otros trabajos creativos comerciales.
A diferencia de los sistemas de video divididos en modelos separados de texto a video, imagen a video, referencia de movimiento, referencia de sujeto, audio y edición, H3 está diseñado para expresar esas tareas mediante instrucciones en lenguaje natural dentro de un solo sistema generalizado. Sus flujos de trabajo compatibles incluyen texto a audio-video, generación de primer y último fotograma, referencia a audio-video, edición multimodal, transferencia de movimiento, modelado nativo de múltiples tomas y generación conjunta de voz, efectos de sonido y música.
MiniMax publicó los pesos H3-Base bajo la MiniMax H3 Community License. La ficha oficial del modelo describe un Transformer H3-Omni denso de 33B, VAEs visuales y de audio de H3, y checkpoints separados para tareas de primer o último fotograma y de referencia a audio-video. Esta página de VisionStory es un perfil de modelo independiente: MiniMax creó H3, mientras que VisionStory ayuda a los creadores a explorar flujos de trabajo de Video con IA y a comparar los principales modelos de video.








