MiniMax H3 è un modello di generazione multimodale general-purpose creato da MiniMax. Accetta contesto creativo tra testo, immagini, video e audio, comprende le relazioni tra questi input e genera video con audio stereo nativo sincronizzato. MiniMax ha annunciato un output fino a 15 secondi in risoluzione 2K, posizionando H3 per pubblicità, branding, ecommerce, cinema, product design, UI, gaming e altri lavori creativi in ambito commerciale.
A differenza dei sistemi video divisi in modelli separati per text-to-video, image-to-video, motion-reference, subject-reference, audio ed editing, H3 è progettato per esprimere questi compiti tramite istruzioni in linguaggio naturale all’interno di un unico sistema generalizzato. I flussi di lavoro supportati includono text-to-audio-video, generazione del primo e dell’ultimo fotogramma, reference-to-audio-video, editing multimodale, transfer del movimento, modellazione multi-inquadratura nativa e generazione congiunta di voce, effetti sonori e musica.
MiniMax ha rilasciato i pesi H3-Base sotto la MiniMax H3 Community License. La model card ufficiale descrive un H3-Omni Transformer denso da 33B, VAE visive e audio di H3 e checkpoint separati per i compiti first-or-last-frame e reference-to-audio-video. Questa pagina di VisionStory è un profilo del modello indipendente: H3 è stato sviluppato da MiniMax, mentre VisionStory aiuta i creator a esplorare flussi di lavoro di Video AI e a confrontare i principali modelli video.








