Το MiniMax H3 είναι ένα general-purpose πολυτροπικό μοντέλο δημιουργίας που αναπτύχθηκε από τη MiniMax. Δέχεται δημιουργικό context από κείμενο, εικόνες, βίντεο και ήχο, κατανοεί τις σχέσεις μεταξύ αυτών των εισόδων και δημιουργεί βίντεο με συγχρονισμένο εγγενή στερεοφωνικό ήχο. Η MiniMax ανακοίνωσε έξοδο έως 15 δευτερόλεπτα σε ανάλυση 2K, τοποθετώντας το H3 για διαφήμιση, branding, ecommerce, κινηματογράφο, σχεδιασμό προϊόντων, UI, gaming και άλλα εμπορικά δημιουργικά έργα.
Σε αντίθεση με τα συστήματα βίντεο που χωρίζονται σε ξεχωριστά μοντέλα για text-to-video, image-to-video, motion-reference, subject-reference, ήχο και επεξεργασία, το H3 έχει σχεδιαστεί ώστε να εκφράζει αυτές τις εργασίες μέσω οδηγιών σε φυσική γλώσσα μέσα σε ένα ενιαίο, γενικευμένο σύστημα. Τα workflows που υποστηρίζει περιλαμβάνουν text-to-audio-video, δημιουργία first-and-last-frame, reference-to-audio-video, πολυτροπική επεξεργασία, μεταφορά κίνησης, εγγενές multi-shot modeling και ταυτόχρονη δημιουργία φωνής, ηχητικών εφέ και μουσικής.
Η MiniMax κυκλοφόρησε τα H3-Base weights υπό την MiniMax H3 Community License. Η επίσημη model card περιγράφει έναν 33B dense H3-Omni Transformer, τα οπτικά και ηχητικά VAEs του H3 και ξεχωριστά checkpoints για εργασίες first-or-last-frame και reference-to-audio-video. Αυτή η σελίδα του VisionStory είναι ένα ανεξάρτητο προφίλ μοντέλου: η MiniMax δημιούργησε το H3, ενώ το VisionStory βοηθά τους creators να εξερευνούν AI video workflows και να συγκρίνουν κορυφαία μοντέλα βίντεο.








