MiniMax H3 là mô hình tạo sinh đa phương thức đa dụng do MiniMax phát triển. Nó tiếp nhận ngữ cảnh sáng tạo từ văn bản, hình ảnh, video và âm thanh, hiểu mối quan hệ giữa các đầu vào đó, rồi tạo video với âm thanh stereo tích hợp đồng bộ. MiniMax công bố đầu ra dài đến 15 giây ở độ phân giải 2K, định vị H3 cho quảng cáo, xây dựng thương hiệu, thương mại điện tử, phim ảnh, thiết kế sản phẩm, UI, game và các công việc sáng tạo thương mại khác.
Không giống các hệ thống video bị chia nhỏ thành các mô hình riêng cho chuyển văn bản thành video, chuyển ảnh thành video, tham chiếu chuyển động, tham chiếu chủ thể, âm thanh và chỉnh sửa, H3 được thiết kế để diễn đạt các tác vụ đó bằng hướng dẫn ngôn ngữ tự nhiên trong một hệ thống tổng quát duy nhất. Các workflow được hỗ trợ bao gồm text-to-audio-video, tạo khung hình đầu-cuối, reference-to-audio-video, chỉnh sửa đa phương thức, chuyển giao chuyển động, mô hình hóa multi-shot tích hợp và tạo đồng thời giọng nói, hiệu ứng âm thanh và nhạc.
MiniMax đã phát hành weights H3-Base theo MiniMax H3 Community License. Model card chính thức mô tả H3-Omni Transformer dense 33B, các VAE hình ảnh và âm thanh của H3, cùng các checkpoint riêng cho tác vụ khung hình đầu-hoặc-cuối và reference-to-audio-video. Trang VisionStory này là hồ sơ mô hình độc lập: MiniMax xây dựng H3, còn VisionStory giúp creator khám phá workflow Video AI và so sánh các mô hình video hàng đầu.








