فارسی

MiniMax H3وزن‌های باز
ویدیوی هوش مصنوعی چندوجهی با صوت استریوی بومی

MiniMax H3 را کشف کنید؛ مدل ویدیویی open-weight و عمومی که متن، تصویر، ویدیو و صوت را می‌فهمد و سپس کلیپ‌هایی تا 15 ثانیه با وضوح 2K و صدای استریوی همگام تولید می‌کند.

MiniMax H3 را همین حالا امتحان کنید

مدل ویدیوی هوش مصنوعی MiniMax H3 چیست؟

MiniMax H3 یک مدل تولید چندوجهیِ عمومی است که توسط MiniMax ساخته شده. این مدل زمینه خلاقانه را از متن، تصویر، ویدیو و صوت دریافت می‌کند، روابط بین این ورودی‌ها را می‌فهمد و ویدیو را همراه با صدای استریوی بومیِ همگام تولید می‌کند. MiniMax خروجی تا 15 ثانیه با وضوح 2K را اعلام کرده و H3 را برای تبلیغات، برندینگ، تجارت الکترونیک، فیلم، طراحی محصول، UI، بازی‌سازی و دیگر کارهای خلاقانه تجاری جایگاه‌گذاری کرده است.

برخلاف سیستم‌های ویدیویی که به مدل‌های جداگانه برای متن‌به‌ویدیو، تصویر‌به‌ویدیو، رفرنس حرکت، رفرنس سوژه، صوت و ویرایش تقسیم شده‌اند، H3 طوری طراحی شده که این کارها را با دستورهای زبان طبیعی در یک سیستم عمومی بیان کند. گردش‌کارهای پشتیبانی‌شده شامل text-to-audio-video، تولید فریم اول و آخر، reference-to-audio-video، ویرایش چندوجهی، انتقال حرکت، مدل‌سازی چندنمای بومی و تولید هم‌زمان صدا، افکت‌های صوتی و موسیقی است.

MiniMax وزن‌های H3-Base را تحت مجوز MiniMax H3 Community License منتشر کرده است. در مدل‌کارت رسمی، یک H3-Omni Transformer متراکمِ 33B، VAEهای بصری و صوتی H3 و چک‌پوینت‌های جداگانه برای وظایف first-or-last-frame و reference-to-audio-video توضیح داده شده‌اند. این صفحه VisionStory یک پروفایل مستقل از مدل است: H3 را MiniMax ساخته و VisionStory به کریتورها کمک می‌کند گردش‌کارهای ویدیوی هوش مصنوعی را بررسی کنند و مدل‌های ویدیویی برتر را با هم مقایسه کنند.

یادداشت انتساب: MiniMax، MiniMax H3 را ساخته و منتشر کرده است. این صفحه VisionStory یک پروفایل مستقل از مدل است — VisionStory وابسته به MiniMax نیست و ادعایی درباره سازنده بودن این مدل ندارد.

ویدیوی 2K تا 15 ثانیه

H3 خروجیِ پرجزئیات تا وضوح 2K و کلیپ‌های تا 15 ثانیه را هدف می‌گیرد و از بازتولید درون‌متن (in-context regeneration) برای بازیابی جزئیات ریز و متن‌های کوچک استفاده می‌کند.

صوت استریوی بومی

ویدیو، دیالوگ، صدای محیط، افکت‌های صوتی و موسیقی با هم مدل‌سازی می‌شوند تا حرکت و صدا در سراسر یک صحنه تولیدشده همگام بمانند.

مدل open-weightِ 33B

MiniMax وزن‌های کامل H3-Base را برای توسعه و فاین‌تیون منتشر می‌کند، همراه با چک‌پوینت‌های وظیفه‌ای برای گردش‌کارهای frame-conditioned و رفرنس چندوجهی.

در یک زمینه واحد، متن، تصویر، ویدیو و صوت را درک کنید

به‌جای اینکه هر دارایی را مجبور کنید در یک کارِ جداگانه جا شود، توضیح دهید رفرنس‌هایتان چطور باید با هم کار کنند. H3 می‌تواند تصویرِ کاراکتر، حرکتِ گرفته‌شده از یک ویدیو، اجرای صوتی و دستورالعملِ نوشتاری را به‌عنوان یک بریف چندوجهی برای کلیپِ هدف به کار بگیرد.

با رفرنس‌هایتان شروع کنید
در یک زمینه واحد، متن، تصویر، ویدیو و صوت را درک کنید

تولید جزئیات 2K با بازتولید درون‌بافتیِ H3

H3-VAE توالی‌های بصری طولانی را به‌صورت کارآمد فشرده می‌کند، و H3 هم نتیجه کم‌وضوح را با اتکا به کانتکست چندوجهیِ اصلی دوباره تولید می‌کند تا خروجی 2K بدهد. این رویکرد به بازیابی بافت‌ها، جزئیات محصول، تایپوگرافی و اطلاعات دیگری کمک می‌کند که سوپررزولوشنِ معمولی ممکن است فقط حدس بزند.

تولید در 2K
تولید جزئیات 2K با بازتولید درون‌بافتیِ H3

ساخت با وزن‌های بازِ MiniMax H3

H3-Base از طریق مخزن رسمی مدل‌های MiniMax برای پژوهش محلی، استنتاج، شخصی‌سازی و فاین‌تیون در دسترس است. H3-Base محلی از اعتبارسنجی 768p پشتیبانی می‌کند، در حالی که گردش‌کار کامل 2K در MiniMax مدل پایه محلی را با APIهای رسمی Context-IR و Regenerate-2K ترکیب می‌کند.

MiniMax H3 را همین حالا امتحان کنید
ساخت با وزن‌های بازِ MiniMax H3

نمونه‌های رسمی ویدیویی MiniMax H3

ببینید MiniMax چطور H3 را در تایتل‌های سینمایی، تجربه‌های تعاملی محصول و ایده‌های تبلیغات عمودی ارائه می‌کند—با حرکت تولیدشده، متن خوانا و داستان‌گویی هماهنگِ صوتی‌تصویری.

مال خودتان را بسازید

تایتل‌های آغازینِ سینمایی فیلم

یک سکانس تایتلِ چندنما، ترکیب‌بندیِ استایلایز، تداوم صحنه، متن گرافیکی، حرکت دوربین، ریتمِ هدایت‌شده با موسیقی و طراحی صدای هماهنگ را به نمایش می‌گذارد.

وب‌سایت و UI محصولِ انیمیشنی

H3 یک کاراکتر، پنل‌های رابط کاربری، حرکت اشاره‌گر، تایپوگرافی و ترنزیشن‌های سبکِ محصول را در یک ایده تعاملی یکپارچه ترکیب می‌کند.

تبلیغات عمودی و تجارت الکترونیک

یک فیلم محصول با فرمت پرتره، از جزئیات کلوزآپ، نورپردازی کنترل‌شده، استایل برندمحور و کادربندی آماده شبکه‌های اجتماعی استفاده می‌کند تا یک کانسپت تبلیغاتی پریمیوم بسازد.

  • متن به ویدیو
  • تصویر به ویدیو
  • ویدیو به ویدیو
  • صوت استریوی بومی
  • ویدیوی 2K
  • کلیپ‌های 15 ثانیه‌ای

با MiniMax H3 چه چیزهایی می‌توانید بسازید؟

H3 برای بریف‌های خلاقانه‌ای طراحی شده که چند نوع محتوای مرجع را با هم ترکیب می‌کنند و نیاز دارند ویدیو، صدا، متن، حرکت و جزئیات برند در کنار هم کار کنند.

01

تبلیغات و ویدیوهای تجارت الکترونیک

رونمایی محصول، تبلیغات عمودی شبکه‌های اجتماعی، فیلم‌های برند، پوسترهای متحرک و ایده‌های کمپین را با رندرِ قوی‌ترِ متن و جزئیات محصول بسازید.

02

داستان‌گویی و ادیتِ مبتنی بر رفرنس

حرکت را منتقل کنید، سوژه را حفظ کنید، از رفرنس‌های بصری یا صوتی پیروی کنید، صحنه‌ها را دوباره تولید کنید و رابطه‌های ادیتِ پیچیده را با زبان طبیعی توضیح دهید.

03

پژوهش و استقرار با وزن‌های باز

چک‌پوینت‌های H3-Base را اجرا کنید، معماری را بررسی کنید، گردش‌کارهای استنتاج سفارشی بسازید یا مدل منتشرشده را برای کارهای خلاقانه تخصصی فاین‌تیون کنید.

سوالات متداول مدل MiniMax H3

  • MiniMax H3 یک مدل عمومیِ چندوجهی برای تولید ویدیوی هوش مصنوعی از MiniMax است. متن، تصویر، ویدیو و صدا را در یک کانتکست درک می‌کند و می‌تواند کلیپ‌هایی تا 15 ثانیه با وضوح 2K تولید کند—همراه با صوت استریوی بومیِ همگام‌سازی‌شده.