فارسی

متن‌باز

پروژه‌های متن‌باز ویدیوی هوش مصنوعی و آواتار

راهنماهای روان و ساده درباره مدل‌ها و ابزارهای متن‌باز هوش مصنوعی پشتِ آواتارهای سخنگو، تولید ویدیو و صدا — اینکه چه کار می‌کنند، چطور اجرا می‌شوند و چه زمانی یک ابزار میزبانی‌شده سریع‌تر است.

OpenMontage: ایجنت ویدیوی هوش مصنوعی متن‌باز، به زبان ساده

OpenMontage: ایجنت ویدیوی هوش مصنوعی متن‌باز، به زبان ساده

یک راهنمای کاربردی برای OpenMontage، ایجنت ویدیوی هوش مصنوعی متن‌باز که دستیار کدنویسی هوش مصنوعی شما را به یک استودیوی کامل ویدیو تبدیل می‌کند — این‌که چه کاری انجام می‌دهد، چطور راه‌اندازی می‌شود، چه هزینه‌ای دارد، و چه زمانی یک ابزار میزبانی‌شده مثل VisionStory انتخاب سریع‌تری است.

LongCat-Video-Avatar 1.5: مدل متن‌باز ویدیوی آواتار سخنگو را اجرا کردیم

LongCat-Video-Avatar 1.5: مدل متن‌باز ویدیوی آواتار سخنگو را اجرا کردیم

یک کالبدشکافی عملی از LongCat-Video-Avatar 1.5؛ مدل متن‌بازِ دارای لایسنس MIT از Meituan که عکس به‌همراه صوت را به ویدیوی آواتار سخنگو تبدیل می‌کند. هر سه تسک را روی GPU مدل A800 اجرا کردیم، سرعت واقعی و VRAM را اندازه گرفتیم، به 5 تله راه‌اندازی برخوردیم و صادقانه توضیح می‌دهیم چه زمانی سلف‌هاستینگ منطقی است و چه زمانی یک ابزار میزبانی‌شده برنده می‌شود.

Kokoro TTS: مدل صدای متن‌باز 82M را روی CPU لپ‌تاپ اجرا کردیم

Kokoro TTS: مدل صدای متن‌باز 82M را روی CPU لپ‌تاپ اجرا کردیم

یک بررسی عملی و موشکافانه از Kokoro، مدل متن‌باز تبدیل متن به گفتار با 82 میلیون پارامتر. آن را روی CPU اپل M3 Pro اجرا کردیم، نمونه‌های واقعی صدا تولید کردیم که می‌توانید پخش کنید، با باگ پکیجینگ espeak-ng برخورد کردیم (و رفعش کردیم) و صادقانه توضیح دادیم چه زمانی Kokoro کافی است و چه زمانی به یک ابزار ویدیوی سخنگوِ میزبانی‌شده نیاز دارید.

LivePortrait: مدل متن‌باز انیمیشن پرتره، به زبان ساده

LivePortrait: مدل متن‌باز انیمیشن پرتره، به زبان ساده

راهنمای کاربردی LivePortrait، مدل متن‌باز هوش مصنوعی که از روی یک ویدیوی هدایت‌کننده یا صدا، یک پرتره ثابت را متحرک می‌کند—اینکه چه کاری انجام می‌دهد، چطور اجرا می‌شود، و چه زمانی یک ابزار آواتار سخنگوی میزبانی‌شده مثل VisionStory انتخاب سریع‌تری است.