Hypit در 29 ژوئیه 2026 روی GitHub منتشر شد و ظرف چند روز از 8,000 ستاره عبور کرد. تا 22 سپتامبر، بیش از 13,000 ستاره و 1,500 فورک داشت و در جدول روزانه Trendshift صدرنشین شد. شعارش هم رک و پوستکنده است: هر ویدیوی وایرالی را با ایجنتهای هوش مصنوعی کپی کن. ما آن را نصب کردیم، هفت تسک واقعی را با Codex و Claude Code اجرا کردیم و ثبت کردیم چه ساخت، زیرِ کاپوت چگونه کار میکند و واقعاً چقدر هزینه داشت. این همان کالبدشکافی است. منبع: github.com/hypit-ai/hypit.
Hypit چیست؟
Hypit از Hypit.AI به ایجنتهای کدنویسی هوش مصنوعی مثل Claude Code و Codex «یک زبان و سیستم برای ساخت ویدیو» میدهد. این یک ادیتور میزبانیشده نیست. بهصورت یک Skill برای ایجنت، یک ابزار خط فرمان و یک مونوریپوی TypeScript با 122 پکیج عرضه میشود: کانکتورهایی برای Seedance، GPT Image، Nano Banana، Grok Imagine، MiniMax، ElevenLabs و Fish Audio، بهعلاوه زیرنویس، حذف پسزمینه، ترکهای B-roll، افکتهای سینمایی و یک رندرر.
ایده اصلی SVML است؛ زبان نشانهگذاری اختصاصی Hypit. ایجنت شما ویدیو را به شکل SVML مینویسد؛ Hypit آن را کامپایل میکند و فریمها را رندر میگیرد (در نمونههایش رندر با 64 پردازش headless Chromium بهصورت موازی انجام میشود). زمانبندی به کلمات گره خورده است، نه ثانیهها. WhisperX هر کلمه گفتهشده را همتراز میکند و تصویرها به بازههای متن وصل میشوند. این یک کد واقعی از مثال رتبهبندی فوتبالی (tier list) در ریپو است:
<HOST>Ronaldo is <D | Dee> tier. || Bro has @{hair-gel} more ||
hair gel than @{trophy} trophies || at this point.@{/trophy}@{/hair-gel}
<media-track:Item id="hair-gel" image={broll-hair-gel.image}
extent={hair-gel-extent} during={story.selection.hair-gel}
motion={recipes.motion.broll-left}/>تصویر B-roll با نام hair-gel دقیقاً همان زمانی روی صفحه است که آن کلمات گفته میشوند. خط را که بازنویسی کنید، زمانبندی خودش دوباره جریان پیدا میکند؛ و همین است که یک پروژه میتواند دهها نسخه مختلف تولید کند.
قبل از نصب، سه نکته دیگر هم بد نیست بدانید:
- مدلهای تولید اختیاریاند. یک پروژه میتواند زیرنویسها، موشنگرافیک و تصویرهای رندرشده با کد را بدون فراخوانی هیچ مدل ویدیویی به یک ویدیوی نهایی تبدیل کند.
- هزینه برای سرویسهاست، نه Hypit. Hypit رایگان است؛ ایجنت کدنویسی و ارائهدهندگان مدلها جداگانه هزینه میگیرند. سرویس میزبانیشده پیشنهادیاش، HypiHub، در اجرای ما اعتبار را با قیمت 15 دلار برای 2,000 اعتبار میفروخت و بهجای آن میتوانید کلیدهای API خودتان یا مدلهای لوکال را وصل کنید.
- لایسنس شرط دارد. «Hypit Open Source License» در اصل Apache 2.0 با شروط اضافه است: میتوانید در داخل سازمان خودتان استفاده تجاری داشته باشید، اما میزبانی آن بهعنوان سرویس چندمستاجری برای دیگران یا فروشِ مجددش به لایسنس تجاری نیاز دارد. ویدیوهایی که میسازید متعلق به شماست.
چطور کار میکند: آنچه در اجراهای ما دیدیم
نصبش یک دستور است: npx skills add hypit-ai/hypit -g. در اولین استفاده، ایجنت فایل اجرایی Hypit را پیدا میکند یا نصب میکند (Node.js 22.15 یا جدیدتر). از آنجا به بعد، هر تسک همین چرخه را طی میکرد.
1. ایجنت ویدیوی مرجع را میبیند و تجزیه میکند
به Codex یک ویدیوی توضیحی مالی 34 ثانیهای دادیم و نوشتیم «Hypit، این ویدیو را کپی کن.» کلیپ را تماشا کرد، ساختارش را توضیح داد (یک مقدمه talking-head و بعد پنج نمودار بازار که یکی پس از دیگری روی هم قرار میگرفتند، با زوم و کنتراستهای اغراقشده) و یک برنامه پیشنهاد کرد: مجری، صدا و متن را نگه داریم و نمودارها، کپشنها و حرکتهای دوربین را بهصورت عناصر قابل ویرایش بازسازی کنیم. بعد پرسید چه چیزهایی را میخواهیم جایگزین کنیم.
2. قبل از خرجکردن، قیمت کار را اعلام میکند
این بخش، مطمئنکنندهترین قسمت بود. پیش از هر فراخوانی پولی، ایجنت یک جدول هزینه ارائه کرد و منتظر ماند. برای یک کلیپ talking-head چینی، 4.39 اعتبار (حدود 0.03 دلار) برای رونویسی نسخه اصلی و بازسازی لوکال قیمت داد؛ در مقابلِ 5.69 تا 9.34 دلار، قبل از تلاشهای مجدد برای تولید دوباره تمام 132 ثانیه از فوتیجِ روی دوربین در 720p. سپس برای اینکه فقط رونویسی را انجام دهد، اجازه خواست حداکثر 10 اعتبار (حدود 0.075 دلار) شارژ کند و تأکید کرد که «هنوز هیچ فراخوانی پولی انجام نشده است.»
3. میسازد، رندر میگیرد و یک پروژه قابل ویرایش تحویل میدهد
بعد از تأیید، ایجنت قطعهها را تولید میکند، SVML را کامپایل میکند و رندر میگیرد. شما یک فایل نهایی میگیرید و پروژه پشت آن را؛ پروژهای که در Hypit Studio باز میشود: سورس در سمت چپ، پیشنمایش وسط، ویژگیها در سمت راست و یک تایملاین چندترکه در پایین. میتوانید دستی ویرایش کنید یا از ایجنت بخواهید خودِ کات را بازبینی و اصلاح کند.

lsj-reconstruction با مدت 2.90 ثانیه روی یک ترک جداست؛ فوتیج اصلیِ زیر آن دستنخورده مانده. فوتیجهای شخص ثالث محو شدهاند.واقعاً اجراش کردیم: هفت تسک
ما هفت تسک را در اپهای دسکتاپ Codex و Claude Code اجرا کردیم؛ برای ویدیو از Seedance 2 Mini و برای تصویر از GPT Image 2 استفاده کردیم. خروجی هر کدام این بود:
- موشنگرافیک روی talking-head. از او خواستیم سبک تدوینِ کاغذ پاره، استیکر و چسبِ یک کریتور را روی یکی از کلیپهای talking-head خودمان کپی کند. ظاهر را قانعکننده بازسازی کرد.
- تعویض لباس. یک ویدیوی ترندِ try-on که در آن لباس با یک لباسِ بازی ویدیویی جایگزین شد. در اکثر نماها جواب داد.
- انتقال سبک. یک کلیپ میم که به سبک یک انیمیشن بزرگسالِ مشهور دوباره ترسیم شده بود. کلیپ اصلی را پایه قرار داد و روی آن استایلدهی کرد و نتیجه واقعاً خوب بود.
- تعویض سوژه. یک ویدیوی وایرال آوازخوانی با حدود یک میلیون لایک که دو اجراکنندهاش با دو گربه جایگزین شدند. ایرادهای کوچک داشت، اما در کل قوی بود (کلیپ اول پایین).
- همان سبک، محتوای جدید. از یک ویدیوی توضیحی مالی محبوب، ایجنت یک متن جدید «Why HBM matters» نوشت، دیاگرامها را با کد کشید و یک مجری روی دوربین برای گوشه بالا-چپ تولید کرد. گزارشش: «Exported, 37.1 s, 1080p … only the first round of generation ran; no additional paid generation.» کل تسک 1 ساعت و 8 دقیقه زمانِ ایجنت برد.
- غافلگیری Blender. وقتی از او خواستیم حروف اختصاریِ چیدهشده با دومینو را در ویدیوی یک ریویور تکنولوژی عوض کند، کلاً مدلهای ویدیویی را کنار گذاشت. نما را در Blender بازسازی کرد، 87 فریم رندر گرفت (2.9 ثانیه در 30 fps) و آنها را داخل فوتیج جاگذاری کرد و باقی آن را دستنخورده گذاشت. این دقیقترین اصلاحِ هفته بود.
- ریویوی سینمایی موبایل. یک ریویوی محصول با حالوهوای فیلم که با یک مجری دیجیتال و B-roll تولیدشده (کلیپ دوم پایین) بازسازی شد. در مجموع این ضعیفترین نتیجه بود: ظاهرِ هوش مصنوعی کاملاً مشخص بود و از یک ادیتور انسانی عقبتر میایستد.
- اسکچ فروشگاهی (E-commerce). از یک تصویر مرجع و ویدیوی منبع، یک اسکچ کوتاه فروش را بازسازی کرد که در آن یک عروسک با چکش تخممرغها را میشکند. ما آن را تقریباً همسطح با نسخه اصلی ارزیابی کردیم؛ نسخهای که خودش هم با هوش مصنوعی ساخته شده بود.
یک نکته درباره چیزهایی که اینجا نشان میدهیم: بیشتر این تستها از ویدیوهای کریتورهای دیگر شروع شدند و آن چهرهها، صداها و فوتیجها مال ما نیست که دوباره منتشرشان کنیم. بنابراین کلیپهای پایین خروجیهایی هستند که کسی در تصویر دیده نمیشود و صدایشان هم قطع شده است.
کلیپهای دمو از اجراهای ما
دو خروجی بدون ادیت از تستهای بالا، بریدهشده از ضبط صفحه ما.
جمعبندی صادقانه: نقاط قوت و محدودیتهای واقعی
چیزهایی که تحتتأثیرمان گذاشت:
- ساختار را کپی میکند، نه فقط متن را. خروجی یک پروژه قابل اجرای مجدد است؛ پس تعویض مجری، محصول یا زبان یعنی یک اجرای تازه، نه یک ادیت تازه.
- زمانبندیِ متکی به کلمات. یک خط را بازنویسی کنید و B-roll، کپشنها و کاتها همگام میمانند.
- ارزانترین ابزارِ کارآمد را انتخاب میکند. وقتی مجبور است از مدلهای ویدیویی استفاده میکند و وقتی یک اصلاح دقیق کافی است، سراغ کد یا حتی Blender میرود.
- شفافیت هزینه. هر مرحله را برآورد میکند و قبل از فراخوانیهای پولی اجازه میگیرد؛ چیزی که بین ابزارهای ایجنتی کمیاب است.
جاهایی که کم میآورد:
- هزینه اصلی، خودِ ایجنت است. در مثالهای README خودِ Hypit، هزینه مدلها برای هر کپی حدود 1.10 دلار ذکر شده است. در تستهای ما هزینه بزرگتر، ایجنت کدنویسی بود: هفت تسک، پلن 100 دلاری ChatGPT ما را از 50% به 3% از سهمیه مصرف رساند.
- کند است. یک کپی بیش از یک ساعت زمانِ ایجنت گرفت.
- بازسازیهای واقعگرایانه هنوز هم شبیه AI به نظر میرسند. ریویوی سینمایی کاملاً مصنوعی بود و نماهای تولیدشده آرتیفکتهای کوچک داشتند.
- به یک ورکفلو ایجنتی نیاز دارید. باید یک ایجنت کدنویسی، Node.js 22.15+ و حسابهای مدل داشته باشید. برای توسعهدهندهها دوستداشتنی است، نه برای کسی که فقط یک ویدیو میخواهد.
- لایسنس کاملاً بدون محدودیت نیست. بدون لایسنس تجاری نمیتوانید Hypit را بهعنوان سرویس برای تیمهای دیگر میزبانی کنید یا آن را دوباره بفروشید.
- مسئولیت حقوقی با شماست. Hypit میگوید خروجیها متعلق به شماست، اما چهرهها، صداها، فوتیج و موسیقیِ ویدیوی مرجع متعلق به صاحبانشان است. با یک ویدیوی وایرال مثل یک «ساختار» برای یادگیری برخورد کنید، نه مثل متریالی برای بازنشر.
Hypit در برابر یک ابزار میزبانیشده ویدیوی هوش مصنوعی
Hypit و ابزارهای میزبانیشدهای مثل VisionStory هر دو به یک ویدیوی نهایی ختم میشوند، اما از نقطههای شروع متفاوتی میآیند و هزینه را هم متفاوت حساب میکنند.
| Hypit (Skill ایجنت) | VisionStory (میزبانیشده) | |
|---|---|---|
| نقطه شروع | یک ویدیوی مرجع یا یک بریفِ مکتوب | یک عکس، یک آواتار یا یک متن |
| راهاندازی | نصب Skill؛ ایجنت کدنویسی، Node.js 22.15+ و حسابهای مدل | هیچ؛ در مرورگر اجرا میشود |
| چیزی که پرداخت میکنید | مصرف ایجنت کدنویسی + اعتبارهای مدل (در مثالهای Hypit حدود 1 دلار هزینه مدل برای هر کپی؛ اما هزینه مصرف ایجنت ما خیلی بیشتر بود) | اشتراک یا اعتبارها |
| زمان برای هر ویدیو | از چند دقیقه تا بیش از یک ساعت زمانِ ایجنت | چند دقیقه |
| چیزی که میگیرید | یک پروژه SVML قابل ویرایش و قابل اجرای مجدد + رندر | یک ویدیوی آواتار سخنگو یا ویدیوی هوش مصنوعیِ نهایی |
| حقوق استفاده | باید مجوزِ هر فوتیج، چهره یا صدایی را که کپی میکنید بگیرید | آواتارها و صداهای خودتان یا دارای لایسنس |
| بهترین انتخاب وقتی | میخواهید تعداد زیادی نسخه درآمدزا بسازید و در ورکفلو ایجنتی زندگی میکنید | میخواهید بدون اجرای ایجنت، همین امروز یک ویدیوی سخنگو آماده داشته باشید |
Hypit را انتخاب کنید اگر میخواهید تبلیغات یا نسخههای UGC را در مقیاس تولید کنید، یک فرمت برنده ارزش قالبسازی دارد و یک توسعهدهنده در تیم هست. یک ابزار میزبانیشده را انتخاب کنید اگر امروز یک ویدیوی مجری میخواهید و ترجیح میدهید برای گرفتنش ساعتها زمانِ ایجنت پول ندهید.
Hypit به ما چه یاد داد
بعد از یک هفته اجرا، برداشت ما این است که «کپیکردن هر ویدیوی وایرال» تیتر است، نه اصل ماجرا. ایده ماندگار این است که ساختار یک ویدیو را به قالبی تبدیل کنید که ایجنت بتواند دوباره اجرا کند. شما چیزهایی را که در ویدیوهای دیگران و خودتان کار میکند تجزیه میکنید، اسکلت را نگه میدارید و میگذارید ایجنت بخشهای متغیر را تولید کند. مسیر آینده ویدیوی هوش مصنوعی همین است و همجهت با محصول خود ما یعنی AI Video Agent: ویدیویی را که میخواهید توصیف کنید و بگذارید یک ایجنت آن را مونتاژ کند؛ بدون راهاندازی و بدون صورتحسابِ ایجنت.
برای نگاه دیگری به ویدیوهای مبتنی بر ایجنت، کالبدشکافی ما از OpenMontage را ببینید که ایدهای مشابه را با پایپلاین متفاوت دنبال میکند.
