Meituan مدل LongCat-Video-Avatar 1.5 را متنباز کرد و دقیقاً همان کاری را انجام میدهد که VisionStory در هستهاش انجام میدهد — تبدیل یک عکس ثابت بههمراه یک ترک صوتی به ویدیوی آواتارِ سخنگو. همین کافی بود کنجکاو شویم و واقعاً آن را اجرا کنیم. این یک کالبدشکافی عملی است: اینکه چیست، واقعاً چقدر خوب عمل میکند، پنج تلهای که در راهاندازی خوردیم، و اینکه اجرای آن روی سیستم خودتان در مقایسه با یک ابزار میزبانیشده چقدر هزینه دارد. منبع: github.com/meituan-longcat/LongCat-Video (MIT).
LongCat-Video-Avatar چیست و سازندهاش کیست؟
LongCat-Video-Avatar 1.5 یک مدل ویدیوی انسانیِ هدایتشده با صدا با وزنهای باز از Meituan (تیم LongCat) است. این مدل بر پایه مدل بنیادی LongCat-Video ساخته شده و با مجوز سهلگیرانه MIT منتشر شده — واقعاً برای استفاده تجاری رایگان است. تا 2026-07 مخزن کد آن حدود 5,200 ستاره در GitHub دارد و وزنهای نسخه 1.5 هم جزو انتشارهای محبوبتر اخیر در Hugging Face هستند.
این مدل از سه وظیفه بومی پشتیبانی میکند: Audio + Text to Video (AT2V، بدون تصویر مرجع)، Audio + Text + Image to Video (ATI2V — عکس مرجع هویت را هدایت میکند؛ همان حالتی که با گردشکار واقعی آواتار جور درمیآید)، و ادامهدادن ویدیو برای امتداد دادن یک کلیپ فراتر از یک سگمنت. در نسخه 1.5 از یک انکودر صوتی Whisper-Large استفاده شده که همان چیزی است که حرکت لب را به آن میدهد. نکته مهم این است که لبها و حالت چهره را از هر صوتی که به آن بدهید هدایت میکند — خودش صدا تولید یا شبیهسازی نمیکند.
ما واقعاً اجراش کردیم (یک A800-40GB)
بدون کلیگویی — هر سه وظیفه را روی یک NVIDIA A800-SXM4-40GB (torch 2.8+cu128، درایور 550) اجرا کردیم، با پیکربندی INT8-quantized + 8-step distill که برای جا دادن یک مدل video-diffusion با این ابعاد روی کارت 40 GB لازم است. این هم گزارش صادقانه قدمبهقدم.
پنج تلهای که خوردیم
- وابستگیِ جداسازی وکال نبود. پایپلاین صدا از طریق
audio-separatorبه مدل Kim_Vocal_2 نیاز دارد که در requirements پیشفرض نیست — اولین اجرا تا وقتیpip install audio-separator==0.30.2نزدیم، از کار افتاد. - نویسنده ویدیو ترکید. ذخیره فریمها با خطای
TiffWriter got an unexpected keyword argument fpsشکست خورد چون imageio نتوانست writer مربوط به ffmpeg را پیدا کند — باpip install imageio-ffmpeg==0.6.0درست شد. - بنبست در چند GPU. اجرای یک job روی چند کارت (context-parallel size برابر 2 یا 8) روی یک desync در collectiveهای NCCL گیر کرد — هر دو rank منتظر هم ماندند تا timeout 600s اجرا را قطع کرد. عملاً فقط توانستیم تککارت اجرا کنیم. وزنهای INT8 روی یک کارت 40 GB جا میشوند، پس چند GPU فقط برای اجرای همزمان jobهای جداگانه مفید بود، نه برای سریعتر کردن یک job.
- کمبود حافظه در سگمنت دوم. کلیپهای بلند با ادامه دادن سگمنت پشت سگمنت ساخته میشوند و مرحله continuation یک KV-cache 48-لایه را در حافظه نگه میداشت. روی کارت 40 GB سگمنت دوم به سقف رسید و کرش کرد — حدود 160 MiB کم میآورد. مجبور شدیم فلگ
--offload_kv_cacheرا آشکار و فعال کنیم (انتقال cache به RAM CPU و برگرداندن صفحهای در هر step) و همچنینPYTORCH_CUDA_ALLOC_CONF=expandable_segments:Trueرا تنظیم کنیم. کار میکند، اما سگمنتها کندتر میشوند. - همترازی وضوح تصویر. خروجی 480p زیر parallelism چندکارته به محدودیت تقسیمپذیری بر 64 برای height و width خورد؛ تککارت از آن اجتناب میکند.
سرعت و حافظه (اندازهگیریشده)
این همان عدد مهم است: یک کلیپ 82 ثانیهای روی A800، 3,586 ثانیه — کمی کمتر از یک ساعت — زمان برد؛ یعنی حدود 44 ثانیه محاسبه برای هر 1 ثانیه ویدیوی نهایی (تقریباً 138s برای هر سگمنت تولیدی در مجموع 26 سگمنت). یک کلیپ کوتاه 10 ثانیهای هم باز حدود 7 دقیقه میشود. و بار کاری هم سبک نیست: VRAM ظرف چند ثانیه بالا رفت و بعد تمام مدت رندر روی 40,500 MiB — یعنی 98.9% از کارت 40 GB — قفل شد. این هم مصرف واقعی که هر ثانیه یک بار نمونهبرداری کردیم:
نمونههایی که رندر کردیم
هر کلیپ زیر توسط ما روی A800 که بالاتر توضیح داده شد رندر شده است. برای بنچمارککردن مدل در سناریوهای مدنظرش، آنها را با ورودیهای رسمی دموِ خود پروژه (پرترههای مرجع و صدا) اجرا کردیم، نه با نمونههایی که خودمان گلچین کنیم — بنابراین اینها خروجیهای صادقانه و بدون دستچینکردن هستند، نه یک ویدیوی هایلایت. دو کلیپ اول هرکدام با عکس مرجع خودشان هدایت شدهاند:
چپ: مرجعِ کلیپِ عکس+صدا. راست: مرجعِ کلیپِ چندگوینده (یک تصویر، دو نفر). کلیپِ سومِ زیر متن+صدا را با بدون عکس مرجع اجرا کرد — مدل خودش شخص را میسازد و این همان جایی است که ضعیفترین عملکرد را دارد.
رندر شده توسط VisionStory با LongCat-Video-Avatar 1.5 روی NVIDIA A800 در تاریخ 2026-07-15، با وضوح کلاس 480p (768×512 / 832×480)، با استفاده از ورودیهای رسمی دموی مدل.
جمعبندی صادقانه: با عکس قوی، بدون عکس خشن و ناپایدار
چیزهایی که واقعاً تحتتأثیرمان قرار داد:
- هویت حفظ میشود. در کلیپِ هدایتشده با عکس، شخص در تمام 82 ثانیه همان شخص میماند — مو، لباس، چهره — و دهان با صدا هماهنگ است. این همان حالتی است که برای آواتارها مهم است و کار میکند.
- چندگوینده واقعاً جواب میدهد. دو نفر در یک صحنه، هر کدام با ترک صوتی خودش، هماهنگ و یکپارچه میمانند — کاری که واقعاً سخت است درست از آب دربیاید.
- MIT و مناسب کار تجاری. وزنهای باز، بدون هزینه بهازای هر رندر، و کیفیتی که در یک کلیپ کوتاه قابل قبول است.
جاهایی که کم میآورد — و اینها واقعیاند:
- تولید فقط-متن دچار drift میشود. بدون عکس مرجع، مدل شخص را خودش میسازد و در یک کلیپ بلند، چهره به یک نمای نزدیک عجیب و مومی تغییر شکل میدهد و صحنه هم جابهجا میشود — در نمونه سوم بالا مشخص است.
- کند و سنگین است. حدود 44s محاسبه برای هر 1s ویدیو، در حالی که یک کارت 40 GB را تمام مدت درگیر نگه میدارد. کلیپ 82 ثانیهای یعنی یک ساعت.
- 40 GB کفِ نیاز است. اجرای ما برای جا شدن به INT8 + distill نیاز داشت و کلیپهای چندسگمنتی فقط با offload کردن KV-cache به CPU زنده ماندند. کارتهای کوچکتر عملاً حذفاند.
- عملاً فقط تککارت. context-parallel چند GPU روی سیستم ما deadlock شد، پس راه سادهای برای سریعتر کردن یک کلیپ با اضافه کردن کارت وجود ندارد.
- بدون صدا. لبها را از صوتی که شما میدهید هدایت میکند — تبدیل متن به گفتار یا شبیهسازی صدا ندارد، پس هنوز به یک منبع صدای جدا نیاز دارید.
- 480p روی این سختافزار. چیزی که روی یک کارت 40 GB توانستیم اجرا کنیم خروجی در حد کلاس 480p بود.
Self-host LongCat یا یک ابزار میزبانیشده: کدام را انتخاب کنید؟
هر دو یک چیز تولید میکنند — عکس + صدا میشود یک ویدیوی سخنگو. تفاوت فقط در این است که رسیدن به آن چقدر برای شما هزینه دارد. یک ابزار میزبانیشده مثل VisionStory مدل را برایتان اجرا میکند؛ این هم مقایسه بیپرده.
| LongCat (self-host) | VisionStory (hosted) | |
|---|---|---|
| سختافزار | یک A100/A800 با 40 GB (چند هزار دلار) | هیچ — در مرورگر اجرا میشود |
| راهاندازی | CUDA، flash-attn، INT8، رفع وابستگیها، تنظیمات OOM | وارد شوید و شروع کنید |
| زمان برای هر کلیپ | ~44s محاسبه برای هر 1s ویدیو (کلیپ 82s ≈ 1 ساعت) | چند ثانیه، روی GPUهای میزبانیشده |
| وضوح تصویر (اجرای ما) | کلاس 480p | ویدیوی HD و بالاتر |
| صدا | صدا را شما میدهید (بدون TTS/clone) | صداهای داخلی و شبیهسازی صدا |
| استفاده تجاری | بله (MIT) | بله (بسته به پلن) |
| نگهداری | پچ کردن وابستگیها، OOM، درایورها با شماست | هیچ |
| بهترین انتخاب وقتی | GPU دارید و به self-host/offline/on-prem نیاز دارید | یک ویدیوی سخنگوی آماده را سریع میخواهید |
LongCat را انتخاب کنید اگر سختافزارش را دارید و واقعاً باید کار را self-host کنید — on-prem، آفلاین، یا کاملاً تحت کنترل خودتان — و با نگهداری یک پشته CUDA راحت هستید. یک ابزار میزبانیشده را انتخاب کنید اگر همان ویدیوی سخنگوی عکس+صدا را میخواهید، بدون یک ساعت محاسبه و بدون GPU پنجرقمی.
LongCat به ما چه یاد داد
درس واقعیِ اجرای LongCat-Video-Avatar این است که کیفیت ویدیوی آواتارِ متنباز بالاخره رسیده — با یک عکس مرجع، این مدل رایگان کلیپهایی تولید میکند که برای استفاده واقعی کافیاند. دیگر خودِ مدل بخش سخت ماجرا نیست.
بخش سخت همه چیزِ دور و بر آن است: جا دادن یک مدل video-diffusion روی کارتی که توان خریدش را دارید، زنده ماندن از OOM در سگمنت دوم، یک ساعت انتظار برای 82 ثانیه، و کنار هم گذاشتن آن با یک صدا. این شکاف — بین یک checkpoint توانمند و یک ویدیوی سخنگوی نهایی که هر کسی بتواند بسازد — دقیقاً همان کاری است که ما انجام میدهیم. اگر میخواهید سمت دیگر ماجرا را ببینید، VisionStory در چند ثانیه داخل مرورگر، یک عکس و یک متن را به یک آواتار سخنگو با همگامسازی لب تبدیل میکند؛ و اگر صدا را هم لازم دارید، کالبدشکافی ما از open-source TTS نشان میدهد این نیمه الان کجا ایستاده است.
