فارسی

Meituan مدل LongCat-Video-Avatar 1.5 را متن‌باز کرد و دقیقاً همان کاری را انجام می‌دهد که VisionStory در هسته‌اش انجام می‌دهد — تبدیل یک عکس ثابت به‌همراه یک ترک صوتی به ویدیوی آواتارِ سخنگو. همین کافی بود کنجکاو شویم و واقعاً آن را اجرا کنیم. این یک کالبدشکافی عملی است: اینکه چیست، واقعاً چقدر خوب عمل می‌کند، پنج تله‌ای که در راه‌اندازی خوردیم، و اینکه اجرای آن روی سیستم خودتان در مقایسه با یک ابزار میزبانی‌شده چقدر هزینه دارد. منبع: github.com/meituan-longcat/LongCat-Video (MIT).

LongCat-Video-Avatar چیست و سازنده‌اش کیست؟

LongCat-Video-Avatar 1.5 یک مدل ویدیوی انسانیِ هدایت‌شده با صدا با وزن‌های باز از Meituan (تیم LongCat) است. این مدل بر پایه مدل بنیادی LongCat-Video ساخته شده و با مجوز سهل‌گیرانه MIT منتشر شده — واقعاً برای استفاده تجاری رایگان است. تا 2026-07 مخزن کد آن حدود 5,200 ستاره در GitHub دارد و وزن‌های نسخه 1.5 هم جزو انتشارهای محبوب‌تر اخیر در Hugging Face هستند.

این مدل از سه وظیفه بومی پشتیبانی می‌کند: Audio + Text to Video (AT2V، بدون تصویر مرجع)، Audio + Text + Image to Video (ATI2V — عکس مرجع هویت را هدایت می‌کند؛ همان حالتی که با گردش‌کار واقعی آواتار جور درمی‌آید)، و ادامه‌دادن ویدیو برای امتداد دادن یک کلیپ فراتر از یک سگمنت. در نسخه 1.5 از یک انکودر صوتی Whisper-Large استفاده شده که همان چیزی است که حرکت لب را به آن می‌دهد. نکته مهم این است که لب‌ها و حالت چهره را از هر صوتی که به آن بدهید هدایت می‌کند — خودش صدا تولید یا شبیه‌سازی نمی‌کند.

ما واقعاً اجراش کردیم (یک A800-40GB)

بدون کلی‌گویی — هر سه وظیفه را روی یک NVIDIA A800-SXM4-40GB (torch 2.8+cu128، درایور 550) اجرا کردیم، با پیکربندی INT8-quantized + 8-step distill که برای جا دادن یک مدل video-diffusion با این ابعاد روی کارت 40 GB لازم است. این هم گزارش صادقانه قدم‌به‌قدم.

پنج تله‌ای که خوردیم

  • وابستگیِ جداسازی وکال نبود. پایپ‌لاین صدا از طریق audio-separator به مدل Kim_Vocal_2 نیاز دارد که در requirements پیش‌فرض نیست — اولین اجرا تا وقتی pip install audio-separator==0.30.2 نزدیم، از کار افتاد.
  • نویسنده ویدیو ترکید. ذخیره فریم‌ها با خطای TiffWriter got an unexpected keyword argument fps شکست خورد چون imageio نتوانست writer مربوط به ffmpeg را پیدا کند — با pip install imageio-ffmpeg==0.6.0 درست شد.
  • بن‌بست در چند GPU. اجرای یک job روی چند کارت (context-parallel size برابر 2 یا 8) روی یک desync در collectiveهای NCCL گیر کرد — هر دو rank منتظر هم ماندند تا timeout ‏600s اجرا را قطع کرد. عملاً فقط توانستیم تک‌کارت اجرا کنیم. وزن‌های INT8 روی یک کارت 40 GB جا می‌شوند، پس چند GPU فقط برای اجرای هم‌زمان jobهای جداگانه مفید بود، نه برای سریع‌تر کردن یک job.
  • کمبود حافظه در سگمنت دوم. کلیپ‌های بلند با ادامه دادن سگمنت پشت سگمنت ساخته می‌شوند و مرحله continuation یک KV-cache ‏48-لایه را در حافظه نگه می‌داشت. روی کارت 40 GB سگمنت دوم به سقف رسید و کرش کرد — حدود 160 MiB کم می‌آورد. مجبور شدیم فلگ --offload_kv_cache را آشکار و فعال کنیم (انتقال cache به RAM CPU و برگرداندن صفحه‌ای در هر step) و همچنین PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True را تنظیم کنیم. کار می‌کند، اما سگمنت‌ها کندتر می‌شوند.
  • هم‌ترازی وضوح تصویر. خروجی 480p زیر parallelism چندکارته به محدودیت تقسیم‌پذیری بر 64 برای height و width خورد؛ تک‌کارت از آن اجتناب می‌کند.

سرعت و حافظه (اندازه‌گیری‌شده)

این همان عدد مهم است: یک کلیپ 82 ثانیه‌ای روی A800، 3,586 ثانیه — کمی کمتر از یک ساعت — زمان برد؛ یعنی حدود 44 ثانیه محاسبه برای هر 1 ثانیه ویدیوی نهایی (تقریباً 138s برای هر سگمنت تولیدی در مجموع 26 سگمنت). یک کلیپ کوتاه 10 ثانیه‌ای هم باز حدود 7 دقیقه می‌شود. و بار کاری هم سبک نیست: VRAM ظرف چند ثانیه بالا رفت و بعد تمام مدت رندر روی 40,500 MiB — یعنی 98.9% از کارت 40 GB — قفل شد. این هم مصرف واقعی که هر ثانیه یک بار نمونه‌برداری کردیم:

مصرف VRAM در طول رندر 82 ثانیه‌ای LongCat-Video-Avatar که نزدیک سقف 40 GB برای کل یک ساعت ثابت مانده

نمونه‌هایی که رندر کردیم

هر کلیپ زیر توسط ما روی A800 که بالاتر توضیح داده شد رندر شده است. برای بنچمارک‌کردن مدل در سناریوهای مدنظرش، آن‌ها را با ورودی‌های رسمی دموِ خود پروژه (پرتره‌های مرجع و صدا) اجرا کردیم، نه با نمونه‌هایی که خودمان گلچین کنیم — بنابراین این‌ها خروجی‌های صادقانه و بدون دست‌چین‌کردن هستند، نه یک ویدیوی هایلایت. دو کلیپ اول هرکدام با عکس مرجع خودشان هدایت شده‌اند:

دو عکس مرجع: یک خواننده تک‌نفره برای کلیپِ عکس+صدا و یک صحنه استودیویی دونفره برای کلیپِ چندگوینده

چپ: مرجعِ کلیپِ عکس+صدا. راست: مرجعِ کلیپِ چندگوینده (یک تصویر، دو نفر). کلیپِ سومِ زیر متن+صدا را با بدون عکس مرجع اجرا کرد — مدل خودش شخص را می‌سازد و این همان جایی است که ضعیف‌ترین عملکرد را دارد.

عکس + صدا (ATI2V) — گردش‌کار آواتار. هویت حفظ می‌شود و دهان با آواز هماهنگ است.
چندگوینده — دو نفر، دو ترک صوتی، و هر دهان مستقل هدایت می‌شود.
فقط متن + صدا، بدون عکس مرجع (AT2V) — موردِ ضعیف: تغییر شکل و سر خوردن چهره را ببینید.

رندر شده توسط VisionStory با LongCat-Video-Avatar 1.5 روی NVIDIA A800 در تاریخ 2026-07-15، با وضوح کلاس 480p (768×512 / 832×480)، با استفاده از ورودی‌های رسمی دموی مدل.

جمع‌بندی صادقانه: با عکس قوی، بدون عکس خشن و ناپایدار

چیزهایی که واقعاً تحت‌تأثیرمان قرار داد:

  • هویت حفظ می‌شود. در کلیپِ هدایت‌شده با عکس، شخص در تمام 82 ثانیه همان شخص می‌ماند — مو، لباس، چهره — و دهان با صدا هماهنگ است. این همان حالتی است که برای آواتارها مهم است و کار می‌کند.
  • چندگوینده واقعاً جواب می‌دهد. دو نفر در یک صحنه، هر کدام با ترک صوتی خودش، هماهنگ و یکپارچه می‌مانند — کاری که واقعاً سخت است درست از آب دربیاید.
  • MIT و مناسب کار تجاری. وزن‌های باز، بدون هزینه به‌ازای هر رندر، و کیفیتی که در یک کلیپ کوتاه قابل قبول است.

جاهایی که کم می‌آورد — و این‌ها واقعی‌اند:

  • تولید فقط-متن دچار drift می‌شود. بدون عکس مرجع، مدل شخص را خودش می‌سازد و در یک کلیپ بلند، چهره به یک نمای نزدیک عجیب و مومی تغییر شکل می‌دهد و صحنه هم جابه‌جا می‌شود — در نمونه سوم بالا مشخص است.
  • کند و سنگین است. حدود 44s محاسبه برای هر 1s ویدیو، در حالی که یک کارت 40 GB را تمام مدت درگیر نگه می‌دارد. کلیپ 82 ثانیه‌ای یعنی یک ساعت.
  • 40 GB کفِ نیاز است. اجرای ما برای جا شدن به INT8 + distill نیاز داشت و کلیپ‌های چندسگمنتی فقط با offload کردن KV-cache به CPU زنده ماندند. کارت‌های کوچک‌تر عملاً حذف‌اند.
  • عملاً فقط تک‌کارت. context-parallel چند GPU روی سیستم ما deadlock شد، پس راه ساده‌ای برای سریع‌تر کردن یک کلیپ با اضافه کردن کارت وجود ندارد.
  • بدون صدا. لب‌ها را از صوتی که شما می‌دهید هدایت می‌کند — تبدیل متن به گفتار یا شبیه‌سازی صدا ندارد، پس هنوز به یک منبع صدای جدا نیاز دارید.
  • 480p روی این سخت‌افزار. چیزی که روی یک کارت 40 GB توانستیم اجرا کنیم خروجی در حد کلاس 480p بود.

Self-host LongCat یا یک ابزار میزبانی‌شده: کدام را انتخاب کنید؟

هر دو یک چیز تولید می‌کنند — عکس + صدا می‌شود یک ویدیوی سخنگو. تفاوت فقط در این است که رسیدن به آن چقدر برای شما هزینه دارد. یک ابزار میزبانی‌شده مثل VisionStory مدل را برایتان اجرا می‌کند؛ این هم مقایسه بی‌پرده.

 LongCat (self-host)VisionStory (hosted)
سخت‌افزاریک A100/A800 با 40 GB (چند هزار دلار)هیچ — در مرورگر اجرا می‌شود
راه‌اندازیCUDA، flash-attn، INT8، رفع وابستگی‌ها، تنظیمات OOMوارد شوید و شروع کنید
زمان برای هر کلیپ~44s محاسبه برای هر 1s ویدیو (کلیپ 82s ≈ 1 ساعت)چند ثانیه، روی GPUهای میزبانی‌شده
وضوح تصویر (اجرای ما)کلاس 480pویدیوی HD و بالاتر
صداصدا را شما می‌دهید (بدون TTS/clone)صداهای داخلی و شبیه‌سازی صدا
استفاده تجاریبله (MIT)بله (بسته به پلن)
نگه‌داریپچ کردن وابستگی‌ها، OOM، درایورها با شماستهیچ
بهترین انتخاب وقتیGPU دارید و به self-host/offline/on-prem نیاز داریدیک ویدیوی سخنگوی آماده را سریع می‌خواهید

LongCat را انتخاب کنید اگر سخت‌افزارش را دارید و واقعاً باید کار را self-host کنید — on-prem، آفلاین، یا کاملاً تحت کنترل خودتان — و با نگه‌داری یک پشته CUDA راحت هستید. یک ابزار میزبانی‌شده را انتخاب کنید اگر همان ویدیوی سخنگوی عکس+صدا را می‌خواهید، بدون یک ساعت محاسبه و بدون GPU پنج‌رقمی.

LongCat به ما چه یاد داد

درس واقعیِ اجرای LongCat-Video-Avatar این است که کیفیت ویدیوی آواتارِ متن‌باز بالاخره رسیده — با یک عکس مرجع، این مدل رایگان کلیپ‌هایی تولید می‌کند که برای استفاده واقعی کافی‌اند. دیگر خودِ مدل بخش سخت ماجرا نیست.

بخش سخت همه چیزِ دور و بر آن است: جا دادن یک مدل video-diffusion روی کارتی که توان خریدش را دارید، زنده ماندن از OOM در سگمنت دوم، یک ساعت انتظار برای 82 ثانیه، و کنار هم گذاشتن آن با یک صدا. این شکاف — بین یک checkpoint توانمند و یک ویدیوی سخنگوی نهایی که هر کسی بتواند بسازد — دقیقاً همان کاری است که ما انجام می‌دهیم. اگر می‌خواهید سمت دیگر ماجرا را ببینید، VisionStory در چند ثانیه داخل مرورگر، یک عکس و یک متن را به یک آواتار سخنگو با همگام‌سازی لب تبدیل می‌کند؛ و اگر صدا را هم لازم دارید، کالبدشکافی ما از open-source TTS نشان می‌دهد این نیمه الان کجا ایستاده است.

سوالات متداول

  • بله. LongCat-Video-Avatar 1.5 تحت مجوز MIT منتشر شده که استفاده تجاری را مجاز می‌داند و هزینه‌کردِ «به‌ازای هر رندر» ندارد. فقط هزینه محاسبات GPU که مصرف می‌کند را می‌پردازید.