قامت Meituan بفتح مصدر LongCat-Video-Avatar 1.5، وهو يفعل بالضبط ما يفعله VisionStory في جوهره — تحويل صورة ثابتة مع مسار صوتي إلى فيديو أفاتار ناطق. هذا أثار فضولنا بما يكفي لتشغيله فعلاً. هذه مراجعة تفكيكية عملية: ما هو، ومدى أدائه الحقيقي، وخمس فخاخ إعداد وقعنا فيها، وما تكلفته لتشغيله بنفسك مقارنةً بأداة مستضافة. المصدر: github.com/meituan-longcat/LongCat-Video (MIT).
ما هو LongCat-Video-Avatar، ومن صنعه؟
LongCat-Video-Avatar 1.5 هو نموذج فيديو بشري موجّه بالصوت بأوزان مفتوحة من Meituan (فريق LongCat). وهو مبني على نموذج الأساس LongCat-Video وصدر تحت ترخيص MIT المتساهل — مجاني فعلاً للاستخدام التجاري. واعتبارًا من 2026-07 يمتلك مستودع الكود حوالي 5,200 نجمة على GitHub، وتُعد أوزان 1.5 من بين الإصدارات الحديثة الأكثر إعجابًا على Hugging Face.
يدعم ثلاث مهام أصلية: الصوت + النص إلى فيديو (AT2V، دون صورة مرجعية)، والصوت + النص + الصورة إلى فيديو (ATI2V — صورة مرجعية تقود الهوية، وهي الحالة التي تطابق سير عمل أفاتار حقيقي)، واستكمال الفيديو لتمديد مقطع إلى ما بعد جزء واحد. في الإصدار 1.5 تم استبدال مُرمِّز الصوت بـ Whisper-Large، وهو ما يمنحه حركة الشفاه. والأهم أنه يقود الشفاه والتعبير من أي صوت تعطيه إياه — ولا يولّد الصوت ولا يستنسخه.
قمنا بتشغيله فعلاً (بطاقة A800-40GB واحدة)
بدون تلميح أو مبالغة — شغّلنا المهام الثلاث كلها على NVIDIA A800-SXM4-40GB واحدة (torch 2.8+cu128، برنامج تشغيل 550)، ضمن إعداد النموذج المكمّم INT8 + تقطير من 8 خطوات، وهو ما يلزم لإدخال نموذج نشر فيديو بهذا الحجم على بطاقة 40 GB. إليك السرد الصريح خطوة بخطوة.
الفخاخ الخمسة التي وقعنا فيها
- اعتمادية مفقودة لفصل الصوت. خط معالجة الصوت يحتاج نموذج Kim_Vocal_2 عبر
audio-separator، وهو غير موجود ضمن المتطلبات الافتراضية — فشل التشغيل الأول إلى أن قمنا بـpip install audio-separator==0.30.2. - انفجر كاتب الفيديو. فشل حفظ الإطارات بخطأ
TiffWriter got an unexpected keyword argument fpsلأن imageio لم يتمكن من العثور على كاتب ffmpeg — وتم إصلاحه عبرpip install imageio-ffmpeg==0.6.0. - تعطّل متعدد وحدات GPU. تشغيل مهمة واحدة عبر عدة بطاقات (حجم التوازي السياقي 2 أو 8) تعلّق بسبب عدم تزامن NCCL collective — انتظر الرتبتان بعضهما إلى أن أنهى مهلة 600 ثانية التشغيل. لم نتمكن إلا من تشغيل بطاقة واحدة. أوزان INT8 تتسع على بطاقة واحدة بسعة 40 GB، لذا كان تعدد GPU مفيدًا فقط لتشغيل مهام منفصلة بالتوازي، وليس لتسريع مهمة واحدة.
- نفاد الذاكرة في الجزء الثاني. المقاطع الطويلة تُبنى عبر استكمال جزء بعد جزء، وخطوة الاستكمال أبقت KV-cache من 48 طبقة مقيمًا. على بطاقة 40 GB بلغ الجزء الثاني ذروة الذاكرة وتوقف — وكان ينقصه حوالي 160 MiB فقط ليتسع. اضطررنا لكشف وتفعيل خيار
--offload_kv_cache(نقل الكاش إلى RAM المعالج وإعادته خطوة بخطوة) بالإضافة إلى ضبطPYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. يعمل ذلك، لكن على حساب بطء الأجزاء. - محاذاة الدقة. دقة 480p تحت توازي متعدد البطاقات اصطدمت بشرط قابلية القسمة على 64 للارتفاع والعرض؛ تشغيل البطاقة الواحدة يتجنب ذلك.
السرعة والذاكرة (مقاسة)
هذا هو الرقم الأهم: مقطع بطول 82 ثانية استغرق 3,586 ثانية — أقل بقليل من ساعة — على A800، أي حوالي 44 ثانية من الحوسبة لكل 1 ثانية من الفيديو النهائي (نحو 138 ثانية لكل جزء مُولّد عبر 26 جزءًا). وحتى مقطع قصير لمدة 10 ثوانٍ سيستغرق حوالي 7 دقائق. وليس الحمل خفيفًا: ارتفعت VRAM خلال ثوانٍ ثم ثبتت عند 40,500 MiB — أي 98.9% من بطاقة 40 GB — طوال عملية التصيير. هذا هو الاستخدام الفعلي الذي قمنا بأخذ عيناته مرة كل ثانية:
عينات قمنا بتصييرها
تم تصيير كل مقطع أدناه بواسطة فريقنا على جهاز A800 المذكور أعلاه. ولقياس أداء النموذج في السيناريوهات المقصودة، شغّلنا المقاطع بمدخلات العرض التجريبي الرسمية الخاصة بالمشروع نفسه (صور مرجعية وصوت) بدلًا من إعداد مدخلاتنا نحن — لذا فهذه نتائج صادقة غير منتقاة بعناية، وليست فيديو استعراضيًا لأفضل اللقطات. تم تشغيل المقطعين الأولين كلٌ بصورته المرجعية الخاصة:
يسارًا: المرجع لمقطع «الصورة + الصوت». يمينًا: المرجع لمقطع «متعدد المتحدثين» (صورة واحدة، شخصان). أمّا المقطع الثالث أدناه فشغّل «النص + الصوت» من دون صورة مرجعية — حيث يخترع النموذج الشخصية، وهنا يكون أداؤه الأضعف.
تم التصيير بواسطة VisionStory باستخدام LongCat-Video-Avatar 1.5 على NVIDIA A800، بتاريخ 2026-07-15، بدقة من فئة 480p (768×512 / 832×480)، باستخدام مدخلات العرض التجريبي الرسمية للنموذج.
حكم صريح: قوي مع صورة، وخشن بدونها
ما أدهشنا حقًا:
- ثبات الهوية. في المقطع القائم على الصورة، يبقى الشخص هو نفسه طوال 82 ثانية — الشعر والملابس والوجه — بينما يتتبع الفم الصوت. هذه هي الحالة الأهم للأفاتارات، وهي تعمل.
- تعدد المتحدثين يعمل فعلاً. شخصان من مشهد واحد، وكل شفاه تُقاد بمسارها الصوتي الخاص، وبقيت النتيجة متماسكة — وهذا أمر صعب جدًا إتقانه.
- MIT وبمستوى تجاري. أوزان مفتوحة، بلا فواتير لكل عملية تصيير، وجودة مخرجات يمكن أن تمر في مقطع قصير.
أين يتعثر — وهذه أمور حقيقية:
- توليد النص فقط ينحرف. بدون صورة مرجعية يخترع النموذج الشخص، ومع المقاطع الطويلة يتحول الوجه إلى لقطة قريبة غريبة وشمعية ويتبدل المشهد — واضح في العينة الثالثة أعلاه.
- بطيء وثقيل. حوالي 44 ثانية حوسبة لكل 1 ثانية فيديو، مع إشغال بطاقة 40 GB طوال الوقت. مقطع 82 ثانية يعني ساعة.
- 40 GB هي الحد الأدنى. احتجنا INT8 + تقطير لمجرد أن يتسع، ولم تنجُ المقاطع متعددة الأجزاء إلا عبر تفريغ KV-cache إلى CPU. البطاقات الأصغر غير مناسبة.
- بطاقة واحدة فقط عمليًا. توازي السياق متعدد GPU تعطل بتوقف متبادل على جهازنا، لذا لا توجد طريقة سهلة لتسريع مقطع واحد بإضافة بطاقات.
- لا صوت. يقود الشفاه من الصوت الذي تزوده به — ولا يقدم تحويل النص إلى كلام ولا استنساخ الصوت، لذا ما زلت بحاجة إلى مصدر صوت منفصل.
- 480p على هذا العتاد. ما استطعنا تشغيله على بطاقة واحدة بسعة 40 GB كان مخرجات من فئة 480p.
استضافة LongCat ذاتيًا مقابل أداة مستضافة: أيهما تختار؟
كلاهما ينتج الشيء نفسه — صورة مع صوت تتحول إلى فيديو ناطق. الفرق كله في ما ستدفعه لتصل إلى ذلك. أداة مستضافة مثل VisionStory تشغّل النموذج نيابةً عنك؛ وهذه هي المقايضة بصراحة.
| LongCat (استضافة ذاتية) | VisionStory (مستضاف) | |
|---|---|---|
| العتاد | A100/A800 بسعة 40 GB (بآلاف الدولارات) | لا شيء — يعمل في المتصفح |
| الإعداد | CUDA وflash-attn وINT8 وإصلاح الاعتماديات وضبط OOM | سجّل الدخول وابدأ |
| الوقت لكل مقطع | حوالي 44 ثانية حوسبة لكل 1 ثانية فيديو (مقطع 82 ثانية ≈ 1 ساعة) | ثوانٍ، على وحدات GPU مستضافة |
| الدقة (تشغيلنا) | من فئة 480p | فيديو عالي الدقة وما فوق |
| الصوت | أنت توفر الصوت (بدون TTS/استنساخ) | أصوات مدمجة واستنساخ الصوت |
| الاستخدام التجاري | نعم (MIT) | نعم (حسب الخطة) |
| الصيانة | أنت تُحدّث الاعتماديات وتعالج OOM وبرامج التشغيل | لا شيء |
| الأفضل عندما | لديك وحدات GPU وتحتاج استضافة ذاتية/دون اتصال/داخل المؤسسة | تريد فيديو ناطقًا جاهزًا بسرعة |
اختر LongCat إذا كان لديك العتاد وكان العمل يجب فعلًا أن يكون مستضافًا ذاتيًا — داخل المؤسسة، دون اتصال، أو تحت سيطرتك بالكامل — وكنت مرتاحًا لإدارة منظومة CUDA. واختر أداة مستضافة إذا كنت تريد نفس فيديو الصورة + الصوت الناطق بدون ساعة من الحوسبة وGPU بسعر من خمسة أرقام.
ماذا علّمنا LongCat
الدرس الحقيقي من تشغيل LongCat-Video-Avatar هو أن جودة فيديوهات الأفاتار المفتوحة وصلت — مع صورة مرجعية، ينتج هذا النموذج المجاني مقاطع جيدة بما يكفي للاستخدام الحقيقي. لم يعد النموذج هو الجزء الأصعب.
الجزء الأصعب هو كل ما حوله: إدخال نموذج نشر فيديو على بطاقة يمكنك تحملها، والنجاة من OOM في الجزء الثاني، وانتظار ساعة مقابل 82 ثانية، وربطه بمصدر صوت. تلك الفجوة — بين نقطة تحقق قوية وفيديو ناطق مكتمل يمكن لأي شخص صنعه — هي بالضبط العمل الذي نقوم به. إذا أردت رؤية الجانب الآخر منها، يحوّل VisionStory صورة ونصًا إلى أفاتار ناطق متزامن الشفاه في متصفحك خلال ثوانٍ، وإذا كنت تحتاج الصوت أيضًا، فمراجعتنا التفكيكية لـ TTS مفتوح المصدر تغطي أين وصل ذلك النصف اليوم.
