قامت Meituan بفتح مصدر LongCat-Video-Avatar 1.5، وهو يفعل بالضبط ما يفعله VisionStory في جوهره — تحويل صورة ثابتة مع مسار صوتي إلى فيديو أفاتار ناطق. هذا أثار فضولنا بما يكفي لتشغيله فعلاً. هذه مراجعة تفكيكية عملية: ما هو، ومدى أدائه الحقيقي، وخمس فخاخ إعداد وقعنا فيها، وما تكلفته لتشغيله بنفسك مقارنةً بأداة مستضافة. المصدر: github.com/meituan-longcat/LongCat-Video (MIT).

ما هو LongCat-Video-Avatar، ومن صنعه؟

LongCat-Video-Avatar 1.5 هو نموذج فيديو بشري موجّه بالصوت بأوزان مفتوحة من Meituan (فريق LongCat). وهو مبني على نموذج الأساس LongCat-Video وصدر تحت ترخيص MIT المتساهل — مجاني فعلاً للاستخدام التجاري. واعتبارًا من 2026-07 يمتلك مستودع الكود حوالي 5,200 نجمة على GitHub، وتُعد أوزان 1.5 من بين الإصدارات الحديثة الأكثر إعجابًا على Hugging Face.

يدعم ثلاث مهام أصلية: الصوت + النص إلى فيديو (AT2V، دون صورة مرجعية)، والصوت + النص + الصورة إلى فيديو (ATI2V — صورة مرجعية تقود الهوية، وهي الحالة التي تطابق سير عمل أفاتار حقيقي)، واستكمال الفيديو لتمديد مقطع إلى ما بعد جزء واحد. في الإصدار 1.5 تم استبدال مُرمِّز الصوت بـ Whisper-Large، وهو ما يمنحه حركة الشفاه. والأهم أنه يقود الشفاه والتعبير من أي صوت تعطيه إياه — ولا يولّد الصوت ولا يستنسخه.

قمنا بتشغيله فعلاً (بطاقة A800-40GB واحدة)

بدون تلميح أو مبالغة — شغّلنا المهام الثلاث كلها على NVIDIA A800-SXM4-40GB واحدة (torch 2.8+cu128، برنامج تشغيل 550)، ضمن إعداد النموذج المكمّم INT8 + تقطير من 8 خطوات، وهو ما يلزم لإدخال نموذج نشر فيديو بهذا الحجم على بطاقة 40 GB. إليك السرد الصريح خطوة بخطوة.

الفخاخ الخمسة التي وقعنا فيها

  • اعتمادية مفقودة لفصل الصوت. خط معالجة الصوت يحتاج نموذج Kim_Vocal_2 عبر audio-separator، وهو غير موجود ضمن المتطلبات الافتراضية — فشل التشغيل الأول إلى أن قمنا بـ pip install audio-separator==0.30.2.
  • انفجر كاتب الفيديو. فشل حفظ الإطارات بخطأ TiffWriter got an unexpected keyword argument fps لأن imageio لم يتمكن من العثور على كاتب ffmpeg — وتم إصلاحه عبر pip install imageio-ffmpeg==0.6.0.
  • تعطّل متعدد وحدات GPU. تشغيل مهمة واحدة عبر عدة بطاقات (حجم التوازي السياقي 2 أو 8) تعلّق بسبب عدم تزامن NCCL collective — انتظر الرتبتان بعضهما إلى أن أنهى مهلة 600 ثانية التشغيل. لم نتمكن إلا من تشغيل بطاقة واحدة. أوزان INT8 تتسع على بطاقة واحدة بسعة 40 GB، لذا كان تعدد GPU مفيدًا فقط لتشغيل مهام منفصلة بالتوازي، وليس لتسريع مهمة واحدة.
  • نفاد الذاكرة في الجزء الثاني. المقاطع الطويلة تُبنى عبر استكمال جزء بعد جزء، وخطوة الاستكمال أبقت KV-cache من 48 طبقة مقيمًا. على بطاقة 40 GB بلغ الجزء الثاني ذروة الذاكرة وتوقف — وكان ينقصه حوالي 160 MiB فقط ليتسع. اضطررنا لكشف وتفعيل خيار --offload_kv_cache (نقل الكاش إلى RAM المعالج وإعادته خطوة بخطوة) بالإضافة إلى ضبط PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. يعمل ذلك، لكن على حساب بطء الأجزاء.
  • محاذاة الدقة. دقة 480p تحت توازي متعدد البطاقات اصطدمت بشرط قابلية القسمة على 64 للارتفاع والعرض؛ تشغيل البطاقة الواحدة يتجنب ذلك.

السرعة والذاكرة (مقاسة)

هذا هو الرقم الأهم: مقطع بطول 82 ثانية استغرق 3,586 ثانية — أقل بقليل من ساعة — على A800، أي حوالي 44 ثانية من الحوسبة لكل 1 ثانية من الفيديو النهائي (نحو 138 ثانية لكل جزء مُولّد عبر 26 جزءًا). وحتى مقطع قصير لمدة 10 ثوانٍ سيستغرق حوالي 7 دقائق. وليس الحمل خفيفًا: ارتفعت VRAM خلال ثوانٍ ثم ثبتت عند 40,500 MiB — أي 98.9% من بطاقة 40 GB — طوال عملية التصيير. هذا هو الاستخدام الفعلي الذي قمنا بأخذ عيناته مرة كل ثانية:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

عينات قمنا بتصييرها

تم تصيير كل مقطع أدناه بواسطة فريقنا على جهاز A800 المذكور أعلاه. ولقياس أداء النموذج في السيناريوهات المقصودة، شغّلنا المقاطع بمدخلات العرض التجريبي الرسمية الخاصة بالمشروع نفسه (صور مرجعية وصوت) بدلًا من إعداد مدخلاتنا نحن — لذا فهذه نتائج صادقة غير منتقاة بعناية، وليست فيديو استعراضيًا لأفضل اللقطات. تم تشغيل المقطعين الأولين كلٌ بصورته المرجعية الخاصة:

صورتان مرجعيتان: مغنٍ منفرد لمقطع «الصورة + الصوت»، ومشهد استوديو لشخصين لمقطع «متعدد المتحدثين»

يسارًا: المرجع لمقطع «الصورة + الصوت». يمينًا: المرجع لمقطع «متعدد المتحدثين» (صورة واحدة، شخصان). أمّا المقطع الثالث أدناه فشغّل «النص + الصوت» من دون صورة مرجعية — حيث يخترع النموذج الشخصية، وهنا يكون أداؤه الأضعف.

صورة + صوت (ATI2V) — سير عمل الأفاتار. الهوية ثابتة، والفم يتتبع الغناء.
تعدد المتحدثين — شخصان، مساران صوتيان، وكل فم يُقاد بشكل مستقل.
نص + صوت فقط، دون صورة مرجعية (AT2V) — الحالة الأضعف: راقب تشوه الوجه وانجرافه.

تم التصيير بواسطة VisionStory باستخدام LongCat-Video-Avatar 1.5 على NVIDIA A800، بتاريخ 2026-07-15، بدقة من فئة 480p (768×512 / 832×480)، باستخدام مدخلات العرض التجريبي الرسمية للنموذج.

حكم صريح: قوي مع صورة، وخشن بدونها

ما أدهشنا حقًا:

  • ثبات الهوية. في المقطع القائم على الصورة، يبقى الشخص هو نفسه طوال 82 ثانية — الشعر والملابس والوجه — بينما يتتبع الفم الصوت. هذه هي الحالة الأهم للأفاتارات، وهي تعمل.
  • تعدد المتحدثين يعمل فعلاً. شخصان من مشهد واحد، وكل شفاه تُقاد بمسارها الصوتي الخاص، وبقيت النتيجة متماسكة — وهذا أمر صعب جدًا إتقانه.
  • MIT وبمستوى تجاري. أوزان مفتوحة، بلا فواتير لكل عملية تصيير، وجودة مخرجات يمكن أن تمر في مقطع قصير.

أين يتعثر — وهذه أمور حقيقية:

  • توليد النص فقط ينحرف. بدون صورة مرجعية يخترع النموذج الشخص، ومع المقاطع الطويلة يتحول الوجه إلى لقطة قريبة غريبة وشمعية ويتبدل المشهد — واضح في العينة الثالثة أعلاه.
  • بطيء وثقيل. حوالي 44 ثانية حوسبة لكل 1 ثانية فيديو، مع إشغال بطاقة 40 GB طوال الوقت. مقطع 82 ثانية يعني ساعة.
  • 40 GB هي الحد الأدنى. احتجنا INT8 + تقطير لمجرد أن يتسع، ولم تنجُ المقاطع متعددة الأجزاء إلا عبر تفريغ KV-cache إلى CPU. البطاقات الأصغر غير مناسبة.
  • بطاقة واحدة فقط عمليًا. توازي السياق متعدد GPU تعطل بتوقف متبادل على جهازنا، لذا لا توجد طريقة سهلة لتسريع مقطع واحد بإضافة بطاقات.
  • لا صوت. يقود الشفاه من الصوت الذي تزوده به — ولا يقدم تحويل النص إلى كلام ولا استنساخ الصوت، لذا ما زلت بحاجة إلى مصدر صوت منفصل.
  • 480p على هذا العتاد. ما استطعنا تشغيله على بطاقة واحدة بسعة 40 GB كان مخرجات من فئة 480p.

استضافة LongCat ذاتيًا مقابل أداة مستضافة: أيهما تختار؟

كلاهما ينتج الشيء نفسه — صورة مع صوت تتحول إلى فيديو ناطق. الفرق كله في ما ستدفعه لتصل إلى ذلك. أداة مستضافة مثل VisionStory تشغّل النموذج نيابةً عنك؛ وهذه هي المقايضة بصراحة.

 LongCat (استضافة ذاتية)VisionStory (مستضاف)
العتادA100/A800 بسعة 40 GB (بآلاف الدولارات)لا شيء — يعمل في المتصفح
الإعدادCUDA وflash-attn وINT8 وإصلاح الاعتماديات وضبط OOMسجّل الدخول وابدأ
الوقت لكل مقطعحوالي 44 ثانية حوسبة لكل 1 ثانية فيديو (مقطع 82 ثانية ≈ 1 ساعة)ثوانٍ، على وحدات GPU مستضافة
الدقة (تشغيلنا)من فئة 480pفيديو عالي الدقة وما فوق
الصوتأنت توفر الصوت (بدون TTS/استنساخ)أصوات مدمجة واستنساخ الصوت
الاستخدام التجارينعم (MIT)نعم (حسب الخطة)
الصيانةأنت تُحدّث الاعتماديات وتعالج OOM وبرامج التشغيللا شيء
الأفضل عندمالديك وحدات GPU وتحتاج استضافة ذاتية/دون اتصال/داخل المؤسسةتريد فيديو ناطقًا جاهزًا بسرعة

اختر LongCat إذا كان لديك العتاد وكان العمل يجب فعلًا أن يكون مستضافًا ذاتيًا — داخل المؤسسة، دون اتصال، أو تحت سيطرتك بالكامل — وكنت مرتاحًا لإدارة منظومة CUDA. واختر أداة مستضافة إذا كنت تريد نفس فيديو الصورة + الصوت الناطق بدون ساعة من الحوسبة وGPU بسعر من خمسة أرقام.

ماذا علّمنا LongCat

الدرس الحقيقي من تشغيل LongCat-Video-Avatar هو أن جودة فيديوهات الأفاتار المفتوحة وصلت — مع صورة مرجعية، ينتج هذا النموذج المجاني مقاطع جيدة بما يكفي للاستخدام الحقيقي. لم يعد النموذج هو الجزء الأصعب.

الجزء الأصعب هو كل ما حوله: إدخال نموذج نشر فيديو على بطاقة يمكنك تحملها، والنجاة من OOM في الجزء الثاني، وانتظار ساعة مقابل 82 ثانية، وربطه بمصدر صوت. تلك الفجوة — بين نقطة تحقق قوية وفيديو ناطق مكتمل يمكن لأي شخص صنعه — هي بالضبط العمل الذي نقوم به. إذا أردت رؤية الجانب الآخر منها، يحوّل VisionStory صورة ونصًا إلى أفاتار ناطق متزامن الشفاه في متصفحك خلال ثوانٍ، وإذا كنت تحتاج الصوت أيضًا، فمراجعتنا التفكيكية لـ TTS مفتوح المصدر تغطي أين وصل ذلك النصف اليوم.

الأسئلة الشائعة

  • نعم. تم إصدار LongCat-Video-Avatar 1.5 بموجب ترخيص MIT الذي يتيح الاستخدام التجاري، ولا توجد فوترة لكل عملية تصيير. أنت تدفع فقط مقابل حوسبة GPU التي يستهلكها.