Meituan เปิดซอร์ส LongCat-Video-Avatar 1.5 และมันทำสิ่งเดียวกับแก่นหลักของ VisionStory แบบเป๊ะ ๆ — เปลี่ยน “รูปนิ่ง + แทร็กเสียง” ให้เป็นวิดีโออวาตาร์พูดได้ นั่นทำให้เราสนใจพอที่จะลองรันจริง บทความนี้คือการแกะให้ดูแบบลงมือทำ: มันคืออะไร ทำได้ดีแค่ไหนจริง เจอกับดักการติดตั้ง 5 จุดอะไรบ้าง และต้นทุนเมื่อรันเองเทียบกับเครื่องมือแบบโฮสต์เป็นอย่างไร แหล่งที่มา: github.com/meituan-longcat/LongCat-Video (MIT).

LongCat-Video-Avatar คืออะไร และใครเป็นคนทำ?

LongCat-Video-Avatar 1.5 คือโมเดล วิดีโอมนุษย์ที่ขับเคลื่อนด้วยเสียง แบบ open-weight จาก Meituan (ทีม LongCat) สร้างบน foundation model อย่าง LongCat-Video และปล่อยภายใต้ไลเซนส์ MIT ที่อนุญาตกว้าง — ใช้เชิงพาณิชย์ได้ฟรีจริง ณ 2026-07 repo มีประมาณ 5,200 GitHub stars และเวต 1.5 ก็เป็นหนึ่งในรีลีสล่าสุดที่คนกดชอบเยอะบน Hugging Face.

มันรองรับงานหลัก 3 แบบ: Audio + Text to Video (AT2V, ไม่มีภาพอ้างอิง), Audio + Text + Image to Video (ATI2V — ใช้รูปอ้างอิงกำหนดตัวตน ซึ่งตรงกับเวิร์กโฟลว์อวาตาร์จริง), และ video continuation เพื่อขยายคลิปให้ยาวกว่าหนึ่งเซกเมนต์ เวอร์ชัน 1.5 เปลี่ยนมาใช้เอนโค้ดเดอร์เสียง Whisper-Large ซึ่งเป็นตัวทำให้การขยับปากเกิดขึ้น ที่สำคัญคือมัน ขับเคลื่อนริมฝีปากและสีหน้าจากเสียงที่คุณป้อนให้ — มันไม่ได้สร้างหรือโคลนเสียง

เรารันจริงมาแล้ว (A800-40GB ใบเดียว)

ไม่พูดลอย ๆ — เรารันครบทั้ง 3 งานบน NVIDIA A800-SXM4-40GB ใบเดียว (torch 2.8+cu128, ไดรเวอร์ 550) โดยใช้คอนฟิก INT8-quantized + distill 8 สเต็ป ของโมเดล ซึ่งเป็นสิ่งที่ต้องทำเพื่อให้โมเดล video-diffusion ขนาดนี้ลงการ์ด 40 GB ได้ นี่คือเหตุการณ์แบบตรงไปตรงมา

กับดัก 5 จุดที่เราเจอ

  • ขาด dependency แยกเสียงร้อง พายป์ไลน์เสียงต้องใช้โมเดล Kim_Vocal_2 ผ่าน audio-separator ซึ่งไม่ได้อยู่ใน requirements เริ่มต้น — รันครั้งแรกพังจนต้อง pip install audio-separator==0.30.2
  • ตัวเขียนวิดีโอพัง การเซฟเฟรมล้มเหลวด้วยเออร์เรอร์ TiffWriter got an unexpected keyword argument fps เพราะ imageio หา ffmpeg writer ไม่เจอ — แก้ด้วย pip install imageio-ffmpeg==0.6.0
  • Multi-GPU เดดล็อก รันงานเดียวข้ามหลายการ์ด (context-parallel size 2 หรือ 8) ค้างเพราะ NCCL collective desync — ทั้งสอง rank รอกันเองจน timeout 600s แล้วรันถูกยกเลิก เรารันได้แค่ การ์ดเดียว เท่านั้น เวต INT8 ใส่การ์ด 40 GB ใบเดียวได้อยู่แล้ว ดังนั้น multi-GPU จึงมีประโยชน์แค่รันหลายงานคู่ขนาน ไม่ได้ช่วยให้ “งานเดียว” เร็วขึ้น
  • หน่วยความจำไม่พอในเซกเมนต์ที่ 2 คลิปยาวทำโดยต่อเซกเมนต์ไปเรื่อย ๆ และขั้น continuation เก็บ KV-cache 48 เลเยอร์ค้างไว้ บนการ์ด 40 GB เซกเมนต์ที่ 2 ดันแตะเพดานแล้วล้ม — ขาดอีกประมาณ 160 MiB ถึงจะพอดี เราต้องเปิดแฟลก --offload_kv_cache (ย้ายแคชไป CPU RAM แล้วเพจกลับมาทีละสเต็ป) และตั้ง PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True ถึงจะรอด ใช้ได้จริง แต่แลกกับเซกเมนต์ที่ช้าลง
  • การจัดแนวความละเอียด 480p ภายใต้ multi-card parallelism ไปชนข้อจำกัดว่าความสูง/กว้างต้องหารด้วย 64 ลงตัว; รันการ์ดเดียวไม่เจอปัญหานี้

ความเร็วและหน่วยความจำ (วัดจริง)

ตัวเลขที่สำคัญคือ: คลิปยาว 82 วินาที ใช้เวลา 3,586 วินาที — เกือบ 1 ชั่วโมง — บน A800 หรือราว ๆ เวลา compute 44 วินาทีต่อวิดีโอสำเร็จ 1 วินาที (ประมาณ 138s ต่อเซกเมนต์ที่สร้างได้ รวม 26 เซกเมนต์) คลิปสั้น 10 วินาทีก็ยังราว ๆ 7 นาที และนี่ไม่ใช่โหลดเบา ๆ: VRAM พุ่งขึ้นในไม่กี่วินาทีแล้วถูก ตรึงไว้ที่ 40,500 MiB — 98.9% ของการ์ด 40 GB — ตลอดทั้งการเรนเดอร์ นี่คือการใช้งานจริงที่เราสุ่มเก็บทุก 1 วินาที:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

ตัวอย่างที่เรารัน

ทุกคลิปด้านล่างเรเรนเดอร์เองบน A800 ที่อธิบายไว้ข้างต้น เพื่อทดสอบประสิทธิภาพโมเดลในสถานการณ์ที่ตั้งใจใช้งานจริง เราใช้เดโมอินพุตอย่างเป็นทางการของโปรเจกต์ (ภาพอ้างอิงและเสียง) แทนการคัดเลือกของเราเอง — ดังนั้นนี่คือผลลัพธ์จริงแบบไม่คัดมาเฉพาะช็อตเด่น ไม่ใช่คลิปไฮไลต์รวมมิตร โดยสองคลิปแรกต่างก็ขับเคลื่อนด้วยภาพอ้างอิงของตัวเอง:

ภาพอ้างอิง 2 ภาพ: นักร้องเดี่ยวสำหรับคลิปภาพ+เสียง และฉากสตูดิโอ 2 คนสำหรับคลิปหลายผู้พูด

ซ้าย: ภาพอ้างอิงสำหรับคลิปภาพ + เสียง ขวา: ภาพอ้างอิงสำหรับคลิปหลายผู้พูด (ภาพเดียว 2 คน) ส่วนคลิปที่ 3 ด้านล่างใช้ข้อความ + เสียงโดย ไม่มีภาพอ้างอิง — โมเดลต้องสร้างบุคคลขึ้นมาเอง ซึ่งเป็นจุดที่ทำได้อ่อนที่สุด

รูป + เสียง (ATI2V) — เวิร์กโฟลว์อวาตาร์ ตัวตนยังอยู่ ปากตามเสียงร้องได้
หลายผู้พูด — 2 คน 2 แทร็กเสียง ขยับปากแยกกันอย่างอิสระ
ข้อความ + เสียงอย่างเดียว ไม่มีรูปอ้างอิง (AT2V) — เคสที่อ่อน: ดูหน้าบิดและไหลเพี้ยน

เรนเดอร์โดย VisionStory ด้วย LongCat-Video-Avatar 1.5 บน NVIDIA A800 เมื่อ 2026-07-15 ที่ความละเอียดระดับ 480p (768×512 / 832×480) โดยใช้อินพุตเดโมทางการของโมเดล

คำตัดสินแบบตรงไปตรงมา: มีรูปแล้วดี ไม่มีรูปแล้วฝืด

สิ่งที่ทำให้เราประทับใจจริง ๆ:

  • ตัวตนคงอยู่ ในคลิปที่ขับเคลื่อนด้วยรูป คนเดิมยังเป็นคนเดิมตลอดทั้ง 82 วินาที — ผม เสื้อผ้า ใบหน้า — ขณะที่ปากตามเสียงได้ นี่คือเคสสำคัญสำหรับอวาตาร์ และมันทำได้
  • หลายผู้พูดใช้ได้จริง 2 คนในฉากเดียว แต่ละคนขยับปากตามแทร็กเสียงของตัวเองได้อย่างคงเส้นคงวา — ซึ่งเป็นเรื่องที่ทำให้ดีได้ยากมาก
  • MIT และระดับใช้งานเชิงพาณิชย์ เวตเปิด ไม่มีคิดเงินต่อการเรนเดอร์ และคุณภาพเอาต์พุตที่ผ่านได้ในคลิปสั้น

จุดที่พลาด — และพลาดจริง:

  • สร้างจากข้อความอย่างเดียวแล้วไหลเพี้ยน ถ้าไม่มีรูปอ้างอิง โมเดลจะสร้างคนขึ้นมาเอง และพอคลิปยาว ใบหน้าจะบิดเป็นโคลสอัปที่หลอน ๆ เหมือนขี้ผึ้ง และฉากก็เลื่อนเปลี่ยน — เห็นชัดในตัวอย่างที่ 3 ข้างบน
  • ช้าและหนัก ใช้ compute ~44s ต่อวิดีโอ 1s และกินการ์ด 40 GB ตลอดเวลา คลิป 82 วินาที = 1 ชั่วโมง
  • 40 GB คือขั้นต่ำ การรันของเราต้อง INT8 + distill แค่เพื่อให้ใส่ได้ และคลิปหลายเซกเมนต์รอดได้เพราะต้อง offload KV-cache ไป CPU การ์ดเล็กกว่านี้ไม่ไหว
  • ในทางปฏิบัติคือการ์ดเดียวเท่านั้น context-parallel แบบหลาย GPU เดดล็อกบนเครื่องเรา จึงไม่มีทางง่าย ๆ ที่จะทำให้คลิปเดียวเร็วขึ้นด้วยการเพิ่มการ์ด
  • ไม่มีเสียง มันขยับปากจากเสียงที่คุณให้ — ไม่ทำแปลงข้อความเป็นเสียงพูดหรือโคลนเสียง ดังนั้นคุณยังต้องมีแหล่งเสียงแยก
  • ได้แค่ 480p บนฮาร์ดแวร์นี้ สิ่งที่เรารันได้บนการ์ด 40 GB ใบเดียวคือเอาต์พุตระดับ 480p

โฮสต์ LongCat เอง vs เครื่องมือแบบโฮสต์: ควรเลือกอะไร?

ทั้งสองแบบได้ผลลัพธ์เหมือนกัน — รูป + เสียง กลายเป็นวิดีโอพูดได้ ความต่างอยู่ที่ “ต้นทุน” ที่คุณต้องจ่ายเพื่อไปถึงตรงนั้น เครื่องมือแบบโฮสต์อย่าง VisionStory จะรันโมเดลแทนคุณ นี่คือการแลกเปลี่ยนแบบตรงไปตรงมา

 LongCat (โฮสต์เอง)VisionStory (แบบโฮสต์)
ฮาร์ดแวร์A100/A800 40 GB (ราคาเป็นหลักพันดอลลาร์)ไม่ต้องมี — รันในเบราว์เซอร์
การติดตั้งCUDA, flash-attn, INT8, แก้ dependency, จูน OOMเข้าสู่ระบบแล้วใช้งานได้เลย
เวลาต่อคลิป~44s compute ต่อวิดีโอ 1s (คลิป 82s ≈ 1 ชั่วโมง)ไม่กี่วินาที บน GPU แบบโฮสต์
ความละเอียด (ที่เรารัน)ระดับ 480pวิดีโอ HD ขึ้นไป
เสียงคุณต้องเตรียมเสียงเอง (ไม่มี TTS/clone)มีเสียงในตัวและโคลนเสียง
ใช้เชิงพาณิชย์ได้ (MIT)ได้ (ตามแพ็กเกจ)
การดูแลรักษาคุณต้องแพตช์ deps, แก้ OOM, ดูแลไดรเวอร์ไม่มี
เหมาะที่สุดเมื่อคุณมี GPU และต้องโฮสต์เอง/ออฟไลน์/ออนพรีมคุณอยากได้วิดีโอพูดได้ที่เสร็จแล้ว แบบเร็ว

เลือก LongCat ถ้า คุณมีฮาร์ดแวร์ และงานจำเป็นต้องโฮสต์เองจริง ๆ — ออนพรีม ออฟไลน์ หรืออยู่ภายใต้การควบคุมของคุณทั้งหมด — และคุณโอเคกับการดูแลสแตก CUDA เลือกเครื่องมือแบบโฮสต์ ถ้า คุณอยากได้วิดีโอพูดได้แบบ “รูป + เสียง” เหมือนกัน แต่ไม่อยากเสียเวลา compute เป็นชั่วโมงและไม่อยากซื้อ GPU ราคาหลักห้าหลัก

สิ่งที่ LongCat สอนเรา

บทเรียนจริงจากการรัน LongCat-Video-Avatar คือ คุณภาพวิดีโออวาตาร์แบบโอเพนมาถึงแล้ว — เมื่อมีรูปอ้างอิง โมเดลฟรีนี้ให้คลิปที่ดีพอสำหรับใช้งานจริง โมเดลไม่ใช่ส่วนที่ยากที่สุดอีกต่อไป

สิ่งที่ยากคือทุกอย่างรอบ ๆ: ทำยังไงให้โมเดล video-diffusion ลงการ์ดที่คุณซื้อไหว เอาตัวรอดจาก OOM ในเซกเมนต์ที่ 2 รอ 1 ชั่วโมงเพื่อได้ 82 วินาที และจับคู่กับเสียง ช่องว่างนั้น — ระหว่างเช็กพอยต์ที่เก่ง กับวิดีโอพูดได้ที่ “ใคร ๆ ก็ทำได้” — คือสิ่งที่เราทำพอดี ถ้าอยากเห็นอีกฝั่งหนึ่ง VisionStory เปลี่ยนรูปกับสคริปต์ให้เป็น talking avatar ซิงก์ปากในเบราว์เซอร์ของคุณได้ภายในไม่กี่วินาที และถ้าคุณต้องการเสียงด้วย บทความแกะของเราเกี่ยวกับ open-source TTS ก็สรุปไว้แล้วว่าฝั่งนั้นไปถึงไหนแล้ว

คำถามที่พบบ่อย

  • ได้ฟรี LongCat-Video-Avatar 1.5 เผยแพร่ภายใต้สัญญาอนุญาต MIT ซึ่งอนุญาตให้ใช้เชิงพาณิชย์ และไม่มีการคิดเงินต่อการเรนเดอร์ คุณจ่ายเพียงค่า GPU compute ที่มันใช้เท่านั้น