Meituan เปิดซอร์ส LongCat-Video-Avatar 1.5 และมันทำสิ่งเดียวกับแก่นหลักของ VisionStory แบบเป๊ะ ๆ — เปลี่ยน “รูปนิ่ง + แทร็กเสียง” ให้เป็นวิดีโออวาตาร์พูดได้ นั่นทำให้เราสนใจพอที่จะลองรันจริง บทความนี้คือการแกะให้ดูแบบลงมือทำ: มันคืออะไร ทำได้ดีแค่ไหนจริง เจอกับดักการติดตั้ง 5 จุดอะไรบ้าง และต้นทุนเมื่อรันเองเทียบกับเครื่องมือแบบโฮสต์เป็นอย่างไร แหล่งที่มา: github.com/meituan-longcat/LongCat-Video (MIT).
LongCat-Video-Avatar คืออะไร และใครเป็นคนทำ?
LongCat-Video-Avatar 1.5 คือโมเดล วิดีโอมนุษย์ที่ขับเคลื่อนด้วยเสียง แบบ open-weight จาก Meituan (ทีม LongCat) สร้างบน foundation model อย่าง LongCat-Video และปล่อยภายใต้ไลเซนส์ MIT ที่อนุญาตกว้าง — ใช้เชิงพาณิชย์ได้ฟรีจริง ณ 2026-07 repo มีประมาณ 5,200 GitHub stars และเวต 1.5 ก็เป็นหนึ่งในรีลีสล่าสุดที่คนกดชอบเยอะบน Hugging Face.
มันรองรับงานหลัก 3 แบบ: Audio + Text to Video (AT2V, ไม่มีภาพอ้างอิง), Audio + Text + Image to Video (ATI2V — ใช้รูปอ้างอิงกำหนดตัวตน ซึ่งตรงกับเวิร์กโฟลว์อวาตาร์จริง), และ video continuation เพื่อขยายคลิปให้ยาวกว่าหนึ่งเซกเมนต์ เวอร์ชัน 1.5 เปลี่ยนมาใช้เอนโค้ดเดอร์เสียง Whisper-Large ซึ่งเป็นตัวทำให้การขยับปากเกิดขึ้น ที่สำคัญคือมัน ขับเคลื่อนริมฝีปากและสีหน้าจากเสียงที่คุณป้อนให้ — มันไม่ได้สร้างหรือโคลนเสียง
เรารันจริงมาแล้ว (A800-40GB ใบเดียว)
ไม่พูดลอย ๆ — เรารันครบทั้ง 3 งานบน NVIDIA A800-SXM4-40GB ใบเดียว (torch 2.8+cu128, ไดรเวอร์ 550) โดยใช้คอนฟิก INT8-quantized + distill 8 สเต็ป ของโมเดล ซึ่งเป็นสิ่งที่ต้องทำเพื่อให้โมเดล video-diffusion ขนาดนี้ลงการ์ด 40 GB ได้ นี่คือเหตุการณ์แบบตรงไปตรงมา
กับดัก 5 จุดที่เราเจอ
- ขาด dependency แยกเสียงร้อง พายป์ไลน์เสียงต้องใช้โมเดล Kim_Vocal_2 ผ่าน
audio-separatorซึ่งไม่ได้อยู่ใน requirements เริ่มต้น — รันครั้งแรกพังจนต้องpip install audio-separator==0.30.2 - ตัวเขียนวิดีโอพัง การเซฟเฟรมล้มเหลวด้วยเออร์เรอร์
TiffWriter got an unexpected keyword argument fpsเพราะ imageio หา ffmpeg writer ไม่เจอ — แก้ด้วยpip install imageio-ffmpeg==0.6.0 - Multi-GPU เดดล็อก รันงานเดียวข้ามหลายการ์ด (context-parallel size 2 หรือ 8) ค้างเพราะ NCCL collective desync — ทั้งสอง rank รอกันเองจน timeout 600s แล้วรันถูกยกเลิก เรารันได้แค่ การ์ดเดียว เท่านั้น เวต INT8 ใส่การ์ด 40 GB ใบเดียวได้อยู่แล้ว ดังนั้น multi-GPU จึงมีประโยชน์แค่รันหลายงานคู่ขนาน ไม่ได้ช่วยให้ “งานเดียว” เร็วขึ้น
- หน่วยความจำไม่พอในเซกเมนต์ที่ 2 คลิปยาวทำโดยต่อเซกเมนต์ไปเรื่อย ๆ และขั้น continuation เก็บ KV-cache 48 เลเยอร์ค้างไว้ บนการ์ด 40 GB เซกเมนต์ที่ 2 ดันแตะเพดานแล้วล้ม — ขาดอีกประมาณ 160 MiB ถึงจะพอดี เราต้องเปิดแฟลก
--offload_kv_cache(ย้ายแคชไป CPU RAM แล้วเพจกลับมาทีละสเต็ป) และตั้งPYTORCH_CUDA_ALLOC_CONF=expandable_segments:Trueถึงจะรอด ใช้ได้จริง แต่แลกกับเซกเมนต์ที่ช้าลง - การจัดแนวความละเอียด 480p ภายใต้ multi-card parallelism ไปชนข้อจำกัดว่าความสูง/กว้างต้องหารด้วย 64 ลงตัว; รันการ์ดเดียวไม่เจอปัญหานี้
ความเร็วและหน่วยความจำ (วัดจริง)
ตัวเลขที่สำคัญคือ: คลิปยาว 82 วินาที ใช้เวลา 3,586 วินาที — เกือบ 1 ชั่วโมง — บน A800 หรือราว ๆ เวลา compute 44 วินาทีต่อวิดีโอสำเร็จ 1 วินาที (ประมาณ 138s ต่อเซกเมนต์ที่สร้างได้ รวม 26 เซกเมนต์) คลิปสั้น 10 วินาทีก็ยังราว ๆ 7 นาที และนี่ไม่ใช่โหลดเบา ๆ: VRAM พุ่งขึ้นในไม่กี่วินาทีแล้วถูก ตรึงไว้ที่ 40,500 MiB — 98.9% ของการ์ด 40 GB — ตลอดทั้งการเรนเดอร์ นี่คือการใช้งานจริงที่เราสุ่มเก็บทุก 1 วินาที:
ตัวอย่างที่เรารัน
ทุกคลิปด้านล่างเรเรนเดอร์เองบน A800 ที่อธิบายไว้ข้างต้น เพื่อทดสอบประสิทธิภาพโมเดลในสถานการณ์ที่ตั้งใจใช้งานจริง เราใช้เดโมอินพุตอย่างเป็นทางการของโปรเจกต์ (ภาพอ้างอิงและเสียง) แทนการคัดเลือกของเราเอง — ดังนั้นนี่คือผลลัพธ์จริงแบบไม่คัดมาเฉพาะช็อตเด่น ไม่ใช่คลิปไฮไลต์รวมมิตร โดยสองคลิปแรกต่างก็ขับเคลื่อนด้วยภาพอ้างอิงของตัวเอง:
ซ้าย: ภาพอ้างอิงสำหรับคลิปภาพ + เสียง ขวา: ภาพอ้างอิงสำหรับคลิปหลายผู้พูด (ภาพเดียว 2 คน) ส่วนคลิปที่ 3 ด้านล่างใช้ข้อความ + เสียงโดย ไม่มีภาพอ้างอิง — โมเดลต้องสร้างบุคคลขึ้นมาเอง ซึ่งเป็นจุดที่ทำได้อ่อนที่สุด
เรนเดอร์โดย VisionStory ด้วย LongCat-Video-Avatar 1.5 บน NVIDIA A800 เมื่อ 2026-07-15 ที่ความละเอียดระดับ 480p (768×512 / 832×480) โดยใช้อินพุตเดโมทางการของโมเดล
คำตัดสินแบบตรงไปตรงมา: มีรูปแล้วดี ไม่มีรูปแล้วฝืด
สิ่งที่ทำให้เราประทับใจจริง ๆ:
- ตัวตนคงอยู่ ในคลิปที่ขับเคลื่อนด้วยรูป คนเดิมยังเป็นคนเดิมตลอดทั้ง 82 วินาที — ผม เสื้อผ้า ใบหน้า — ขณะที่ปากตามเสียงได้ นี่คือเคสสำคัญสำหรับอวาตาร์ และมันทำได้
- หลายผู้พูดใช้ได้จริง 2 คนในฉากเดียว แต่ละคนขยับปากตามแทร็กเสียงของตัวเองได้อย่างคงเส้นคงวา — ซึ่งเป็นเรื่องที่ทำให้ดีได้ยากมาก
- MIT และระดับใช้งานเชิงพาณิชย์ เวตเปิด ไม่มีคิดเงินต่อการเรนเดอร์ และคุณภาพเอาต์พุตที่ผ่านได้ในคลิปสั้น
จุดที่พลาด — และพลาดจริง:
- สร้างจากข้อความอย่างเดียวแล้วไหลเพี้ยน ถ้าไม่มีรูปอ้างอิง โมเดลจะสร้างคนขึ้นมาเอง และพอคลิปยาว ใบหน้าจะบิดเป็นโคลสอัปที่หลอน ๆ เหมือนขี้ผึ้ง และฉากก็เลื่อนเปลี่ยน — เห็นชัดในตัวอย่างที่ 3 ข้างบน
- ช้าและหนัก ใช้ compute ~44s ต่อวิดีโอ 1s และกินการ์ด 40 GB ตลอดเวลา คลิป 82 วินาที = 1 ชั่วโมง
- 40 GB คือขั้นต่ำ การรันของเราต้อง INT8 + distill แค่เพื่อให้ใส่ได้ และคลิปหลายเซกเมนต์รอดได้เพราะต้อง offload KV-cache ไป CPU การ์ดเล็กกว่านี้ไม่ไหว
- ในทางปฏิบัติคือการ์ดเดียวเท่านั้น context-parallel แบบหลาย GPU เดดล็อกบนเครื่องเรา จึงไม่มีทางง่าย ๆ ที่จะทำให้คลิปเดียวเร็วขึ้นด้วยการเพิ่มการ์ด
- ไม่มีเสียง มันขยับปากจากเสียงที่คุณให้ — ไม่ทำแปลงข้อความเป็นเสียงพูดหรือโคลนเสียง ดังนั้นคุณยังต้องมีแหล่งเสียงแยก
- ได้แค่ 480p บนฮาร์ดแวร์นี้ สิ่งที่เรารันได้บนการ์ด 40 GB ใบเดียวคือเอาต์พุตระดับ 480p
โฮสต์ LongCat เอง vs เครื่องมือแบบโฮสต์: ควรเลือกอะไร?
ทั้งสองแบบได้ผลลัพธ์เหมือนกัน — รูป + เสียง กลายเป็นวิดีโอพูดได้ ความต่างอยู่ที่ “ต้นทุน” ที่คุณต้องจ่ายเพื่อไปถึงตรงนั้น เครื่องมือแบบโฮสต์อย่าง VisionStory จะรันโมเดลแทนคุณ นี่คือการแลกเปลี่ยนแบบตรงไปตรงมา
| LongCat (โฮสต์เอง) | VisionStory (แบบโฮสต์) | |
|---|---|---|
| ฮาร์ดแวร์ | A100/A800 40 GB (ราคาเป็นหลักพันดอลลาร์) | ไม่ต้องมี — รันในเบราว์เซอร์ |
| การติดตั้ง | CUDA, flash-attn, INT8, แก้ dependency, จูน OOM | เข้าสู่ระบบแล้วใช้งานได้เลย |
| เวลาต่อคลิป | ~44s compute ต่อวิดีโอ 1s (คลิป 82s ≈ 1 ชั่วโมง) | ไม่กี่วินาที บน GPU แบบโฮสต์ |
| ความละเอียด (ที่เรารัน) | ระดับ 480p | วิดีโอ HD ขึ้นไป |
| เสียง | คุณต้องเตรียมเสียงเอง (ไม่มี TTS/clone) | มีเสียงในตัวและโคลนเสียง |
| ใช้เชิงพาณิชย์ | ได้ (MIT) | ได้ (ตามแพ็กเกจ) |
| การดูแลรักษา | คุณต้องแพตช์ deps, แก้ OOM, ดูแลไดรเวอร์ | ไม่มี |
| เหมาะที่สุดเมื่อ | คุณมี GPU และต้องโฮสต์เอง/ออฟไลน์/ออนพรีม | คุณอยากได้วิดีโอพูดได้ที่เสร็จแล้ว แบบเร็ว |
เลือก LongCat ถ้า คุณมีฮาร์ดแวร์ และงานจำเป็นต้องโฮสต์เองจริง ๆ — ออนพรีม ออฟไลน์ หรืออยู่ภายใต้การควบคุมของคุณทั้งหมด — และคุณโอเคกับการดูแลสแตก CUDA เลือกเครื่องมือแบบโฮสต์ ถ้า คุณอยากได้วิดีโอพูดได้แบบ “รูป + เสียง” เหมือนกัน แต่ไม่อยากเสียเวลา compute เป็นชั่วโมงและไม่อยากซื้อ GPU ราคาหลักห้าหลัก
สิ่งที่ LongCat สอนเรา
บทเรียนจริงจากการรัน LongCat-Video-Avatar คือ คุณภาพวิดีโออวาตาร์แบบโอเพนมาถึงแล้ว — เมื่อมีรูปอ้างอิง โมเดลฟรีนี้ให้คลิปที่ดีพอสำหรับใช้งานจริง โมเดลไม่ใช่ส่วนที่ยากที่สุดอีกต่อไป
สิ่งที่ยากคือทุกอย่างรอบ ๆ: ทำยังไงให้โมเดล video-diffusion ลงการ์ดที่คุณซื้อไหว เอาตัวรอดจาก OOM ในเซกเมนต์ที่ 2 รอ 1 ชั่วโมงเพื่อได้ 82 วินาที และจับคู่กับเสียง ช่องว่างนั้น — ระหว่างเช็กพอยต์ที่เก่ง กับวิดีโอพูดได้ที่ “ใคร ๆ ก็ทำได้” — คือสิ่งที่เราทำพอดี ถ้าอยากเห็นอีกฝั่งหนึ่ง VisionStory เปลี่ยนรูปกับสคริปต์ให้เป็น talking avatar ซิงก์ปากในเบราว์เซอร์ของคุณได้ภายในไม่กี่วินาที และถ้าคุณต้องการเสียงด้วย บทความแกะของเราเกี่ยวกับ open-source TTS ก็สรุปไว้แล้วว่าฝั่งนั้นไปถึงไหนแล้ว
