Meituan đã open-source LongCat-Video-Avatar 1.5, và nó làm đúng điều VisionStory cốt lõi đang làm — biến một bức ảnh tĩnh cộng với một track âm thanh thành video avatar biết nói. Điều đó khiến chúng tôi đủ tò mò để chạy thử thật. Đây là bài “mổ xẻ” thực chiến: nó là gì, hiệu năng thực sự ra sao, 5 cái bẫy cài đặt mà chúng tôi gặp phải, và chi phí khi tự chạy so với dùng công cụ được host. Nguồn: github.com/meituan-longcat/LongCat-Video (MIT).

LongCat-Video-Avatar là gì, và ai làm ra nó?

LongCat-Video-Avatar 1.5 là một mô hình video người điều khiển bằng âm thanh (audio-driven human video) với trọng số mở từ Meituan (đội LongCat). Nó được xây dựng trên foundation model LongCat-Video và phát hành theo giấy phép MIT “thoáng” — thực sự miễn phí để dùng thương mại. Tính đến 2026-07, repo code có khoảng 5 200 sao trên GitHub và weights 1.5 nằm trong số những bản phát hành gần đây được yêu thích hơn trên Hugging Face.

Nó hỗ trợ 3 tác vụ gốc: Audio + Text to Video (AT2V, không có ảnh tham chiếu), Audio + Text + Image to Video (ATI2V — ảnh tham chiếu điều khiển nhận diện, đúng với quy trình avatar thực tế), và video continuation để kéo dài clip qua nhiều đoạn. Phiên bản 1.5 thay audio encoder sang Whisper-Large, giúp tạo chuyển động khớp môi. Quan trọng là nó điều khiển môi và biểu cảm từ bất kỳ âm thanh nào bạn đưa vào — nó không tạo ra hay nhân bản giọng nói.

Chúng tôi đã chạy thật (một A800-40GB)

Không nói suông — chúng tôi chạy cả 3 tác vụ trên một NVIDIA A800-SXM4-40GB (torch 2.8+cu128, driver 550), với cấu hình INT8-quantized + distill 8 bước, vốn là mức cần thiết để nhét một mô hình video-diffusion cỡ này vào card 40 GB. Dưới đây là diễn biến thực tế, không tô hồng.

5 cái bẫy chúng tôi gặp

  • Thiếu phụ thuộc tách giọng. Pipeline âm thanh cần model Kim_Vocal_2 thông qua audio-separator, nhưng không có trong requirements mặc định — lần chạy đầu tiên “chết” cho đến khi pip install audio-separator==0.30.2.
  • Trình ghi video bị lỗi. Lưu frame thất bại với lỗi TiffWriter got an unexpected keyword argument fps vì imageio không tìm thấy ffmpeg writer — sửa bằng pip install imageio-ffmpeg==0.6.0.
  • Deadlock đa GPU. Chạy một job trên nhiều card (context-parallel size 2 hoặc 8) bị treo do NCCL collective desync — cả hai rank chờ nhau cho đến khi timeout 600s hủy run. Chúng tôi chỉ có thể chạy một card. INT8 weights vẫn vừa một card 40 GB, nên đa GPU chỉ hữu ích để chạy nhiều job song song, chứ không giúp tăng tốc một job.
  • Hết bộ nhớ ở segment thứ hai. Clip dài được tạo bằng cách nối segment này sang segment khác, và bước continuation giữ KV-cache 48 lớp trong VRAM. Trên card 40 GB, segment thứ hai đẩy lên đỉnh rồi crash — thiếu khoảng 160 MiB để vừa. Chúng tôi phải lộ và bật flag --offload_kv_cache (đẩy cache sang RAM CPU và nạp lại theo từng step) đồng thời đặt PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Nó chạy được, đổi lại segment chậm hơn.
  • Căn chỉnh độ phân giải. 480p dưới chế độ song song đa card vướng ràng buộc chiều cao/chiều rộng phải chia hết cho 64; chạy một card thì tránh được.

Tốc độ và bộ nhớ (đo thực tế)

Đây là con số quan trọng nhất: một clip 82 giây mất 3 586 giây — gần 1 giờ — trên A800, tức khoảng 44 giây tính toán cho mỗi 1 giây video thành phẩm (xấp xỉ 138s cho mỗi segment, tổng 26 segment). Một clip ngắn 10 giây vẫn sẽ khoảng 7 phút. Và tải không hề nhẹ: VRAM tăng vọt chỉ trong vài giây rồi ghim ở 40 500 MiB — 98,9% của card 40 GB — suốt toàn bộ quá trình render. Dưới đây là mức sử dụng thực tế chúng tôi lấy mẫu mỗi giây:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Các mẫu chúng tôi render

Mỗi clip bên dưới đều do chúng tôi render trên A800 đã mô tả ở trên. Để benchmark mô hình đúng theo các kịch bản mà nó nhắm tới, chúng tôi chạy bằng chính bộ input demo chính thức của dự án (ảnh chân dung tham chiếu và audio) thay vì tự tuyển chọn — vì vậy đây là các đầu ra trung thực, không “cherry-pick”, không phải một video tổng hợp highlight. Hai clip đầu tiên mỗi clip đều được chạy với ảnh tham chiếu riêng:

Hai ảnh tham chiếu: một ca sĩ solo cho clip ảnh + audio và một cảnh phòng thu có hai người cho clip nhiều người nói

Trái: ảnh tham chiếu cho clip ảnh + audio. Phải: ảnh tham chiếu cho clip nhiều người nói (một ảnh, hai người). Clip thứ ba bên dưới chạy bằng text + audio với không có ảnh tham chiếu — mô hình tự “bịa” ra nhân vật, và đây cũng là phần nó yếu nhất.

Ảnh + âm thanh (ATI2V) — đúng quy trình avatar. Nhận diện giữ ổn, miệng bám theo đoạn hát.
Nhiều người nói — 2 người, 2 track âm thanh, mỗi miệng được điều khiển độc lập.
Chỉ text + audio, không có ảnh tham chiếu (AT2V) — trường hợp yếu: nhìn mặt bị méo và “trôi” dần.

Render bởi VisionStory với LongCat-Video-Avatar 1.5 trên NVIDIA A800, 2026-07-15, ở độ phân giải lớp 480p (768×512 / 832×480), dùng các input demo chính thức của mô hình.

Kết luận thẳng thắn: mạnh khi có ảnh, đuối khi không có

Những điều thực sự làm chúng tôi ấn tượng:

  • Nhận diện giữ vững. Trong clip có ảnh tham chiếu, nhân vật vẫn là một người xuyên suốt 82 giây — tóc, trang phục, gương mặt — trong khi miệng bám theo âm thanh. Đây là trường hợp quan trọng nhất với avatar, và nó làm được.
  • Nhiều người nói hoạt động thật. Hai người trong một cảnh, mỗi người được điều khiển khớp môi bằng track âm thanh riêng, vẫn giữ được tính nhất quán — một bài toán khó thật sự.
  • MIT và đủ “chuẩn thương mại”. Trọng số mở, không tính phí theo lần render, và chất lượng đầu ra đủ ổn cho một clip ngắn.

Những điểm hụt hơi — và đều là thật:

  • Tạo chỉ từ text bị trôi. Không có ảnh tham chiếu thì mô hình tự bịa nhân vật, và trong clip dài gương mặt bị méo thành kiểu “uncanny”, bóng sáp cận cảnh, cảnh nền cũng đổi — thấy rõ ở mẫu thứ ba phía trên.
  • Chậm và nặng. ~44s tính toán cho 1s video, ghim kín card 40 GB suốt thời gian chạy. Clip 82 giây là 1 giờ.
  • 40 GB là mức sàn. Lần chạy của chúng tôi cần INT8 + distill chỉ để vừa, và clip nhiều segment chỉ sống sót nhờ offload KV-cache sang CPU. Card nhỏ hơn coi như không chơi được.
  • Thực tế chỉ chạy một card. Context-parallel đa GPU bị deadlock trên máy chúng tôi, nên không có cách dễ để làm một clip nhanh hơn chỉ bằng cách thêm card.
  • Không có giọng. Nó điều khiển môi từ âm thanh bạn đưa vào — không làm chuyển văn bản thành giọng nói hay nhân bản giọng nói, nên bạn vẫn cần một nguồn giọng nói riêng.
  • 480p với phần cứng này. Mức chúng tôi chạy được trên một card 40 GB là đầu ra lớp 480p.

Tự host LongCat vs dùng công cụ được host: nên chọn cái nào?

Cả hai đều tạo ra cùng một thứ — ảnh cộng âm thanh thành video nói chuyện. Khác biệt nằm hoàn toàn ở chi phí bạn phải trả để đi đến kết quả đó. Một công cụ được host như VisionStory sẽ chạy mô hình thay bạn; đây là so sánh thẳng thắn.

 LongCat (tự host)VisionStory (được host)
Phần cứngA100/A800 40 GB (vài nghìn đô)Không cần — chạy ngay trong trình duyệt
Cài đặtCUDA, flash-attn, INT8, sửa dep, tinh chỉnh OOMĐăng nhập là dùng
Thời gian mỗi clip~44s tính toán cho 1s video (clip 82s ≈ 1 giờ)Vài giây, trên GPU được host
Độ phân giải (lần chạy của chúng tôi)Lớp 480pVideo HD trở lên
Giọng nóiBạn tự cung cấp âm thanh (không TTS/clone)Có sẵn giọng nói và nhân bản giọng nói
Dùng thương mạiCó (MIT)Có (tùy gói)
Bảo trìBạn tự vá dep, xử lý OOM, driverKhông cần
Phù hợp nhất khiBạn có GPU và cần tự host/offline/on-premBạn muốn ra video nói chuyện hoàn chỉnh, thật nhanh

Chọn LongCat nếu bạn có phần cứng và công việc bắt buộc phải tự host — on-prem, offline, hoặc hoàn toàn trong tầm kiểm soát của bạn — và bạn sẵn sàng duy trì cả stack CUDA. Chọn công cụ được host nếu bạn muốn video nói chuyện kiểu ảnh + âm thanh tương tự mà không phải chờ 1 giờ tính toán và mua GPU giá 5 chữ số.

LongCat dạy chúng tôi điều gì

Bài học lớn nhất khi chạy LongCat-Video-Avatar là chất lượng video avatar mã nguồn mở đã tới ngưỡng dùng được — với một ảnh tham chiếu, mô hình miễn phí này tạo ra clip đủ tốt để dùng thật. Bản thân mô hình không còn là phần khó nhất.

Phần khó là mọi thứ xung quanh: nhét một mô hình video-diffusion vào chiếc card bạn có thể mua được, sống sót qua OOM ở segment thứ hai, chờ 1 giờ để có 82 giây, và ghép thêm một giọng nói. Khoảng trống đó — giữa một checkpoint đủ mạnh và một video nói chuyện hoàn chỉnh mà ai cũng có thể làm — chính là thứ chúng tôi đang giải quyết. Nếu bạn muốn thấy “mặt còn lại” của bài toán, VisionStory biến một bức ảnh và một kịch bản thành talking avatar khớp môi ngay trong trình duyệt chỉ trong vài giây; và nếu bạn còn cần cả giọng nói, bài mổ xẻ của chúng tôi về open-source TTS sẽ cho bạn biết nửa còn lại hiện đang ở đâu.

Câu hỏi thường gặp

  • Có. LongCat-Video-Avatar 1.5 được phát hành theo giấy phép MIT, cho phép sử dụng thương mại và không tính phí theo mỗi lần render. Bạn chỉ trả chi phí cho phần tài nguyên GPU mà nó tiêu thụ.