Meituan mengopen-source LongCat-Video-Avatar 1.5, dan ia melakukan tepat apa yang VisionStory lakukan pada terasnya — menukar foto pegun bersama trek audio menjadi video avatar bercakap. Itu membuatkan kami cukup ingin tahu untuk benar-benar menjalankannya. Ini ialah bedah siasat hands-on: apa ia, sejauh mana prestasinya sebenarnya, lima perangkap persediaan yang kami hadapi, dan berapa kos untuk jalankan sendiri berbanding alat berhos. Sumber: github.com/meituan-longcat/LongCat-Video (MIT).

Apa itu LongCat-Video-Avatar, dan siapa yang membangunkannya?

LongCat-Video-Avatar 1.5 ialah model video manusia dipacu audio berbobot terbuka daripada Meituan (pasukan LongCat). Ia dibina berasaskan model asas LongCat-Video dan dikeluarkan di bawah lesen MIT yang longgar — benar-benar percuma untuk kegunaan komersial. Setakat 2026-07, repo kodnya mempunyai kira-kira 5,200 bintang GitHub dan pemberat 1.5 ialah antara keluaran terkini yang lebih digemari di Hugging Face.

Ia menyokong tiga tugasan natif: Audio + Text to Video (AT2V, tiada imej rujukan), Audio + Text + Image to Video (ATI2V — foto rujukan memacu identiti, kes yang sepadan dengan aliran kerja avatar sebenar), dan sambungan video untuk memanjangkan klip melepasi satu segmen. Versi 1.5 menggantikan pengekod audio Whisper-Large, yang memberikan pergerakan bibirnya. Yang penting, ia memacu bibir dan ekspresi daripada apa jua audio yang anda berikan — ia tidak menjana atau meniru Suara.

Kami benar-benar menjalankannya (A800-40GB tunggal)

Tiada cakap kosong — kami menjalankan ketiga-tiga tugasan pada satu NVIDIA A800-SXM4-40GB (torch 2.8+cu128, pemacu 550), dalam konfigurasi model INT8-quantized + distill 8 langkah, iaitu apa yang diperlukan untuk memuatkan model video-diffusion sebesar ini pada kad 40 GB. Ini laporan jujur langkah demi langkah.

Lima perangkap yang kami hadapi

  • Kebergantungan pemisahan vokal tiada. Pipeline audio memerlukan model Kim_Vocal_2 melalui audio-separator, yang tidak berada dalam keperluan lalai — larian pertama gagal sehinggalah pip install audio-separator==0.30.2.
  • Penulis video “meletup”. Menyimpan frame gagal dengan ralat TiffWriter got an unexpected keyword argument fps kerana imageio tidak dapat mencari penulis ffmpeg — dibetulkan dengan pip install imageio-ffmpeg==0.6.0.
  • Kebuntuan berbilang GPU. Menjalankan satu kerja merentas beberapa kad (saiz context-parallel 2 atau 8) tergantung pada nyahsegerak kolektif NCCL — kedua-dua rank saling menunggu sehingga had masa 600s membatalkan larian. Kami hanya boleh jalankan satu kad. Pemberat INT8 memang muat pada satu kad 40 GB, jadi multi-GPU hanya berguna untuk menjalankan kerja berasingan secara selari, bukan untuk mempercepatkan satu kerja.
  • Kehabisan memori pada segmen kedua. Klip panjang dibina dengan menyambung segmen demi segmen, dan langkah sambungan mengekalkan KV-cache 48 lapisan sentiasa resident. Pada kad 40 GB segmen kedua memuncakkan penggunaan dan crash — lebih kurang kurang 160 MiB untuk muat. Kami perlu dedahkan dan aktifkan flag --offload_kv_cache (alih cache ke RAM CPU dan “page” semula setiap langkah) serta tetapkan PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True. Ia berfungsi, dengan kos segmen yang lebih perlahan.
  • Penjajaran resolusi. 480p di bawah paralelisme berbilang kad terkena kekangan boleh dibahagi 64 untuk tinggi dan lebar; satu kad mengelakkannya.

Kelajuan dan memori (diukur)

Ini nombor yang paling penting: klip 82 saat mengambil 3,586 saat — hampir 1 jam — pada A800, iaitu kira-kira 44 saat pengiraan untuk setiap 1 saat video siap (lebih kurang 138s bagi setiap segmen yang dijana merentas 26 segmen). Klip pendek 10 saat pun masih sekitar 7 minit. Dan ia bukan beban ringan: VRAM meningkat dalam beberapa saat dan kemudian terkunci pada 40,500 MiB — 98.9% daripada kad 40 GB — sepanjang render. Ini penggunaan sebenar yang kami sampel sekali setiap saat:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

Sampel yang kami render

Setiap klip di bawah telah kami render pada A800 yang diterangkan di atas. Untuk menanda aras model dalam senario yang dimaksudkan, kami menggerakkannya menggunakan input demo rasmi projek itu sendiri (potret rujukan dan audio), bukannya memilih input kami sendiri — jadi ini ialah output yang jujur, tanpa “cherry-pick”, bukan kompilasi sorotan. Dua klip pertama masing-masing digerakkan oleh foto rujukan mereka sendiri:

Dua foto rujukan: seorang penyanyi solo untuk klip foto+audio dan adegan studio dua orang untuk klip berbilang penutur

Kiri: rujukan untuk klip foto+audio. Kanan: rujukan untuk klip berbilang penutur (satu imej, dua orang). Klip ketiga di bawah menggunakan teks+audio tanpa foto rujukan — model mereka cipta orang tersebut, dan di situlah ia paling lemah.

Foto + audio (ATI2V) — aliran kerja avatar. Identiti kekal, mulut mengikut nyanyian.
Berbilang penutur — dua orang, dua trek audio, setiap mulut dipacu secara berasingan.
Teks + audio sahaja, tiada foto rujukan (AT2V) — kes lemah: lihat wajah berpintal dan “drift”.

Dirender oleh VisionStory menggunakan LongCat-Video-Avatar 1.5 pada NVIDIA A800, 2026-07-15, pada resolusi kelas 480p (768×512 / 832×480), menggunakan input demo rasmi model.

Keputusan jujur: kuat dengan foto, kasar tanpa foto

Apa yang benar-benar mengagumkan kami:

  • Identiti kekal. Dalam klip dipacu foto, orang itu kekal orang yang sama sepanjang 82 saat — rambut, pakaian, wajah — sambil mulut mengikut audio. Ini kes yang penting untuk avatar, dan ia menjadi.
  • Berbilang penutur memang berfungsi. Dua orang daripada satu babak, setiap satu dipacu bibir oleh trek audio sendiri, kekal koheren — memang sukar untuk dibuat dengan betul.
  • MIT dan bertaraf komersial. Pemberat terbuka, tiada bil setiap render, dan kualiti output yang akan “lulus” untuk klip pendek.

Di mana ia gagal — dan ini memang nyata:

  • Penjanaan teks sahaja “drift”. Tanpa foto rujukan, model mencipta orang itu, dan sepanjang klip panjang wajah berubah menjadi close-up yang ganjil dan kelihatan seperti lilin, serta babak turut berubah — jelas dalam sampel ketiga di atas.
  • Ia perlahan dan berat. ~44s pengiraan bagi setiap 1s video, mengunci kad 40 GB sepanjang masa. Klip 82 saat mengambil 1 jam.
  • 40 GB ialah minimum. Larian kami perlukan INT8 + distill hanya untuk muat, dan klip berbilang segmen hanya sempat hidup dengan meng-offload KV-cache ke CPU. Kad lebih kecil memang tak lepas.
  • Dalam praktiknya, satu kad sahaja. Context-parallel multi-GPU deadlock pada mesin kami, jadi tiada cara mudah untuk menjadikan satu klip lebih laju hanya dengan menambah kad.
  • Tiada Suara. Ia memacu bibir daripada audio yang anda sediakan — ia tidak buat teks-ke-pertuturan atau peniruan Suara, jadi anda masih perlukan sumber Suara berasingan.
  • 480p, dengan perkakasan ini. Apa yang kami boleh jalankan pada satu kad 40 GB ialah output kelas 480p.

Hos sendiri LongCat vs alat berhos: yang mana patut anda pilih?

Kedua-duanya menghasilkan perkara yang sama — foto bersama audio menjadi video bercakap. Perbezaannya sepenuhnya pada apa yang anda perlu “bayar” untuk sampai ke situ. Alat berhos seperti VisionStory menjalankan model untuk anda; ini pertukaran yang jujur.

 LongCat (hos sendiri)VisionStory (berhos)
PerkakasanA100/A800 40 GB (beribu-ribu dolar)Tiada — berjalan dalam pelayar
PersediaanCUDA, flash-attn, INT8, pembaikan dep, talaan OOMLog masuk dan teruskan
Masa setiap klip~44s pengiraan per 1s video (klip 82s ≈ 1 jam)Beberapa saat, pada GPU berhos
Resolusi (larian kami)Kelas 480pHD dan ke atas
SuaraAnda sediakan audio (tiada TTS/clone)Suara terbina dalam dan peniruan Suara
Kegunaan komersialYa (MIT)Ya (mengikut pelan)
PenyelenggaraanAnda tampal dep, OOM, pemacuTiada
Terbaik apabilaAnda ada GPU dan perlukan hos sendiri/offline/on-premAnda mahu video bercakap siap, pantas

Pilih LongCat jika anda mempunyai perkakasan dan kerja itu benar-benar mesti dihoskan sendiri — on-prem, offline, atau sepenuhnya di bawah kawalan anda — dan anda selesa menyelenggara stack CUDA. Pilih alat berhos jika anda mahu video bercakap foto-plus-audio yang sama tanpa satu jam pengiraan dan GPU lima angka.

Apa yang LongCat ajarkan kepada kami

Pengajaran sebenar daripada menjalankan LongCat-Video-Avatar ialah kualiti video avatar terbuka sudah tiba — dengan foto rujukan, model percuma ini menghasilkan klip yang cukup baik untuk kegunaan sebenar. Modelnya bukan lagi bahagian yang sukar.

Yang sukar ialah segala-galanya di sekelilingnya: memuatkan model video-diffusion pada kad yang anda mampu, bertahan daripada OOM pada segmen kedua, menunggu 1 jam untuk 82 saat, dan memadankannya dengan Suara. Jurang itu — antara checkpoint yang berkeupayaan dan video bercakap siap yang sesiapa pun boleh hasilkan — itulah tepatnya kerja yang kami buat. Jika anda mahu lihat sisi satu lagi, VisionStory menukar foto dan skrip menjadi avatar bercakap segerak bibir dalam pelayar anda dalam beberapa saat, dan jika anda perlukan Suara juga, bedah siasat kami tentang TTS open-source merangkumi sejauh mana keadaan separuh yang satu itu sekarang.

Soalan Lazim

  • Ya. LongCat-Video-Avatar 1.5 diterbitkan di bawah lesen MIT, yang membenarkan kegunaan komersial, dan tiada bil per render. Anda hanya membayar untuk pengiraan GPU yang digunakan.