美團(Meituan)開源咗 LongCat-Video-Avatar 1.5,而佢做嘅嘢同 VisionStory 嘅核心完全一樣——將一張靜態相片加一段音軌,變成一條 talking-avatar 影片。呢點令我哋好奇到真係落手跑一次。以下係一篇實測拆解:佢係乜、真實表現有幾好、我哋踩過嘅 5 個安裝陷阱,同埋自己跑 vs 用託管工具嘅成本差異。來源:github.com/meituan-longcat/LongCat-Video(MIT)。

LongCat-Video-Avatar 係咩?邊個做?

LongCat-Video-Avatar 1.5 係美團(Meituan,LongCat 團隊)推出嘅開放權重音訊驅動真人影片模型。佢建立喺 LongCat-Video 基礎模型之上,並以寬鬆嘅 MIT 授權釋出——真正可以免費商用。到 2026-07 為止,代碼倉庫大約有5,200 個 GitHub star,而 1.5 權重亦係 Hugging Face 上近期頗受歡迎嘅發佈之一。

佢原生支援 3 個任務:Audio + Text to Video(AT2V,無參考圖片)、Audio + Text + Image to Video(ATI2V——用參考相片驅動身份,亦即最貼近真實 avatar 工作流嘅情境),以及用影片延續去將片段延伸到多於一個 segment。1.5 版本換咗 Whisper-Large 音訊編碼器,口型動作就係由佢帶出嚟。重點係,佢會用你提供嘅任何音訊去驅動口型同表情——但佢唔會生成或複製音色。

我哋真係跑咗(單張 A800-40GB)

唔講虛嘢——我哋喺單張 NVIDIA A800-SXM4-40GB(torch 2.8+cu128、driver 550)上面,把 3 個任務都跑咗一次;用嘅係模型嘅INT8 量化 + 8-step 蒸餾配置,呢個就係要將呢個體量嘅 video-diffusion 模型塞入 40 GB 顯卡嘅方法。以下係最老實嘅實測過程。

我哋踩到嘅 5 個陷阱

  • 欠咗人聲分離依賴。 音訊流程需要透過 audio-separator 用到 Kim_Vocal_2 模型,但預設 requirements 入面冇——第一次跑直接死,直到 pip install audio-separator==0.30.2 先得。
  • 影片寫入器爆咗。 儲存 frames 時因為 imageio 搵唔到 ffmpeg writer,報 TiffWriter got an unexpected keyword argument fps——用 pip install imageio-ffmpeg==0.6.0 解決。
  • 多 GPU 死鎖。 喺多張卡上跑同一個 job(context-parallel size 2 或 8)會卡喺 NCCL collective desync——兩個 rank 互相等到 600s timeout 先中止。結果只可以跑單卡。其實 INT8 權重的確塞得落單張 40 GB 卡,所以多 GPU 只係用嚟並行跑多個獨立 job,唔係用嚟加速同一個 job。
  • 第二個 segment 爆顯存。 長片係一段接一段咁延續,而延續步驟會保留一個 48-layer KV-cache 常駐。喺 40 GB 卡上,第二段就頂爆同 crash——大約差 160 MiB 先塞得落。我哋要開放並啟用 --offload_kv_cache 參數(將 cache 搬去 CPU RAM,再逐步 paging 返上嚟),再加埋設定 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True。可以用,但每段會慢啲。
  • 解像度對齊。 480p 喺多卡並行時會撞到高、闊要可被 64 整除嘅限制;單卡就避開到。

速度同記憶體(實測)

呢個先係關鍵數字:一條82 秒片,用 A800 跑咗3,586 秒——差唔多 1 個鐘——即大約每完成 1 秒成片要 44 秒計算(26 個 segment,每個生成 segment 約 138 秒)。就算係短短 10 秒片,都大約要 7 分鐘。而且負載唔輕:顯存幾秒內就衝上去,然後全程鎖死喺 40,500 MiB——即 40 GB 顯卡嘅 98.9%——直到 render 完。以下係我哋每秒取樣一次嘅實際用量:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

我哋渲染出嚟嘅樣本

以下每段片段均由我哋使用上面所述嘅 A800 渲染。為咗喺模型預期嘅使用情境下進行基準測試,我哋採用項目官方示範所用嘅輸入(參考人像同音訊),而唔係自己另外揀素材 — 所以呢啲都係真實、冇刻意挑選嘅輸出,唔係精華集。頭兩段片段各自以佢哋嘅參考相片驅動:

兩張參考相片:一張獨唱歌手用於「相片 + 音訊」片段;一張兩人錄音室場景用於「多講者」片段

左:用於「相片 + 音訊」片段嘅參考。右:用於「多講者」片段嘅參考(同一張相,有兩個人)。下面第 3 段片段以文字 + 音訊驅動,冇參考相片 — 模型需要自行「創作」人物,亦正正係佢最弱嘅地方。

相片 + 音訊(ATI2V)——典型 avatar 工作流。身份保持到,口型亦跟到唱歌。
多講者——兩個人、兩條音軌,每個人口型都各自獨立驅動。
淨係 text + audio、冇參考相片(AT2V)——最弱情境:留意塊面點樣變形同漂移。

由 VisionStory 於 2026-07-15 用 NVIDIA A800 跑 LongCat-Video-Avatar 1.5 渲染,解像度屬 480p 級(768×512 / 832×480),並使用模型官方 demo inputs。

老實評語:有相片就強,冇相片就粗糙

真正令我哋驚喜嘅位:

  • 身份保持得住。 喺相片驅動嘅片入面,整整 82 秒個人都仲係同一個人——頭髮、衫、面——同時口型會跟住音訊。呢個先係 avatar 最重要嘅情境,而佢做得到。
  • 多講者真係得。 同一個畫面兩個人,各自用自己嘅音軌去驅動口型,仲可以保持一致——呢樣其實好難做好。
  • MIT + 可商用級。 開放權重、冇按次渲染收費,而且短片輸出質素係過得到關。

跌落嚟嘅位——而且係真問題:

  • 純文字生成會飄。 冇參考相片時,模型要自己諗個人;拉長到長片就會見到塊面慢慢變形,變成唔自然、似蠟像咁嘅近鏡,場景亦會走樣——上面第三個樣本好明顯。
  • 慢同重。 每 1 秒影片約要 ~44 秒計算,全程鎖死一張 40 GB 卡;82 秒片就係 1 個鐘。
  • 40 GB 係最低門檻。 我哋要 INT8 + 蒸餾先塞得落,而多段延續亦只係靠將 KV-cache offload 去 CPU 先頂得住。細啲嘅卡基本唔使諗。
  • 實際上只可以單卡。 我哋部機嘅多 GPU context-parallel 會死鎖,所以冇一個簡單方法可以靠加卡令同一條片快啲。
  • 冇音色。 佢只會用你提供嘅音訊去驅動口型——唔做 文字轉語音、亦唔做音色複製,所以你仍然需要另外嘅聲源。
  • 喺呢個硬件下只到 480p。 喺單張 40 GB 卡上,我哋可跑到嘅只係 480p 級輸出。

Self-host LongCat vs 託管工具:應該揀邊個?

兩者做出嚟嘅嘢一樣——相片 + 音訊變成一條說話影片。分別只係你為咗做到呢一步要付出幾多成本。好似 VisionStory 呢種託管工具會代你跑模型;以下係最老實嘅取捨。

 LongCat(self-host)VisionStory(託管)
硬件一張 40 GB A100/A800(幾千美元)唔需要——瀏覽器直接跑
安裝CUDA、flash-attn、INT8、修依賴、OOM 調校登入就用得
每條片時間每 1 秒影片約 ~44 秒計算(82 秒片 ≈ 1 個鐘)用託管 GPU,幾秒內搞掂
解像度(我哋實測)480p 級高清影片及以上
音色你自行提供音訊(冇 TTS/複製)內置音色同音色複製
商用可以(MIT)可以(視乎計劃)
維護你要自己補依賴、處理 OOM、driver唔需要
最適合你有 GPU,而且必須 self-host/離線/on-prem你想快手得到一條完成嘅說話影片

揀 LongCat,如果你有硬件,而且工作真係一定要 self-host——on-prem、離線,或者完全由你掌控——同時你亦願意維護一套 CUDA stack。揀託管工具,如果你想要同樣嘅「相片 + 音訊」說話影片,但唔想用 1 個鐘計算、亦唔想買一張五位數字價錢嘅 GPU。

LongCat 教咗我哋乜

跑完 LongCat-Video-Avatar 最重要嘅啟示係:開源 avatar 影片嘅質素真係到咗——只要有參考相片,呢個免費模型已經可以做出足夠實用嘅片段。模型本身已經唔係最難嘅部分。

最難嘅係周邊所有嘢:點樣將 video-diffusion 模型塞入你買得起嘅顯卡、點樣喺第二個 segment 爆顯存時頂住、等足 1 個鐘先出到 82 秒、仲要再配合一個聲源。呢個落差——由一個有能力嘅 checkpoint 到「任何人都做得到」嘅完成 talking video——就係我哋一直做緊嘅工作。如果你想睇到另一面,VisionStory 可以喺瀏覽器用幾秒就將相片同講稿變成口型同步嘅 talking avatar;而如果你仲需要聲音,我哋對 開源 TTS 嘅拆解亦會講清楚而家嗰半邊發展到邊。

常見問題

  • 可以。LongCat-Video-Avatar 1.5 以 MIT 授權釋出,容許商業用途,而且唔會按次渲染收費;你只需要支付佢所消耗嘅 GPU 運算成本。