美團(Meituan)開源了 LongCat-Video-Avatar 1.5,而它做的事情,正是 VisionStory 的核心——把一張靜態照片加上一段音訊,變成一支會說話的虛擬人影片。這讓我們好奇到真的把它跑起來。本篇是一次實作拆解:它是什麼、實際表現到底如何、我們踩到的 5 個安裝陷阱,以及自己跑和用託管工具的成本差異。 來源:github.com/meituan-longcat/LongCat-Video(MIT)。

LongCat-Video-Avatar 是什麼?誰做的?

LongCat-Video-Avatar 1.5 是由美團(LongCat 團隊)推出的開放權重音訊驅動真人影片模型。它基於 LongCat-Video foundation model,並以寬鬆的 MIT 授權釋出——商用也是真正免費。到 2026-07 為止,程式碼倉庫約有5,200 個 GitHub stars,而 1.5 權重也屬於 Hugging Face 上近期更受喜愛的釋出之一。

它原生支援 3 種任務:Audio + Text to Video(AT2V,無參考圖片)、Audio + Text + Image to Video(ATI2V——用參考照片來驅動身分,最貼近真實的 avatar 工作流程),以及用影片延續把片段延長到超過單一 segment。1.5 版本改用 Whisper-Large 音訊編碼器,這也是它嘴型動作的來源。重點是,它會依你提供的音訊來驅動嘴型與表情——不會產生或複製音色。

我們真的跑了(單張 A800-40GB)

不空談——我們在一張 NVIDIA A800-SXM4-40GB(torch 2.8+cu128、driver 550)上,把 3 種任務都實際跑完;使用模型的 INT8 量化 + 8-step distill 配置,因為這就是把這種規模的 video-diffusion 模型塞進 40 GB 顯卡所需要的做法。下面是誠實的逐步紀錄。

我們踩到的 5 個陷阱

  • 缺少人聲分離依賴。 音訊流程需要透過 audio-separator 使用 Kim_Vocal_2 模型,但預設 requirements 裡沒有——第一次執行直接掛掉,直到我們安裝 pip install audio-separator==0.30.2
  • 影片寫入器爆炸。 存影格時出現 TiffWriter got an unexpected keyword argument fps,原因是 imageio 找不到 ffmpeg writer——用 pip install imageio-ffmpeg==0.6.0 修好。
  • 多 GPU 死鎖。 把一個工作跨多張卡跑(context-parallel size 2 或 8)會卡在 NCCL collective desync——兩個 rank 互等直到 600s timeout 中止。我們只能跑單卡。INT8 權重確實能塞進一張 40 GB 顯卡,所以多 GPU 對我們只適合並行跑不同工作,無法加速單一工作。
  • 第二個 segment 直接 OOM。 長影片是靠一段段延續拼起來,而 continuation 步驟會把 48 層的 KV-cache 常駐在記憶體。40 GB 顯卡跑到第二段就衝頂崩潰——大概還差 160 MiB 才能塞下。我們只好把 --offload_kv_cache 參數打開(把 cache 搬到 CPU RAM,每一步再分頁搬回)並設定 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True。能跑,但後續 segment 會更慢。
  • 解析度對齊。 在多卡平行時跑 480p 會觸發高寬必須可被 64 整除的限制;單卡則能避開。

速度與記憶體(實測)

最重要的數字在這裡:一支82 秒的影片,在 A800 上花了3,586 秒——不到 1 小時——約等於每產出 1 秒成片需要 44 秒計算(26 個 segment、每段約 138 秒)。就算是短短 10 秒,也大約要 7 分鐘。而且負載不輕:顯存在幾秒內就衝上去,然後整段渲染期間都被釘在 40,500 MiB——佔 40 GB 顯卡的 98.9%。以下是我們每秒取樣一次的實際使用量:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

我們渲染的樣本

以下每段片段都是由我們在上述的 A800 上渲染完成。為了在模型預期的使用情境下進行基準測試,我們使用專案官方示範輸入(參考人像與音訊)來驅動,而不是自行挑選素材 — 因此這些是忠實、未經刻意挑選的輸出結果,而非精華剪輯。前兩段影片各自使用了自己的參考照片:

兩張參考照片:一張是單人歌手,用於「照片 + 音訊」片段;另一張是雙人錄音室場景,用於多講者片段

左:用於「照片 + 音訊」片段的參考素材。右:用於多講者片段的參考素材(同一張圖片、兩個人)。下面第三段片段以文字 + 音訊驅動,沒有參考照片 — 人物由模型自行生成,而這正是它表現最弱的地方。

照片 + 音訊(ATI2V)——最貼近 avatar 工作流程。身分穩得住,嘴型能跟著歌聲走。
多說話者——兩個人、兩條音軌,各自的嘴型獨立被驅動。
只有文字 + 音訊、沒有參考照片(AT2V)——最弱場景:看臉部如何扭曲、漂移。

由 VisionStory 使用 LongCat-Video-Avatar 1.5 在 NVIDIA A800 上渲染,日期 2026-07-15;解析度為 480p 等級(768×512 / 832×480),使用模型官方 demo 輸入。

誠實結論:有照片很強,沒照片就很抖

真正讓我們驚豔的地方:

  • 身分維持得住。 在照片驅動的片段裡,整整 82 秒人物都維持同一個人——髮型、穿著、臉——同時嘴型能跟著音訊走。這是 avatar 最重要的用例,而且它做到了。
  • 多說話者真的能用。 同一個場景裡的兩個人,各自被自己的音軌驅動嘴型,仍能保持一致——這其實很難。
  • MIT、且有商用品質。 開放權重、每次渲染不計費,短片段的輸出品質也能過關。

它會跌倒的地方——而且都是真的:

  • 純文字生成會漂。 沒有參考照片時,模型會自己發明人物;片段一拉長,臉會扭成詭異、蠟像感的近景,場景也會飄——第三個樣本就看得到。
  • 又慢又重。 每 1 秒影片約要 ~44 秒計算,而且全程把 40 GB 顯卡釘滿。82 秒就是 1 小時。
  • 40 GB 只是門檻。 我們需要 INT8 + distill 才勉強塞得下,多段延續也只能靠把 KV-cache offload 到 CPU 才撐住。更小的卡不用想。
  • 實務上只能單卡。 我們這台機器上,多 GPU 的 context-parallel 直接死鎖,所以沒有「加卡就變快」的簡單路線。
  • 沒有音色。 它只會用你提供的音訊來驅動嘴型——不做文字轉語音,也不做音色複製,所以你仍需要另外準備聲音來源。
  • 在這套硬體下只到 480p。 我們在單張 40 GB 顯卡上能跑的,就是 480p 等級輸出。

自架 LongCat vs 託管工具:你該選哪個?

兩者產出的東西其實一樣——照片 + 音訊變成一支會說話的影片。差別完全在「你為了做到這件事要付出什麼成本」。像 VisionStory 這樣的託管工具會替你跑模型;以下是誠實的取捨。

 LongCat(自架)VisionStory(託管)
硬體40 GB 的 A100/A800(要好幾千美元)不需要——瀏覽器內就能跑
設定CUDA、flash-attn、INT8、修依賴、OOM 調校登入就能用
每支片段耗時每 1 秒影片約 ~44 秒計算(82 秒片段 ≈ 1 小時)使用託管 GPU,幾秒搞定
解析度(我們的實測)480p 等級高畫質影片以上
音色你自行提供音訊(無 TTS/clone)內建多種音色與音色複製
商用可以(MIT)可以(依方案)
維護你要自己修依賴、OOM、driver不需要
最適合你有 GPU,且確實需要自架/離線/本地部署(on-prem)你想要快速得到一支完成的會說話影片

選 LongCat 的情況:你有硬體,而且工作真的必須自架——本地部署、離線,或完全由你掌控——並且你願意維護一整套 CUDA 環境。選託管工具的情況:你想要同樣的「照片 + 音訊」會說話影片,但不想付出 1 小時的算力等待與一張五位數美元的 GPU。

LongCat 教會我們的事

實際跑完 LongCat-Video-Avatar 的最大收穫是:開源的 avatar 影片品質真的到位了——只要有參考照片,這個免費模型就能產出足夠上線使用的片段。模型本身不再是最難的部分。

最難的是模型周邊的一切:把 video-diffusion 模型塞進你買得起的顯卡、在第二個 segment 撐過 OOM、為了 82 秒等 1 小時,還要另外搭配聲音來源。這個落差——在「有能力的 checkpoint」與「任何人都能做出的完成版會說話影片」之間——正是我們在做的事。想看看另一端長什麼樣,VisionStory 能在瀏覽器中用幾秒把照片與腳本變成對嘴同步的 talking avatar;如果你也需要聲音,我們對 open-source TTS 的拆解也整理了那一半目前的進展。

常見問題

  • 可以。LongCat-Video-Avatar 1.5 以 MIT 授權釋出,允許商用,而且不會按次渲染計費;你只需要負擔它消耗的 GPU 算力成本。