美团开源了 LongCat-Video-Avatar 1.5,它做的事情和 VisionStory 的核心能力一模一样——把一张静态照片 + 一条音轨,变成会说话的头像视频。我们因此好奇到亲自跑了一遍。这是一篇实测拆解:它是什么、真实效果到底怎样、我们踩到的 5 个部署坑,以及自己跑和用托管工具的成本差在哪。 来源:github.com/meituan-longcat/LongCat-Video(MIT)。

LongCat-Video-Avatar 是什么?是谁做的?

LongCat-Video-Avatar 1.5 是美团(LongCat 团队)推出的开源权重 音频驱动的人像视频模型。它基于 LongCat-Video 基座模型构建,并以宽松的 MIT 许可证发布——真正意义上可免费商用。截至 2026-07,代码仓库大约有 5,200 个 GitHub stars,而 1.5 的权重也是 Hugging Face 上近期更受欢迎的发布之一。

它原生支持 3 类任务:Audio + Text to Video(AT2V,无参考图)、Audio + Text + Image to Video(ATI2V——用参考照片来锁定身份,更贴近真实头像工作流),以及视频续写(video continuation),把片段延展到单段之外。1.5 版本换用了 Whisper-Large 音频编码器,这也是它口型运动的来源。需要特别强调的是:它根据你提供的音频来驱动口型与表情——它不会生成或克隆音色。

我们确实跑了(单卡 A800-40GB)

不讲虚的——我们在单张 NVIDIA A800-SXM4-40GB(torch 2.8+cu128,driver 550)上把 3 个任务都跑通了,使用的是模型的 INT8 量化 + 8-step 蒸馏配置——这基本就是把这个体量的视频扩散模型塞进 40 GB 显存的必选项。下面是毫不粉饰的实测记录。

我们踩到的 5 个坑

  • 缺少人声分离依赖。音频管线通过 audio-separator 需要一个 Kim_Vocal_2 模型,但默认 requirements 里没有——首次运行直接挂掉,直到执行 pip install audio-separator==0.30.2 才能继续。
  • 视频写入器炸了。保存帧时出现 TiffWriter got an unexpected keyword argument fps,原因是 imageio 找不到 ffmpeg writer——用 pip install imageio-ffmpeg==0.6.0 修好。
  • 多 GPU 死锁。把一个任务跨多张卡跑(context-parallel size 2 或 8)会卡在 NCCL collective 不同步上——两个 rank 互相等,直到 600s 超时终止。我们最终只能跑单卡。而且 INT8 权重本来就能放进单张 40 GB 卡里,多 GPU 也就只能用来并行跑多个独立任务,并不能让单个任务更快。
  • 第二段直接爆显存。长视频是靠一段接一段续写出来的,而续写步骤会常驻一个 48 层 KV-cache。在 40 GB 卡上第二段直接顶满崩溃——大约还差 160 MiB 才能塞下。我们不得不暴露并启用 --offload_kv_cache 参数(把 cache 挪到 CPU 内存,每一步再分页回传),并设置 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True。能跑,但代价是后续片段更慢。
  • 分辨率对齐问题。在多卡并行下跑 480p 会触发高宽必须可被 64 整除的限制;单卡可避开。

速度与显存(实测)

最关键的数据在这里:一个82 秒的片段在 A800 上跑了3,586 秒——接近 1 小时——也就是每生成 1 秒成片约需要 44 秒计算(26 个 segment,每个生成段大约 138 秒)。哪怕是 10 秒短片,也差不多要 7 分钟。而且负载一点也不轻:显存在几秒内飙升,然后全程钉死在 40,500 MiB——占 40 GB 显卡的 98.9%。下面是我们每秒采样一次得到的真实占用:

VRAM usage over an 82-second LongCat-Video-Avatar render, pinned near the 40 GB ceiling for the full hour

我们渲染的样片

下面的每段视频片段都是我们在上文所述的 A800 上渲染生成的。为了在模型的预期使用场景中进行基准测试,我们采用了该项目官方演示提供的输入(参考人像与音频),而不是自己精心挑选素材 — 因此这些是诚实、未经过“挑好看的”输出结果,不是高光集锦。前两段视频分别由各自的参考照片驱动:

两张参考照片:一张是单人歌手(用于“照片 + 音频”片段),另一张是双人录音棚场景(用于多说话人片段)

左:用于“照片 + 音频”片段的参考图。右:用于多说话人片段的参考图(同一张图,两个人)。下面第三段视频使用“文本 + 音频”驱动,没有参考照片 — 人物由模型自行虚构,这也是它表现最弱的地方。

照片 + 音频(ATI2V)——头像工作流。身份稳定,嘴型能跟上歌声。
多说话者——两个人,两条音轨,各自的嘴型独立驱动。
仅文本 + 音频、无参考照片(AT2V)——最弱场景:注意人脸如何扭曲漂移。

VisionStory 于 2026-07-15 在 NVIDIA A800 上使用 LongCat-Video-Avatar 1.5 渲染,分辨率为 480p 级别(768×512 / 832×480),输入使用模型官方 demo 素材。

真实结论:有照片很强,没照片就很吃力

真正让我们惊喜的点:

  • 身份稳定。在照片驱动的片段里,人物在整个 82 秒内都保持同一个人——发型、服装、脸部——同时嘴型能跟随音频。这才是头像最重要的场景,而且它做到了。
  • 多说话者真的能用。同一画面里的两个人,各自由自己的音轨驱动嘴型,整体还能保持一致——这其实非常难。
  • MIT,商用友好。开源权重、没有按渲染计费,输出质量在短片里完全过关。

它翻车的地方——而且都是真的:

  • 纯文本生成会漂。没有参考照片时,模型要自己“捏”出一个人;视频一长,脸会逐渐扭曲成诡异的蜡像特写,场景也会漂移——上面第三个样例很明显。
  • 又慢又重。每 1 秒视频约 44 秒计算,40 GB 显卡全程拉满。82 秒片段就是 1 小时。
  • 40 GB 是底线。我们的实测需要 INT8 + 蒸馏才刚好能塞下,多段续写还得把 KV-cache offload 到 CPU 才活下来。更小的卡基本没戏。
  • 实际只能单卡。我们机器上的多 GPU context-parallel 会死锁,所以基本没有“加卡让单条视频更快”的简单办法。
  • 不带音色。它只根据你提供的音频来驱动口型——不做文本转语音,也不做音色克隆,所以你仍需要单独的音频来源。
  • 这套硬件下只能到 480p。单张 40 GB 卡我们能稳定跑的就是 480p 级别输出。

自托管 LongCat vs 托管工具:该选哪个?

两者产出的东西相同——照片 + 音频变成会说话的视频。差别完全在于“为了得到它,你要付出什么成本”。像 VisionStory 这样的托管工具会帮你把模型跑好;下面是诚实的取舍对比。

 LongCat(自托管)VisionStory(托管)
硬件40 GB 的 A100/A800(几千美元起)不需要——浏览器里就能跑
部署CUDA、flash-attn、INT8、依赖修补、OOM 调参登录就能用
单条耗时约每 1 秒视频需要 44 秒计算(82 秒 ≈ 1 小时)托管 GPU 上,几秒出片
分辨率(我们的实测)480p 级别高清视频及以上
音色你自备音频(无 TTS/克隆)内置多种音色并支持音色克隆
商用支持(MIT)支持(视订阅计划而定)
维护自己打补丁:依赖、OOM、驱动不需要
最适合你有 GPU,且必须自托管/离线/本地部署你想快速拿到成片的会说话视频

选择 LongCat 的情况:你硬件到位,而且工作确实必须自托管——本地部署、离线运行或完全由你掌控——并且你愿意长期维护 CUDA 技术栈。选择托管工具的情况:你想要同样的“照片 + 音频”会说话视频,但不想付出 1 小时计算和一张五位数美元的 GPU。

LongCat 给我们的启示

跑完 LongCat-Video-Avatar 后,最重要的结论是:开源的头像视频质量已经到了——有参考照片时,这个免费模型就能生成足够真实可用的片段。模型本身不再是最难的部分。

真正难的是模型之外的一切:如何把视频扩散模型塞进你买得起的显卡里、如何在第二段续写时躲过 OOM、如何为 82 秒视频等上 1 小时、以及如何搭配音色。这道鸿沟——从一个“能力很强的 checkpoint”,到“任何人都能做出来的成品会说话视频”——正是我们在做的工作。如果你想看看另一种体验,VisionStory 可以在浏览器里几秒内把照片和脚本变成口型同步的 talking avatar;如果你还需要音色,我们对 open-source TTS 的拆解也涵盖了那一半能力目前的进展。

常见问题

  • 可以。LongCat-Video-Avatar 1.5 以 MIT 许可证发布,允许商业使用,且不按单次渲染计费。你只需为它消耗的 GPU 算力买单。