开源

开源 AI 视频与头像项目

用通俗易懂的方式讲解支撑会说话头像、视频生成与音色的开源 AI 模型和工具——它们能做什么、如何运行,以及何时使用托管工具更快。

OpenMontage:开源 AI 视频代理详解

OpenMontage:开源 AI 视频代理详解

一份实用的 OpenMontage 指南:这款开源 AI 视频代理能把你的 AI 编程助手变成完整的视频工作室——它能做什么、如何搭建、成本几何,以及在什么情况下像 VisionStory 这样的托管工具会是更快的选择。

LongCat-Video-Avatar 1.5:我们实测了这款开源口播头像视频模型

LongCat-Video-Avatar 1.5:我们实测了这款开源口播头像视频模型

对 LongCat-Video-Avatar 1.5 的上手拆解:这是美团开源、MIT 许可的模型,可将照片+音频生成口播头像视频。我们在 A800 GPU 上跑完全部 3 个任务,实测真实速度与显存占用,踩中 5 个搭建坑,并坦诚分析:什么时候自建更划算,什么时候用托管工具更省心。

Kokoro TTS:我们在笔记本 CPU 上跑通了 82M 开源音色模型

Kokoro TTS:我们在笔记本 CPU 上跑通了 82M 开源音色模型

对 Kokoro 这款 8200 万参数的开源文本转语音模型进行一次上手拆解。我们在 Apple M3 Pro CPU 上运行它,生成了可播放的真实语音样本,踩到了 espeak-ng 打包 bug(并修复了它),也会坦诚说明:什么时候 Kokoro 已经够用,什么时候你需要一个托管式的会说话视频工具。

LivePortrait:开源人像动画模型详解

LivePortrait:开源人像动画模型详解

一份面向实操的 LivePortrait 指南:这款开源 AI 模型可通过驱动视频或音频为静态人像生成动画——它能做什么、如何运行,以及何时像 VisionStory 这样的在线口播头像工具会是更快的选择。