开源

开源 AI 视频与虚拟人项目

用大白话讲解支撑会说话虚拟人、视频生成与音色的开源 AI 模型与工具 — 它们能做什么、怎么跑起来,以及什么时候用 VisionStory 这类托管工具更快。

OpenMontage:开源 AI 视频 Agent 详解

OpenMontage:开源 AI 视频 Agent 详解

这是一份 OpenMontage 实用指南:这款开源 AI 视频 Agent 能把你的 AI 编程助手变成完整的视频工作室——它能做什么、如何设置、成本是多少,以及什么时候像 VisionStory 这样的托管工具会是更快的选择。

LongCat-Video-Avatar 1.5:我们实测了这款开源会说话虚拟人视频模型

LongCat-Video-Avatar 1.5:我们实测了这款开源会说话虚拟人视频模型

深度上手拆解 LongCat-Video-Avatar 1.5:美团开源、MIT 许可的模型,可将照片 + 音频生成会说话的虚拟人视频。我们在 A800 GPU 上跑完全部 3 个任务,实测真实速度与显存占用,踩中 5 个部署坑,并坦诚分析:什么时候自托管更合适,什么时候托管工具更胜一筹。

Kokoro TTS:我们在笔记本 CPU 上运行了 82M 开源语音模型

Kokoro TTS:我们在笔记本 CPU 上运行了 82M 开源语音模型

对 Kokoro 这款拥有 8200 万参数的开源文本转语音模型进行实测拆解。我们在 Apple M3 Pro CPU 上运行它,生成了可播放的真实语音样本,遇到 espeak-ng 打包 bug(并已修复),也会坦诚说明:什么时候 Kokoro 就够用,什么时候你需要一个托管式的说话视频工具。

LivePortrait:开源人像动画模型详解

LivePortrait:开源人像动画模型详解

一份实用指南,带你了解 LivePortrait:这款开源 AI 模型可通过驱动视频或音频让静态人像动起来——它能做什么、如何运行,以及什么时候选择 VisionStory 这类托管式口播虚拟人工具会更快。