開源

開源 AI 影片及虛擬人像專案

用易明方式講解支撐會說話虛擬人像、影片生成同音色嘅開源 AI 模型與工具 — 佢哋做乜、點樣運行,以及幾時用託管工具會更快。

OpenMontage:開源 AI 影片 Agent 全面解說

OpenMontage:開源 AI 影片 Agent 全面解說

OpenMontage 實用指南:呢個開源 AI 影片 Agent 可以將你嘅 AI coding assistant 變成完整影片工作室——包括佢做得到啲乜、點樣設定、成本係幾多,以及幾時用好似 VisionStory 呢類託管式工具會更快。

LongCat-Video-Avatar 1.5:我哋實測咗呢個開源說話虛擬人像影片模型

LongCat-Video-Avatar 1.5:我哋實測咗呢個開源說話虛擬人像影片模型

深入實測拆解 LongCat-Video-Avatar 1.5——美團開源、採用 MIT 授權嘅模型,可將相片加音訊變成說話虛擬人像影片。我哋用 A800 GPU 跑晒 3 個任務,實測真實速度同 VRAM 佔用,踩中 5 個安裝陷阱,並坦白講清楚幾時自建部署值得、幾時用託管工具更著數。

Kokoro TTS:我哋喺手提電腦 CPU 上跑咗 82M 開源音色模型

Kokoro TTS:我哋喺手提電腦 CPU 上跑咗 82M 開源音色模型

深入實測拆解 Kokoro 呢個 8,200 萬參數嘅開源文字轉語音模型。我哋喺 Apple M3 Pro CPU 上跑,生成咗你可以即刻播放嘅真實音色樣本,亦遇到 espeak-ng 打包 bug(並已修正),最後坦白講清楚:幾時用 Kokoro 已經夠、幾時你需要一個託管式嘅說話影片工具。

LivePortrait:開源人像動畫模型全解

LivePortrait:開源人像動畫模型全解

一篇實用指南,帶你了解 LivePortrait:這個開源 AI 模型可透過驅動影片或音訊,令靜態人像動起來——它能做什麼、如何運行,以及在什麼情況下選用像 VisionStory 這類託管式說話虛擬人像工具會更快更方便。