開源
開源 AI 影片與虛擬人像專案
用白話帶你認識支撐會說話虛擬人像、影片生成與音色的開源 AI 模型與工具 — 它們能做什麼、怎麼跑起來,以及什麼情況下使用 VisionStory 這類託管工具更快。
開源
用白話帶你認識支撐會說話虛擬人像、影片生成與音色的開源 AI 模型與工具 — 它們能做什麼、怎麼跑起來,以及什麼情況下使用 VisionStory 這類託管工具更快。

這是一份 OpenMontage 的實用指南。OpenMontage 是一款開源 AI 影片代理,能把你的 AI 程式助理升級成完整的影片工作室——本文將說明它能做什麼、如何設定、成本是多少,以及在什麼情況下,像 VisionStory 這種託管式工具會是更快的選擇。

深入實測並拆解 LongCat-Video-Avatar 1.5:美團開源、採 MIT 授權的模型,可將一張照片加上音訊轉成會說話的虛擬人像影片。我們在 A800 GPU 上跑完 3 個任務,量測實際速度與 VRAM 需求,踩到 5 個安裝/設定陷阱,並坦白整理哪些情境適合自架、哪些情境用託管工具更划算。

Kokoro 是一個擁有 82M 參數的開源文字轉語音模型;本文帶你實作拆解。我們在 Apple M3 Pro CPU 上實際跑起來,產出可直接播放的真實音色樣本,遇到 espeak-ng 打包問題(也把它修好),並坦白整理:什麼時候 Kokoro 夠用、什麼時候你會需要託管式的說話影片工具。

LivePortrait 實用指南:這個開源 AI 模型可透過驅動影片或音訊,讓靜態人像動起來——包含它能做什麼、如何執行,以及在什麼情況下,像 VisionStory 這類託管式會說話虛擬人像工具會是更快速的選擇。