オープンソース
オープンソースのAI動画&アバタープロジェクト
トーキングアバター、動画生成、音声を支えるオープンソースAIモデル/ツールを、わかりやすい言葉で解説。何ができるのか、動かし方、そしてホスティング型ツールの方が速い場面までまとめています。
オープンソース
トーキングアバター、動画生成、音声を支えるオープンソースAIモデル/ツールを、わかりやすい言葉で解説。何ができるのか、動かし方、そしてホスティング型ツールの方が速い場面までまとめています。

AIコーディングアシスタントを本格的な動画スタジオに変える、オープンソースのAI動画エージェント「OpenMontage」を実用目線で解説。できること、セットアップ方法、費用、そしてVisionStoryのようなホスト型ツールのほうが早いケースまでまとめました。

LongCat-Video-Avatar 1.5を実際に動かして徹底解説。Meituanが公開するMITライセンスのオープンソースモデルで、写真+音声からトーキングアバター動画を生成できます。A800 GPUで3つのタスクをすべて実行し、実測の速度とVRAMを計測。セットアップでハマりやすい5つの落とし穴も検証し、セルフホスティングが向く場面/ホスト型ツールのほうが勝つ場面を率直に整理しました。

8200万パラメータのオープンソースのテキスト読み上げモデル「Kokoro」を、実際に分解して検証しました。Apple M3 ProのCPUで動かし、再生できる実音声サンプルを生成し、espeak-ngのパッケージング不具合にも遭遇(そして修正)しつつ、Kokoroで十分なケースと、ホスティング型のトーキング動画ツールが必要なケースを正直に整理します。

駆動動画や音声をもとに静止ポートレートを動かすオープンソースAIモデル「LivePortrait」を実用目線で解説。できること、動かし方、そしてVisionStoryのようなホスティング型トーキングアバターツールを使うほうが早いケースまで紹介します。