Hypit 于 2026 年 7 月 29 日登陆 GitHub,几天内就突破 8,000 stars。到 9 月 22 日,它已经拥有超过 13,000 stars 和 1,500 forks,并登顶 Trendshift 的日榜。它的卖点直截了当:用 AI 代理克隆任何爆款视频。我们把它装起来,用 Codex 和 Claude Code 跑了 7 个真实任务,并记录了它做出了什么、底层怎么跑、以及实际花了多少钱。这就是那份拆解报告。来源:github.com/hypit-ai/hypit。
什么是 Hypit?
Hypit 由 Hypit.AI 推出,为 Claude Code、Codex 等 AI 编程代理提供“一套用于创作视频的语言与系统”。它不是托管式编辑器,而是以代理 Skill、命令行工具,以及一个包含 122 个包的 TypeScript 单体仓库形式发布:内置 Seedance、GPT Image、Nano Banana、Grok Imagine、MiniMax、ElevenLabs、Fish Audio 等连接器,并提供字幕、背景移除、B-roll 轨道、电影特效与渲染器。
核心概念是 SVML——Hypit 自家的标记语言。你的代理用 SVML 写视频;Hypit 负责编译并渲染帧(示例会在 64 个并行的无界面 Chromium 进程中渲染)。它的时间轴以词为锚点,而不是以秒为单位。WhisperX 会对齐每一个被说出的单词,画面元素则绑定到脚本文字的区间。下面这段是真实仓库里“足球分档榜”示例的代码:
<HOST>Ronaldo is <D | Dee> tier. || Bro has @{hair-gel} more ||
hair gel than @{trophy} trophies || at this point.@{/trophy}@{/hair-gel}
<media-track:Item id="hair-gel" image={broll-hair-gel.image}
extent={hair-gel-extent} during={story.selection.hair-gel}
motion={recipes.motion.broll-left}/>hair-gel 这张 B-roll 图片会在这些词被说出来的期间精确出现在屏幕上。你只要改写这句话,时间轴就会自动重排,这也是为什么一个项目能轻松衍生出几十个变体。
安装之前,还有 3 点值得先知道:
- 生成模型不是必须的。即使不调用任何视频模型,一个项目也可以把字幕、动效和代码渲染的画面编译成成片。
- 你付费的是服务,不是 Hypit。Hypit 本身免费;你的编程代理与模型供应商会分别计费。它推荐的托管服务 HypiHub,在我们实测中 2,000 积分售价 $15;你也可以改用自己的 API key 或本地模型。
- 许可证带有条件。“Hypit Open Source License” 基于 Apache 2.0 但增加了额外条款:你可以在自己组织内部进行商业使用,但若将其作为面向他人的多租户服务托管,或进行转售,则需要商业许可证。你制作的视频归你所有。
它如何工作:我们实测看到的流程
安装只需一条命令:npx skills add hypit-ai/hypit -g。首次使用时,代理会查找或安装 Hypit 可执行文件(需要 Node.js 22.15 或更新版本)。之后每个任务基本都遵循同一个循环。
1. 代理观看并拆解参考视频
我们给 Codex 一段 34 秒的财经讲解视频,并输入“Hypit,照着这个视频做”。它会先看完片子,描述结构(先是一段口播开场,接着 5 张市场图表依次叠放出现,伴随缩放与夸张对比),然后提出方案:保留出镜人、音色和脚本,把图表、字幕与镜头运动重建为可编辑元素。接着它会问你想替换哪些部分。
2. 在花钱之前先给出报价
这是最让人安心的一点。在任何付费调用之前,代理会先列出成本表并等待确认。以一段中文口播视频为例,它报价4.39 积分(约 $0.03)用于转写原音并在本地重建;而若要在 720p 下重新生成全部 132 秒的出镜画面,则需要$5.69–9.34(不含重试)。随后它会请求授权:仅转写最多扣 10 积分(约 $0.075),并注明“目前尚未进行任何付费调用”。
3. 生成、渲染,并交付一个可编辑项目
一旦批准,代理会生成各个组件,编译 SVML 并渲染。你不仅会拿到成片文件,还会得到背后的项目,它会在 Hypit Studio 中打开:左侧是源码,中间是预览,右侧是属性,下方是多轨时间线。你可以手动编辑,也可以让代理自行复查并修正剪辑。

lsj-reconstruction 片段;下方的原始素材完全未改动。第三方素材已做模糊处理。我们真的跑了:7 个任务
我们用 Codex 和 Claude Code 的桌面应用跑了 7 个任务,视频用 Seedance 2 Mini、图像用 GPT Image 2。下面是每个任务的产出:
- 口播动效复刻。我们让它把某位创作者的“撕纸+贴纸+胶带”剪辑风格套到我们自己的口播片段上。它把质感还原得相当像。
- 换装。把一条热门试穿视频的服装替换成游戏角色服装。大多数镜头都能站得住。
- 风格迁移。把一个梗图片段重绘成某个知名成人动画风格。它以原片为底进行再风格化,效果确实不错。
- 主体替换。一条约 100 万点赞的爆款唱歌视频,把两位表演者替换成两只猫。小瑕疵有,但整体很强(下方第一个片段)。
- 同风格,新内容。基于一条热门财经讲解,代理写了新的“Why HBM matters”脚本,用代码画示意图,并在左上角生成了出镜讲解者。它的报告写道:“已导出,37.1 秒,1080p … 只运行了第一轮生成,没有额外的付费生成。” 整个任务耗费了1 小时 8 分钟的代理时间。
- Blender 惊喜。我们让它替换某位科技评测视频里用多米诺骨牌拼出来的首字母,它完全跳过视频模型,直接用 Blender 重建镜头,渲染了 87 帧(30 fps 下 2.9 秒),再把它拼接回其他未改动的画面里。这是本周最“外科手术式”的修复。
- 电影感手机评测。把一条电影风产品评测重制为数字人讲解,并生成 B-roll(下方第二个片段)。整体是最弱的结果:AI 味很明显,和真人剪辑师相比差距不小。
- 电商小短剧。基于一张参考图和源视频,重制了一段“玩偶用锤子砸鸡蛋”的短促销剧情。我们给它的评分大致与原片相当——而原片本身也是 AI 生成的。
关于我们在这里展示的内容说明:这些测试大多从其他创作者的视频开始,而那些人脸、声音与画面并非我们所有,无法直接转载。因此下面的片段都是“画面没有人物出镜”的输出版本,且音频已静音。
实测 Demo 片段
从上面的测试中截取两段未剪辑的输出,来自我们的录屏。
坦诚结论:优势与真实边界
让我们惊艳的点:
- 它克隆的是结构,不只是脚本。输出是可重复运行的项目,所以换出镜人、产品或语言,属于“再跑一次”,而不是“重新剪一次”。
- 以词为锚的时间轴。改写一句台词,B-roll、字幕与剪辑点依然能保持同步。
- 总能选到够用且最便宜的工具。必须生成时才用视频模型;只需微创修补时,就用代码,甚至用 Blender。
- 成本非常透明。它会估算每一步,并在付费调用前征求确认——在代理工具里这很少见。
不足之处:
- 真正的大头是代理费用。Hypit 自己的 README 示例称每次克隆的模型费用约 $1.10。我们的实测中,成本更高的是编程代理:7 个任务把我们 $100 的 ChatGPT 套餐可用额度从 50% 用到了 3%。
- 它很慢。有一次克隆耗费了超过 1 小时的代理时间。
- 写实重制依然有 AI 味。电影感评测明显是合成的,生成镜头也能看到小伪影。
- 你需要一套代理工作流。你得有编程代理、Node.js 22.15+ 和模型账号。它对开发者友好,但对“只想做个视频”的人不够友好。
- 许可证并非完全宽松。未经商业许可,你不能把 Hypit 作为服务提供给其他团队,也不能转售。
- 版权责任在你自己。Hypit 说产出归你,但参考视频的人脸、声音、素材与音乐仍归原权利人。把爆款视频当作结构来学习,而不是当作素材直接再发布。
Hypit vs 托管式 AI 视频工具
Hypit 和 VisionStory 这类托管式工具最终都能输出成片,但起点不同、计费方式也不同。
| Hypit(代理 skill) | VisionStory(托管式) | |
|---|---|---|
| 起点 | 参考视频或文字需求 | 照片、头像或脚本 |
| 配置 | 安装 skill;需要编程代理、Node.js 22.15+ 与模型账号 | 无需配置;浏览器里直接用 |
| 费用构成 | 编程代理使用费 + 模型积分(Hypit 示例中每次克隆模型费约 $1;我们的代理使用费远高于此) | 订阅或积分 |
| 单条视频耗时 | 几分钟到超过 1 小时的代理时间 | 几分钟 |
| 交付物 | 可编辑、可重复运行的 SVML 项目 + 渲染成片 | 成片的口播头像视频或 AI 视频 |
| 权利与合规 | 你克隆的任何素材、人脸或声音,都必须自行取得授权 | 使用你自己的或已授权的头像与音色 |
| 最适合 | 你会批量产出并变现大量变体,且长期在代理工作流里工作 | 你今天就想做出一条口播成片,不想跑代理流程 |
适合选择 Hypit 的情况:你要批量制作广告或 UGC 变体、值得把一个爆款格式模板化,并且团队里有开发者。更适合选择托管式工具的情况:你想今天就拿到一条出镜讲解视频,也不想为了它支付数小时的代理时间成本。
Hypit 给我们的启发
跑了一周后,我们的感受是:“克隆任何爆款视频”是标题,但不是重点。更长期、更关键的想法,是把视频的结构变成代理可重复运行的模板。你拆解别人的视频(以及你自己的视频)里有效的做法,保留骨架,让代理去生成那些会变化的部分。AI 视频正在朝这个方向走,这也与我们自己的 AI Video Agent 同一路线:描述你想要的视频,让代理自动组装出来——无需复杂配置,也无需承担高额的代理账单。
如果你还想看另一种“代理驱动的视频”思路,可以看看我们对 OpenMontage 的拆解,它用不同的流水线追求了相似的理念。
