Hypit เปิดตัวบน GitHub เมื่อวันที่ 29 กรกฎาคม 2026 และทะลุ 8,000 ดาวภายในไม่กี่วัน ภายในวันที่ 22 กันยายน มันมีมากกว่า 13,000 ดาวและ 1,500 ฟอร์ก และขึ้นอันดับ 1 บนชาร์ตรายวันของ Trendshift คำโปรยของมันตรงไปตรงมา: โคลนวิดีโอไวรัลอะไรก็ได้ด้วยเอเจนต์ AI เราติดตั้งมัน รันงานจริง 7 งานผ่าน Codex และ Claude Code แล้วบันทึกว่ามันสร้างอะไรออกมา ทำงานภายในอย่างไร และสุดท้ายเสียเงินจริงเท่าไหร่ นี่คือบทแกะเครื่องนั้น แหล่งที่มา: github.com/hypit-ai/hypit.
Hypit คืออะไร?
Hypit จาก Hypit.AI มอบ “ภาษาและระบบสำหรับสร้างวิดีโอ” ให้กับ AI coding agents อย่าง Claude Code และ Codex มันไม่ใช่เอดิเตอร์แบบโฮสต์ มันมาในรูปแบบ Skill สำหรับเอเจนต์ เครื่องมือคอมมานด์ไลน์ และ TypeScript monorepo จำนวน 122 แพ็กเกจ: คอนเนกเตอร์สำหรับ Seedance, GPT Image, Nano Banana, Grok Imagine, MiniMax, ElevenLabs และ Fish Audio รวมถึงคำบรรยาย การลบพื้นหลัง แทร็ก B-roll เอฟเฟกต์ภาพยนตร์ และเรนเดอเรอร์
แกนกลางคือ SVML ซึ่งเป็นมาร์กอัปของ Hypit เอง เอเจนต์ของคุณเขียนวิดีโอเป็น SVML; Hypit จะคอมไพล์และเรนเดอร์เฟรม (ตัวอย่างของมันเรนเดอร์แบบขนานด้วย headless Chromium 64 โปรเซส) การจับเวลาอ้างอิงกับ คำ ไม่ใช่วินาที WhisperX จะจัดแนวทุกคำที่พูด และภาพจะถูกผูกเข้ากับช่วงของสคริปต์ นี่คือโค้ดจริงจากตัวอย่าง football tier-list ในรีโป:
<HOST>Ronaldo is <D | Dee> tier. || Bro has @{hair-gel} more ||
hair gel than @{trophy} trophies || at this point.@{/trophy}@{/hair-gel}
<media-track:Item id="hair-gel" image={broll-hair-gel.image}
extent={hair-gel-extent} during={story.selection.hair-gel}
motion={recipes.motion.broll-left}/>ภาพ B-roll ชื่อ hair-gel จะอยู่บนจอ “พอดีเป๊ะ” ในช่วงที่คำเหล่านั้นถูกพูดอยู่ แก้ประโยคใหม่แล้วไทม์มิงจะไหลปรับเองทั้งหมด นี่คือเหตุผลที่โปรเจกต์เดียวแตกออกไปเป็นเวอร์ชันย่อยได้เป็นสิบ ๆ แบบ
อีก 3 เรื่องที่ควรรู้ก่อนติดตั้ง:
- โมเดลสำหรับการสร้างเป็นตัวเลือกเสริม โปรเจกต์หนึ่งสามารถคอมไพล์คำบรรยาย โมชันกราฟิก และภาพที่เรนเดอร์ด้วยโค้ดให้เป็นวิดีโอสำเร็จได้ โดยไม่ต้องเรียกโมเดลวิดีโอใด ๆ
- คุณจ่ายให้บริการต่าง ๆ ไม่ใช่ Hypit Hypit ใช้ฟรี; ค่าใช้จ่ายจะถูกคิดแยกโดยเอเจนต์เขียนโค้ดและผู้ให้บริการโมเดล บริการโฮสต์ที่มันแนะนำคือ HypiHub ซึ่งขายเครดิตที่ $15 ต่อ 2,000 ในการทดสอบของเรา และคุณสามารถใส่ API keys ของตัวเองหรือใช้โมเดลในเครื่องแทนได้
- ไลเซนส์มีเงื่อนไข “Hypit Open Source License” คือ Apache 2.0 ที่มีเงื่อนไขเพิ่มเติม: คุณใช้เชิงพาณิชย์ภายในองค์กรของคุณได้ แต่ถ้าโฮสต์เป็นบริการแบบ multi-tenant ให้คนอื่นใช้ หรือเอาไปขายต่อ ต้องมีไลเซนส์เชิงพาณิชย์ วิดีโอที่คุณสร้างเป็นของคุณ
มันทำงานยังไง: สิ่งที่เราเห็นจากการรันจริง
การติดตั้งใช้คำสั่งเดียว: npx skills add hypit-ai/hypit -g ครั้งแรกที่ใช้งาน เอเจนต์จะค้นหาหรือติดตั้งไฟล์รัน Hypit (ต้องใช้ Node.js 22.15 ขึ้นไป) จากนั้นทุกงานจะวนลูปเดิม ๆ
1. เอเจนต์ดูคลิปอ้างอิงและแยกองค์ประกอบ
เราให้ Codex ดูคลิปอธิบายการเงินยาว 34 วินาที แล้วพิมพ์ว่า “Hypit, copy this video.” มันดูคลิป อธิบายโครงสร้าง (เปิดด้วย talking-head แล้วตามด้วยกราฟตลาด 5 อันซ้อนเรียงกัน พร้อมการซูมและคอนทราสต์แบบเว่อร์ ๆ) และเสนอแผน: คงโฮสต์ เสียง และสคริปต์ไว้ แล้วสร้างกราฟ คำบรรยาย และการเคลื่อนกล้องใหม่ให้เป็นองค์ประกอบที่แก้ไขได้ จากนั้นมันถามว่าเราต้องการเปลี่ยนส่วนไหนบ้าง
2. มันตีราคางานก่อนใช้เงินแม้แต่บาทเดียว
นี่คือส่วนที่ทำให้สบายใจที่สุด ก่อนจะมีการเรียกใช้แบบเสียเงิน เอเจนต์จะวางตารางค่าใช้จ่ายและรอ สำหรับคลิป talking-head ภาษาจีน มันประเมินว่าใช้ 4.39 เครดิต (ประมาณ $0.03) เพื่อถอดเสียงต้นฉบับและสร้างใหม่แบบโลคัล เทียบกับ $5.69–9.34 (ยังไม่รวมรอบลองใหม่) เพื่อสร้างฟุตเทจหน้ากล้องทั้งหมด 132 วินาทีใหม่ที่ 720p จากนั้นมันขออนุญาตคิดค่าใช้จ่ายสูงสุด 10 เครดิต (ประมาณ $0.075) สำหรับการถอดเสียงอย่างเดียว พร้อมระบุว่า “ยังไม่มีการเรียกใช้แบบเสียเงินเกิดขึ้น”
3. มันประกอบ เรนเดอร์ และส่งโปรเจกต์ที่แก้ไขได้ให้คุณ
พออนุมัติแล้ว เอเจนต์จะสร้างชิ้นส่วนต่าง ๆ คอมไพล์ SVML และเรนเดอร์ คุณจะได้ทั้งไฟล์ที่เสร็จแล้ว และ โปรเจกต์เบื้องหลัง ซึ่งเปิดใน Hypit Studio: ซอร์สอยู่ซ้าย พรีวิวอยู่กลาง พร็อพเพอร์ตี้อยู่ขวา และไทม์ไลน์หลายแทร็กอยู่ด้านล่าง คุณแก้เองด้วยมือได้ หรือให้เอเจนต์ช่วยรีวิวและแก้คัตให้เลยก็ได้

lsj-reconstruction ยาว 2.90 วินาทีบนแทร็กของตัวเอง; ฟุตเทจต้นฉบับด้านล่างไม่ถูกแตะต้อง ฟุตเทจจากบุคคลที่สามถูกเบลอเรารันจริง: 7 งาน
เรารันงาน 7 งานผ่านแอปเดสก์ท็อป Codex และ Claude Code โดยใช้ Seedance 2 Mini สำหรับวิดีโอ และ GPT Image 2 สำหรับรูปภาพ นี่คือผลลัพธ์ของแต่ละงาน:
- โมชันกราฟิกบนคลิป talking-head เราขอให้มันคัดลอกสไตล์ตัดต่อแบบกระดาษฉีก สติกเกอร์ และเทปของครีเอเตอร์คนหนึ่ง มาลงบนคลิป talking-head ของเราเอง มันสร้างลุคกลับมาได้เนียนน่าเชื่อ
- สลับชุด วิดีโอ try-on ที่กำลังมาแรง โดยเปลี่ยนชุดเป็นคอสตูมจากวิดีโอเกม ในช็อตส่วนใหญ่ยังดูไหว
- ถ่ายโอนสไตล์ คลิปมีมที่ถูกวาดใหม่เป็นสไตล์แอนิเมชันสำหรับผู้ใหญ่ที่เป็นที่รู้จัก มันใช้คลิปเดิมเป็นฐานแล้วรีสไตล์ทับ และผลลัพธ์ดีจริง
- สลับตัวแบบ วิดีโอร้องเพลงไวรัลที่มีไลก์ราว ๆ หนึ่งล้าน โดยเปลี่ยนนักแสดง 2 คนเป็นแมว 2 ตัว มีจุดพลาดเล็กน้อย แต่โดยรวมแข็งแรงมาก (คลิปแรกด้านล่าง)
- สไตล์เดิม คอนเทนต์ใหม่ จากคลิปอธิบายการเงินยอดนิยม เอเจนต์เขียนสคริปต์ใหม่ “Why HBM matters” วาดไดอะแกรมด้วยโค้ด และสร้างพรีเซนเตอร์หน้ากล้องไว้ที่มุมซ้ายบน รายงานของมัน: “ส่งออกแล้ว 37.1 วินาที 1080p … รันการสร้างแค่รอบแรก ไม่มีการสร้างแบบเสียเงินเพิ่มเติม” ทั้งงานใช้เวลาของเอเจนต์ 1 ชั่วโมง 8 นาที
- เซอร์ไพรส์จาก Blender เราขอให้มันสลับอักษรย่อที่เรียงด้วยโดมิโนในวิดีโอของนักรีวิวสายเทค มันข้ามโมเดลวิดีโอไปเลย แล้วสร้างช็อตใหม่ใน Blender เรนเดอร์ 87 เฟรม (2.9 วินาทีที่ 30 fps) แล้วนำไปแทรกในฟุตเทจเดิมที่ส่วนอื่นไม่ได้เปลี่ยนเลย นี่คือการแก้แบบผ่าตัดที่คมที่สุดของสัปดาห์
- รีวิวมือถือแบบภาพยนตร์ รีวิวสินค้าสไตล์หนังที่รีเมกใหม่ด้วยพรีเซนเตอร์ดิจิทัลและ B-roll ที่สร้างขึ้น (คลิปที่สองด้านล่าง) โดยรวมเป็นผลลัพธ์ที่อ่อนที่สุด: กลิ่น AI ชัด และยังห่างจากเอดิเตอร์มนุษย์พอสมควร
- สเก็ตช์อีคอมเมิร์ซ จากภาพอ้างอิง 1 ภาพและวิดีโอต้นฉบับ มันรีเมกสเก็ตช์ขายของสั้น ๆ ที่ตุ๊กตาทุบไข่ด้วยค้อน เราให้คะแนนว่าใกล้เคียงต้นฉบับ ซึ่งตัวต้นฉบับเองก็เป็นงานที่สร้างด้วย AI อยู่แล้ว
หมายเหตุเกี่ยวกับสิ่งที่เราแสดงที่นี่: การทดสอบส่วนใหญ่เริ่มจากวิดีโอของครีเอเตอร์คนอื่น ๆ และใบหน้า เสียง และฟุตเทจเหล่านั้นไม่ใช่ของเราที่จะนำมาเผยแพร่ซ้ำ ดังนั้นคลิปด้านล่างเป็นเอาต์พุตที่ไม่มีคนอยู่บนหน้าจอ และปิดเสียงไว้
คลิปเดโมจากการรันของเรา
เอาต์พุต 2 ชิ้นแบบไม่ตัดต่อจากการทดสอบด้านบน ตัดมาจากบันทึกหน้าจอของเรา
คำตัดสินแบบตรงไปตรงมา: จุดแข็งและข้อจำกัดจริง
สิ่งที่เราประทับใจ:
- มันโคลน “โครงสร้าง” ไม่ใช่แค่สคริปต์ เอาต์พุตเป็นโปรเจกต์ที่รันซ้ำได้ ดังนั้นการสลับโฮสต์ สินค้า หรือภาษา คือการรันรอบใหม่ ไม่ใช่การตัดต่อใหม่
- ไทม์มิงผูกกับคำพูด แก้ประโยคแล้ว B-roll คำบรรยาย และคัตต่าง ๆ ยังซิงก์กัน
- มันเลือกเครื่องมือที่ถูกที่สุดที่ยังทำงานได้ มันใช้โมเดลวิดีโอเมื่อจำเป็นต้องสร้าง และใช้โค้ดหรือแม้แต่ Blender เมื่อการแก้แบบผ่าตัดก็พอ
- โปร่งใสเรื่องค่าใช้จ่าย มันประเมินทีละขั้นและถามก่อนเรียกใช้แบบเสียเงิน ซึ่งหาได้ยากในเครื่องมือสายเอเจนต์
จุดที่ยังไม่ถึง:
- ค่าเอเจนต์ต่างหากที่เป็นบิลจริง ตัวอย่างใน README ของ Hypit ระบุค่าธรรมเนียมโมเดลราว ๆ $1.10 ต่อการโคลน 1 ครั้ง แต่ในการทดสอบของเรา ต้นทุนที่ใหญ่กว่าคือเอเจนต์เขียนโค้ด: 7 งานทำให้แพ็กเกจ ChatGPT ราคา $100 ของเราจากใช้ได้ 50% เหลือ 3% ของโควตาการใช้งาน
- มันช้า การโคลน 1 งานใช้เวลาของเอเจนต์มากกว่า 1 ชั่วโมง
- รีเมกแบบสมจริงยังดูเป็น AI รีวิวแบบภาพยนตร์ดูสังเคราะห์ชัด และช็อตที่สร้างมีอาร์ติแฟกต์เล็ก ๆ
- คุณต้องมีเวิร์กโฟลว์แบบเอเจนต์ คุณต้องมี coding agent, Node.js 22.15+ และแอคเคานต์โมเดล มันเป็นมิตรกับนักพัฒนา ไม่ใช่คนที่ “แค่อยากได้วิดีโอ”
- ไลเซนส์ไม่ใช่แบบ permissive เต็มรูปแบบ คุณโฮสต์ Hypit เป็นบริการให้ทีมอื่นใช้ หรือเอาไปขายต่อไม่ได้ หากไม่มีไลเซนส์เชิงพาณิชย์
- เรื่องสิทธิ์เป็นความรับผิดชอบของคุณ Hypit บอกว่าเอาต์พุตเป็นของคุณ แต่ใบหน้า เสียง ฟุตเทจ และเพลงในวิดีโออ้างอิงเป็นของเจ้าของสิทธิ์ โปรดมองวิดีโอไวรัลเป็น “โครงสร้าง” ไว้เรียนรู้ ไม่ใช่เนื้อหาสำหรับเอาไปเผยแพร่ซ้ำ
Hypit vs เครื่องมือวิดีโอ AI แบบโฮสต์
Hypit และเครื่องมือแบบโฮสต์อย่าง VisionStory ต่างก็ลงท้ายด้วยวิดีโอที่เสร็จแล้วเหมือนกัน แต่เริ่มต้นคนละจุด และคิดเงินคนละแบบ
| Hypit (สกิลเอเจนต์) | VisionStory (แบบโฮสต์) | |
|---|---|---|
| จุดเริ่มต้น | วิดีโออ้างอิง หรือบรีฟเป็นลายลักษณ์อักษร | รูปภาพ อวาตาร์ หรือสคริปต์ |
| การตั้งค่า | ติดตั้งสกิล; ต้องมีเอเจนต์เขียนโค้ด, Node.js 22.15+ และแอคเคานต์โมเดล | ไม่มี; รันบนเบราว์เซอร์ |
| สิ่งที่คุณต้องจ่าย | ค่าใช้งานเอเจนต์เขียนโค้ด + เครดิตโมเดล (ตัวอย่าง Hypit อยู่ราว ๆ $1 เป็นค่าธรรมเนียมโมเดลต่อการโคลน 1 ครั้ง; แต่ค่าการใช้งานเอเจนต์ของเราสูงกว่านั้นมาก) | การสมัครสมาชิกหรือเครดิต |
| เวลาต่อวิดีโอ | ตั้งแต่นาทีไปจนถึงมากกว่า 1 ชั่วโมงของเวลาเอเจนต์ | ไม่กี่นาที |
| สิ่งที่คุณได้ | โปรเจกต์ SVML ที่แก้ไขได้และรันซ้ำได้ + ไฟล์เรนเดอร์ | วิดีโออวาตาร์พูดหรือวิดีโอ AI ที่เสร็จแล้ว |
| สิทธิ์ | คุณต้องเคลียร์สิทธิ์ของฟุตเทจ ใบหน้า หรือเสียงที่คุณโคลน | อวาตาร์และเสียงของคุณเองหรือที่มีไลเซนส์ |
| เหมาะที่สุดเมื่อ | คุณจะทำเงินจากเวอร์ชันย่อยจำนวนมาก และทำงานอยู่ในเวิร์กโฟลว์แบบเอเจนต์ | คุณอยากได้วิดีโอพูดที่เสร็จสมบูรณ์ โดยไม่ต้องรันเอเจนต์ |
เลือก Hypit ถ้า คุณกำลังผลิตโฆษณาหรือเวอร์ชัน UGC จำนวนมาก รูปแบบที่ชนะคุ้มค่ากับการทำเป็นเทมเพลต และทีมมีนักพัฒนา เลือกเครื่องมือแบบโฮสต์ถ้า คุณต้องการวิดีโอพรีเซนเตอร์วันนี้ และไม่อยากจ่ายเวลาเอเจนต์เป็นชั่วโมง ๆ เพื่อให้ได้มันมา
สิ่งที่ Hypit สอนเรา
หลังจากลองรันอยู่หนึ่งสัปดาห์ มุมมองของเราคือ “โคลนวิดีโอไวรัลอะไรก็ได้” เป็นพาดหัว ไม่ใช่แก่นจริง ไอเดียที่ยั่งยืนคือการเปลี่ยน โครงสร้าง ของวิดีโอให้เป็นเทมเพลตที่เอเจนต์รันซ้ำได้ คุณแยกสิ่งที่เวิร์กในวิดีโอของคนอื่นและของตัวเอง เก็บโครงไว้ แล้วให้เอเจนต์สร้างส่วนที่เปลี่ยนไป นั่นคือทิศทางที่วิดีโอ AI กำลังมุ่งหน้าไป และเป็นทิศทางเดียวกับ AI Video Agent ของเรา: บรรยายวิดีโอที่คุณต้องการ แล้วให้เอเจนต์ประกอบให้ โดยไม่ต้องตั้งค่าและไม่ต้องจ่ายบิลเอเจนต์
ถ้าคุณอยากดูอีกมุมของวิดีโอที่ขับเคลื่อนด้วยเอเจนต์ ลองอ่านบทแกะเครื่องของเราเกี่ยวกับ OpenMontage ซึ่งไล่แนวคิดคล้ายกันแต่ใช้พายป์ไลน์ต่างออกไป
