한국어

Hypit은 2026년 7월 29일 GitHub에 올라온 뒤 며칠 만에 8,000 스타를 넘겼습니다. 9월 22일 기준으로는 13,000+ 스타와 1,500 포크를 기록했고 Trendshift 일간 차트 1위도 찍었죠. 메시지는 단도직입적입니다. AI 에이전트로 어떤 바이럴 영상이든 복제하라. 우리는 직접 설치해 Codex와 Claude Code로 실제 작업 7개를 돌려 보고, 무엇을 만들었는지, 내부적으로 어떻게 동작하는지, 그리고 실제 비용이 얼마였는지까지 기록했습니다. 이 글은 그 해부기입니다. 출처: github.com/hypit-ai/hypit.

Hypit이란?

Hypit.AI의 Hypit은 Claude Code, Codex 같은 AI 코딩 에이전트에게 “비디오를 만들기 위한 언어와 시스템”을 제공합니다. 호스팅형 편집기는 아닙니다. 에이전트 Skill, 커맨드라인 도구, 그리고 122개 패키지로 구성된 TypeScript 모노레포 형태로 배포되며, Seedance, GPT Image, Nano Banana, Grok Imagine, MiniMax, ElevenLabs, Fish Audio용 커넥터는 물론 자막, 배경 제거, B-roll 트랙, 필름 효과, 렌더러까지 포함합니다.

핵심 아이디어는 Hypit의 자체 마크업 언어인 SVML입니다. 에이전트가 비디오를 SVML로 작성하면, Hypit이 이를 컴파일해 프레임을 렌더링합니다(예시에서는 헤드리스 Chromium 프로세스 64개를 병렬로 돌려 렌더링합니다). 타이밍은 ‘초’가 아니라 단어에 고정됩니다. WhisperX가 발화된 모든 단어를 정렬하고, 비주얼은 스크립트의 특정 구간(span)에 붙습니다. 아래는 레포지토리의 축구 티어 리스트 예제에 들어 있는 실제 코드입니다:

<HOST>Ronaldo is <D | Dee> tier. || Bro has @{hair-gel} more ||
  hair gel than @{trophy} trophies || at this point.@{/trophy}@{/hair-gel}

<media-track:Item id="hair-gel" image={broll-hair-gel.image}
  extent={hair-gel-extent} during={story.selection.hair-gel}
  motion={recipes.motion.broll-left}/>

hair-gel B-roll 이미지는 해당 단어들이 발화되는 동안 정확히 화면에 표시됩니다. 문장을 고쳐 쓰면 타이밍이 자동으로 다시 흐르기 때문에, 하나의 프로젝트에서 수십 개 변형을 뽑아낼 수 있는 거죠.

설치하기 전에 알아두면 좋은 포인트 3가지:

  • 생성 모델은 선택 사항입니다. 비디오 모델을 호출하지 않고도, 자막·모션 그래픽·코드로 렌더링된 비주얼을 컴파일해 완성된 비디오로 만들 수 있습니다.
  • 돈은 Hypit이 아니라 서비스에 냅니다. Hypit은 무료이며, 코딩 에이전트와 모델 제공업체가 각각 과금합니다. Hypit이 추천하는 호스팅 서비스 HypiHub는 우리 테스트에서 2,000 크레딧을 $15에 판매했고, 대신 본인 API 키나 로컬 모델을 연결해 쓸 수도 있습니다.
  • 라이선스에는 조건이 있습니다. “Hypit Open Source License”는 Apache 2.0에 추가 조항이 붙은 형태입니다. 자체 조직 내부에서 상업적으로 사용하는 것은 가능하지만, 다른 사람들을 위해 멀티 테넌트 서비스로 호스팅하거나 재판매하려면 상업용 라이선스가 필요합니다. 당신이 만든 비디오는 당신 소유입니다.

작동 방식: 우리가 돌려보며 확인한 것

설치는 명령어 한 줄이면 됩니다: npx skills add hypit-ai/hypit -g. 처음 실행하면 에이전트가 Hypit 실행 파일을 찾아주거나 설치합니다(Node.js 22.15 이상 필요). 그다음부터는 모든 작업이 같은 루프로 진행됐습니다.

1. 에이전트가 레퍼런스를 보고 분해합니다

우리는 Codex에 34초짜리 금융 설명 영상을 주고 “Hypit, 이 영상 복사해.”라고 입력했습니다. 그러자 클립을 보고 구조를 설명했죠(토킹헤드 인트로 뒤에 시장 차트 5개가 순서대로 쌓이고, 줌과 과장된 대비가 들어가는 구성). 그리고 호스트·음성·스크립트는 유지하되, 차트·자막·카메라 무브를 편집 가능한 요소로 다시 구축하겠다는 계획을 제안했습니다. 마지막으로 무엇을 교체하길 원하는지 물었습니다.

2. 돈을 쓰기 전에 작업 비용을 먼저 산정합니다

이 부분이 가장 안심됐습니다. 유료 호출을 하기 전에 에이전트가 비용 표를 제시하고 대기합니다. 중국어 토킹헤드 클립의 경우, 원본을 전사하고 로컬에서 재구성하는 데 4.39 크레딧(약 $0.03)이 든다고 했고, 720p로 카메라에 잡힌 화면 132초를 전부 재생성하려면 재시도 전 기준 $5.69–9.34가 든다고 안내했습니다. 이어서 전사만 진행하는 비용으로 최대 10 크레딧(약 $0.075)까지 청구해도 되는지 허락을 구하면서, “아직 유료 호출은 한 번도 발생하지 않았다”고 명시했습니다.

3. 빌드·렌더링 후, 편집 가능한 프로젝트를 넘겨줍니다

승인하면 에이전트가 구성 요소를 생성하고, SVML을 컴파일해 렌더링합니다. 완성 파일 그리고 그 뒤에 있는 프로젝트까지 함께 받게 되며, 이는 Hypit Studio에서 열립니다. 왼쪽에는 소스, 가운데에는 프리뷰, 오른쪽에는 속성, 아래에는 멀티 트랙 타임라인이 배치됩니다. 수동으로 편집할 수도 있고, 에이전트에게 컷을 직접 검토하고 수정해 달라고 요청할 수도 있습니다.

Hypit Studio showing SVML source, preview, project properties and a timeline with a 2.9-second reconstruction track
우리 프로젝트 중 하나에서의 Hypit Studio 화면. 생성된 부분은 별도 트랙에 있는 2.90초짜리 lsj-reconstruction 클립뿐이며, 아래의 원본 푸티지는 손대지 않았습니다. 서드파티 푸티지는 블러 처리했습니다.

직접 돌려봤습니다: 7가지 작업

우리는 Codex와 Claude Code 데스크톱 앱으로 작업 7개를 실행했으며, 비디오는 Seedance 2 Mini, 이미지는 GPT Image 2를 사용했습니다. 각 작업에서 나온 결과는 다음과 같습니다:

  • 토킹헤드 모션 그래픽. 크리에이터의 찢어진 종이·스티커·테이프 감성 편집 스타일을 우리 토킹헤드 클립에 그대로 복사해 달라고 했더니, 꽤 설득력 있게 룩을 재현했습니다.
  • 의상 스왑. 유행하는 착용(try-on) 영상에서 의상을 게임 캐릭터 코스튬으로 바꾼 작업. 대부분의 샷에서 잘 버텼습니다.
  • 스타일 트랜스퍼. 밈 클립을 유명한 성인 애니메이션 스타일로 다시 그린 작업. 원본 클립을 베이스로 삼고 그 위에 리스타일링했는데, 결과물이 진짜로 좋았습니다.
  • 피사체 스왑. 좋아요가 약 100만 개 달린 바이럴 노래 영상에서 두 퍼포머를 고양이 2마리로 교체. 작은 흠은 있었지만 전체적으로는 강했습니다(아래 첫 번째 클립).
  • 같은 스타일, 새로운 내용. 인기 있는 금융 설명 영상에서 에이전트가 “HBM이 왜 중요한가”라는 새 스크립트를 쓰고, 도표를 코드로 그린 다음, 왼쪽 상단 구석에 온카메라 진행자를 생성했습니다. 리포트에는 이렇게 적혀 있었습니다: “내보내기 완료, 37.1초, 1080p … 1차 생성만 실행됨, 추가 유료 생성 없음.” 전체 작업은 에이전트 시간 기준 1시간 8분이 걸렸습니다.
  • Blender의 깜짝 활용. 테크 리뷰어 영상에서 도미노로 찍어낸 이니셜만 바꿔 달라고 하자, 비디오 모델을 아예 쓰지 않았습니다. 대신 Blender에서 샷을 재구성해 87 프레임(30 fps 기준 2.9초)을 렌더링한 뒤, 나머지는 그대로인 푸티지에 깔끔하게 끼워 넣었습니다. 이번 주 테스트 중 가장 ‘외과 수술’ 같은 수정이었습니다.
  • 시네마틱 폰 리뷰. 영화 같은 제품 리뷰를 디지털 프레젠터와 생성된 B-roll로 재제작(아래 두 번째 클립). 전체적으로는 가장 약한 결과였습니다. AI 티가 뚜렷했고, 사람 편집자와 비교하면 한참 뒤처졌습니다.
  • 이커머스 스킷. 레퍼런스 이미지 1장과 소스 비디오로, 인형이 망치로 계란을 깨는 짧은 판매 스킷을 재제작했습니다. 원본 자체도 AI 생성이었는데, 대략 그와 비슷한 수준으로 평가했습니다.

여기서 보여드리는 내용에 대한 참고: 테스트 대부분은 다른 크리에이터의 영상에서 시작했으며, 그 얼굴·목소리·푸티지는 우리가 재게시할 권리가 없습니다. 그래서 아래 클립은 화면에 사람이 나오지 않는 출력물만 골랐고, 오디오도 음소거되어 있습니다.

테스트에서 나온 데모 클립

위 테스트에서 나온 결과물 중, 화면 녹화에서 그대로 잘라낸 무편집 출력 2개입니다.

피사체 스왑: 바이럴 노래 영상 속 두 퍼포머를 고양이 2마리로 교체. Hypit은 생성을 Seedance 2 Mini로 보냈습니다.
시네마틱 폰 리뷰 리메이크에서 생성된 B-roll: 지구 위로 떠 있는 스마트폰, 분해되어 날아가는 부품들, 대기를 가로지르며 질주하는 칩.

솔직한 결론: 장점과 현실적인 한계

인상적이었던 점:

  • 스크립트가 아니라 ‘구조’를 복제합니다. 결과물은 재실행 가능한 프로젝트라서, 호스트·제품·언어를 바꾸는 건 ‘새 편집’이 아니라 ‘새 실행’입니다.
  • 단어 기준 타이밍. 한 줄을 고쳐 써도 B-roll, 자막, 컷이 계속 싱크를 유지합니다.
  • 되면 가장 싼 도구를 고릅니다. 생성해야 할 때는 비디오 모델을 쓰고, 외과적 수정만 필요하면 코드나 심지어 Blender까지 사용합니다.
  • 비용 투명성. 각 단계별 예상 비용을 내고 유료 호출 전에 확인을 받습니다. 에이전트 도구 중에서는 드문 방식입니다.

아쉬운 점:

  • 진짜 비용은 에이전트입니다. Hypit의 README 예시는 클론 1회당 모델 비용이 약 $1.10이라고 적습니다. 하지만 우리 테스트에서 더 큰 비용은 코딩 에이전트였습니다. 7개 작업을 돌리는 동안 $100짜리 ChatGPT 플랜의 사용 한도가 50%에서 3%로 내려갔습니다.
  • 느립니다. 클론 1개가 에이전트 시간 기준 1시간이 넘게 걸리기도 했습니다.
  • 리얼한 리메이크도 여전히 AI처럼 보입니다. 시네마틱 리뷰는 합성 느낌이 뚜렷했고, 생성 샷에는 작은 아티팩트가 보였습니다.
  • 에이전트 워크플로가 필요합니다. 코딩 에이전트, Node.js 22.15+ 그리고 모델 계정이 필요합니다. 개발자에게는 친화적이지만, 그냥 비디오만 만들고 싶은 사람에게는 어렵습니다.
  • 완전한 퍼미시브 라이선스는 아닙니다. 상업용 라이선스 없이 Hypit을 다른 팀을 위한 서비스로 호스팅하거나 재판매할 수 없습니다.
  • 권리는 사용자 책임입니다. Hypit은 출력물이 당신 소유라고 말하지만, 레퍼런스의 얼굴·음성·푸티지·음악은 원 소유자에게 권리가 있습니다. 바이럴 영상을 ‘재게시할 소재’가 아니라 ‘학습할 구조’로 다루는 게 안전합니다.

Hypit vs 호스팅형 AI 비디오 도구

Hypit과 VisionStory 같은 호스팅형 도구는 모두 ‘완성된 비디오’로 끝나지만, 출발점도 다르고 과금 방식도 다릅니다.

 Hypit (에이전트 스킬)VisionStory (호스팅형)
시작점레퍼런스 비디오 또는 서면 브리프사진, 아바타 또는 스크립트
설정스킬 설치; 코딩 에이전트, Node.js 22.15+ 및 모델 계정 필요없음; 브라우저에서 실행
지불 항목코딩 에이전트 사용량 + 모델 크레딧(Hypit 예시 기준 클론당 모델 비용 약 $1; 우리 테스트에서는 에이전트 사용 비용이 훨씬 큼)구독 또는 크레딧
비디오당 소요 시간수 분 ~ 에이전트 시간 1시간 이상수 분
결과물편집 가능하고 재실행 가능한 SVML 프로젝트 + 렌더 결과완성된 토킹 아바타 또는 AI 비디오
권리클론한 푸티지·얼굴·목소리의 권리 정리는 사용자가 해야 함본인 소유 또는 라이선스된 아바타와 음성
잘 맞는 경우다양한 변형을 대량으로 수익화할 계획이고, 에이전트 워크플로에 익숙할 때에이전트를 돌리지 않고도 지금 바로 완성된 토킹 비디오가 필요할 때

Hypit을 고르세요: 광고나 UGC 변형을 대량으로 제작하고, 성과가 검증된 포맷은 템플릿화할 가치가 있으며, 팀에 개발자가 있을 때. 호스팅형 도구를 고르세요: 오늘 당장 프레젠터 비디오가 필요하고, 그걸 얻기 위해 에이전트 시간을 몇 시간씩 결제하고 싶지 않을 때.

Hypit이 우리에게 보여준 것

일주일간 직접 돌려본 결론은 이렇습니다. “바이럴 영상을 뭐든 복제”는 헤드라인일 뿐, 핵심은 아닙니다. 오래 남을 아이디어는 비디오의 구조를 에이전트가 재실행할 수 있는 템플릿으로 바꾸는 것입니다. 남의 영상과 내 영상에서 ‘먹히는 요소’를 분해해 뼈대는 유지하고, 바뀌는 부분만 에이전트가 생성하게 만드는 거죠. AI 비디오는 그 방향으로 가고 있고, 이는 우리 AI 비디오 에이전트가 지향하는 방향과도 같습니다. 복잡한 설정이나 에이전트 사용료 없이, 원하는 비디오를 설명하면 에이전트가 조립해 주는 것.

에이전트 기반 비디오에 대한 또 다른 관점이 궁금하다면, 비슷한 아이디어를 다른 파이프라인으로 구현한 OpenMontage 해부기도 참고해 보세요.

자주 묻는 질문

  • Hypit은 무료로 사용할 수 있으며, 소스 코드는 GitHub에 공개되어 있습니다(Hypit Open Source License: Apache 2.0에 추가 조건이 붙은 라이선스). 자체 조직 내부에서는 상업적으로 사용해도 되지만, 타인을 대상으로 멀티 테넌트 서비스 형태로 운영하거나 재판매하려면 상업용 라이선스가 필요합니다. 또한 사용 중인 코딩 에이전트와 모델 서비스 비용은 별도로 지불해야 합니다.