Hypit est arrivé sur GitHub le 29 juillet 2026 et a dépassé les 8 000 étoiles en quelques jours. Au 22 septembre, il comptait plus de 13 000 étoiles et 1 500 forks, et il a pris la tête du classement quotidien de Trendshift. Son message est direct : cloner n’importe quelle vidéo virale avec des agents IA. Nous l’avons installé, fait tourner sept tâches réelles via Codex et Claude Code, et noté ce qu’il produit, comment il fonctionne sous le capot et ce que cela a réellement coûté. Voici notre démontage. Source : github.com/hypit-ai/hypit.
Qu’est-ce que Hypit ?
Hypit, de Hypit.AI, fournit à des agents de codage IA comme Claude Code et Codex “un langage et un système pour créer de la vidéo”. Ce n’est pas un éditeur hébergé. Il est livré sous forme de Skill d’agent, d’un outil en ligne de commande et d’un monorepo TypeScript de 122 packages : des connecteurs pour Seedance, GPT Image, Nano Banana, Grok Imagine, MiniMax, ElevenLabs et Fish Audio, plus des sous-titres, la suppression d’arrière-plan, des pistes de B-roll, des effets de film et un moteur de rendu.
L’idée centrale est SVML, le langage de balisage propre à Hypit. Votre agent écrit la vidéo en SVML ; Hypit le compile et rend les images (ses exemples rendent dans 64 processus Chromium headless en parallèle). Le timing est ancré sur les mots, pas sur les secondes. WhisperX aligne chaque mot prononcé, et les visuels se rattachent à des portions du script. Voici du vrai code extrait de l’exemple “football tier-list” du repo :
<HOST>Ronaldo is <D | Dee> tier. || Bro has @{hair-gel} more ||
hair gel than @{trophy} trophies || at this point.@{/trophy}@{/hair-gel}
<media-track:Item id="hair-gel" image={broll-hair-gel.image}
extent={hair-gel-extent} during={story.selection.hair-gel}
motion={recipes.motion.broll-left}/>L’image de B-roll hair-gel reste à l’écran exactement pendant que ces mots sont prononcés. Réécrivez la phrase et le timing se recalcule tout seul, ce qui explique pourquoi un même projet peut générer des dizaines de variantes.
Trois autres choses à savoir avant de l’installer :
- Les modèles de génération sont optionnels. Un projet peut compiler les sous-titres, les animations graphiques et des visuels rendus par du code en une vidéo finale sans appeler aucun modèle vidéo.
- Vous payez les services, pas Hypit. Hypit est gratuit ; votre agent de codage et vos fournisseurs de modèles facturent séparément. Son service hébergé recommandé, HypiHub, vendait des crédits à 15 $ les 2 000 lors de notre test, et vous pouvez plutôt utiliser vos propres clés API ou des modèles locaux.
- La licence comporte des conditions. La “Hypit Open Source License” est une Apache 2.0 avec des clauses supplémentaires : vous pouvez l’utiliser commercialement au sein de votre propre organisation, mais l’héberger comme service multi-tenant pour d’autres ou le revendre nécessite une licence commerciale. Les vidéos que vous créez vous appartiennent.
Comment ça marche : ce que nous avons vu lors de nos tests
L’installation se fait avec une seule commande : npx skills add hypit-ai/hypit -g. Au premier usage, l’agent trouve ou installe l’exécutable Hypit (Node.js 22.15 ou plus récent). Ensuite, chaque tâche a suivi la même boucle.
1. L’agent regarde et décompose la référence
Nous avons donné à Codex une vidéo explicative de 34 secondes sur la finance et tapé “Hypit, copie cette vidéo.” Il a regardé le clip, décrit sa structure (une intro face-cam suivie de cinq graphiques de marché empilés les uns après les autres, avec des zooms et des contrastes exagérés) et proposé un plan : conserver l’hôte, la voix et le script, et reconstruire les graphiques, sous-titres et mouvements de caméra comme des éléments modifiables. Puis il nous a demandé ce que nous voulions remplacer.
2. Il chiffre le job avant de dépenser quoi que ce soit
C’était la partie la plus rassurante. Avant tout appel payant, l’agent a présenté un tableau de coûts et a attendu. Pour un clip face-cam en chinois, il a annoncé 4,39 crédits (environ 0,03 $) pour transcrire l’original et le reconstruire localement, contre 5,69–9,34 $, hors nouvelles tentatives, pour régénérer les 132 secondes de plans à l’écran en 720p. Il a ensuite demandé l’autorisation de facturer au maximum 10 crédits (environ 0,075 $) pour la transcription seule, en précisant qu’“aucun appel payant n’a encore été effectué”.
3. Il construit, rend et vous remet un projet éditable
Une fois le plan approuvé, l’agent génère les éléments, compile le SVML et rend la vidéo. Vous obtenez un fichier final et le projet qui l’a produit, qui s’ouvre dans Hypit Studio : sources à gauche, aperçu au centre, propriétés à droite et une timeline multi-pistes en bas. Vous pouvez éditer à la main ou demander à l’agent de relire et de corriger le montage lui-même.

lsj-reconstruction de 2,90 secondes sur sa propre piste ; les images d’origine en dessous sont intactes. Les séquences tierces sont floutées.On l’a vraiment utilisé : sept tâches
Nous avons exécuté sept tâches via les apps desktop Codex et Claude Code, en utilisant Seedance 2 Mini pour la vidéo et GPT Image 2 pour les images. Voici ce que chacune a produit :
- Motion graphics sur face-cam. Nous lui avons demandé de copier le style de montage d’un créateur (papier déchiré, autocollants et adhésif) sur l’un de nos propres clips face-cam. Il a recréé le look de façon convaincante.
- Changement de tenue. Une vidéo d’essayage tendance avec la tenue remplacée par un costume de jeu vidéo. Ça tient dans la plupart des plans.
- Transfert de style. Un meme redessiné dans un style d’animation adulte bien connu. Il a utilisé le clip original comme base et a restylisé par-dessus ; le résultat était vraiment bon.
- Remplacement du sujet. Une vidéo virale de chant avec environ un million de likes, où les deux interprètes sont remplacés par deux chats. Il y avait de petits défauts, mais l’ensemble était solide (premier clip ci-dessous).
- Même style, nouveau contenu. À partir d’une vidéo explicative populaire sur la finance, l’agent a écrit un nouveau script “Why HBM matters”, dessiné les schémas en code et généré un présentateur à l’écran dans le coin supérieur gauche. Son rapport : “Exporté, 37,1 s, 1080p … seul le premier cycle de génération a été lancé ; aucune génération payante supplémentaire.” L’ensemble de la tâche a pris 1 heure 8 minutes de temps d’agent.
- La surprise Blender. Chargé de remplacer les initiales formées par des dominos dans la vidéo d’un testeur tech, il a totalement évité les modèles vidéo. Il a reconstruit le plan dans Blender, rendu 87 images (2,9 secondes à 30 fps) et les a insérées dans des images par ailleurs inchangées. C’était la correction la plus chirurgicale de la semaine.
- Test cinématographique d’un smartphone. Un test produit en style film refait avec un présentateur numérique et du B-roll généré (deuxième clip ci-dessous). Globalement, c’était le résultat le plus faible : l’aspect IA sautait aux yeux, et c’est loin derrière un monteur humain.
- Saynète e-commerce. À partir d’une image de référence et de la vidéo source, il a refait une courte saynète de vente où une poupée casse des œufs avec un marteau. Nous l’avons jugée à peu près au niveau de l’original, qui était lui-même généré par IA.
Une précision sur ce que nous montrons ici : la plupart de ces tests partaient de vidéos d’autres créateurs, et ces visages, voix et séquences ne nous appartiennent pas et ne peuvent pas être republiés. Les clips ci-dessous sont donc des sorties sans personnes à l’écran, et leur audio est coupé.
Clips de démo issus de nos tests
Deux sorties non éditées des tests ci-dessus, découpées depuis notre enregistrement d’écran.
Verdict honnête : points forts et limites réelles
Ce qui nous a impressionnés :
- Il clone une structure, pas seulement un script. La sortie est un projet relançable ; remplacer l’hôte, le produit ou la langue, c’est une nouvelle exécution, pas un nouveau montage.
- Un timing ancré sur les mots. Réécrivez une phrase, et le B-roll, les sous-titres et les coupes restent synchronisés.
- Il choisit l’outil le moins cher qui marche. Il utilise des modèles vidéo quand il doit générer, et du code, voire Blender, quand une correction chirurgicale suffit.
- Transparence des coûts. Il estime chaque étape et demande avant les appels payants — ce qui est rare pour des outils d’agent.
Là où il montre ses limites :
- L’agent, c’est la vraie facture. Les exemples du README de Hypit affichent environ 1,10 $ de frais de modèles par clone. Dans nos tests, le coût le plus élevé était l’agent de codage : sept tâches ont fait passer notre formule ChatGPT à 100 $ de 50 % à 3 % de son quota d’utilisation.
- C’est lent. Un clone a pris plus d’une heure de temps d’agent.
- Les remakes réalistes ont encore un look IA. Le test cinématographique était clairement synthétique, et les plans générés montraient de petits artefacts.
- Il faut un workflow d’agent. Il vous faut un agent de codage, Node.js 22.15+ et des comptes chez les fournisseurs de modèles. C’est pensé pour les développeurs, pas pour quelqu’un qui veut juste une vidéo.
- La licence n’est pas totalement permissive. Vous ne pouvez pas héberger Hypit comme service pour d’autres équipes ni le revendre sans licence commerciale.
- Les droits, c’est votre responsabilité. Hypit dit que vos sorties vous appartiennent, mais les visages, voix, séquences et musiques de la référence appartiennent à leurs propriétaires. Considérez une vidéo virale comme une structure dont on s’inspire, pas comme un contenu à republier.
Hypit vs un outil Vidéo IA hébergé
Hypit et des outils hébergés comme VisionStory aboutissent tous deux à une vidéo finalisée, mais ils partent de points de départ différents et ne facturent pas de la même façon.
| Hypit (skill d’agent) | VisionStory (hébergé) | |
|---|---|---|
| Point de départ | Une vidéo de référence ou un brief écrit | Une photo, un avatar ou un script |
| Configuration | Installer la skill ; agent de codage, Node.js 22.15+ et comptes modèles | Aucune ; tout tourne dans le navigateur |
| Ce que vous payez | L’usage de l’agent de codage + des crédits de modèles (environ 1 $ de frais de modèles par clone dans les exemples de Hypit ; notre coût d’usage d’agent était bien plus élevé) | Un abonnement ou des Crédits |
| Temps par vidéo | De quelques minutes à plus d’une heure de temps d’agent | Quelques minutes |
| Ce que vous obtenez | Un projet SVML modifiable et relançable + le rendu | Une vidéo d’avatar parlant ou une Vidéo IA finalisée |
| Droits | Vous devez obtenir les droits pour toute séquence, tout visage ou toute voix clonés | Vos propres avatars et voix, ou sous licence |
| Idéal quand | Vous monétisez de nombreuses variantes et vous travaillez au quotidien avec des agents | Vous voulez une vidéo parlante finalisée sans lancer d’agent |
Choisissez Hypit si vous produisez des publicités ou des variantes UGC à grande échelle, qu’un format gagnant mérite d’être transformé en modèle, et qu’un développeur est dans l’équipe. Choisissez un outil hébergé si vous voulez une vidéo de présentateur dès aujourd’hui et préférez éviter de payer des heures de temps d’agent pour l’obtenir.
Ce que Hypit nous a appris
Après une semaine de tests, notre conclusion est que “cloner n’importe quelle vidéo virale” est le titre, pas l’essentiel. L’idée durable, c’est de transformer la structure d’une vidéo en modèle qu’un agent peut relancer. Vous décomposez ce qui marche dans les vidéos des autres et dans les vôtres, vous gardez le squelette, et vous laissez l’agent générer les parties qui changent. C’est là que va la Vidéo IA, et c’est la même direction que notre AI Video Agent : décrire la vidéo que vous voulez et laisser un agent l’assembler, sans configuration ni facture d’agent.
Pour un autre point de vue sur la vidéo pilotée par agent, voyez notre démontage d’OpenMontage, qui poursuit une idée similaire avec un pipeline différent.
