Toute vidéo IA commence par un script, mais c’est la voix qui décide de l’effet réellement produit. Elle définit l’accent, l’âge, le grain, l’énergie et la personnalité de votre présentateur — et la vitesse, les pauses et les indications d’interprétation déterminent si le résultat sonne comme une personne ou comme une machine qui lit une page.

En résumé : choisissez une voix IA en accordant la langue et l’accent régional à votre audience, en vous servant des étiquettes de profil pour établir une présélection, en écoutant chaque candidate avec votre propre script, puis en ajustant l’interprétation avec la vitesse et les pauses avant de générer. La suite de ce guide détaille ce processus étape par étape dans VisionStory, dont la bibliothèque de voix IA compte plus de 1 000 voix dans 88 langues.

Ce que couvre ce guide : la Bibliothèque de voix publique et les réglages d’interprétation qui l’entourent. Créer une voix à partir de votre propre enregistrement est un flux de travail distinct — voir comment cloner votre voix avec l’IA.

Étape 1 : Ouvrez la Bibliothèque de voix et lisez la ligne d’une voix

Ouvrez Vidéo IA, sélectionnez l’avatar que vous voulez utiliser, puis cliquez sur la voix actuelle sous la zone Script. La Bibliothèque de voix s’ouvre par-dessus l’éditeur.

Chaque ligne porte quatre indices qui vous permettent d’anticiper le rendu d’une voix avant même d’appuyer sur lecture :

  • Étiquette de langue — la langue que parle la voix.
  • Drapeau — l’accent régional, et non une seconde langue. Les voix anglaises peuvent porter un drapeau américain, britannique, canadien ou autre.
  • Genre et âge — l’identité perçue du locuteur.
  • Caractéristiques et cas d’usage — des descriptions comme claire, chaleureuse, conversationnelle, narration, éducation ou réseaux sociaux.
Guide des étiquettes de langue, d’accent régional, de genre, d’âge, de caractéristiques et de cas d’usage sur une ligne de voix VisionStory
Le drapeau indique l’accent régional — l’étiquette qui compte le plus quand vous comparez plusieurs voix dans la même langue.

Servez-vous des étiquettes pour établir une présélection, pas pour trancher. Deux voix aux étiquettes presque identiques peuvent malgré tout différer beaucoup par le rythme, le grain et l’énergie.

Étape 2 : Filtrez, recherchez et écoutez une présélection

Commencez assez large pour entendre de vraies différences, puis affinez. Utilisez les filtres Langue, Genre, Âge et Cas d’usage tant que vous êtes en phase d’exploration. Si vous connaissez déjà une voix par son nom, saisissez-le plutôt dans le champ de recherche.

  1. Établissez une présélection. Filtrez ou recherchez jusqu’à obtenir une poignée de candidates plutôt qu’un catalogue entier.
  2. Écoutez toute la présélection. Cliquez sur le bouton de lecture à droite d’une ligne de voix pour entendre son échantillon.
  3. Mettez en pause et comparez. Cliquez de nouveau sur le même bouton pour arrêter avant de lancer la suivante.
Bibliothèque de voix VisionStory avec un champ de recherche, les filtres Langue, Genre, Âge et Cas d’usage, et un bouton de lecture sur chaque ligne de voix
La recherche et les filtres rendent gérable une bibliothèque de 1 000 voix ; c’est l’écoute qui confirme le bon choix.

Écoutez en pensant à ce dont votre vidéo a réellement besoin : accent régional, clarté, énergie, chaleur, autorité et vitesse à laquelle la voix parcourt une phrase. Une voix excellente prise isolément peut malgré tout ne pas convenir à un script pédagogique, commercial, informatif ou incarné par un personnage.

Étape 3 : Accordez la voix à votre contenu et à votre audience

La plupart des voix off IA décevantes ne souffrent pas d’un problème de qualité, mais d’un problème d’adéquation. Avant de valider, déterminez ce que cette voix doit accomplir pour cette vidéo précise.

Si vous réalisezÀ rechercherÀ éviter
Tutoriels, vidéos explicatives, coursArticulation claire, rythme régulier, chaleur neutreLes lectures promotionnelles survoltées qui expédient les termes techniques
Publicités, promos, courts clips pour les réseaux sociauxDe l’énergie, du punch, un profil assuré et plutôt jeuneUne narration lente et posée qui fait retomber l’accroche
Actualités, communication d’entreprise, mises à jour produitAutorité, rythme régulier, texture vocale minimaleLes voix familières ou très typées
Récits, interviews, podcastsDe la personnalité et une large palette expressiveLes lectures de présentateur plates, sans dynamique
Versions localisées d’une même vidéoUn accent régional natif pour chaque marchéUne seule voix anglaise qui lit un texte traduit

L’accent est le réglage le plus souvent raté. Si votre audience se trouve à Londres et que votre présentateur affiche un drapeau américain, les auditeurs le remarquent — même si chaque mot est correct. Choisissez le drapeau en fonction de l’audience, pas seulement de la langue.

Étape 4 : Réglez la vitesse d’élocution, puis ajoutez des pauses

Cliquez sur une ligne de voix pour l’appliquer à la configuration en cours. Ouvrez ensuite le menu de vitesse à côté de la voix sélectionnée et choisissez Lent, Normal ou Rapide.

  • Lent convient aux explications posées et à tout contenu où la compréhension prime sur l’urgence.
  • Normal est la valeur sûre pour la plupart des tutoriels, des présentations et des vidéos d’avatar parlant.
  • Rapide donne de l’énergie aux promos courtes et aux clips sociaux, mais les scripts denses deviennent plus difficiles à suivre.

La vitesse fixe le tempo de toute l’interprétation. Pour un contrôle à l’intérieur d’une phrase, placez le curseur là où le temps d’arrêt doit tomber et cliquez sur la commande Pause. Chaque clic ajoute 0,5 seconde ; cliquez de nouveau pour un silence plus long.

Comparaison des vitesses d’élocution Lent, Normal et Rapide à côté d’une pause d’une demi-seconde insérée dans un script
Utilisez la vitesse pour le tempo général et les pauses pour les temps d’arrêt qui portent le sens.

Bon à savoir : ajoutez des pauses là où un vrai présentateur reprendrait son souffle, changerait d’idée ou laisserait une affirmation faire son effet. Trop de pauses fragmentent le débit : prévisualisez donc la phrase entière après modification, pas seulement la partie que vous avez changée.

Étape 5 : Dirigez l’interprétation avec l’Amélioration de la voix

Cliquez sur Amélioration de la voix lorsque les mots sont justes mais que l’interprétation voulue n’est pas encore explicite. VisionStory ajoute des indications d’interprétation pour l’émotion, le rythme et l’accentuation, tout en conservant votre formulation d’origine.

Relisez le script enrichi avant de continuer. Choisissez Conserver si les indications correspondent à votre intention, ou Annuler pour revenir à la version d’origine. Cette fonction prend tout son sens quand un script a besoin d’une direction émotionnelle claire sans devoir être réécrit.

Comparaison avant/après où l’Amélioration de la voix ajoute des indications d’interprétation calme et posée sans modifier les mots
Le message reste le vôtre ; c’est l’interprétation qui reçoit une direction.

Étape 6 : Prévisualisez votre script réel avant de générer

Cliquez sur Aperçu audio une fois la voix, la vitesse, les pauses et les éventuelles indications d’amélioration en place. Écoutez la prise en entier au lieu de juger sur les premiers mots, et vérifiez la prononciation, l’accent, le rythme, les fins de phrases, les pauses et la justesse émotionnelle.

Tant que vous comparez encore plusieurs candidates, commencez par une courte phrase représentative. Une fois la sélection réduite à deux ou trois voix, prévisualisez un passage contenant les noms, les chiffres, les termes techniques ou les moments d’émotion qui comptent le plus dans la vidéo finale — c’est là que les voix se départagent.

Quota de prévisualisation : la prévisualisation audio inclut un quota de caractères gratuit qui se renouvelle sur un cycle glissant de 24 heures. Une fois ce quota épuisé, chaque prévisualisation coûte 1 crédit pour 500 caractères. Consultez comment fonctionnent les Crédits VisionStory pour une vue d’ensemble.

Étape 7 : Générez une fois pour que l’avatar retienne la voix

Sélectionner une voix modifie la configuration en cours dans l’éditeur, mais la sélection seule n’enregistre pas cette voix sur l’avatar. Générez une vidéo avec la voix que vous avez choisie. VisionStory mémorise alors l’association et la restaure la prochaine fois que vous utilisez le même avatar.

Schéma en trois étapes montrant une voix sélectionnée, enregistrée après la génération d’une vidéo, puis restaurée lorsque l’avatar est réutilisé
La frontière, c’est la génération : sélectionnez la voix, générez une fois, puis réutilisez l’avatar avec cette voix déjà associée.

C’est pourquoi ce choix mérite d’être fait avec soin. Une fois un avatar et une voix associés, chaque nouvelle vidéo part d’un présentateur cohérent au lieu de repartir d’une décision à prendre.

Pourquoi les voix IA sonnent robotiques — et comment y remédier

Quand une voix off générée sonne artificielle, la cause tient généralement à l’une de ces cinq raisons faciles à corriger, et non au modèle vocal lui-même.

  • Mauvaise voix pour le script. Une voix de narration qui lit un texte publicitaire sonne plate. Refaites votre présélection par cas d’usage avant d’incriminer la qualité.
  • Aucune pause. Un orateur réel respire. Un bloc de texte sans respiration sonne comme une machine : ajoutez des pauses d’une demi-seconde aux frontières entre les idées.
  • Vitesse réglée une fois puis oubliée. Le réglage Rapide rend les phrases denses confuses ; le réglage Lent fait traîner une promo courte. Adaptez le tempo au type de contenu.
  • Ponctuation ambiguë. Les phrases à rallonge, les virgules manquantes et les abréviations non développées poussent toutes la voix vers la monotonie. Nettoyez d’abord le script.
  • Aucune direction émotionnelle. Si l’intention n’est pas dans le texte, la voix ne peut pas la deviner — et c’est précisément à cela que sert l’Amélioration de la voix.

Corrigez ces cinq points et la plupart des reproches faits aux voix IA robotiques disparaissent sans même changer de voix.

Si un fournisseur retire une voix que vous utilisez

VisionStory s’approvisionne en voix auprès de plusieurs fournisseurs, et un fournisseur peut retirer une voix de son propre catalogue. Dans ce cas, la voix ne peut pas être rétablie dans la Bibliothèque de voix publique.

Si une voix sur laquelle vous comptiez a disparu, trouvez un passage propre d’une vidéo antérieure qui ne contient que cette voix, et utilisez-le comme audio source dans Clone de voix. Le clone peut fournir un remplacement très proche, mais il ne faut pas s’attendre à un rendu identique.

Schéma du processus montrant comment un audio propre issu d’une vidéo antérieure peut servir de source à un clone de voix de remplacement similaire
Une vidéo déjà validée peut fournir l’audio propre qui préserve la continuité lorsqu’une voix du catalogue est retirée.

Autorisation requise : ne clonez que des audios dont vous êtes propriétaire ou pour lesquels vous disposez d’une autorisation explicite, et prévisualisez le remplacement avec le script que vous comptez utiliser avant de publier.

Votre check-list de voix IA avant de générer

  • Choisissez l’accent régional adapté à votre audience, pas seulement la langue.
  • Servez-vous des étiquettes de profil pour présélectionner, puis laissez votre oreille trancher.
  • Prévisualisez les noms, les chiffres et les termes difficiles de votre vrai script.
  • Réglez la vitesse globale avant d’ajouter des pauses ponctuelles.
  • N’utilisez l’Amélioration de la voix que lorsque l’interprétation a besoin d’indications plus claires.
  • Écoutez une prévisualisation complète, pas seulement la première phrase.
  • Générez une fois lorsque vous voulez que l’avatar mémorise la voix.
  • Notez le nom de la voix retenue dans vos consignes de marque ou de campagne.

Une fois la voix figée, le reste va vite. Menez la même configuration jusqu’à la vidéo finale avec comment créer un avatar parlant IA, ou ouvrez texte en parole lorsque vous n’avez besoin que de l’audio.

Questions fréquemment posées

  • Commencez par l’audience : faites correspondre la langue et l’accent régional indiqué par le drapeau, puis servez-vous des étiquettes de genre, d’âge, de caractéristiques et de cas d’usage pour établir une présélection de quelques candidates. Prévisualisez chacune avec une phrase tirée de votre vrai script plutôt qu’avec un extrait générique, et retenez la voix dont le rythme, l’énergie et la chaleur correspondent au type de contenu. Terminez en réglant la vitesse d’élocution et en ajoutant des pauses pour que l’interprétation corresponde à votre intention.