Todo video de IA comienza con un guion, pero la voz decide cómo llega realmente ese guion. Define el acento, la edad, la textura, la energía y la personalidad de tu presentador — y la velocidad, las pausas y las indicaciones de interpretación deciden si el resultado suena como una persona o como una máquina leyendo una página.

La versión corta: elige una voz de IA haciendo coincidir el idioma y el acento regional con tu audiencia, usa las etiquetas del perfil para armar una lista corta, escucha la vista previa de cada candidata con tu propio guion y luego ajusta la interpretación con la velocidad y las pausas antes de generar. El resto de esta guía recorre ese proceso paso a paso en VisionStory, cuya biblioteca de voces de IA incluye más de 1000 voces en 88 idiomas.

Qué cubre esta guía: la Biblioteca de Voces pública y los controles de interpretación que la acompañan. Crear una voz a partir de tu propia grabación es un flujo de trabajo aparte — consulta cómo clonar tu voz con IA.

Paso 1: Abre la Biblioteca de Voces y lee la fila de voz

Abre Video de IA, selecciona el avatar que quieras usar y haz clic en la voz actual debajo del cuadro de Guion. La Biblioteca de Voces se abre sobre el editor.

Cada fila incluye cuatro señales que te permiten predecir cómo sonará un locutor antes de pulsar reproducir:

  • Etiqueta de idioma — el idioma que habla la voz.
  • Bandera — el acento regional, no un segundo idioma. Las voces en inglés pueden llevar banderas de EE. UU., Reino Unido, Canadá y otros países.
  • Género y edad — la identidad percibida del locutor.
  • Rasgos y caso de uso — descripciones como clara, cálida, conversacional, narración, educación o redes sociales.
Guía de las etiquetas de idioma, acento regional, género, edad, rasgos y caso de uso en una fila de voz de VisionStory
La bandera es el acento regional — la etiqueta que más importa cuando comparas varias voces en el mismo idioma.

Usa las etiquetas para armar una lista corta, no para tomar la decisión final. Dos voces con etiquetas casi idénticas pueden diferir mucho en ritmo, textura y energía.

Paso 2: Filtra, busca y escucha una lista corta

Empieza con un rango lo bastante amplio para oír diferencias reales y luego acota. Usa los filtros Idioma, Género, Edad y Caso de Uso mientras aún estás explorando. Si ya conoces una voz por su nombre, escríbelo directamente en el campo de búsqueda.

  1. Arma una lista corta. Filtra o busca hasta quedarte con un puñado de candidatas en lugar de un catálogo completo.
  2. Escucha toda la lista corta. Haz clic en el botón de reproducción a la derecha de una fila de voz para oír su muestra.
  3. Pausa y compara. Haz clic en el mismo botón otra vez para detenerla antes de empezar con la siguiente.
Biblioteca de Voces de VisionStory con un campo de búsqueda, filtros de Idioma, Género, Edad y Caso de Uso, y un botón de reproducción en cada fila de voz
La búsqueda y los filtros hacen manejable una biblioteca de 1000 voces; la vista previa es lo que confirma que encaja.

Presta atención a lo que tu video necesita de verdad: acento regional, claridad, energía, calidez, autoridad y qué tan rápido avanza la voz dentro de una frase. Una voz que suena genial por sí sola puede no funcionar para un guion instructivo, comercial, informativo o protagonizado por un personaje.

Paso 3: Adapta la voz a tu contenido y a tu audiencia

La mayoría de las voces en off de IA decepcionantes no tienen un problema de calidad, sino de adecuación. Antes de decidirte, define qué tiene que lograr esta voz en este video concreto.

Si vas a crearBuscaEvita
Tutoriales, explicaciones, cursosArticulación clara, ritmo constante, calidez neutraLecturas promocionales de mucha energía que atropellan los términos técnicos
Anuncios, promociones, clips cortos para redes socialesEnergía, fuerza, un perfil seguro y más jovenNarración lenta y pausada que pierde el gancho
Noticias, contenido corporativo, novedades de productoAutoridad, ritmo uniforme, textura vocal mínimaVoces informales o con un estilo de personaje muy marcado
Narrativa, entrevistas, pódcastPersonalidad y rango expresivoLecturas planas de locutor, sin dinámica
Versiones localizadas de un mismo videoUn acento regional nativo para cada mercadoUna sola voz en inglés leyendo el texto traducido

El acento es el ajuste en el que más se equivoca la gente. Si tu audiencia está en Londres y tu presentador lleva la bandera de EE. UU., los oyentes lo notan — aunque todas las palabras sean correctas. Elige la bandera pensando en la audiencia, no solo en el idioma.

Paso 4: Ajusta la velocidad de habla y luego añade pausas

Haz clic en una fila de voz para aplicarla a la configuración actual. Después abre el menú de velocidad junto a la voz seleccionada y elige Lento, Normal o Rápido.

  • Lento encaja con explicaciones pausadas y con cualquier contenido en el que la comprensión importe más que la urgencia.
  • Normal es la opción segura para la mayoría de tutoriales, presentaciones y videos de avatar parlante.
  • Rápido aporta energía a promociones cortas y clips para redes sociales, pero los guiones densos se vuelven más difíciles de seguir.

La velocidad marca el tempo de toda la interpretación. Para controlar el ritmo dentro de una frase, coloca el cursor donde quieras que caiga el silencio y haz clic en el control Pausa. Cada clic añade 0,5 segundos; vuelve a hacer clic para un silencio más largo.

Comparación de las velocidades de habla Lento, Normal y Rápido junto a una pausa de medio segundo insertada en un guion
Usa la velocidad para el tempo general y las pausas para los silencios concretos que aportan significado.

Consejo práctico: añade pausas donde un presentador real respiraría, cambiaría de idea o dejaría que una afirmación cale. Demasiadas pausas fragmentan la interpretación, así que previsualiza la frase completa después de editar, no solo la parte que cambiaste.

Paso 5: Dirige la interpretación con Mejora de Voz

Haz clic en Mejora de Voz cuando las palabras ya son las correctas pero la interpretación buscada aún no está explícita. VisionStory añade indicaciones de interpretación para la emoción, el ritmo y el énfasis, manteniendo tu redacción original.

Revisa el guion mejorado antes de continuar. Elige Conservar cuando las indicaciones coincidan con tu intención, o Deshacer para volver al original. Resulta especialmente útil cuando un guion necesita una dirección emocional clara pero no debe reescribirse.

Comparación de antes y después que muestra cómo Mejora de Voz añade indicaciones de interpretación calmadas y pausadas sin cambiar las palabras
El mensaje sigue siendo tuyo; lo que recibe dirección es la interpretación.

Paso 6: Escucha una vista previa de tu guion real antes de generar

Haz clic en Vista Previa de Audio cuando ya tengas listas la voz, la velocidad, las pausas y las indicaciones de mejora. Escucha la toma completa en lugar de juzgar por las primeras palabras y revisa la pronunciación, el acento, el ritmo, los finales de frase, las pausas y la coherencia emocional.

Mientras sigas comparando candidatas, empieza con una frase corta y representativa. Cuando la lista se reduzca a dos o tres, escucha un fragmento que contenga los nombres, las cifras, los términos técnicos o los momentos emotivos que más importan en el video terminado — ahí es donde las voces se diferencian.

Cuota de vista previa: la vista previa de audio incluye una cuota gratuita de caracteres que se renueva en un ciclo continuo de 24 horas. Una vez agotada esa cuota, generar una vista previa cuesta 1 crédito por cada 500 caracteres. Consulta cómo funcionan los créditos de VisionStory para ver el panorama completo.

Paso 7: Genera una vez para que el avatar recuerde la voz

Seleccionar una voz cambia la configuración actual del editor, pero la selección por sí sola no guarda esa voz en el avatar. Genera un video con la voz que elegiste. VisionStory recordará entonces esa combinación y la restaurará la próxima vez que uses el mismo avatar.

Diagrama de tres pasos que muestra cómo se selecciona una voz, se guarda tras generar un video y se restaura al reutilizar el avatar
El límite es la generación: selecciona la voz, genera una vez y luego reutiliza el avatar con esa voz ya asociada.

Por eso vale la pena tomar la decisión con cuidado. Una vez que un avatar y una voz quedan emparejados, cada video futuro parte de un presentador coherente en lugar de una decisión desde cero.

Por qué las voces de IA suenan robóticas — y cómo solucionarlo

Cuando una locución generada suena artificial, casi siempre se debe a una de cinco causas corregibles y no al modelo de voz en sí.

  • Voz equivocada para el guion. Una voz de narración leyendo un texto publicitario suena plana. Vuelve a filtrar por Caso de Uso antes de culpar a la calidad.
  • Sin pausas. Las personas reales respiran al hablar. Un muro de texto sin respiros suena a máquina, así que añade pausas de medio segundo en los límites entre ideas.
  • Velocidad configurada una vez y olvidada. El ajuste Rápido vuelve confusas las frases densas; el ajuste Lento hace que una promo corta se arrastre. Ajusta el ritmo al tipo de contenido.
  • Puntuación ambigua. Las frases interminables, las comas ausentes y las abreviaturas sin desarrollar empujan la voz hacia la monotonía. Limpia primero el guion.
  • Sin dirección emocional. Si la intención no está en el texto, la voz no puede deducirla — y justo para eso sirve Mejora de Voz.

Corrige esos cinco puntos y la mayoría de las quejas sobre voces de IA robóticas desaparecen sin cambiar de voz.

Si un proveedor retira una voz que utilizas

VisionStory obtiene sus voces de varios proveedores, y un proveedor puede eliminar una voz de su propio catálogo. Cuando eso ocurre, la voz no se puede restaurar en la Biblioteca de Voces pública.

Si desaparece una voz en la que confiabas, busca un fragmento limpio de un video anterior en el que solo se oiga esa voz y úsalo como audio de origen en Clonación de Voz. El clon puede generar un reemplazo muy parecido, aunque no hay que esperar que suene idéntico.

Diagrama del proceso que muestra cómo el audio limpio de un video anterior puede servir de base para clonar una voz de reemplazo similar
Un video aprobado anteriormente puede aportar el audio limpio que mantiene la continuidad cuando se retira una voz del catálogo.

Permiso obligatorio: clona únicamente audio que te pertenezca o que tengas permiso explícito para usar, y escucha una vista previa del reemplazo con el guion que vas a utilizar antes de publicar.

Tu lista de comprobación de la voz de IA antes de generar

  • Elige el acento regional pensando en tu audiencia, no solo el idioma.
  • Usa las etiquetas del perfil para preseleccionar y deja que sean tus oídos los que decidan.
  • Escucha una vista previa con los nombres, los números y los términos difíciles de tu guion real.
  • Ajusta la velocidad general antes de añadir pausas puntuales.
  • Usa Mejora de Voz solo cuando la interpretación necesite indicaciones más claras.
  • Escucha una vista previa completa, no solo la primera frase.
  • Genera una vez cuando quieras que el avatar recuerde la voz.
  • Anota el nombre de la voz elegida en las notas de tu marca o campaña.

Una vez fijada la voz, el resto es rápido. Lleva esa misma configuración hasta un video terminado con cómo crear un avatar parlante de IA, o abre Texto a Voz cuando solo necesites la parte de audio.

Preguntas frecuentes

  • Empieza por el público: haz coincidir el idioma y el acento regional que muestra la bandera, y luego usa las etiquetas de género, edad, rasgo y caso de uso para armar una lista corta de unas pocas candidatas. Previsualiza cada una con una frase de tu guion real en lugar de una muestra genérica y elige la voz cuyo ritmo, energía y calidez encajen con el tipo de contenido. Termina definiendo la velocidad de habla y añadiendo pausas para que la interpretación coincida con tu intención.