Español (España)

Ver este tutorial en YouTube

YouTube

Todo vídeo con IA empieza con un guion, pero la voz decide cómo cala realmente ese guion. Define el acento, la edad, la textura, la energía y la personalidad de tu presentador — y la velocidad, las pausas y las indicaciones de interpretación deciden si el resultado suena a persona o a máquina leyendo una página.

La versión corta: elige una voz con IA ajustando el idioma y el acento regional a tu público, usa las etiquetas del perfil para hacer una preselección, previsualiza cada candidata con tu propio guion y, después, ajusta la interpretación con la velocidad y las pausas antes de generar. El resto de esta guía recorre ese proceso paso a paso en VisionStory, cuya biblioteca de voces con IA reúne más de 1000 voces en 88 idiomas.

Qué cubre esta guía: la Biblioteca de voces pública y los controles de interpretación que la rodean. Crear una voz a partir de tu propia grabación es un flujo aparte — consulta cómo clonar tu voz con IA.

Paso 1: Abre la Biblioteca de voces y lee la fila de voz

Abre Vídeo con IA, selecciona el avatar que quieras usar y haz clic en la voz actual debajo del cuadro de Guion. La Biblioteca de voces se abre sobre el editor.

Cada fila incluye cuatro señales que te permiten predecir cómo sonará el locutor antes de pulsar reproducir:

  • Etiqueta de idioma — el idioma que habla la voz.
  • Bandera — el acento regional, no un segundo idioma. Las voces en inglés pueden llevar banderas de EE. UU., Reino Unido, Canadá y otros países.
  • Género y edad — la identidad que se percibe del locutor.
  • Rasgos y caso de uso — descripciones como clara, cálida, conversacional, narración, educación o redes sociales.
Guía de las etiquetas de idioma, acento regional, género, edad, rasgos y caso de uso de una fila de voz de VisionStory
La bandera es el acento regional — la etiqueta que más importa cuando comparas varias voces del mismo idioma.

Usa las etiquetas para hacer una preselección, no para tomar la decisión final. Dos voces con etiquetas casi idénticas pueden diferir mucho en ritmo, textura y energía.

Paso 2: Filtra, busca y previsualiza una preselección

Empieza con un abanico lo bastante amplio para oír diferencias reales y luego ve acotando. Usa los filtros Idioma, Género, Edad y Caso de uso mientras aún estás explorando. Si ya conoces una voz por su nombre, escríbelo directamente en el campo de búsqueda.

  1. Haz una preselección. Filtra o busca hasta quedarte con un puñado de candidatas en lugar de con un catálogo entero.
  2. Escucha toda la preselección. Haz clic en el botón de reproducción situado a la derecha de una fila de voz para oír su muestra.
  3. Pausa y compara. Vuelve a hacer clic en el mismo botón para detenerla antes de empezar con la siguiente.
Biblioteca de voces de VisionStory con un campo de búsqueda, filtros de Idioma, Género, Edad y Caso de uso, y un botón de reproducción en cada fila de voz
La búsqueda y los filtros hacen manejable una biblioteca de 1000 voces; la previsualización es lo que confirma que encaja.

Escucha pensando en lo que tu vídeo necesita de verdad: acento regional, claridad, energía, calidez, autoridad y con qué rapidez avanza la voz por una frase. Una voz que suena estupenda de forma aislada puede no encajar en un guion instructivo, comercial, informativo o de personaje.

Paso 3: Ajusta la voz a tu contenido y a tu audiencia

La mayoría de las locuciones con IA decepcionantes no tienen un problema de calidad, sino de encaje. Antes de decidirte, define qué debe conseguir esa voz en este vídeo concreto.

Si estás creandoBuscaEvita
Tutoriales, vídeos explicativos, cursosArticulación clara, ritmo constante, calidez neutraLocuciones promocionales muy enérgicas que atropellan los términos técnicos
Anuncios, promociones, clips cortos para redesEnergía, fuerza, un perfil seguro y más jovenNarración lenta y pausada que pierde el gancho
Noticias, comunicación corporativa, novedades de productoAutoridad, ritmo uniforme, textura vocal mínimaVoces informales o con un marcado estilo de personaje
Narrativa, entrevistas, podcastsPersonalidad y rango expresivoLocuciones planas de locutor, sin dinámica
Versiones localizadas de un mismo vídeoUn acento regional nativo para cada mercadoUna única voz en inglés leyendo el texto traducido

El acento es el ajuste que más se suele fallar. Si tu audiencia está en Londres y tu presentador lleva la bandera de EE. UU., quien escucha lo nota — aunque todas las palabras sean correctas. Elige la bandera pensando en la audiencia, no solo en el idioma.

Paso 4: Ajusta la velocidad de habla y después añade pausas

Haz clic en la fila de una voz para aplicarla a la configuración actual. Después, abre el menú de velocidad junto a la voz seleccionada y elige Lenta, Normal o Rápida.

  • Lenta encaja con explicaciones reflexivas y con cualquier contenido en el que comprender importe más que la urgencia.
  • Normal es la base segura para la mayoría de tutoriales, presentaciones y vídeos con avatar parlante.
  • Rápida aporta energía a promociones cortas y clips para redes, pero los guiones densos se vuelven más difíciles de seguir.

La velocidad marca el tempo de toda la interpretación. Para controlar el ritmo dentro de una frase, coloca el cursor donde deba ir el silencio y haz clic en el control Pausa. Cada clic añade 0,5 segundos; vuelve a hacer clic para conseguir un silencio más largo.

Comparación de las velocidades de habla Lenta, Normal y Rápida junto a una pausa de medio segundo insertada en un guion
Usa la velocidad para el tempo general y las pausas para los silencios concretos que aportan significado.

Consejo práctico: añade pausas donde un presentador real respiraría, cambiaría de idea o dejaría que una afirmación calara. Demasiadas pausas fragmentan la locución, así que escucha la frase entera después de editarla, no solo la parte que has cambiado.

Paso 5: Dirige la interpretación con Mejora de Voz

Haz clic en Mejora de Voz cuando las palabras ya sean las correctas pero la interpretación que buscas todavía no esté explícita. VisionStory añade indicaciones de interpretación para la emoción, el ritmo y el énfasis sin cambiar tu redacción original.

Revisa el guion mejorado antes de continuar. Elige Mantener si las indicaciones se ajustan a tu intención, o Deshacer para volver al original. Resulta especialmente útil cuando un guion necesita una dirección emocional clara, pero no debe reescribirse.

Comparación de antes y después que muestra cómo Mejora de Voz añade indicaciones de interpretación calmada y pausada sin cambiar las palabras
El mensaje sigue siendo tuyo; lo que recibe dirección es la interpretación.

Paso 6: Previsualiza tu guion real antes de generar

Haz clic en Previsualizar audio cuando ya tengas ajustadas la voz, la velocidad, las pausas y las indicaciones de mejora. Escucha la toma completa en lugar de juzgar por las primeras palabras y comprueba la pronunciación, el acento, el ritmo, los finales de frase, las pausas y la adecuación emocional.

Mientras sigues comparando candidatas, empieza con una frase corta y representativa. Cuando la lista se reduzca a dos o tres, escucha un fragmento que incluya los nombres, las cifras, los términos técnicos o los momentos emocionales que más importan en el vídeo final — ahí es donde se distinguen las voces.

Cuota de previsualización: la previsualización de audio incluye una cuota gratuita de caracteres que se renueva en un ciclo continuo de 24 horas. Una vez agotada esa cuota, generar una previsualización cuesta 1 crédito por cada 500 caracteres. Consulta cómo funcionan los créditos de VisionStory para ver el panorama completo.

Paso 7: Genera una vez para que el avatar recuerde la voz

Seleccionar una voz cambia la configuración actual del editor, pero la selección por sí sola no guarda esa voz en el avatar. Genera un vídeo con la voz que hayas elegido. VisionStory recordará entonces esa combinación y la restaurará la próxima vez que uses el mismo avatar.

Diagrama de tres pasos que muestra cómo se selecciona una voz, se guarda tras generar un vídeo y se restaura al reutilizar el avatar
El punto de inflexión es la generación: selecciona la voz, genera una vez y después reutiliza el avatar con esa voz ya asociada.

Por eso merece la pena elegir con cuidado. Una vez emparejados un avatar y una voz, cada vídeo futuro parte de un presentador coherente en lugar de una decisión nueva.

Por qué las voces con IA suenan robóticas — y cómo solucionarlo

Cuando una locución generada suena sintética, casi siempre se debe a una de estas cinco causas corregibles y no al modelo de voz en sí.

  • Voz equivocada para el guion. Una voz de narración leyendo un texto publicitario suena plana. Vuelve a filtrar por caso de uso antes de culpar a la calidad.
  • Sin pausas. Las personas reales respiran. Un muro de texto sin silencios suena a máquina, así que añade pausas de medio segundo en los límites entre ideas.
  • Velocidad ajustada una vez y olvidada. La velocidad Rápida vuelve confusas las frases densas; la Lenta hace que una promoción corta se arrastre. Ajusta el tempo al tipo de contenido.
  • Puntuación ambigua. Las frases interminables, las comas que faltan y las abreviaturas sin desarrollar empujan a la voz hacia la monotonía. Limpia primero el guion.
  • Sin indicaciones emocionales. Si la intención no está en el texto, la voz no puede deducirla — y para eso existe precisamente Mejora de Voz.

Corrige esas cinco cosas y la mayoría de las quejas sobre voces con IA robóticas desaparecen sin cambiar la voz.

Si un proveedor retira una voz que utilizas

VisionStory obtiene sus voces de varios proveedores, y un proveedor puede eliminar una voz de su propio catálogo. Cuando eso ocurre, la voz no se puede restaurar en la Biblioteca de voces pública.

Si una voz de la que dependías ha desaparecido, busca un fragmento limpio de un vídeo anterior que contenga solo esa voz y úsalo como audio de origen en Clonación de Voz. El clon puede generar un sustituto muy parecido, aunque no hay que esperar que suene idéntico.

Diagrama de proceso que muestra cómo el audio limpio de un vídeo anterior puede servir de base para un clon de voz sustituto similar
Un vídeo aprobado anteriormente puede aportar el audio limpio que mantiene la continuidad cuando se retira una voz del catálogo.

Permiso obligatorio: clona solo audio del que seas propietario o para el que tengas un permiso claro de uso, y escucha la previsualización del sustituto con el guion que vayas a utilizar antes de publicar.

Tu lista de comprobación de voz con IA antes de generar

  • Elige el acento regional adecuado para tu audiencia, no solo el idioma.
  • Usa las etiquetas del perfil para preseleccionar y, después, deja que decida tu oído.
  • Escucha la previsualización de los nombres, las cifras y los términos difíciles de tu guion real.
  • Ajusta la velocidad general antes de añadir pausas puntuales.
  • Usa Mejora de Voz solo cuando la interpretación necesite indicaciones más claras.
  • Escucha una previsualización completa, no solo la primera frase.
  • Genera una sola vez cuando quieras que el avatar recuerde la voz.
  • Anota el nombre de la voz elegida en las notas de tu marca o campaña.

Una vez fijada la voz, el resto va rápido. Lleva esta misma configuración hasta un vídeo terminado con cómo crear un avatar parlante con IA, o abre texto a voz cuando solo necesites la parte de audio.

Preguntas frecuentes

  • Empieza por el público: haz coincidir el idioma y el acento regional que indica la bandera y, después, usa las etiquetas de género, edad, rasgos y caso de uso para crear una preselección de unas pocas candidatas. Previsualiza cada una con una frase de tu guion real en lugar de con una muestra genérica y quédate con la voz cuyo ritmo, energía y calidez encajen con el tipo de contenido. Para terminar, ajusta la velocidad de habla y añade pausas para que la interpretación se corresponda con tu intención.