Español (México)

Mira este tutorial en YouTube

YouTube

Todo video con IA empieza con un guion, pero la voz decide cómo aterriza ese guion en realidad. Define el acento, la edad, la textura, la energía y la personalidad de tu presentador — y la velocidad, las pausas y las indicaciones de interpretación deciden si el resultado suena como una persona o como una máquina leyendo una página.

En corto: elige una voz con IA haciendo coincidir el idioma y el acento regional con tu audiencia, usa las etiquetas del perfil para armar una lista corta, escucha cada candidata con tu propio guion y después ajusta la interpretación con la velocidad y las pausas antes de generar. El resto de esta guía recorre ese proceso paso a paso en VisionStory, cuya biblioteca de voces con IA tiene más de 1,000 voces en 88 idiomas.

Lo que cubre esta guía: la Biblioteca de voces pública y los controles de interpretación que la acompañan. Crear una voz a partir de tu propia grabación es un flujo aparte — consulta cómo clonar tu voz con IA.

Paso 1: Abre la Biblioteca de voces y lee la fila de la voz

Abre Video con IA, selecciona el avatar que quieras usar y haz clic en la voz actual debajo del cuadro de guion. La Biblioteca de voces se abre sobre el editor.

Cada fila incluye cuatro señales que te permiten predecir cómo sonará un hablante antes de darle reproducir:

  • Etiqueta de idioma — el idioma que habla la voz.
  • Bandera — el acento regional, no un segundo idioma. Las voces en inglés pueden llevar banderas de Estados Unidos, Reino Unido, Canadá y otras.
  • Género y edad — la identidad percibida del hablante.
  • Rasgos y caso de uso — descripciones como clara, cálida, conversacional, narración, educación o redes sociales.
Guía de las etiquetas de idioma, acento regional, género, edad, rasgos y caso de uso en una fila de voz de VisionStory
La bandera es el acento regional — la etiqueta que más importa cuando comparas varias voces del mismo idioma.

Usa las etiquetas para armar una lista corta, no para tomar la decisión final. Dos voces con etiquetas casi idénticas pueden diferir mucho en ritmo, textura y energía.

Paso 2: Filtra, busca y escucha una lista corta

Empieza con un rango lo bastante amplio para escuchar diferencias reales y luego acota. Usa los filtros Idioma, Género, Edad y Caso de uso mientras sigues explorando. Si ya conoces una voz por su nombre, mejor escríbelo en el campo de búsqueda.

  1. Arma una lista corta. Filtra o busca hasta quedarte con unas cuantas candidatas en lugar de un catálogo completo.
  2. Escucha toda la lista corta. Haz clic en el botón de reproducción a la derecha de una fila de voz para oír su muestra.
  3. Pausa y compara. Haz clic de nuevo en el mismo botón para detenerla antes de empezar la siguiente.
Biblioteca de voces de VisionStory con un campo de búsqueda, filtros de Idioma, Género, Edad y Caso de uso, y un botón de reproducción en cada fila de voz
La búsqueda y los filtros hacen manejable una biblioteca de 1,000 voces; escuchar las muestras es lo que confirma que encaja.

Escucha pensando en lo que tu video realmente necesita: acento regional, claridad, energía, calidez, autoridad y qué tan rápido avanza la voz dentro de una oración. Una voz que suena increíble por sí sola puede no funcionar para un guion instructivo, de ventas, de noticias o de personaje.

Paso 3: Empareja la voz con tu contenido y tu audiencia

La mayoría de las voces en off con IA que decepcionan no tienen un problema de calidad, sino de compatibilidad. Antes de decidirte, define qué debe lograr esta voz en este video en particular.

Si estás creandoBuscaEvita
Tutoriales, explicativos, cursosArticulación clara, ritmo constante, calidez neutraLecturas promocionales de alta energía que atropellan los términos técnicos
Anuncios, promociones, clips cortos para redesEnergía, fuerza, un perfil seguro y más jovenNarración lenta y pausada que pierde el gancho
Noticias, contenido corporativo, actualizaciones de productoAutoridad, ritmo parejo, textura vocal mínimaVoces informales o muy caracterizadas
Narrativa, entrevistas, podcastsPersonalidad y rango expresivoLecturas planas de locutor, sin dinámica
Versiones localizadas de un mismo videoUn acento regional nativo para cada mercadoUna sola voz en inglés leyendo el texto traducido

El acento es el ajuste que más se equivoca. Si tu audiencia está en Londres y tu presentador lleva la bandera de Estados Unidos, los oyentes lo notan — aunque cada palabra sea correcta. Elige la bandera pensando en la audiencia, no solo en el idioma.

Paso 4: Ajusta la velocidad de habla y luego agrega pausas

Haz clic en la fila de una voz para aplicarla a la configuración actual. Después abre el menú de velocidad junto a la voz seleccionada y elige Lento, Normal o Rápido.

  • Lento funciona para explicaciones reflexivas y para cualquier contenido donde la comprensión importa más que la urgencia.
  • Normal es la base segura para la mayoría de los tutoriales, las presentaciones y los videos con avatar parlante.
  • Rápido aporta energía a promociones cortas y clips para redes, pero los guiones densos se vuelven más difíciles de seguir.

La velocidad define el ritmo de toda la interpretación. Para tener control dentro de una oración, coloca el cursor donde debe ir el silencio y haz clic en el control Pausa. Cada clic agrega 0.5 segundos; vuelve a hacer clic para un silencio más largo.

Comparación de las velocidades de habla Lento, Normal y Rápido junto a una pausa de medio segundo insertada en un guion
Usa la velocidad para el ritmo general y las pausas para los silencios específicos que aportan significado.

Consejo práctico: agrega pausas donde un presentador real respiraría, cambiaría de idea o dejaría asentar una afirmación. Demasiadas pausas fragmentan la interpretación, así que escucha la vista previa de la oración completa después de editar, no solo de la parte que cambiaste.

Paso 5: Dirige la interpretación con Mejora de voz

Haz clic en Mejora de voz cuando las palabras ya son las correctas, pero la interpretación que buscas todavía no es explícita. VisionStory agrega indicaciones de interpretación para la emoción, el ritmo y el énfasis, sin cambiar tu redacción original.

Revisa el guion mejorado antes de continuar. Elige Mantener cuando las indicaciones coincidan con tu intención, o Deshacer para volver al original. Vale la pena cuando un guion necesita una dirección emocional clara pero no debe reescribirse.

Comparación de antes y después que muestra cómo Mejora de voz agrega indicaciones de interpretación calmada y pausada sin cambiar las palabras
El mensaje sigue siendo tuyo; lo que recibe dirección es la interpretación.

Paso 6: Escucha la vista previa de tu guion real antes de generar

Haz clic en Vista previa de audio cuando ya estén listas la voz, la velocidad, las pausas y cualquier indicación de mejora. Escucha la toma completa en lugar de juzgar por las primeras palabras, y revisa la pronunciación, el acento, el ritmo, los finales de frase, las pausas y qué tan bien encaja la emoción.

Mientras sigas comparando candidatas, empieza con una sola frase corta y representativa. Cuando la lista se reduzca a dos o tres, escucha la vista previa de un fragmento que incluya los nombres, las cifras, los términos técnicos o los momentos emocionales que más importan en el video final — ahí es donde las voces se diferencian.

Cuota de vista previa: la vista previa de audio incluye una cuota gratuita de caracteres que se renueva en un ciclo continuo de 24 horas. Una vez agotada esa cuota, generar una vista previa cuesta 1 crédito por cada 500 caracteres. Consulta cómo funcionan los créditos de VisionStory para ver el panorama completo.

Paso 7: Genera una vez para que el avatar recuerde la voz

Seleccionar una voz cambia la configuración actual del editor, pero la sola selección no guarda esa voz en el avatar. Genera un video con la voz que elegiste. VisionStory recuerda entonces la combinación y la restaura la próxima vez que uses el mismo avatar.

Diagrama de tres pasos que muestra una voz seleccionada, guardada después de generar un video y restaurada al reutilizar el avatar
El límite es la generación: selecciona la voz, genera una vez y luego reutiliza el avatar con esa voz ya asociada.

Por eso vale la pena elegir con cuidado. Una vez que un avatar y una voz quedan emparejados, cada video futuro parte de un presentador consistente en lugar de una decisión desde cero.

Por qué las voces con IA suenan robóticas — y cómo solucionarlo

Cuando una locución generada suena sintética, casi siempre se debe a una de cinco causas corregibles y no al modelo de voz en sí.

  • Voz equivocada para el guion. Una voz de narración leyendo un texto publicitario suena plana. Vuelve a armar tu lista corta filtrando por Caso de uso antes de culpar a la calidad.
  • Sin pausas. Las personas reales respiran. Un muro de texto sin respiros suena a máquina, así que agrega pausas de medio segundo donde termina cada idea.
  • Velocidad puesta una vez y olvidada. Rápido vuelve confusas las frases densas; Lento hace que una promo corta se arrastre. Ajusta el ritmo al tipo de contenido.
  • Puntuación ambigua. Las frases interminables, las comas faltantes y las abreviaturas sin desarrollar empujan a la voz hacia el tono monótono. Limpia primero el guion.
  • Sin dirección emocional. Si la intención no está en el texto, la voz no puede deducirla — y justo para eso sirve Mejora de voz.

Corrige esos cinco puntos y la mayoría de las quejas sobre voces con IA robóticas desaparecen sin cambiar la voz en absoluto.

Si un proveedor retira una voz que usas

VisionStory obtiene sus voces de varios proveedores, y un proveedor puede eliminar una voz de su propio catálogo. Cuando eso ocurre, la voz ya no se puede restaurar en la Biblioteca de voces pública.

Si desapareció una voz en la que te apoyabas, busca un fragmento limpio de un video anterior que contenga únicamente esa voz y úsalo como audio de origen en Clonación de voz. El clon puede generar un reemplazo muy parecido, aunque no hay que esperar que suene idéntico.

Diagrama de proceso que muestra cómo el audio limpio de un video anterior puede servir de origen para un clon de voz de reemplazo similar
Un video aprobado anteriormente puede aportar el audio limpio que conserva la continuidad cuando se retira una voz del catálogo.

Se requiere permiso: clona únicamente audio que te pertenezca o que tengas permiso explícito para usar, y escucha la vista previa del reemplazo con el guion que vas a publicar antes de hacerlo.

Tu lista de verificación de voz con IA antes de generar

  • Elige el acento regional según tu audiencia, no solo el idioma.
  • Usa las etiquetas del perfil para armar una lista corta y luego deja que tus oídos decidan.
  • Escucha en vista previa los nombres, los números y los términos difíciles de tu guion real.
  • Ajusta la velocidad general antes de agregar pausas puntuales.
  • Usa Mejora de voz solo cuando la interpretación necesite indicaciones más claras.
  • Escucha una vista previa completa, no solo la primera oración.
  • Genera una sola vez cuando quieras que el avatar recuerde la voz.
  • Anota el nombre de la voz elegida en las notas de tu marca o campaña.

Una vez que defines la voz, lo demás es rápido. Lleva esta misma configuración hasta el video terminado con cómo crear un avatar parlante con IA, o abre texto a voz cuando solo necesites la parte de audio.

Preguntas frecuentes

  • Empieza por la audiencia: haz coincidir el idioma y el acento regional que muestra la bandera, y después usa las etiquetas de género, edad, rasgo y caso de uso para armar una lista corta con unas cuantas candidatas. Escucha cada una con una oración de tu guion real en lugar de una muestra genérica, y elige la voz cuyo ritmo, energía y calidez encajen con el tipo de contenido. Termina ajustando la velocidad del habla y agregando pausas para que la interpretación coincida con tu intención.