Español (Estados Unidos)

Mira este tutorial en YouTube

YouTube

Todo video con IA comienza con un guion, pero la voz decide cómo llega realmente ese guion. Define el acento, la edad, la textura, la energía y la personalidad de tu presentador — y la velocidad, las pausas y las indicaciones de interpretación deciden si el resultado suena a persona o a máquina leyendo una página.

La versión corta: elige una voz con IA haciendo coincidir el idioma y el acento regional con tu audiencia, usa las etiquetas del perfil para armar una lista corta, escucha una vista previa de cada candidata con tu propio guion y luego ajusta la interpretación con la velocidad y las pausas antes de generar. El resto de esta guía recorre ese proceso paso a paso en VisionStory, cuya biblioteca de voces con IA tiene más de 1,000 voces en 88 idiomas.

Lo que cubre esta guía: la Biblioteca de voces pública y los controles de interpretación que la acompañan. Crear una voz a partir de tu propia grabación es un flujo aparte — consulta cómo clonar tu voz con IA.

Paso 1: Abre la Biblioteca de voces y lee la fila de la voz

Abre Video con IA, selecciona el avatar que quieras usar y haz clic en la voz actual debajo del cuadro de guion. La Biblioteca de voces se abre sobre el editor.

Cada fila incluye cuatro señales que te permiten anticipar cómo sonará una voz antes de presionar reproducir:

  • Etiqueta de idioma — el idioma que habla la voz.
  • Bandera — el acento regional, no un segundo idioma. Las voces en inglés pueden llevar banderas de Estados Unidos, Reino Unido, Canadá y otras.
  • Género y edad — la identidad percibida de quien habla.
  • Rasgos y caso de uso — descripciones como clara, cálida, conversacional, narración, educación o redes sociales.
Guía de las etiquetas de idioma, acento regional, género, edad, rasgos y caso de uso en una fila de voz de VisionStory
La bandera es el acento regional — la etiqueta que más importa cuando comparas varias voces en el mismo idioma.

Usa las etiquetas para armar una lista corta, no para tomar la decisión final. Dos voces con etiquetas casi idénticas pueden diferir bastante en ritmo, textura y energía.

Paso 2: Filtra, busca y escucha una lista corta

Empieza con un rango lo bastante amplio para escuchar diferencias reales y después reduce las opciones. Usa los filtros Idioma, Género, Edad y Caso de uso mientras sigues explorando. Si ya conoces una voz por su nombre, escríbela en el campo de búsqueda.

  1. Arma una lista corta. Filtra o busca hasta quedarte con un puñado de candidatas en lugar de un catálogo completo.
  2. Escucha toda la lista corta. Haz clic en el botón de reproducción a la derecha de la fila de una voz para oír su muestra.
  3. Pausa y compara. Haz clic de nuevo en el mismo botón para detenerla antes de pasar a la siguiente.
Biblioteca de voces de VisionStory con un campo de búsqueda, filtros de Idioma, Género, Edad y Caso de uso, y un botón de reproducción en cada fila de voz
La búsqueda y los filtros hacen manejable una biblioteca de 1,000 voces; la vista previa es lo que confirma que encaja.

Escucha pensando en lo que tu video realmente necesita: acento regional, claridad, energía, calidez, autoridad y qué tan rápido avanza la voz dentro de una oración. Una voz que suena genial por sí sola puede no funcionar para un guion instructivo, de ventas, de noticias o basado en un personaje.

Paso 3: Haz coincidir la voz con tu contenido y tu audiencia

La mayoría de las voces en off con IA que decepcionan no tienen un problema de calidad, sino de encaje. Antes de decidirte, define qué tiene que lograr esta voz en este video específico.

Si estás creandoBuscaEvita
Tutoriales, videos explicativos, cursosArticulación clara, ritmo constante, calidez neutraLecturas promocionales de mucha energía que apuran los términos técnicos
Anuncios, promociones, clips cortos para redes socialesEnergía, impacto, un perfil seguro y más jovenNarración lenta y pausada que pierde el gancho
Noticias, contenido corporativo, novedades de productoAutoridad, ritmo parejo, textura vocal mínimaVoces informales o con mucho estilo de personaje
Narrativa, entrevistas, podcastsPersonalidad y rango expresivoLecturas planas de locutor, sin dinámica
Versiones localizadas de un mismo videoUn acento regional nativo para cada mercadoUna sola voz en inglés leyendo el texto traducido

El acento es el ajuste en el que más se equivoca la gente. Si tu audiencia está en Londres y tu presentador lleva una bandera de Estados Unidos, los oyentes lo notan — aunque cada palabra sea correcta. Elige la bandera según la audiencia, no solo según el idioma.

Paso 4: Ajusta la velocidad de habla y luego agrega pausas

Haz clic en la fila de una voz para aplicarla a la configuración actual. Luego abre el menú de velocidad junto a la voz seleccionada y elige Lento, Normal o Rápido.

  • Lento va bien con explicaciones reflexivas y con cualquier contenido en el que la comprensión importe más que la urgencia.
  • Normal es la base segura para la mayoría de los tutoriales, presentaciones y videos con avatar parlante.
  • Rápido agrega energía a promociones cortas y clips para redes sociales, pero los guiones densos se vuelven más difíciles de seguir.

La velocidad define el tempo de toda la interpretación. Para tener control dentro de una oración, coloca el cursor donde va el silencio y haz clic en el control Pausa. Cada clic agrega 0.5 segundos; haz clic de nuevo para una pausa más larga.

Comparación de las velocidades de habla Lento, Normal y Rápido junto a una pausa de medio segundo insertada en un guion
Usa la velocidad para el tempo general y las pausas para los silencios específicos que aportan significado.

Consejo práctico: agrega pausas donde un presentador real respiraría, cambiaría de idea o dejaría que una afirmación cale. Demasiadas pausas fragmentan la interpretación, así que escucha la vista previa de la oración completa después de editar, no solo de la parte que cambiaste.

Paso 5: Dirige la interpretación con Mejorar voz

Haz clic en Mejorar voz cuando las palabras ya estén bien, pero la interpretación que buscas todavía no sea explícita. VisionStory agrega indicaciones de interpretación para la emoción, el ritmo y el énfasis, y conserva tu redacción original.

Revisa el guion mejorado antes de continuar. Elige Mantener cuando las indicaciones coincidan con tu intención, o Deshacer para volver al original. Vale la pena cuando un guion necesita una dirección emocional clara, pero no se debe reescribir.

Comparación de antes y después que muestra cómo Mejorar voz agrega indicaciones de interpretación calmada y pausada sin cambiar las palabras
El mensaje sigue siendo tuyo; lo que recibe dirección es la interpretación.

Paso 6: Previsualiza tu guion real antes de generar

Haz clic en Vista previa del audio cuando la voz, la velocidad, las pausas y las indicaciones de mejora ya estén listas. Escucha la toma completa en lugar de juzgar por las primeras palabras y revisa la pronunciación, el acento, el ritmo, los finales de oración, las pausas y si la emoción encaja.

Cuando todavía estés comparando candidatas, empieza con una sola oración corta y representativa. Una vez que la lista se reduzca a dos o tres, previsualiza un fragmento que incluya los nombres, números, términos técnicos o momentos emocionales que más importan en el video final — ahí es donde las voces se diferencian.

Cupo de vista previa: la vista previa de audio incluye un cupo gratuito de caracteres que se renueva en un ciclo continuo de 24 horas. Una vez agotado ese cupo, generar una vista previa cuesta 1 crédito por cada 500 caracteres. Consulta cómo funcionan los créditos de VisionStory para ver el panorama completo.

Paso 7: Genera una vez para que el avatar recuerde la voz

Seleccionar una voz cambia la configuración actual del editor, pero seleccionarla no basta para guardar esa voz en el avatar. Genera un video con la voz que elegiste. VisionStory recuerda entonces esa combinación y la restaura la próxima vez que uses el mismo avatar.

Diagrama de tres pasos que muestra una voz seleccionada, guardada tras generar un video y restaurada al reutilizar el avatar
El límite es la generación: selecciona la voz, genera una vez y luego reutiliza el avatar con esa voz ya asociada.

Por eso vale la pena elegir con cuidado. Una vez que un avatar y una voz quedan emparejados, cada video futuro parte de un presentador consistente en lugar de una decisión desde cero.

Por qué las voces con IA suenan robóticas — y cómo solucionarlo

Cuando una voz en off generada suena sintética, casi siempre se debe a una de cinco causas que puedes corregir y no al modelo de voz en sí.

  • Voz equivocada para el guion. Una voz de narración que lee un texto publicitario suena plana. Vuelve a filtrar por Caso de uso antes de culpar a la calidad.
  • Sin pausas. Las personas reales respiran. Un bloque de texto sin respiros suena a máquina, así que agrega pausas de medio segundo donde termina cada idea.
  • Velocidad configurada una vez y olvidada. Rápido vuelve confusas las oraciones densas; Lento hace que una promo corta se arrastre. Ajusta el ritmo al tipo de contenido.
  • Puntuación ambigua. Las oraciones interminables, las comas faltantes y las abreviaturas sin desarrollar empujan la voz hacia un tono monótono. Limpia primero el guion.
  • Sin dirección emocional. Si la intención no está en el texto, la voz no puede deducirla — y justo para eso sirve Mejorar voz.

Corrige esos cinco puntos y la mayoría de las quejas sobre voces con IA robóticas desaparecen sin cambiar la voz.

Si un proveedor retira una voz que usas

VisionStory obtiene sus voces de varios proveedores, y un proveedor puede eliminar una voz de su propio catálogo. Cuando eso ocurre, la voz no se puede restaurar en la Biblioteca de voces pública.

Si desapareció una voz en la que te apoyabas, busca un fragmento limpio de un video anterior que contenga solo esa voz y úsalo como audio de origen en Clonación de voz. El clon puede producir un reemplazo muy parecido, aunque no debes esperar que suene idéntico.

Diagrama del proceso que muestra cómo el audio limpio de un video anterior puede servir de base para un clon de voz de reemplazo similar
Un video anterior ya aprobado puede aportar el audio limpio que mantiene la continuidad cuando se retira una voz del catálogo.

Permiso requerido: clona únicamente audio que te pertenezca o que tengas permiso claro para usar, y previsualiza el reemplazo con el guion que piensas usar antes de publicar.

Tu lista de verificación de la voz con IA antes de generar

  • Elige el acento regional según tu audiencia, no solo el idioma.
  • Usa las etiquetas del perfil para armar una lista corta y luego deja que tu oído decida.
  • Previsualiza los nombres, los números y los términos difíciles de tu guion real.
  • Ajusta la velocidad general antes de agregar pausas puntuales.
  • Usa Mejorar voz solo cuando la interpretación necesite una dirección más clara.
  • Escucha una vista previa completa, no solo la primera oración.
  • Genera un video una vez para que el avatar recuerde la voz.
  • Anota el nombre de la voz elegida en las notas de tu marca o campaña.

Una vez definida la voz, el resto es rápido. Lleva esa misma configuración hasta un video terminado con cómo crear un avatar parlante con IA, o abre texto a voz cuando solo necesites la parte de audio.

Preguntas frecuentes

  • Empieza por la audiencia: haz coincidir el idioma y el acento regional que indica la bandera; luego usa las etiquetas de género, edad, rasgo y caso de uso para armar una preselección de unas pocas candidatas. Escucha cada una con una frase de tu guion real en lugar de una muestra genérica y quédate con la voz cuyo ritmo, energía y calidez encajen con el tipo de contenido. Termina ajustando la velocidad de habla y agregando pausas para que la interpretación coincida con tu intención.