Español (Argentina)

Mirá este tutorial en YouTube

YouTube

Todo video con IA empieza con un guion, pero la voz es la que define cómo llega ese guion. Fija el acento, la edad, la textura, la energía y la personalidad de tu presentador — y la velocidad, las pausas y las indicaciones de interpretación deciden si el resultado suena a una persona o a una máquina leyendo una página.

La versión corta: elegí una voz con IA haciendo coincidir el idioma y el acento regional con tu audiencia, usá las etiquetas del perfil para armar una lista corta, escuchá la vista previa de cada candidata con tu propio guion y después ajustá la interpretación con la velocidad y las pausas antes de generar. El resto de esta guía recorre ese proceso paso a paso en VisionStory, cuya biblioteca de voces con IA tiene más de 1.000 voces en 88 idiomas.

Qué cubre esta guía: la Biblioteca de voces pública y los controles de interpretación que la rodean. Crear una voz a partir de tu propia grabación es un flujo aparte — mirá cómo clonar tu voz con IA.

Paso 1: Abrí la Biblioteca de voces y leé la fila de la voz

Abrí Video con IA, seleccioná el avatar que quieras usar y hacé clic en la voz actual debajo del cuadro de guion. La Biblioteca de voces se abre sobre el editor.

Cada fila trae cuatro señales que te permiten anticipar cómo va a sonar una voz antes de darle play:

  • Etiqueta de idioma — el idioma que habla la voz.
  • Bandera — el acento regional, no un segundo idioma. Las voces en inglés pueden llevar banderas de Estados Unidos, Reino Unido, Canadá y otros países.
  • Género y edad — la identidad que se percibe de quien habla.
  • Rasgos y caso de uso — descripciones como clara, cálida, conversacional, narración, educación o redes sociales.
Guía de las etiquetas de idioma, acento regional, género, edad, rasgos y caso de uso en una fila de voz de VisionStory
La bandera es el acento regional — la etiqueta que más importa cuando comparás varias voces en el mismo idioma.

Usá las etiquetas para armar una lista corta, no para tomar la decisión final. Dos voces con etiquetas casi idénticas pueden diferir bastante en ritmo, textura y energía.

Paso 2: Filtrá, buscá y escuchá una lista corta

Empezá con un rango bien amplio para escuchar diferencias reales y después acotá. Usá los filtros Idioma, Género, Edad y Caso de uso mientras seguís explorando. Si ya conocés una voz por su nombre, escribilo en el campo de búsqueda.

  1. Armá una lista corta. Filtrá o buscá hasta quedarte con un puñado de candidatas en vez de un catálogo entero.
  2. Escuchá toda la lista corta. Hacé clic en el botón de reproducción a la derecha de una fila de voz para oír su muestra.
  3. Pausá y compará. Hacé clic de nuevo en el mismo botón para detenerla antes de pasar a la siguiente.
Biblioteca de voces de VisionStory con un campo de búsqueda, filtros de Idioma, Género, Edad y Caso de uso, y un botón de reproducción en cada fila de voz
La búsqueda y los filtros hacen manejable una biblioteca de 1.000 voces; la vista previa es lo que confirma que encaja.

Prestá atención a lo que realmente necesita tu video: acento regional, claridad, energía, calidez, autoridad y qué tan rápido avanza la voz dentro de una oración. Una voz que suena bárbara por sí sola igual puede no funcionar para un guion instructivo, de ventas, de noticias o de personaje.

Paso 3: Ajustá la voz a tu contenido y a tu audiencia

La mayoría de las locuciones con IA que decepcionan no tienen un problema de calidad, sino de adecuación. Antes de confirmar, definí qué tiene que lograr esta voz en este video puntual.

Si estás haciendoBuscáEvitá
Tutoriales, explicativos, cursosArticulación clara, ritmo parejo, calidez neutraLecturas promocionales de alta energía que apuran los términos técnicos
Anuncios, promos, clips cortos para redesEnergía, impacto, un perfil seguro y más jovenNarración lenta y pausada que hace perder el gancho
Noticias, contenido corporativo, novedades de productoAutoridad, ritmo uniforme, textura vocal mínimaVoces informales o muy caracterizadas
Narrativa, entrevistas, podcastsPersonalidad y rango expresivoLecturas de locutor planas y sin dinámica
Versiones localizadas de un mismo videoUn acento regional nativo para cada mercadoUna única voz en inglés leyendo el texto traducido

El acento es el ajuste que más se equivoca. Si tu audiencia está en Londres y tu presentador lleva la bandera de Estados Unidos, quien escucha lo nota — incluso cuando cada palabra está bien. Elegí la bandera pensando en la audiencia, no solo en el idioma.

Paso 4: Configurá la velocidad de habla y después agregá pausas

Hacé clic en la fila de una voz para aplicarla a la configuración actual. Después abrí el menú de velocidad que está al lado de la voz seleccionada y elegí Lenta, Normal o Rápida.

  • Lenta va bien para explicaciones reflexivas y para cualquier contenido en el que la comprensión importe más que la urgencia.
  • Normal es la base segura para la mayoría de los tutoriales, presentaciones y videos con avatar parlante.
  • Rápida le suma energía a las promos cortas y a los clips para redes, pero los guiones densos se vuelven más difíciles de seguir.

La velocidad define el tempo de toda la interpretación. Para controlar el ritmo dentro de una oración, ubicá el cursor donde va el silencio y hacé clic en el control Pausa. Cada clic agrega 0,5 segundos; volvé a hacer clic para un silencio más largo.

Comparación de las velocidades de habla Lenta, Normal y Rápida junto a una pausa de medio segundo insertada en un guion
Usá la velocidad para el tempo general y las pausas para los silencios puntuales que cargan sentido.

Consejo práctico: agregá pausas donde un presentador real respiraría, cambiaría de idea o dejaría que una afirmación cale. Demasiadas pausas fragmentan la locución, así que escuchá la vista previa de la oración completa después de editar, no solo de la parte que cambiaste.

Paso 5: Dirigí la interpretación con Mejora de voz

Hacé clic en Mejora de voz cuando las palabras ya están bien pero la interpretación que buscás todavía no es explícita. VisionStory agrega indicaciones de emoción, ritmo y énfasis sin cambiar tu redacción original.

Revisá el guion mejorado antes de seguir. Elegí Mantener cuando las indicaciones coincidan con tu intención, o Deshacer para volver al original. Se gana su lugar cuando un guion necesita una dirección emocional clara pero no debería reescribirse.

Comparación de antes y después que muestra Mejora de voz agregando indicaciones de interpretación calmada y pausada sin cambiar las palabras
El mensaje sigue siendo tuyo; lo que recibe dirección es la interpretación.

Paso 6: Escuchá una vista previa de tu guion real antes de generar

Hacé clic en Vista previa del audio una vez que la voz, la velocidad, las pausas y las indicaciones de mejora estén listas. Escuchá la toma completa en lugar de juzgar por las primeras palabras, y revisá la pronunciación, el acento, el ritmo, los finales de las oraciones, las pausas y la carga emocional.

Cuando todavía estés comparando candidatas, empezá con una sola oración corta y representativa. Cuando la lista quede reducida a dos o tres, escuchá la vista previa de un pasaje que incluya los nombres, los números, los términos técnicos o los momentos emotivos que más importan en el video terminado — ahí es donde las voces se diferencian.

Cupo de vista previa: la vista previa de audio incluye un cupo gratuito de caracteres que se renueva en un ciclo móvil de 24 horas. Una vez usado ese cupo, generar una vista previa cuesta 1 crédito cada 500 caracteres. Mirá cómo funcionan los créditos de VisionStory para tener el panorama completo.

Paso 7: Generá una vez para que el avatar recuerde la voz

Elegir una voz cambia la configuración actual del editor, pero la selección por sí sola no guarda esa voz en el avatar. Generá un video con la voz que elegiste. A partir de ahí, VisionStory recuerda esa combinación y la restaura la próxima vez que uses el mismo avatar.

Diagrama de tres pasos que muestra una voz seleccionada, guardada tras generar un video y restaurada cuando se vuelve a usar el avatar
El límite es la generación: elegí la voz, generá una vez y después reutilizá el avatar con esa voz ya asociada.

Por eso vale la pena elegir con cuidado. Una vez que un avatar y una voz quedan emparejados, cada video futuro arranca con un presentador consistente en lugar de una decisión desde cero.

Por qué las voces con IA suenan robóticas — y cómo solucionarlo

Cuando una locución generada suena sintética, en general se debe a una de cinco causas que tienen arreglo y no al modelo de voz en sí.

  • Voz equivocada para el guion. Una voz de narración leyendo un texto publicitario suena plana. Rehacé la preselección por caso de uso antes de culpar a la calidad.
  • Sin pausas. Las personas reales respiran. Un bloque de texto sin respiros se lee como una máquina, así que agregá pausas de medio segundo en los límites entre ideas.
  • Velocidad configurada una vez y olvidada. La velocidad Rápida vuelve confusas las oraciones densas; la Lenta hace que una promo corta se arrastre. Ajustá el ritmo al tipo de contenido.
  • Puntuación ambigua. Las oraciones interminables, las comas faltantes y las abreviaturas sin desarrollar empujan a cualquier voz hacia el tono monótono. Limpiá el guion primero.
  • Sin dirección emocional. Si la intención no está en el texto, la voz no puede deducirla — y justamente para eso está Mejora de voz.

Corregí esas cinco cosas y la mayoría de las quejas sobre voces con IA robóticas desaparecen sin necesidad de cambiar la voz.

Si un proveedor retira una voz que usás

VisionStory obtiene sus voces de varios proveedores, y un proveedor puede eliminar una voz de su propio catálogo. Cuando eso pasa, la voz no se puede restaurar en la Biblioteca de voces pública.

Si desapareció una voz en la que confiabas, buscá un fragmento limpio de un video anterior que contenga solo esa voz y usalo como audio de origen en Clonación de voz. El clon puede generar un reemplazo muy parecido, aunque no hay que esperar que suene idéntico.

Diagrama de proceso que muestra cómo el audio limpio de un video anterior puede servir de fuente para clonar una voz de reemplazo similar
Un video anterior ya aprobado puede aportar el audio limpio que mantiene la continuidad cuando se retira una voz del catálogo.

Permiso obligatorio: cloná solo audio que te pertenezca o que tengas permiso claro para usar, y escuchá una vista previa del reemplazo con el guion que vas a usar antes de publicar.

Tu checklist de voz con IA antes de generar

  • Elegí el acento regional según tu audiencia, no solo el idioma.
  • Usá las etiquetas del perfil para armar una preselección y después dejá que decida tu oído.
  • Escuchá una vista previa de los nombres, los números y los términos difíciles de tu guion real.
  • Definí la velocidad general antes de agregar pausas puntuales.
  • Usá Mejora de voz solo cuando la interpretación necesite indicaciones más claras.
  • Escuchá una vista previa completa, no solo la primera oración.
  • Generá una vez cuando quieras que el avatar recuerde la voz.
  • Anotá el nombre de la voz elegida en las notas de tu marca o campaña.

Una vez que fijaste la voz, el resto es rápido. Llevá esa misma configuración hasta el video terminado con cómo crear un avatar parlante con IA, o abrí Texto a voz cuando solo necesites la parte del audio.

Preguntas frecuentes

  • Empezá por la audiencia: hacé coincidir el idioma y el acento regional que muestra la bandera, y después usá las etiquetas de género, edad, rasgo y caso de uso para armar una lista corta de unas pocas candidatas. Previsualizá cada una con una oración de tu guion real en lugar de una muestra genérica, y elegí la voz cuyo ritmo, energía y calidez encajen con el tipo de contenido. Terminá ajustando la velocidad de habla y agregando pausas para que la interpretación coincida con tu intención.