Português (Portugal)

Veja este tutorial no YouTube

YouTube

Todos os vídeos com IA começam por um guião, mas é a voz que decide como esse guião chega realmente ao público. É ela que define o sotaque, a idade, a textura, a energia e a personalidade do seu apresentador — e são a velocidade, as pausas e as indicações de interpretação que decidem se o resultado soa a uma pessoa ou a uma máquina a ler uma página.

Em resumo: escolha uma voz de IA fazendo corresponder o idioma e o sotaque regional ao seu público, use as etiquetas de perfil para criar uma lista restrita, pré-visualize cada candidata com o seu próprio guião e molde depois a interpretação com a velocidade e as pausas antes de gerar. O resto deste guia percorre esse processo passo a passo na VisionStory, cuja biblioteca de vozes de IA tem mais de 1000 vozes em 88 idiomas.

O que este guia abrange: a Biblioteca de Vozes pública e os controlos de interpretação que a rodeiam. Criar uma voz a partir da sua própria gravação é um fluxo de trabalho separado — consulte como clonar a sua voz com IA.

Passo 1: Abra a Biblioteca de Vozes e leia a linha da voz

Abra o Vídeo com IA, selecione o avatar que pretende utilizar e clique na voz atual por baixo da caixa de Guião. A Biblioteca de Vozes abre-se por cima do editor.

Cada linha apresenta quatro sinais que lhe permitem prever como uma voz vai soar antes de carregar em reproduzir:

  • Etiqueta de idioma — o idioma que a voz fala.
  • Bandeira — o sotaque regional, não um segundo idioma. As vozes em inglês podem apresentar bandeiras dos EUA, do Reino Unido, do Canadá e de outros países.
  • Género e idade — a identidade percebida de quem fala.
  • Características e caso de utilização — descrições como clara, calorosa, conversacional, narração, educação ou redes sociais.
Guia das etiquetas de idioma, sotaque regional, género, idade, características e caso de utilização numa linha de voz da VisionStory
A bandeira é o sotaque regional — a etiqueta que mais importa quando compara várias vozes no mesmo idioma.

Use as etiquetas para criar uma lista restrita, não para tomar a decisão final. Duas vozes com etiquetas quase idênticas podem ainda assim diferir bastante no ritmo, na textura e na energia.

Passo 2: Filtre, pesquise e pré-visualize uma lista restrita

Comece com uma seleção suficientemente ampla para ouvir diferenças reais e depois vá restringindo. Use os filtros Idioma, Género, Idade e Caso de Utilização enquanto ainda está a explorar. Se já conhece uma voz pelo nome, escreva-o diretamente no campo de pesquisa.

  1. Crie uma lista restrita. Filtre ou pesquise até ter um punhado de candidatas em vez de um catálogo completo.
  2. Ouça toda a lista restrita. Clique no botão de reprodução à direita de uma linha de voz para ouvir a respetiva amostra.
  3. Pause e compare. Clique novamente no mesmo botão para parar antes de iniciar a voz seguinte.
Biblioteca de Vozes da VisionStory com um campo de pesquisa, filtros de Idioma, Género, Idade e Caso de Utilização e um botão de reprodução em cada linha de voz
A pesquisa e os filtros tornam gerível uma biblioteca de 1000 vozes; é a pré-visualização que confirma se a escolha encaixa.

Ouça à procura daquilo de que o seu vídeo precisa mesmo: sotaque regional, clareza, energia, calor, autoridade e a rapidez com que a voz avança dentro de uma frase. Uma voz que soa muito bem isoladamente pode continuar a ser desadequada para um guião instrutivo, de vendas, noticioso ou centrado numa personagem.

Passo 3: Adeque a voz ao seu conteúdo e ao seu público

A maioria das narrações com IA dececionantes não tem um problema de qualidade, mas sim de adequação. Antes de decidir, defina o que esta voz tem de fazer por este vídeo em concreto.

Se está a criarProcureEvite
Tutoriais, explicações, cursosArticulação clara, ritmo constante, calor neutroLeituras promocionais de alta energia que atropelam termos técnicos
Anúncios, promoções, clipes curtos para redes sociaisEnergia, impacto, um perfil confiante e mais jovemNarração lenta e comedida que deixa cair o gancho
Notícias, comunicação corporativa, atualizações de produtoAutoridade, ritmo uniforme, textura vocal mínimaVozes informais ou muito caracterizadas
Narrativa, entrevistas, podcastsPersonalidade e amplitude expressivaLeituras planas de locutor, sem dinâmica
Versões localizadas de um mesmo vídeoUm sotaque regional nativo para cada mercadoUma única voz em inglês a ler texto traduzido

O sotaque é a definição que as pessoas mais erram. Se o seu público está em Londres e o seu apresentador exibe uma bandeira dos EUA, os ouvintes reparam — mesmo quando todas as palavras estão corretas. Escolha a bandeira a pensar no público, não apenas no idioma.

Passo 4: Defina a velocidade de fala e depois acrescente pausas

Clique numa linha de voz para a aplicar à configuração atual. Depois, abra o menu de velocidade junto à voz selecionada e escolha Lento, Normal ou Rápido.

  • Lento adequa-se a explicações ponderadas e a qualquer conteúdo em que a compreensão conte mais do que a urgência.
  • Normal é a base segura para a maioria dos tutoriais, apresentações e vídeos de avatar falante.
  • Rápido dá energia a promoções curtas e clipes para redes sociais, mas os guiões densos tornam-se mais difíceis de acompanhar.

A velocidade define o andamento de toda a interpretação. Para controlar o interior de uma frase, coloque o cursor onde a pausa deve entrar e clique no controlo Pausa. Cada clique acrescenta 0,5 segundos; clique novamente para uma pausa mais longa.

Comparação das velocidades de fala Lento, Normal e Rápido junto a uma pausa de meio segundo inserida num guião
Use a velocidade para o andamento global e as pausas para os momentos específicos que transmitem sentido.

Dica prática: acrescente pausas onde um apresentador real respiraria, mudaria de ideia ou deixaria uma afirmação assentar. Demasiadas pausas fragmentam a interpretação, por isso pré-visualize a frase inteira depois de editar, e não apenas a parte que alterou.

Passo 5: Oriente a interpretação com o Melhorar Voz

Clique em Melhorar Voz quando as palavras já estão certas, mas a interpretação pretendida ainda não está explícita. A VisionStory acrescenta indicações de interpretação para emoção, ritmo e ênfase, mantendo a sua redação original.

Reveja o guião melhorado antes de continuar. Escolha Manter quando as indicações correspondem à sua intenção ou Anular para voltar ao original. Compensa quando um guião precisa de uma direção emocional clara, mas não deve ser reescrito.

Comparação de antes e depois a mostrar o Melhorar Voz a acrescentar indicações de interpretação calma e comedida sem alterar as palavras
A mensagem continua a ser sua; o que recebe direção é a interpretação.

Passo 6: Pré-visualize o seu guião real antes de gerar

Clique em Pré-visualizar Áudio assim que a voz, a velocidade, as pausas e eventuais indicações de melhoria estiverem definidas. Ouça a gravação completa em vez de julgar pelas primeiras palavras e verifique a pronúncia, o sotaque, o ritmo, os finais de frase, as pausas e a adequação emocional.

Enquanto ainda está a comparar candidatas, comece por uma frase curta e representativa. Quando a lista restrita estiver reduzida a duas ou três, pré-visualize uma passagem que contenha os nomes, os números, os termos técnicos ou os momentos emocionais mais importantes do vídeo final — é aí que as vozes se distinguem.

Limite de pré-visualização: a pré-visualização de áudio inclui um limite gratuito de caracteres que é renovado num ciclo contínuo de 24 horas. Depois de esgotado esse limite, gerar uma pré-visualização custa 1 crédito por cada 500 caracteres. Consulte como funcionam os créditos da VisionStory para ter uma visão completa.

Passo 7: Gere uma vez para que o avatar memorize a voz

Selecionar uma voz altera a configuração atual do editor, mas a seleção, por si só, não guarda essa voz no avatar. Gere um vídeo com a voz que escolheu. A VisionStory memoriza então essa associação e restaura-a da próxima vez que utilizar o mesmo avatar.

Diagrama de três passos que mostra uma voz a ser selecionada, guardada após a geração de um vídeo e restaurada quando o avatar é reutilizado
A fronteira é a geração: selecione a voz, gere uma vez e reutilize depois o avatar com essa voz já associada.

É por isso que vale a pena fazer a escolha com cuidado. Depois de um avatar e uma voz estarem associados, todos os vídeos futuros partem de um apresentador coerente em vez de uma nova decisão.

Porque é que as vozes de IA soam robóticas — e como resolver

Quando uma narração gerada parece sintética, a causa costuma ser uma de cinco situações corrigíveis e não o modelo de voz em si.

  • Voz errada para o guião. Uma voz de narração a ler texto publicitário soa sem vida. Volte a fazer a lista restrita por caso de utilização antes de culpar a qualidade.
  • Falta de pausas. Os oradores reais respiram. Um bloco de texto sem intervalos soa a máquina, por isso acrescente pausas de meio segundo nas fronteiras entre ideias.
  • Velocidade definida uma vez e esquecida. O modo Rápido torna confusas as frases densas; o Lento arrasta uma promoção curta. Ajuste o ritmo ao tipo de conteúdo.
  • Pontuação ambígua. Frases intermináveis, vírgulas em falta e abreviaturas não desenvolvidas empurram a voz para o monocórdico. Limpe primeiro o guião.
  • Sem direção emocional. Se a intenção não estiver no texto, a voz não a consegue deduzir — e é exatamente para isso que serve a função Melhorar Voz.

Corrija estes cinco pontos e a maioria das queixas sobre vozes de IA robóticas desaparece sem sequer mudar de voz.

Se um fornecedor descontinuar uma voz que utiliza

A VisionStory obtém vozes de vários fornecedores e um fornecedor pode remover uma voz do seu próprio catálogo. Quando isso acontece, a voz não pode ser reposta na Biblioteca de Vozes pública.

Se uma voz de que dependia deixou de estar disponível, procure uma passagem limpa de um vídeo anterior que contenha apenas essa voz e use-a como áudio de origem no Clone de Voz. O clone consegue produzir um substituto aproximado, embora não se deva esperar que soe exatamente igual.

Diagrama do processo que mostra como o áudio limpo de um vídeo anterior pode servir de origem para um clone de voz de substituição semelhante
Um vídeo anterior já aprovado pode fornecer o áudio limpo que preserva a continuidade quando uma voz do catálogo é descontinuada.

Autorização necessária: clone apenas áudio que lhe pertença ou que tenha autorização clara para utilizar e pré-visualize o substituto com o guião que pretende usar antes de publicar.

A sua lista de verificação da voz com IA antes de gerar

  • Escolha o sotaque regional adequado ao público, não apenas o idioma.
  • Use as etiquetas do perfil para criar uma lista restrita e depois deixe que os seus ouvidos decidam.
  • Pré-visualize os nomes, os números e os termos difíceis do seu guião real.
  • Defina a velocidade geral antes de adicionar pausas pontuais.
  • Use o Melhorar Voz apenas quando a interpretação precisar de indicações mais claras.
  • Ouça uma pré-visualização completa, não apenas a primeira frase.
  • Gere uma vez quando quiser que o avatar memorize a voz.
  • Registe o nome da voz escolhida nas notas da sua marca ou campanha.

Assim que a voz estiver definida, o resto é rápido. Leve a mesma configuração até ao vídeo final com como criar um avatar falante com IA ou abra texto para fala quando só precisar da parte de áudio.

Perguntas frequentes

  • Comece pelo público: faça corresponder o idioma e o sotaque regional indicado pela bandeira e use depois as etiquetas de género, idade, característica e caso de utilização para criar uma lista restrita com algumas candidatas. Pré-visualize cada uma com uma frase do seu guião real, em vez de uma amostra genérica, e escolha a voz cujo ritmo, energia e calor humano se adequam ao tipo de conteúdo. Termine definindo a velocidade de fala e acrescentando pausas para que a interpretação corresponda à sua intenção.