Quer fazer uma foto parada falar—um retrato que abre a boca, pisca e diz o que você digitar? Com o VisionStory, dá para fazer exatamente isso a partir de uma única imagem, direto no seu navegador, sem câmera e sem experiência em edição. O vídeo acima mostra todo o fluxo, e o guia passo a passo abaixo cobre cada etapa em detalhes.
Ao longo do processo, você vai enviar um retrato e prepará-lo como seu próprio avatar reutilizável. Outros usuários não conseguem vê-lo, e você pode selecioná-lo novamente em vídeos futuros em vez de enviar a mesma imagem toda vez. Tudo funciona dentro da ferramenta de foto falante do VisionStory com uma conta gratuita.
Etapa 1: Envie um retrato nítido
Abra AI Video. No painel de Personagens, escolha Upload e selecione uma imagem do seu dispositivo ou arraste a foto diretamente para a área de envio. Use uma pessoa nítida, de frente, com rosto e ombros visíveis, olhos e boca desobstruídos e um pouco de espaço ao redor para reenquadrar depois.
- Arquivos compatíveis: JPG, JPEG, PNG, WebP e HEIC.
- Tamanho máximo do arquivo: 30 MB.
- Tamanho inicial recomendado: pelo menos 512 x 768 pixels para um retrato.
- Comportamento de upload: uma imagem de origem por vez.

Combine a composição da imagem de origem com o destino do vídeo. Um retrato com corte muito fechado pode funcionar em 9:16, mas virar um corte de rosto desconfortavelmente apertado em 16:9, porque não há área de imagem à esquerda e à direita para preencher o enquadramento mais amplo.
Etapa 2: Deixe o VisionStory validar e preparar o avatar
Depois do upload, o VisionStory verifica se a imagem contém uma pessoa utilizável e a prepara como um personagem. Quando o upload falha, quase sempre a causa está na foto de origem: o rosto pode estar pequeno demais, muito coberto, virado demais para o lado, borrado ou muito perto de outro rosto.
Se a preparação falhar, não continue tentando o mesmo recorte. Escolha uma fonte mais nítida, com um rosto maior, um ângulo mais direto, ombros visíveis, iluminação uniforme e menos obstrução.

Quando o processamento termina, o avatar aparece acima da biblioteca pública de personagens e abre na prévia do avatar. Ele fica visível apenas para você.
Etapa 3: Faça a prévia ou troque a voz atribuída
O VisionStory atribui automaticamente uma voz inicial adequada com base na idade e no gênero aparentes da pessoa. Você pode mantê-la, ouvir a prévia ou trocar por outra.
- Selecione a voz atual para abrir a Biblioteca de Vozes.
- Use o botão de reproduzir à direita de uma voz para ouvir uma amostra.
- Se não combinar, filtre por Idioma, Gênero, Idade e Caso de Uso.
- Faça a prévia de algumas alternativas e escolha a voz que combine tanto com o avatar quanto com o objetivo do vídeo.

Uma voz pode combinar com a idade e o gênero aparentes da pessoa e, ainda assim, soar errada para narração, educação, publicidade ou conteúdo conversacional. Combine a pessoa e o objetivo, não apenas os dados demográficos.
Etapa 4: Reenquadre a foto para o destino
Use a prévia do avatar para decidir quanto da pessoa aparece no vídeo final. Arraste a foto para reposicionar o sujeito e use os controles de zoom para aproximar ou afastar. Depois, escolha a Proporção de Aspecto que combina com onde você vai publicar:
- 9:16 vertical para TikTok, Instagram Reels, YouTube Shorts e outros formatos focados em mobile.
- 1:1 quadrado para posts quadrados, layouts centrados em perfil e embeds flexíveis.
- 16:9 horizontal para YouTube, apresentações, sites e cursos em widescreen.

O zoom não revela pixels que não existem. Se a pessoa já encosta em todas as bordas da foto de origem, comece com uma imagem que tenha mais fundo em vez de forçar um recorte mais amplo.
Etapa 5: Entenda o que Change Look e Generate Image fazem
Duas ferramentas de imagem com IA ficam ao lado do avatar, e vale entender a diferença antes de usá-las.
Change Look abre um chat de IA com o seu avatar atual já anexado, para que você descreva um novo figurino, cenário ou estilo. É um fluxo de trabalho image-to-image, e o avatar original continua disponível. Generate Image começa a partir de uma descrição escrita do personagem em vez de uma foto, então é um fluxo text-to-image. Em ambos, você pode continuar no chat para refinar o resultado.

Resumindo: use Change Look quando o personagem já existe e precisa de um novo visual; e use Generate Image quando você quiser criar um personagem a partir de um prompt.
Etapa 6: Adicione um roteiro curto e gere o vídeo falante
Com o avatar enviado selecionado, digite uma frase curta e conversacional na caixa de Roteiro. Uma linha curta renderiza mais rápido e facilita avaliar foto, recorte, voz, sincronização labial e movimento juntos.
Clique em Generate Talking Video. O VisionStory anima o rosto, sincroniza os lábios com a voz e adiciona piscadas realistas e movimento de cabeça usando o avatar, o enquadramento, o roteiro e a voz selecionados. A renderização leva alguns minutos.

Trate este primeiro resultado como um teste prático da foto de origem. Revise quatro pontos:
- O rosto permanece nítido o suficiente no tamanho final.
- Olhos e boca continuam desobstruídos durante o movimento.
- Cabeça e ombros ficam confortavelmente dentro da proporção escolhida.
- O avatar em movimento ainda se parece com a pessoa da foto de origem.
Se o recorte estiver muito fechado ou o rosto parecer suave no movimento, corrija primeiro a imagem de origem ou o enquadramento. Trocar o roteiro não resolve um problema de composição.
Etapa 7: Reutilize ou remova seu avatar de foto falante
De volta à lista de Personagens, seu avatar enviado fica acima da biblioteca pública e pode ser selecionado sempre que você quiser o mesmo apresentador novamente. Outros usuários não conseguem vê-lo, e assinantes podem criar e manter avatares ilimitados.
- Reutilize: selecione o avatar em vez de enviar a foto novamente.
- Troque o visual: abra o avatar e escolha uma das miniaturas de visual salvas.
- Remova: passe o mouse sobre o avatar para revelar o botão de excluir no canto superior direito e confirme antes de excluir o avatar e seus visuais.

Solução de problemas comuns de fotos
O VisionStory não encontra um rosto utilizável. Use uma imagem mais clara e nítida, com um rosto maior e de frente. Evite olhos ou bocas cobertos, ângulos fortes de perfil e fotos em que outro rosto esteja muito próximo do sujeito principal.
O recorte horizontal está muito próximo. O retrato de origem provavelmente não tem área de imagem suficiente nas laterais. Use uma imagem de origem mais ampla ou com mais espaço vazio ao redor da pessoa.
O avatar ainda está sendo preparado. Espere a preparação terminar antes de usar o personagem. Se travar, atualize a visualização de Personagens e verifique se o avatar já apareceu antes de enviar outra cópia.
O resultado parece suave. Comece com uma foto em resolução mais alta e em foco e evite ampliar um rosto pequeno de forma agressiva. A Resolução de saída não consegue restaurar detalhes que estavam faltando na origem.
É só isso para fazer uma foto falar: envie um retrato, combine uma voz, enquadre e gere. Sua foto agora é um avatar falante reutilizável que você pode usar sempre que precisar.
Quer o fluxo completo de roteiro, voz, configurações, créditos e geração? Siga How to Create an AI Talking Avatar ou transforme roteiros completos em Vídeos com IA em escala. Ou comece agora mesmo: crie sua primeira foto falante grátis.
