Crie vídeos de avatares falantes com lip-sync a partir de texto ou áudio com a REST API da VisionStory ou o SDK em Python. Descubra modelos, avatares e vozes atuais, envie um job assíncrono e baixe o MP4 final — ou automatize o mesmo fluxo de trabalho com o CLI, o servidor MCP ou o Agent Skill.
Envie este prompt de configuração para Claude Code
Help me set up VisionStory and generate a talking-avatar video.1. Install or update the CLI and Agent Skill:curl -fsSL https://developers.visionstory.ai/cli | bashnpx skills add visionstory-ai/skills --skill visionstory-api2. Run visionstory doctor. If I need a key, send me to https://developers.visionstory.ai/api-keys, wait while I create one, then ask me to run visionstory login in my terminal. Never ask me to paste the key into chat or expose it.3. Verify access with visionstory credits. Stop and help me if it fails.4. Discover current models, avatars, and voices, then use the CLI and visionstory-api skill to create and download the video. Never delete anything unless I explicitly request and confirm it.
Novo por aqui?
Crie uma chave de API e envie este prompt para seu agente de programação. Ele vai te guiar pelo login no visionstory, verificar créditos e criar o vídeo sem expor sua chave.
Ferramentas de desenvolvedor da VisionStory
Escolha a integração de API para sua stack.
REST, o SDK em Python, o CLI, o servidor MCP e o Agent Skill usam a mesma API autenticada da VisionStory e os mesmos IDs de recurso. Comece com uma interface e depois leve o mesmo fluxo de vídeos de avatar para um backend, pipeline de CI ou agente de programação.
Crie uma chave de API no lado do servidor, verifique seu saldo de créditos e descubra os IDs atuais de modelo, avatar e voz. Envie um text_script ou audio_script para POST /api/v1/video, faça polling a cada cinco segundos até o job ser criado e então baixe o MP4. As URLs dos vídeos concluídos ficam disponíveis por sete dias.
create_video.py
from pathlib import Pathfrom visionstory import VisionStoryClient, build_video_payloadclient = VisionStoryClient.from_env()payload = build_video_payload(avatar_id="YOUR_AVATAR_ID",text="Hello from my product.",voice_id="YOUR_VOICE_ID",)video = client.generate_video(payload)client.download(video["video_url"], Path("result.mp4"))
Catálogo de modelos da VisionStory
Escolha o modelo para o resultado que você precisa.
Comece pelo job que você precisa concluir e, em seguida, busque o catálogo de modelos atual em runtime. A resposta da API é a fonte de verdade para IDs disponíveis, parâmetros aceitos e limites de saída.
Use uma única chave de API para criar apresentadores falantes, sintetizar fala natural, reutilizar avatares, vozes e assets de mídia personalizados e gerar clipes de vídeo de apoio. Crie explicações localizadas, onboarding personalizado, conteúdos de educação, prospecção de vendas ou mídia criada por agentes sem precisar juntar provedores separados.
Perguntas frequentes sobre a API de Vídeo de Avatar com IA
Respostas diretas sobre autenticação, requisições, jobs assíncronos, SDKs, automação via CLI, MCP e uso em produção.
Uma API de vídeo de avatar com IA transforma um apresentador digital mais texto ou áudio gravado em um vídeo com lip-sync que um aplicativo pode gerar programaticamente. O VisionStory aceita requisições autenticadas do lado do servidor, retorna um ID de vídeo imediatamente, renderiza o job de forma assíncrona e fornece uma URL de MP4 quando a geração é concluída.
Crie uma chave de API do VisionStory, verifique seus Créditos, obtenha os IDs atuais de modelo, avatar e voz e, em seguida, envie um text_script ou um audio_script para POST /api/v1/video. A API retorna um ID de vídeo imediatamente. Faça polling do job a cada cinco segundos até que o status seja created e, então, baixe o MP4 a partir de video_url.
Use REST quando precisar de controle independente de linguagem, o SDK Python quando estiver criando um serviço ou notebook em Python e a CLI para automação no terminal, CI ou geração em lote. As três interfaces usam os mesmos recursos do VisionStory e o mesmo fluxo de trabalho assíncrono de vídeo.
Sim. Instale o VisionStory Agent Skill ou conecte o servidor MCP do VisionStory. Um agente de codificação compatível pode verificar Créditos, listar modelos, avatares e vozes atuais, preparar uma requisição válida, iniciar o job de vídeo, monitorá-lo e baixar o resultado enquanto a chave de API permanece no seu ambiente ou no armazenamento de segredos do MCP.
Sim. Envie um audio_script quando quiser que o avatar fale a partir de áudio gravado ou envie um text_script com um ID de voz quando o VisionStory precisar sintetizar a fala. Use um tipo de script por requisição em vez de enviar os dois.
Trate a criação de vídeo como um job assíncrono. Armazene o ID da requisição do cliente e o ID de vídeo retornado, faça polling a cada cinco segundos e pare quando o job chegar a created ou failed. As URLs de vídeos concluídos são mantidas por sete dias; portanto, copie a mídia final para o seu próprio armazenamento permanente quando necessário.
Mantenha a VISIONSTORY_API_KEY em uma variável de ambiente do servidor, em um secret de CI ou no armazenamento de segredos do cliente MCP e envie-a pelo header de requisição X-API-Key. Nunca incorpore a chave em código do navegador, no bundle de um aplicativo móvel, em um repositório público, em capturas de tela, em logs ou em uma mensagem de chat com IA.
Você pode combinar vídeo de avatar com Texto para Fala, vozes públicas ou clonadas, assets reutilizáveis de imagem e áudio, transcrição, geração de imagens com IA e modelos de vídeo de ponta. Esses componentes viabilizam explicações localizadas, contato personalizado, conteúdo de aprendizado automatizado e fluxos de mídia com agentes de IA.
Comece com uma requisição autenticada
Crie sua primeira integração de vídeo de avatar com IA.
Crie uma chave de API, verifique seus Créditos e execute o quickstart de avatar falante em cinco etapas. Comece com REST ou Python e, depois, adicione automação via CLI, ferramentas MCP ou o Agent Skill conforme seu fluxo de trabalho cresce. Consulte endpoints de recursos ao vivo em vez de codificar IDs de modelo, avatar ou voz.