Creá videos de avatares parlantes con sincronización labial a partir de texto o audio con la API REST de VisionStory o el SDK de Python. Descubrí los modelos, avatares y voces disponibles, enviá un trabajo asíncrono y descargá el MP4 final; o automatizá el mismo flujo con la CLI, el servidor MCP o Agent Skill.
Help me set up VisionStory and generate a talking-avatar video.1. Install or update the CLI and Agent Skill:curl -fsSL https://developers.visionstory.ai/cli | bashnpx skills add visionstory-ai/skills --skill visionstory-api2. Run visionstory doctor. If I need a key, send me to https://developers.visionstory.ai/api-keys, wait while I create one, then ask me to run visionstory login in my terminal. Never ask me to paste the key into chat or expose it.3. Verify access with visionstory credits. Stop and help me if it fails.4. Discover current models, avatars, and voices, then use the CLI and visionstory-api skill to create and download the video. Never delete anything unless I explicitly request and confirm it.
¿Recién empezás?
Creá una clave de API y después enviá este prompt a tu agente de código. Te va a guiar por el inicio de sesión en visionstory, va a verificar los créditos y va a crear el video sin exponer tu clave.
Herramientas para desarrolladores de VisionStory
Elegí la integración de API para tu stack.
REST, el SDK de Python, la CLI, el servidor MCP y Agent Skill usan la misma API de VisionStory autenticada y los mismos IDs de recursos. Empezá con una interfaz y después llevá el mismo flujo de trabajo de video de avatar a un backend, un pipeline de CI o un agente de programación.
Creá una clave de API del lado del servidor, verificá tu saldo de Créditos y descubrí los IDs del modelo, avatar y Voz actuales. Enviá un text_script o audio_script a POST /api/v1/video, consultá cada cinco segundos aprox. hasta que se cree el trabajo y después descargá el MP4. Las URLs de los videos finalizados se conservan durante siete días.
create_video.py
from pathlib import Pathfrom visionstory import VisionStoryClient, build_video_payloadclient = VisionStoryClient.from_env()payload = build_video_payload(avatar_id="YOUR_AVATAR_ID",text="Hello from my product.",voice_id="YOUR_VOICE_ID",)video = client.generate_video(payload)client.download(video["video_url"], Path("result.mp4"))
Catálogo de modelos de VisionStory
Elegí el modelo para el resultado que necesitás.
Empezá por el trabajo que necesitás completar y después traé el catálogo de modelos vigente en tiempo de ejecución. La respuesta de la API es la fuente de verdad sobre los IDs disponibles, los parámetros aceptados y los límites de salida.
Usá una sola clave de API para crear presentadores parlantes, sintetizar habla natural, reutilizar avatares, voces y recursos multimedia personalizados, y generar clips de video de apoyo. Creá explicadores localizados, onboarding personalizado, contenidos educativos, alcance comercial o piezas creadas por agentes sin tener que unir proveedores separados.
Preguntas frecuentes de la API de video de avatar con IA
Respuestas directas sobre autenticación, solicitudes, trabajos asíncronos, SDKs, automatización con CLI, MCP y uso en producción.
Una API de video de avatar con IA convierte un presentador digital más texto o audio grabado en un video con sincronización labial que una aplicación puede generar de forma programática. VisionStory acepta solicitudes autenticadas del lado del servidor, devuelve un ID de video de inmediato, procesa el trabajo de forma asíncrona y entrega una URL de MP4 cuando la generación está completa.
Creá una clave de API de VisionStory, verificá tus créditos, obtené los IDs actuales de modelo, avatar y voz, y después enviá un text_script o un audio_script a POST /api/v1/video. La API devuelve un ID de video de inmediato. Consultá el estado del trabajo cada unos cinco segundos hasta que sea created, y luego descargá el MP4 desde video_url.
Usá REST cuando necesitás control independiente del lenguaje, el SDK de Python cuando estás construyendo un servicio o notebook en Python, y la CLI para automatización en terminal, CI o generación por lotes. Las tres interfaces usan los mismos recursos de VisionStory y el mismo flujo de trabajo de video asíncrono.
Sí. Instalá la Agent Skill de VisionStory o conectá el servidor MCP de VisionStory. Un agente de programación compatible puede verificar créditos, listar los modelos, avatares y voces actuales, preparar una solicitud válida, iniciar el trabajo de video, monitorearlo y descargar el resultado mientras la clave de API permanece en tu entorno o en el almacenamiento de secretos de MCP.
Sí. Enviá un audio_script cuando quieras que el avatar hable a partir de audio grabado, o enviá un text_script con un ID de voz cuando VisionStory deba sintetizar el habla. Usá un solo tipo de script por solicitud en lugar de enviar ambos.
Tratá la creación de video como un trabajo asíncrono. Guardá el ID de solicitud de tu cliente y el ID de video devuelto, consultá cada unos cinco segundos y detenete cuando el trabajo llegue a created o failed. Las URLs de video finalizadas se conservan durante siete días, así que copiá el material terminado a tu propio almacenamiento permanente cuando sea necesario.
Guardá VISIONSTORY_API_KEY en una variable de entorno del servidor, un secreto de CI o el almacén de secretos del cliente MCP, y enviala mediante el header de solicitud X-API-Key. Nunca incrustes la clave en código del navegador, un bundle de una app móvil, un repositorio público, capturas de pantalla, logs o un mensaje de chat con IA.
Podés combinar video de avatar con Texto a voz, voces públicas o clonadas, assets de imagen y audio reutilizables, transcripción, generación de imágenes con IA y modelos de video de vanguardia. Estos componentes permiten explicativos localizados, alcance personalizado, contenido de aprendizaje automatizado y flujos de trabajo multimedia con agentes de IA.
Empezá con una solicitud autenticada
Creá tu primera integración de video de avatar con IA.
Creá una clave de API, verificá tus créditos y ejecutá el quickstart de avatar parlante en cinco pasos. Empezá con REST o Python, y después sumá automatización con CLI, herramientas MCP o la Agent Skill a medida que crece tu flujo de trabajo. Consultá endpoints de recursos en vivo en lugar de hardcodear los IDs de modelo, avatar o voz.