Crea videos de avatares parlantes con sincronización labial a partir de texto o audio con la API REST de VisionStory o el SDK de Python. Descubre los modelos, avatares y voces disponibles, envía un trabajo asíncrono y descarga el MP4 final, o automatiza el mismo flujo de trabajo con la CLI, el servidor MCP o Agent Skill.
Help me set up VisionStory and generate a talking-avatar video.1. Install or update the CLI and Agent Skill:curl -fsSL https://developers.visionstory.ai/cli | bashnpx skills add visionstory-ai/skills --skill visionstory-api2. Run visionstory doctor. If I need a key, send me to https://developers.visionstory.ai/api-keys, wait while I create one, then ask me to run visionstory login in my terminal. Never ask me to paste the key into chat or expose it.3. Verify access with visionstory credits. Stop and help me if it fails.4. Discover current models, avatars, and voices, then use the CLI and visionstory-api skill to create and download the video. Never delete anything unless I explicitly request and confirm it.
¿Eres nuevo aquí?
Crea una clave de API y luego envía este prompt a tu agente de programación. Te guiará por el inicio de sesión en visionstory, verificará los créditos y creará el video sin exponer tu clave.
Herramientas para desarrolladores de VisionStory
Elige la integración de API para tu stack.
REST, el SDK de Python, la CLI, el servidor MCP y Agent Skill usan la misma API autenticada de VisionStory y los mismos IDs de recursos. Comienza con una interfaz y luego lleva el mismo flujo de trabajo de video de avatar a un backend, una canalización de CI o un agente de programación.
Crea una clave de API del lado del servidor, verifica tu saldo de Créditos y descubre los IDs actuales de modelo, avatar y voz. Envía un text_script o audio_script a POST /api/v1/video, consulta aproximadamente cada cinco segundos hasta que se cree el trabajo y luego descarga el MP4. Las URLs de videos completados se conservan durante siete días.
create_video.py
from pathlib import Pathfrom visionstory import VisionStoryClient, build_video_payloadclient = VisionStoryClient.from_env()payload = build_video_payload(avatar_id="YOUR_AVATAR_ID",text="Hello from my product.",voice_id="YOUR_VOICE_ID",)video = client.generate_video(payload)client.download(video["video_url"], Path("result.mp4"))
Catálogo de modelos de VisionStory
Elige el modelo para el resultado que necesitas.
Comienza con el trabajo que necesitas completar y luego obtiene el catálogo de modelos actual en tiempo de ejecución. La respuesta de la API es la fuente de verdad para los IDs disponibles, los parámetros aceptados y los límites de salida.
Usa una sola clave de API para crear presentadores parlantes, sintetizar habla natural, reutilizar avatares, voces y recursos multimedia personalizados, y generar clips de video de apoyo. Crea explicadores localizados, onboarding personalizado, educación, prospección de ventas o contenido multimedia creado por agentes sin tener que unir proveedores por separado.
Preguntas frecuentes sobre la API de video de avatar con IA
Respuestas directas sobre autenticación, solicitudes, trabajos asíncronos, SDKs, automatización con CLI, MCP y uso en producción.
Una API de video de avatar con IA convierte un presentador digital más texto o audio grabado en un video con sincronización labial que una aplicación puede generar de forma programática. VisionStory acepta solicitudes autenticadas del lado del servidor, devuelve un ID de video de inmediato, renderiza el trabajo de forma asíncrona y proporciona una URL de MP4 cuando la generación se completa.
Crea una clave de API de VisionStory, verifica tus créditos, obtén los IDs actuales de modelo, avatar y voz, y luego envía un text_script o un audio_script a POST /api/v1/video. La API devuelve un ID de video de inmediato. Consulta el estado del trabajo aproximadamente cada cinco segundos hasta que su estado sea created y luego descarga el MP4 desde video_url.
Usa REST cuando necesites control independiente del lenguaje, el SDK de Python cuando estés creando un servicio o notebook en Python, y la CLI para automatización en terminal, CI o generación por lotes. Las tres interfaces usan los mismos recursos de VisionStory y el mismo flujo de trabajo de video asíncrono.
Sí. Instala la Agent Skill de VisionStory o conéctate al servidor MCP de VisionStory. Un agente de programación compatible puede verificar créditos, listar los modelos, avatares y voces actuales, preparar una solicitud válida, iniciar el trabajo de video, monitorearlo y descargar el resultado mientras la clave de API permanece en tu entorno o en el almacenamiento de secretos de MCP.
Sí. Envía un audio_script cuando quieras que el avatar hable a partir de audio grabado, o envía un text_script con un ID de voz cuando VisionStory deba sintetizar el habla. Usa un tipo de script por solicitud en lugar de enviar ambos.
Trata la creación de video como un trabajo asíncrono. Guarda el ID de solicitud del cliente y el ID de video devuelto, consulta aproximadamente cada cinco segundos y detente cuando el trabajo llegue a created o failed. Las URLs de videos completados se conservan durante siete días, así que copia los medios finalizados a tu propio almacenamiento permanente cuando sea necesario.
Guarda VISIONSTORY_API_KEY en una variable de entorno del servidor, un secreto de CI o el almacén de secretos del cliente MCP, y envíala mediante el encabezado de solicitud X-API-Key. Nunca insertes la clave en código del navegador, en el paquete de una aplicación móvil, en un repositorio público, en capturas de pantalla, en logs o en un mensaje de chat con IA.
Puedes combinar el video de avatar con texto a voz, voces públicas o clonadas, recursos de imagen y audio reutilizables, transcripción, generación de imágenes con IA y modelos de video de frontera. Estos componentes permiten explicaciones localizadas, alcance personalizado, contenido de aprendizaje automatizado y flujos de trabajo de medios con agentes de IA.
Comienza con una solicitud autenticada
Crea tu primera integración de video de avatar con IA.
Crea una clave de API, verifica tus créditos y ejecuta el inicio rápido de avatar parlante en cinco pasos. Comienza con REST o Python y luego agrega automatización con CLI, herramientas MCP o la Agent Skill a medida que crece tu flujo de trabajo. Consulta endpoints de recursos en vivo en lugar de codificar de forma fija los IDs de modelo, avatar o voz.