Erstellen Sie lippensynchrone Talking-Avatar-Videos aus Text oder Audio mit der VisionStory REST API oder dem Python SDK. Entdecken Sie aktuelle Modelle, Avatare und Stimmen, senden Sie einen asynchronen Job und laden Sie das fertige MP4 herunter – oder automatisieren Sie denselben Workflow mit der CLI, dem MCP-Server oder Agent Skill.
Kopieren Sie eine Setup-Nachricht für Ihren Coding-Agent – oder verbinden Sie den MCP-Server und stellen Sie VisionStory als wiederverwendbares Tool bereit.
VisionStory CLI
Einmal installieren. Jede API im Terminal nutzen.
Der Installer aktualisiert in einer isolierten Umgebung auf das neueste PyPI-Release. Ihre bestehenden Python-Projekte bleiben unberührt.
Help me set up VisionStory and generate a talking-avatar video.1. Install or update the CLI and Agent Skill:curl -fsSL https://developers.visionstory.ai/cli | bashnpx skills add visionstory-ai/skills --skill visionstory-api2. Run visionstory doctor. If I need a key, send me to https://developers.visionstory.ai/api-keys, wait while I create one, then ask me to run visionstory login in my terminal. Never ask me to paste the key into chat or expose it.3. Verify access with visionstory credits. Stop and help me if it fails.4. Discover current models, avatars, and voices, then use the CLI and visionstory-api skill to create and download the video. Never delete anything unless I explicitly request and confirm it.
Neu hier?
Erstellen Sie einen API-Key und senden Sie dann diesen Prompt an Ihren Coding-Agent. Er führt Sie durch den visionstory Login, prüft Credits und erstellt das Video – ohne Ihren Key offenzulegen.
VisionStory Entwickler-Tools
Wählen Sie die API-Integration für Ihren Stack.
REST, das Python SDK, CLI, MCP-Server und Agent Skill nutzen alle dieselbe authentifizierte VisionStory API und dieselben Ressourcen-IDs. Starten Sie mit einer Schnittstelle und verlagern Sie denselben Avatar-Video-Workflow anschließend in ein Backend, eine CI-Pipeline oder einen Coding-Agent.
Erstellen Sie einen serverseitigen API-Key, prüfen Sie Ihr Credit-Guthaben und ermitteln Sie die aktuellen Modell-, Avatar- und Stimmen-IDs. Senden Sie ein text_script oder audio_script an POST /api/v1/video, pollen Sie etwa alle fünf Sekunden, bis der Job erstellt ist, und laden Sie dann das MP4 herunter. Fertige Video-URLs werden sieben Tage lang gespeichert.
create_video.py
from pathlib import Pathfrom visionstory import VisionStoryClient, build_video_payloadclient = VisionStoryClient.from_env()payload = build_video_payload(avatar_id="YOUR_AVATAR_ID",text="Hello from my product.",voice_id="YOUR_VOICE_ID",)video = client.generate_video(payload)client.download(video["video_url"], Path("result.mp4"))
VisionStory Modellkatalog
Wählen Sie das Modell für die Ausgabe, die Sie benötigen.
Starten Sie mit dem Job, den Sie erledigen müssen, und laden Sie dann zur Laufzeit den aktuellen Modellkatalog. Die API-Antwort ist die maßgebliche Quelle für verfügbare IDs, akzeptierte Parameter und Ausgabegrenzen.
Kombinieren Sie Avatar-, Stimme- und KI-Video-APIs.
Nutzen Sie einen API-Key, um sprechende Presenter zu erstellen, natürliche Sprache zu synthetisieren, benutzerdefinierte Avatare, Stimmen und Medien-Assets wiederzuverwenden und ergänzende Videoclips zu generieren. Erstellen Sie lokalisierte Erklärvideos, personalisiertes Onboarding, Schulungen, Sales-Outreach oder agentenerstellte Medien – ohne verschiedene Anbieter zusammenstückeln zu müssen.
Direkte Antworten zu Authentifizierung, Requests, asynchronen Jobs, SDKs, CLI-Automatisierung, MCP und Produktionseinsatz.
Eine KI-Avatar-Video-API verwandelt einen digitalen Presenter plus Text oder aufgenommenes Audio in ein lippensynchrones Video, das eine Anwendung programmatisch erzeugen kann. VisionStory akzeptiert authentifizierte serverseitige Requests, gibt sofort eine Video-ID zurück, rendert den Job asynchron und stellt eine MP4-URL bereit, sobald die Generierung abgeschlossen ist.
Erstellen Sie einen VisionStory API-Key, prüfen Sie Ihre Credits, rufen Sie die aktuellen Modell-, Avatar- und Voice-IDs ab und senden Sie dann entweder ein text_script oder ein audio_script per POST an /api/v1/video. Die API gibt sofort eine Video-ID zurück. Pollen Sie den Job etwa alle fünf Sekunden, bis der Status created ist, und laden Sie anschließend die MP4 über video_url herunter.
Nutzen Sie REST, wenn Sie sprachunabhängige Kontrolle benötigen, das Python SDK, wenn Sie einen Python-Service oder ein Notebook bauen, und die CLI für Terminal-Automatisierung, CI oder Batch-Generierung. Alle drei Interfaces verwenden dieselben VisionStory-Ressourcen und denselben asynchronen Video-Workflow.
Ja. Installieren Sie den VisionStory Agent Skill oder verbinden Sie den VisionStory MCP-Server. Ein unterstützter Coding-Agent kann Credits prüfen, aktuelle Modelle, Avatare und Stimmen auflisten, eine gültige Anfrage vorbereiten, den Video-Job starten, ihn überwachen und das Ergebnis herunterladen – während der API-Key in Ihrer Umgebung oder im MCP-Secret-Speicher bleibt.
Ja. Senden Sie ein audio_script, wenn der Avatar aus aufgenommenem Audio sprechen soll, oder senden Sie ein text_script mit einer Voice-ID, wenn VisionStory die Sprache synthetisieren soll. Verwenden Sie pro Request nur einen Skripttyp, statt beide zu senden.
Behandeln Sie die Videoerstellung als asynchronen Job. Speichern Sie Ihre Client-Request-ID und die zurückgegebene Video-ID, pollen Sie etwa alle fünf Sekunden und stoppen Sie, wenn der Job created oder failed erreicht. Fertige Video-URLs werden sieben Tage lang aufbewahrt – kopieren Sie abgeschlossene Medien bei Bedarf in Ihren eigenen permanenten Speicher.
Bewahren Sie VISIONSTORY_API_KEY in einer Server-Umgebungsvariable, einem CI-Secret oder im Secret Store des MCP-Clients auf und senden Sie ihn über den Request-Header X-API-Key. Betten Sie den Key niemals in Browser-Code, ein Mobile-App-Bundle, ein öffentliches Repository, Screenshots, Logs oder eine KI-Chat-Nachricht ein.
Sie können Avatar-Video mit Text zu Sprache, öffentlichen oder geklonten Stimmen, wiederverwendbaren Bild- und Audio-Assets, Transkription, KI-Bildgenerierung und modernsten Videomodellen kombinieren. Diese Bausteine ermöglichen lokalisierte Erklärvideos, personalisierte Ansprache, automatisierte Lerninhalte und Media-Workflows mit KI-Agenten.
Starten Sie mit einem authentifizierten Request
Bauen Sie Ihre erste KI-Avatar-Video-Integration.
Erstellen Sie einen API-Key, prüfen Sie Ihre Credits und starten Sie den Talking-Avatar-Quickstart in fünf Schritten. Beginnen Sie mit REST oder Python und ergänzen Sie dann CLI-Automatisierung, MCP-Tools oder den Agent Skill, wenn Ihr Workflow wächst. Fragen Sie Live-Ressourcen-Endpoints ab, statt Modell-, Avatar- oder Voice-IDs fest zu codieren.