Tạo video avatar nói khớp môi từ văn bản hoặc âm thanh bằng VisionStory REST API hoặc Python SDK. Khám phá các model, avatar và giọng nói hiện có, gửi tác vụ bất đồng bộ và tải xuống file MP4 hoàn chỉnh—hoặc tự động hóa cùng quy trình với CLI, máy chủ MCP hoặc Agent Skill.
Help me set up VisionStory and generate a talking-avatar video.1. Install or update the CLI and Agent Skill:curl -fsSL https://developers.visionstory.ai/cli | bashnpx skills add visionstory-ai/skills --skill visionstory-api2. Run visionstory doctor. If I need a key, send me to https://developers.visionstory.ai/api-keys, wait while I create one, then ask me to run visionstory login in my terminal. Never ask me to paste the key into chat or expose it.3. Verify access with visionstory credits. Stop and help me if it fails.4. Discover current models, avatars, and voices, then use the CLI and visionstory-api skill to create and download the video. Never delete anything unless I explicitly request and confirm it.
Mới dùng lần đầu?
Tạo một API key, rồi gửi prompt này cho coding agent của bạn. Nó sẽ hướng dẫn bạn đăng nhập visionstory, xác minh Credit và tạo video mà không làm lộ key của bạn.
Công cụ cho lập trình viên VisionStory
Chọn tích hợp API phù hợp với stack của bạn.
REST, Python SDK, CLI, máy chủ MCP và Agent Skill đều dùng cùng API VisionStory (có xác thực) và cùng resource ID. Bắt đầu với một giao diện, rồi đưa cùng quy trình video avatar vào backend, pipeline CI hoặc agent lập trình.
Tạo API key phía server, kiểm tra số dư Credit và lấy các ID model, avatar và giọng nói hiện có. Gửi một text_script hoặc audio_script tới POST /api/v1/video, poll khoảng mỗi 5 giây cho đến khi tác vụ được tạo, rồi tải xuống MP4. URL video đã hoàn thành sẽ được lưu trong 7 ngày.
create_video.py
from pathlib import Pathfrom visionstory import VisionStoryClient, build_video_payloadclient = VisionStoryClient.from_env()payload = build_video_payload(avatar_id="YOUR_AVATAR_ID",text="Hello from my product.",voice_id="YOUR_VOICE_ID",)video = client.generate_video(payload)client.download(video["video_url"], Path("result.mp4"))
Danh mục model VisionStory
Chọn model cho đầu ra bạn cần.
Bắt đầu từ tác vụ bạn cần hoàn thành, rồi lấy danh mục model hiện tại tại runtime. Phản hồi API là nguồn thông tin chuẩn cho các ID khả dụng, tham số được chấp nhận và giới hạn đầu ra.
Dùng một API key để tạo người dẫn dạng avatar nói, tổng hợp lời nói tự nhiên, tái sử dụng avatar tùy chỉnh, giọng nói và tài sản media, đồng thời tạo các clip video bổ trợ. Xây dựng video giải thích bản địa hóa, onboarding cá nhân hóa, nội dung giáo dục, tiếp cận bán hàng hoặc media do agent tạo mà không cần ghép nhiều nhà cung cấp riêng lẻ.
Trả lời trực tiếp về xác thực, request, tác vụ bất đồng bộ, SDK, tự động hóa CLI, MCP và sử dụng trong môi trường production.
API video avatar AI biến một người dẫn chuyện kỹ thuật số cùng văn bản hoặc âm thanh ghi sẵn thành video khớp khẩu hình mà ứng dụng có thể tạo bằng lập trình. VisionStory nhận các request phía server có xác thực, trả về video ID ngay lập tức, render tác vụ bất đồng bộ và cung cấp URL MP4 khi quá trình tạo hoàn tất.
Tạo một VisionStory API key, kiểm tra Credit của bạn, lấy các ID model, avatar và giọng nói hiện có, rồi gửi text_script hoặc audio_script tới POST /api/v1/video. API sẽ trả về video ID ngay lập tức. Poll tác vụ khoảng mỗi 5 giây cho đến khi trạng thái là created, sau đó tải MP4 từ video_url.
Dùng REST khi bạn cần khả năng điều khiển độc lập với ngôn ngữ, dùng Python SDK khi bạn xây dựng dịch vụ Python hoặc notebook, và dùng CLI cho tự động hóa terminal, CI hoặc tạo hàng loạt. Cả 3 giao diện đều dùng chung tài nguyên VisionStory và quy trình video bất đồng bộ.
Có. Cài đặt VisionStory Agent Skill hoặc kết nối VisionStory MCP server. Một coding agent được hỗ trợ có thể kiểm tra Credit, liệt kê model/avatar/giọng nói hiện có, chuẩn bị request hợp lệ, khởi chạy tác vụ video, theo dõi và tải kết quả về trong khi API key vẫn nằm trong môi trường của bạn hoặc kho bí mật MCP.
Có. Gửi audio_script khi bạn muốn avatar nói từ âm thanh đã ghi, hoặc gửi text_script kèm voice ID khi VisionStory cần tổng hợp lời thoại. Mỗi request chỉ nên dùng một loại script thay vì gửi cả hai.
Hãy coi việc tạo video là một tác vụ bất đồng bộ. Lưu client request ID và video ID được trả về, poll khoảng mỗi 5 giây và dừng khi tác vụ đạt trạng thái created hoặc failed. URL video đã hoàn tất được lưu trong 7 ngày, vì vậy hãy sao chép media thành phẩm sang nơi lưu trữ lâu dài của bạn khi cần.
Hãy lưu VISIONSTORY_API_KEY trong biến môi trường của server, CI secret hoặc kho bí mật của MCP client và gửi nó qua header request X-API-Key. Tuyệt đối không nhúng key vào code trình duyệt, gói ứng dụng di động, kho mã nguồn công khai, ảnh chụp màn hình, log hoặc tin nhắn chat với AI.
Bạn có thể kết hợp video avatar với chuyển văn bản thành giọng nói, giọng nói công khai hoặc giọng nói nhân bản, tài nguyên hình ảnh và âm thanh tái sử dụng, phiên âm, tạo hình ảnh AI và các mô hình video tiên tiến. Những thành phần nền tảng này hỗ trợ video giải thích bản địa hóa, tiếp cận cá nhân hóa, nội dung học tập tự động và quy trình media do AI agent vận hành.
Bắt đầu với 1 request có xác thực
Xây dựng tích hợp video avatar AI đầu tiên của bạn.
Tạo API key, kiểm tra Credit và chạy quickstart avatar nói chuyện gồm 5 bước. Bắt đầu với REST hoặc Python, sau đó bổ sung tự động hóa CLI, công cụ MCP hoặc Agent Skill khi quy trình của bạn phát triển. Truy vấn các endpoint tài nguyên trực tiếp thay vì hard-code ID model, avatar hoặc giọng nói.