VisionStory API
สร้างมาเพื่อนักพัฒนา

สร้างวิดีโออวาตาร์พูดที่ลิปซิงก์จากข้อความหรือเสียงด้วย VisionStory REST API หรือ Python SDK ค้นหาโมเดล อวาตาร์ และเสียงที่ใช้งานได้ในปัจจุบัน ส่งงานแบบอะซิงโครนัส แล้วดาวน์โหลด MP4 ที่เสร็จแล้ว—or ทำให้เวิร์กโฟลว์เดียวกันเป็นอัตโนมัติด้วย CLI, MCP server หรือ Agent Skill

POST /api/v1/video
  • REST API
  • Python SDK
  • CLI
  • MCP
  • Agent Skill
พร้อมสำหรับเอเจนต์

ใช้งานได้ในที่ที่เอเจนต์ของคุณทำงาน

คัดลอกข้อความตั้งค่าเดียวสำหรับเอเจนต์เขียนโค้ดของคุณ หรือเชื่อมต่อเซิร์ฟเวอร์ MCP เพื่อเปิดให้ VisionStory เป็นเครื่องมือที่ใช้ซ้ำได้

VisionStory CLI

ติดตั้งครั้งเดียว ใช้ทุก API จากเทอร์มินัลของคุณ

ตัวติดตั้งจะอัปเกรดเป็นเวอร์ชันล่าสุดบน PyPI ในสภาพแวดล้อมแบบแยกส่วน ดังนั้นโปรเจกต์ Python ที่มีอยู่ของคุณจะไม่ถูกรบกวน

curl -fsSL https://developers.visionstory.ai/cli | bash
ส่งพรอมต์ตั้งค่านี้ให้ Claude Code
Help me set up VisionStory and generate a talking-avatar video.1. Install or update the CLI and Agent Skill:   curl -fsSL https://developers.visionstory.ai/cli | bash   npx skills add visionstory-ai/skills --skill visionstory-api2. Run visionstory doctor. If I need a key, send me to https://developers.visionstory.ai/api-keys, wait while I create one, then ask me to run visionstory login in my terminal. Never ask me to paste the key into chat or expose it.3. Verify access with visionstory credits. Stop and help me if it fails.4. Discover current models, avatars, and voices, then use the CLI and visionstory-api skill to create and download the video. Never delete anything unless I explicitly request and confirm it.
เพิ่งเริ่มใช่ไหม?

สร้าง API Key แล้วส่งพรอมต์นี้ให้เอเจนต์เขียนโค้ดของคุณ ระบบจะพาคุณเข้าสู่ระบบ visionstory ตรวจสอบเครดิต และสร้างวิดีโอโดยไม่เปิดเผยคีย์ของคุณ

เครื่องมือนักพัฒนา VisionStory

เลือกการเชื่อมต่อ API ที่เหมาะกับสแต็กของคุณ

REST, Python SDK, CLI, MCP server และ Agent Skill ใช้ VisionStory API (ที่ยืนยันตัวตนแล้ว) และ resource ID ชุดเดียวกัน เริ่มจากอินเทอร์เฟซใดก็ได้ แล้วนำเวิร์กโฟลว์วิดีโออวาตาร์เดียวกันไปใช้กับแบ็กเอนด์, CI pipeline หรือเอเจนต์เขียนโค้ดได้ทันที

01REST

เรียกใช้ REST API

เรียกใช้ VisionStory ได้จากภาษาแบ็กเอนด์ใดก็ได้ แสดงรายการโมเดล อวาตาร์ และเสียงที่มีอยู่ ส่ง text_script หรือ audio_script ไปที่ POST /api/v1/video ทำการ poll งานจนถูกสร้าง จากนั้นดาวน์โหลด MP4

ดูเอกสารอ้างอิง REST API
02PYTHON

พัฒนาด้วย Python SDK

ใช้ไคลเอนต์ Python แบบมีชนิดข้อมูล (typed) ที่ไม่ต้องพึ่งพาไลบรารีอื่น (zero-dependency) สำหรับการยืนยันตัวตนผ่าน environment, การประกอบ payload, การอัปโหลด, การ poll งาน และการดาวน์โหลด เหมาะกับแอป Python, notebooks และบริการมีเดียภายในองค์กร

อ่านคู่มือเริ่มต้น Python SDK
03CLI

ทำงานอัตโนมัติด้วย CLI

รัน visionstory doctor ตรวจสอบเครดิต ค้นหา resource ID สร้างวิดีโออวาตาร์ ตรวจสอบงาน และดาวน์โหลดผลลัพธ์ได้จากเทอร์มินัล, shell script หรือ CI job โดยไม่ต้องสร้างแอปก่อน

ติดตั้งและตรวจสอบ CLI
04MCP / SKILL

เชื่อมต่อเอเจนต์เขียนโค้ด AI

เชื่อมต่อ VisionStory MCP server หรือติดตั้ง Agent Skill เพื่อให้ Codex, Claude Code, Cursor, Windsurf, Cline และ Gemini ค้นหา resources สร้างมีเดีย และดาวน์โหลดผลลัพธ์ได้ โดยที่ API key ยังคงอยู่ในที่เก็บความลับบนเครื่อง (local secret storage)

เชื่อมต่อ MCP หรือ Agent Skill

คู่มือเริ่มต้น Talking avatar API

สร้างวิดีโออวาตาร์พูดแรกของคุณ

สร้าง API key ฝั่งเซิร์ฟเวอร์ ตรวจสอบยอดเครดิต และค้นหา ID ของโมเดล อวาตาร์ และเสียงที่ใช้งานได้ในปัจจุบัน ส่ง text_script หรือ audio_script ไปที่ POST /api/v1/video จากนั้น poll ประมาณทุก 5 วินาทีจนกว่างานจะถูกสร้าง แล้วดาวน์โหลด MP4 ลิงก์ URL ของวิดีโอที่เสร็จแล้วจะถูกเก็บไว้ 7 วัน

create_video.py
from pathlib import Pathfrom visionstory import VisionStoryClient, build_video_payload client = VisionStoryClient.from_env()payload = build_video_payload(    avatar_id="YOUR_AVATAR_ID",    text="Hello from my product.",    voice_id="YOUR_VOICE_ID",)video = client.generate_video(payload)client.download(video["video_url"], Path("result.mp4"))

แคตตาล็อกโมเดล VisionStory

เลือกโมเดลให้เหมาะกับผลลัพธ์ที่คุณต้องการ

เริ่มจากงานที่คุณต้องทำให้เสร็จ แล้วดึงแคตตาล็อกโมเดลล่าสุดตอนรันไทม์ โดยผลลัพธ์ที่ API ส่งกลับคือข้อมูลจริง (source of truth) สำหรับ ID ที่ใช้ได้ พารามิเตอร์ที่รองรับ และขีดจำกัดของเอาต์พุต

พรีเซนเตอร์ที่สร้างด้วยโมเดลอวาตาร์พูด VisionStory V-Character
อวาตาร์พูดVisionStory

V-Character 4.0

vs_character_v4

โมเดลตัวละครแบบเนทีฟของ VisionStory เปลี่ยนภาพพอร์ตเทรต 1 รูป พร้อมข้อความหรือเสียงที่บันทึกไว้ ให้เป็นการแสดงที่คงเอกลักษณ์เดิม เคลื่อนไหวมีอารมณ์ และลิปซิงก์เป็นธรรมชาติ

  • ข้อความหรือเสียงที่บันทึกไว้
  • 720p, 1080p หรือ 2K
  • สูงสุด 10 นาที
ฉากรถสไตล์ภาพยนตร์ที่สร้างด้วยโมเดลวิดีโอ AI Seedance
วิดีโอ AIByteDance

Seedance 2.5

seedance-2.5

สร้างวิดีโอทั้งแบบขับเคลื่อนด้วยพรอมต์และแบบขับเคลื่อนด้วยภาพ ให้การเคลื่อนไหวต่อเนื่องสอดคล้อง มุมกล้องสไตล์ภาพยนตร์ และคลิปเดี่ยวยาวขึ้น

  • Text-to-video
  • Image-to-video
  • คลิปความยาว 4–30 วินาที
ทับทิมแก้วที่มีรายละเอียดสูง สร้างด้วยโมเดลภาพ Nano Banana
ภาพ AIGoogle

Nano Banana 2

nano-banana-2

สร้างภาพความละเอียดสูง เรนเดอร์ข้อความได้อย่างน่าเชื่อถือ และปรับผลลัพธ์ให้ดีขึ้นด้วยการแก้ไขแบบสนทนา โดยมีภาพอ้างอิงเป็นแนวทาง

  • Prompt-to-image
  • การแก้ไขโดยใช้อ้างอิงเป็นแนวทาง
  • เอาต์พุต 1K และ 2K

API มีเดีย AI ที่ประกอบต่อกันได้

ผสาน API อวาตาร์ เสียง และวิดีโอ AI

ใช้ API key เดียวเพื่อสร้างพรีเซนเตอร์พูด สังเคราะห์เสียงพูดให้เป็นธรรมชาติ นำอวาตาร์แบบกำหนดเอง เสียง และแอสเซ็ตมีเดียกลับมาใช้ซ้ำ และสร้างคลิปวิดีโอประกอบ สร้างวิดีโออธิบายแบบโลคัลไลซ์ ออนบอร์ดดิ้งแบบเฉพาะบุคคล คอนเทนต์การศึกษา งานขายแบบ outreach หรือมีเดียที่สร้างโดยเอเจนต์ได้ โดยไม่ต้องต่อผู้ให้บริการหลายเจ้ามารวมกัน

อินพุตภาพพอร์ตเทรตและเสียงถูกแปลงเป็นวิดีโออวาตาร์พูดได้ผ่าน VisionStory API

เวิร์กโฟลว์อวาตาร์หลัก

API วิดีโออวาตาร์พูด

สร้างวิดีโอพรีเซนเตอร์ที่ลิปซิงก์จากข้อความหรือเสียงที่บันทึกไว้ เลือกอวาตาร์สาธารณะหรือสร้างอวาตาร์แบบกำหนดเองที่นำกลับมาใช้ซ้ำได้จากภาพพอร์ตเทรต 1 รูป เลือกเสียงสาธารณะหรือเสียงโคลน และรับ MP4 สำหรับดาวน์โหลดเมื่อจบงานแบบอะซิงโครนัส

สคริปต์ถูกแปลงเป็นเวฟฟอร์มเสียงผ่าน VisionStory API แปลงข้อความเป็นเสียงพูด

เลเยอร์เสียงและการพูด

API แปลงข้อความเป็นเสียงพูดและเสียง

แปลงข้อความเป็นเสียงพูด MP3 ที่เป็นธรรมชาติด้วยเสียงสาธารณะหรือเสียงที่โคลน จากนั้นนำเสียงเดียวกันไปใช้ซ้ำกับวิดีโออวาตาร์และคอนเทนต์ที่แปลเป็นภาษาท้องถิ่นได้ คิวรีแคตตาล็อกเสียงขณะรันไทม์แทนการฮาร์ดโค้ด Voice ID

พรอมป์ต์ถูกแปลงเป็นวิดีโอที่สร้างขึ้นผ่าน VisionStory API สร้างวิดีโอ AI

การสร้างที่ขับเคลื่อนโดยเอเจนต์

API สร้างวิดีโอ AI

สร้างคลิปแบบแปลงข้อความเป็นวิดีโอ แปลงภาพเป็นวิดีโอ และคลิปแบบอ้างอิงด้วยโมเดลที่เลือกจากแคตตาล็อกแบบเรียลไทม์ เอเจนต์ AI สามารถเตรียมพรอมป์ต์และแอสเซ็ต ประเมินเครดิต ส่งงาน และผสานผลลัพธ์เข้ากับพรีเซนเตอร์อวาตาร์ได้

คำถามที่พบบ่อยเกี่ยวกับ API วิดีโออวาตาร์ AI

คำตอบแบบตรงประเด็นเกี่ยวกับการยืนยันตัวตน คำขอ งานแบบอะซิงก์ SDK ระบบอัตโนมัติผ่าน CLI, MCP และการใช้งานจริงในโปรดักชัน

  • API วิดีโออวาตาร์ AI จะเปลี่ยนพรีเซนเตอร์ดิจิทัลพร้อมข้อความหรือเสียงที่บันทึกไว้ให้เป็นวิดีโอซิงก์ปากที่แอปสามารถสร้างได้แบบโปรแกรมมิ่ง VisionStory รองรับคำขอฝั่งเซิร์ฟเวอร์ที่ผ่านการยืนยันตัวตน ส่งกลับ Video ID ทันที เรนเดอร์งานแบบอะซิงก์ และให้ URL ของไฟล์ MP4 เมื่อสร้างเสร็จ

เริ่มต้นด้วยคำขอที่ยืนยันตัวตน 1 ครั้ง

สร้างการเชื่อมต่อวิดีโออวาตาร์ AI ครั้งแรกของคุณ

สร้าง API key ตรวจสอบเครดิตของคุณ และทำตามคู่มือเริ่มต้นแบบเร็วสำหรับอวาตาร์พูดได้ 5 ขั้นตอน เริ่มจาก REST หรือ Python ก่อน แล้วค่อยเพิ่มระบบอัตโนมัติด้วย CLI, เครื่องมือ MCP หรือ Agent Skill เมื่อเวิร์กโฟลว์ของคุณเติบโต คิวรีเอ็นด์พอยต์ทรัพยากรแบบเรียลไทม์แทนการฮาร์ดโค้ด Model ID, Avatar ID หรือ Voice ID