ดูวิดีโอสอนนี้บน YouTube

YouTube

อยากทำให้รูปนิ่งพูดได้—แบบภาพพอร์ตเทรตที่อ้าปาก กะพริบตา และพูดตามที่คุณพิมพ์ไหม? ด้วย VisionStory คุณทำได้เลยจากรูปเพียงภาพเดียว บนเบราว์เซอร์ของคุณ ไม่ต้องใช้กล้องและไม่ต้องมีประสบการณ์ตัดต่อ วิดีโอด้านบนจะพาดูครบทั้งขั้นตอน และคู่มือทีละขั้นด้านล่างจะอธิบายทุกส่วนแบบละเอียด

ระหว่างทำ คุณจะอัปโหลดภาพพอร์ตเทรต 1 รูปและเตรียมเป็น อวาตาร์แบบใช้ซ้ำของคุณเอง ผู้ใช้อื่นมองไม่เห็น และคุณสามารถเลือกใช้อวาตาร์เดิมกับวิดีโอครั้งต่อๆ ไปได้ โดยไม่ต้องอัปโหลดรูปเดิมซ้ำทุกครั้ง ทุกอย่างทำใน เครื่องมือรูปพูดได้ของ VisionStory ด้วยบัญชีฟรี

ขั้นที่ 1: อัปโหลดภาพพอร์ตเทรตที่ชัดเจน 1 รูป

เปิด วิดีโอ AI ในแผง Characters ให้เลือก Upload แล้วเลือกรูปจากอุปกรณ์ของคุณ หรือจะลากรูปมาวางในพื้นที่อัปโหลดได้เลย ใช้รูปคนที่ชัดเจน หันหน้าตรง เห็นใบหน้าและช่วงไหล่ ดวงตาและปากไม่ถูกบัง และเผื่อพื้นที่รอบตัวแบบนิดหน่อยเพื่อไว้จัดเฟรมใหม่ภายหลัง

  • ไฟล์ที่รองรับ: JPG, JPEG, PNG, WebP และ HEIC
  • ขนาดไฟล์สูงสุด: 30 MB
  • ขนาดเริ่มต้นที่แนะนำ: อย่างน้อย 512 x 768 พิกเซลสำหรับภาพพอร์ตเทรต
  • รูปแบบการอัปโหลด: ครั้งละ 1 รูปต้นฉบับ
Dragging a portrait onto the Upload control in the VisionStory Characters panel

จัดองค์ประกอบรูปต้นฉบับให้สอดคล้องกับปลายทางของวิดีโอ ภาพพอร์ตเทรตที่ครอปชิดอาจใช้ได้กับ 9:16 แต่พอเป็น 16:9 อาจกลายเป็นการครอปใบหน้าที่ชิดเกินไป เพราะไม่มีพื้นที่ภาพด้านซ้ายและขวาไว้เติมเฟรมที่กว้างขึ้น

ขั้นที่ 2: ให้ VisionStory ตรวจสอบและเตรียมอวาตาร์

หลังอัปโหลด VisionStory จะตรวจว่ารูปมีบุคคลที่ใช้งานได้หรือไม่ และเตรียมให้เป็นตัวละคร การอัปโหลดล้มเหลวแทบทั้งหมดมักย้อนกลับไปที่รูปต้นฉบับ: ใบหน้าอาจเล็กเกินไป ถูกบังมาก หันข้างมากไป เบลอ หรืออยู่ใกล้ใบหน้าอื่นเกินไป

ถ้าเตรียมไม่สำเร็จ อย่าลองซ้ำด้วยครอปเดิมเรื่อยๆ ให้เปลี่ยนไปใช้รูปต้นฉบับที่คมชัดกว่า มีใบหน้าเดียวที่ใหญ่กว่า มุมตรงกว่า เห็นไหล่ แสงสม่ำเสมอ และมีสิ่งบังน้อยกว่า

VisionStory avatar preview beside a checklist for a clear, unobstructed source photo

เมื่อประมวลผลเสร็จ อวาตาร์จะปรากฏอยู่เหนือคลังตัวละครสาธารณะ และเปิดในหน้าพรีวิวอวาตาร์ โดยจะมองเห็นได้เฉพาะคุณเท่านั้น

ขั้นที่ 3: พรีวิวหรือเปลี่ยนเสียงที่ถูกกำหนดไว้

VisionStory จะกำหนดเสียงเริ่มต้นที่เหมาะสมให้อัตโนมัติตามอายุและเพศที่ดูจากภาพ คุณจะใช้เสียงเดิม พรีวิว หรือเปลี่ยนเป็นเสียงอื่นก็ได้

  1. คลิกเลือกเสียงปัจจุบันเพื่อเปิดคลังเสียง
  2. กดปุ่มเล่นทางขวาของเสียงเพื่อฟังตัวอย่าง
  3. ถ้าไม่เข้ากัน ให้กรองตาม Language, Gender, Age และ Use Case
  4. พรีวิวตัวเลือกอื่นๆ แล้วเลือกเสียงที่เข้ากับทั้งอวาตาร์และจุดประสงค์ของวิดีโอ
VisionStory Voice Library with Language, Gender, Age, and Use Case filters and a preview button

บางครั้งเสียงอาจเข้ากับอายุและเพศที่เห็นได้ แต่ยังไม่เหมาะกับงานบรรยาย การศึกษา โฆษณา หรือคอนเทนต์แบบสนทนา ให้จับคู่ “คน” กับ “จุดประสงค์” ไม่ใช่ดูแค่ข้อมูลประชากร

ขั้นที่ 4: จัดเฟรมรูปให้เหมาะกับปลายทาง

ใช้พรีวิวอวาตาร์เพื่อกำหนดว่าจะให้เห็นตัวคนมากน้อยแค่ไหนในวิดีโอสุดท้าย ลากรูปเพื่อจัดตำแหน่ง และใช้ปุ่มซูมเพื่อเข้าใกล้หรือถอยออก จากนั้นเลือกอัตราส่วนภาพให้เหมาะกับที่คุณจะเผยแพร่:

  • แนวตั้ง 9:16 สำหรับ TikTok, Instagram Reels, YouTube Shorts และพื้นที่ที่เน้นมือถือเป็นหลัก
  • จัตุรัส 1:1 สำหรับโพสต์โซเชียลแบบสี่เหลี่ยม เลย์เอาต์ที่เน้นรูปโปรไฟล์ และการฝังที่ยืดหยุ่น
  • แนวนอน 16:9 สำหรับ YouTube งานนำเสนอ เว็บไซต์ และคอร์สจอไวด์
The same VisionStory avatar shown in 9:16, 1:1, and 16:9 aspect ratios

การซูมไม่สามารถสร้างพิกเซลที่ไม่มีอยู่จริงได้ ถ้าตัวคนในรูปต้นฉบับชนขอบทุกด้านอยู่แล้ว ให้เริ่มจากรูปที่มีฉากหลังมากขึ้น แทนการฝืนครอปให้กว้างขึ้น

ขั้นที่ 5: รู้ว่า Change Look และ Generate Image ทำอะไร

ข้างๆ อวาตาร์จะมีเครื่องมือภาพด้วย AI อยู่ 2 ตัว และควรรู้ความต่างก่อนใช้งาน

Change Look จะเปิดแชต AI โดยแนบอวาตาร์ปัจจุบันไว้เป็นภาพตั้งต้นแล้ว คุณจึงบรรยายชุดใหม่ ฉากใหม่ หรือสไตล์ใหม่ได้ นี่คือเวิร์กโฟลว์แบบ image-to-image และอวาตาร์ต้นฉบับยังคงใช้งานได้ ส่วน Generate Image จะเริ่มจากคำบรรยายตัวละครที่พิมพ์ แทนการเริ่มจากรูปถ่าย จึงเป็นเวิร์กโฟลว์แบบ text-to-image ทั้งสองแบบคุณสามารถคุยต่อเพื่อปรับผลลัพธ์ให้ตรงใจได้

VisionStory Change Look chat opened with the current avatar attached as the starting image

สรุปสั้นๆ: ใช้ Change Look เมื่อมีตัวละครอยู่แล้วและอยากปรับลุคใหม่ และใช้ Generate Image เมื่ออยากสร้างตัวละครจากพรอมป์ต์

ขั้นที่ 6: ใส่สคริปต์สั้นๆ แล้วสร้างวิดีโอพูดได้

เมื่อเลือกอวาตาร์ที่อัปโหลดไว้แล้ว ให้พิมพ์ประโยคสั้นๆ แบบภาษาพูด 1 ประโยคในช่อง Script ประโยคสั้นจะเรนเดอร์เร็วกว่า และช่วยให้ประเมินรูป ครอป เสียง การลิปซิงก์ และการเคลื่อนไหวไปพร้อมกันได้ง่าย

คลิก Generate Talking Video แล้ว VisionStory จะทำให้ใบหน้าขยับ ซิงก์ริมฝีปากให้ตรงกับเสียง และเติมการกะพริบตา/การขยับศีรษะที่สมจริง โดยใช้ อวาตาร์ เฟรม สคริปต์ และเสียงที่เลือกไว้ การเรนเดอร์ใช้เวลาประมาณไม่กี่นาที

A short VisionStory script generating a talking-avatar result from the uploaded portrait

ให้มองผลลัพธ์แรกนี้เป็นการทดสอบรูปต้นฉบับแบบใช้งานจริง แล้วเช็ก 4 อย่าง:

  • ใบหน้ายังคมชัดพอเมื่ออยู่ในขนาดสุดท้าย
  • ดวงตาและปากไม่ถูกบังระหว่างการเคลื่อนไหว
  • ศีรษะและไหล่อยู่ในเฟรมของอัตราส่วนที่เลือกได้พอดี
  • อวาตาร์ที่ขยับแล้วยังดูเหมือนคนในรูปต้นฉบับ

ถ้าครอปแน่นเกินไปหรือใบหน้าดูนุ่ม/ไม่คมตอนขยับ ให้แก้รูปต้นฉบับหรือการจัดเฟรมก่อน การเปลี่ยนสคริปต์ไม่ได้ช่วยแก้ปัญหาองค์ประกอบภาพ

ขั้นที่ 7: ใช้ซ้ำหรือลบอวาตาร์รูปพูดได้ของคุณ

กลับไปที่รายการ Characters คุณจะเห็นอวาตาร์ที่อัปโหลดไว้อยู่เหนือคลังตัวละครสาธารณะ และสามารถเลือกใช้ได้ทุกครั้งที่อยากได้ผู้พรีเซนต์คนเดิม ผู้ใช้อื่นมองไม่เห็น และผู้สมัครสมาชิกสามารถสร้างและเก็บอวาตาร์ได้ไม่จำกัด

  • ใช้ซ้ำ: เลือกอวาตาร์แทนการอัปโหลดรูปอีกครั้ง
  • สลับลุค: เปิดอวาตาร์แล้วเลือกจากภาพตัวอย่างลุคที่บันทึกไว้
  • ลบออก: วางเมาส์เหนืออวาตาร์เพื่อให้เห็นปุ่มลบที่มุมขวาบน จากนั้นยืนยันก่อนลบอวาตาร์และลุคทั้งหมด
A reusable uploaded avatar in VisionStory Characters with the delete control and confirmation dialog

แก้ปัญหาทั่วไปของรูปภาพ

VisionStory หาใบหน้าที่ใช้งานได้ไม่เจอ ให้ใช้รูปที่สว่างกว่า คมชัดกว่า และมีใบหน้าหันตรงที่ใหญ่กว่า 1 ใบหน้า หลีกเลี่ยงรูปที่ตาหรือปากถูกบัง มุมเสย/มุมด้านข้างจัดๆ และรูปที่มีใบหน้าอื่นอยู่ใกล้ตัวแบบหลักเกินไป

ครอปแนวนอนชิดเกินไป ภาพพอร์ตเทรตต้นฉบับน่าจะมีพื้นที่ด้านข้างไม่พอ ให้ใช้รูปที่กว้างกว่า หรือมีพื้นที่ว่างรอบตัวแบบมากกว่า

อวาตาร์ยังอยู่ระหว่างการเตรียม รอให้การเตรียมเสร็จก่อนใช้งานตัวละคร หากค้าง ให้รีเฟรชมุมมอง Characters และตรวจดูว่าอวาตาร์ปรากฏขึ้นแล้วหรือยัง ก่อนอัปโหลดซ้ำอีกครั้ง

ผลลัพธ์ดูไม่คม เริ่มจากรูปที่ความละเอียดสูงและโฟกัสดี และหลีกเลี่ยงการขยายใบหน้าที่เล็กเกินไปแบบหนักๆ ความละเอียดเอาต์พุตไม่สามารถกู้รายละเอียดที่หายไปจากรูปต้นฉบับได้

ทั้งหมดนี้คือวิธีทำให้รูปพูดได้: อัปโหลดภาพพอร์ตเทรต 1 รูป จับคู่เสียง จัดเฟรม แล้วสร้าง รูปของคุณจะกลายเป็นอวาตาร์พูดได้แบบใช้ซ้ำ ที่หยิบมาใช้ได้อีกทุกครั้งที่ต้องการ

อยากได้ขั้นตอนแบบครบทั้งสคริปต์ เสียง การตั้งค่า เครดิต และเวิร์กโฟลว์การสร้างทั้งหมดไหม? ไปต่อที่ How to Create an AI Talking Avatar หรือเปลี่ยนสคริปต์ยาวๆ ให้เป็น วิดีโอ AI จำนวนมากได้ หรือเริ่มเลยตอนนี้: สร้างรูปพูดได้ชิ้นแรกฟรี

คำถามที่พบบ่อย

  • อัปโหลดรูปที่ชัดเจน หันหน้าตรงไปที่เครื่องมือรูปพูดได้ของ VisionStory จากนั้นพิมพ์ข้อความสั้นๆ ให้รูปพูด เลือกหรือใช้เสียงที่ระบบกำหนดไว้ แล้วคลิก Generate Talking Video คุณจะได้วิดีโอพูดได้ที่ซิงก์ปากบนเบราว์เซอร์ภายในไม่กี่นาทีในแผนฟรี โดยไม่ต้องติดตั้งซอฟต์แวร์