อยากทำให้รูปนิ่งพูดได้—แบบภาพพอร์ตเทรตที่อ้าปาก กะพริบตา และพูดตามที่คุณพิมพ์ไหม? ด้วย VisionStory คุณทำได้เลยจากรูปเพียงภาพเดียว บนเบราว์เซอร์ของคุณ ไม่ต้องใช้กล้องและไม่ต้องมีประสบการณ์ตัดต่อ วิดีโอด้านบนจะพาดูครบทั้งขั้นตอน และคู่มือทีละขั้นด้านล่างจะอธิบายทุกส่วนแบบละเอียด
ระหว่างทำ คุณจะอัปโหลดภาพพอร์ตเทรต 1 รูปและเตรียมเป็น อวาตาร์แบบใช้ซ้ำของคุณเอง ผู้ใช้อื่นมองไม่เห็น และคุณสามารถเลือกใช้อวาตาร์เดิมกับวิดีโอครั้งต่อๆ ไปได้ โดยไม่ต้องอัปโหลดรูปเดิมซ้ำทุกครั้ง ทุกอย่างทำใน เครื่องมือรูปพูดได้ของ VisionStory ด้วยบัญชีฟรี
ขั้นที่ 1: อัปโหลดภาพพอร์ตเทรตที่ชัดเจน 1 รูป
เปิด วิดีโอ AI ในแผง Characters ให้เลือก Upload แล้วเลือกรูปจากอุปกรณ์ของคุณ หรือจะลากรูปมาวางในพื้นที่อัปโหลดได้เลย ใช้รูปคนที่ชัดเจน หันหน้าตรง เห็นใบหน้าและช่วงไหล่ ดวงตาและปากไม่ถูกบัง และเผื่อพื้นที่รอบตัวแบบนิดหน่อยเพื่อไว้จัดเฟรมใหม่ภายหลัง
- ไฟล์ที่รองรับ: JPG, JPEG, PNG, WebP และ HEIC
- ขนาดไฟล์สูงสุด: 30 MB
- ขนาดเริ่มต้นที่แนะนำ: อย่างน้อย 512 x 768 พิกเซลสำหรับภาพพอร์ตเทรต
- รูปแบบการอัปโหลด: ครั้งละ 1 รูปต้นฉบับ

จัดองค์ประกอบรูปต้นฉบับให้สอดคล้องกับปลายทางของวิดีโอ ภาพพอร์ตเทรตที่ครอปชิดอาจใช้ได้กับ 9:16 แต่พอเป็น 16:9 อาจกลายเป็นการครอปใบหน้าที่ชิดเกินไป เพราะไม่มีพื้นที่ภาพด้านซ้ายและขวาไว้เติมเฟรมที่กว้างขึ้น
ขั้นที่ 2: ให้ VisionStory ตรวจสอบและเตรียมอวาตาร์
หลังอัปโหลด VisionStory จะตรวจว่ารูปมีบุคคลที่ใช้งานได้หรือไม่ และเตรียมให้เป็นตัวละคร การอัปโหลดล้มเหลวแทบทั้งหมดมักย้อนกลับไปที่รูปต้นฉบับ: ใบหน้าอาจเล็กเกินไป ถูกบังมาก หันข้างมากไป เบลอ หรืออยู่ใกล้ใบหน้าอื่นเกินไป
ถ้าเตรียมไม่สำเร็จ อย่าลองซ้ำด้วยครอปเดิมเรื่อยๆ ให้เปลี่ยนไปใช้รูปต้นฉบับที่คมชัดกว่า มีใบหน้าเดียวที่ใหญ่กว่า มุมตรงกว่า เห็นไหล่ แสงสม่ำเสมอ และมีสิ่งบังน้อยกว่า

เมื่อประมวลผลเสร็จ อวาตาร์จะปรากฏอยู่เหนือคลังตัวละครสาธารณะ และเปิดในหน้าพรีวิวอวาตาร์ โดยจะมองเห็นได้เฉพาะคุณเท่านั้น
ขั้นที่ 3: พรีวิวหรือเปลี่ยนเสียงที่ถูกกำหนดไว้
VisionStory จะกำหนดเสียงเริ่มต้นที่เหมาะสมให้อัตโนมัติตามอายุและเพศที่ดูจากภาพ คุณจะใช้เสียงเดิม พรีวิว หรือเปลี่ยนเป็นเสียงอื่นก็ได้
- คลิกเลือกเสียงปัจจุบันเพื่อเปิดคลังเสียง
- กดปุ่มเล่นทางขวาของเสียงเพื่อฟังตัวอย่าง
- ถ้าไม่เข้ากัน ให้กรองตาม Language, Gender, Age และ Use Case
- พรีวิวตัวเลือกอื่นๆ แล้วเลือกเสียงที่เข้ากับทั้งอวาตาร์และจุดประสงค์ของวิดีโอ

บางครั้งเสียงอาจเข้ากับอายุและเพศที่เห็นได้ แต่ยังไม่เหมาะกับงานบรรยาย การศึกษา โฆษณา หรือคอนเทนต์แบบสนทนา ให้จับคู่ “คน” กับ “จุดประสงค์” ไม่ใช่ดูแค่ข้อมูลประชากร
ขั้นที่ 4: จัดเฟรมรูปให้เหมาะกับปลายทาง
ใช้พรีวิวอวาตาร์เพื่อกำหนดว่าจะให้เห็นตัวคนมากน้อยแค่ไหนในวิดีโอสุดท้าย ลากรูปเพื่อจัดตำแหน่ง และใช้ปุ่มซูมเพื่อเข้าใกล้หรือถอยออก จากนั้นเลือกอัตราส่วนภาพให้เหมาะกับที่คุณจะเผยแพร่:
- แนวตั้ง 9:16 สำหรับ TikTok, Instagram Reels, YouTube Shorts และพื้นที่ที่เน้นมือถือเป็นหลัก
- จัตุรัส 1:1 สำหรับโพสต์โซเชียลแบบสี่เหลี่ยม เลย์เอาต์ที่เน้นรูปโปรไฟล์ และการฝังที่ยืดหยุ่น
- แนวนอน 16:9 สำหรับ YouTube งานนำเสนอ เว็บไซต์ และคอร์สจอไวด์

การซูมไม่สามารถสร้างพิกเซลที่ไม่มีอยู่จริงได้ ถ้าตัวคนในรูปต้นฉบับชนขอบทุกด้านอยู่แล้ว ให้เริ่มจากรูปที่มีฉากหลังมากขึ้น แทนการฝืนครอปให้กว้างขึ้น
ขั้นที่ 5: รู้ว่า Change Look และ Generate Image ทำอะไร
ข้างๆ อวาตาร์จะมีเครื่องมือภาพด้วย AI อยู่ 2 ตัว และควรรู้ความต่างก่อนใช้งาน
Change Look จะเปิดแชต AI โดยแนบอวาตาร์ปัจจุบันไว้เป็นภาพตั้งต้นแล้ว คุณจึงบรรยายชุดใหม่ ฉากใหม่ หรือสไตล์ใหม่ได้ นี่คือเวิร์กโฟลว์แบบ image-to-image และอวาตาร์ต้นฉบับยังคงใช้งานได้ ส่วน Generate Image จะเริ่มจากคำบรรยายตัวละครที่พิมพ์ แทนการเริ่มจากรูปถ่าย จึงเป็นเวิร์กโฟลว์แบบ text-to-image ทั้งสองแบบคุณสามารถคุยต่อเพื่อปรับผลลัพธ์ให้ตรงใจได้

สรุปสั้นๆ: ใช้ Change Look เมื่อมีตัวละครอยู่แล้วและอยากปรับลุคใหม่ และใช้ Generate Image เมื่ออยากสร้างตัวละครจากพรอมป์ต์
ขั้นที่ 6: ใส่สคริปต์สั้นๆ แล้วสร้างวิดีโอพูดได้
เมื่อเลือกอวาตาร์ที่อัปโหลดไว้แล้ว ให้พิมพ์ประโยคสั้นๆ แบบภาษาพูด 1 ประโยคในช่อง Script ประโยคสั้นจะเรนเดอร์เร็วกว่า และช่วยให้ประเมินรูป ครอป เสียง การลิปซิงก์ และการเคลื่อนไหวไปพร้อมกันได้ง่าย
คลิก Generate Talking Video แล้ว VisionStory จะทำให้ใบหน้าขยับ ซิงก์ริมฝีปากให้ตรงกับเสียง และเติมการกะพริบตา/การขยับศีรษะที่สมจริง โดยใช้ อวาตาร์ เฟรม สคริปต์ และเสียงที่เลือกไว้ การเรนเดอร์ใช้เวลาประมาณไม่กี่นาที

ให้มองผลลัพธ์แรกนี้เป็นการทดสอบรูปต้นฉบับแบบใช้งานจริง แล้วเช็ก 4 อย่าง:
- ใบหน้ายังคมชัดพอเมื่ออยู่ในขนาดสุดท้าย
- ดวงตาและปากไม่ถูกบังระหว่างการเคลื่อนไหว
- ศีรษะและไหล่อยู่ในเฟรมของอัตราส่วนที่เลือกได้พอดี
- อวาตาร์ที่ขยับแล้วยังดูเหมือนคนในรูปต้นฉบับ
ถ้าครอปแน่นเกินไปหรือใบหน้าดูนุ่ม/ไม่คมตอนขยับ ให้แก้รูปต้นฉบับหรือการจัดเฟรมก่อน การเปลี่ยนสคริปต์ไม่ได้ช่วยแก้ปัญหาองค์ประกอบภาพ
ขั้นที่ 7: ใช้ซ้ำหรือลบอวาตาร์รูปพูดได้ของคุณ
กลับไปที่รายการ Characters คุณจะเห็นอวาตาร์ที่อัปโหลดไว้อยู่เหนือคลังตัวละครสาธารณะ และสามารถเลือกใช้ได้ทุกครั้งที่อยากได้ผู้พรีเซนต์คนเดิม ผู้ใช้อื่นมองไม่เห็น และผู้สมัครสมาชิกสามารถสร้างและเก็บอวาตาร์ได้ไม่จำกัด
- ใช้ซ้ำ: เลือกอวาตาร์แทนการอัปโหลดรูปอีกครั้ง
- สลับลุค: เปิดอวาตาร์แล้วเลือกจากภาพตัวอย่างลุคที่บันทึกไว้
- ลบออก: วางเมาส์เหนืออวาตาร์เพื่อให้เห็นปุ่มลบที่มุมขวาบน จากนั้นยืนยันก่อนลบอวาตาร์และลุคทั้งหมด

แก้ปัญหาทั่วไปของรูปภาพ
VisionStory หาใบหน้าที่ใช้งานได้ไม่เจอ ให้ใช้รูปที่สว่างกว่า คมชัดกว่า และมีใบหน้าหันตรงที่ใหญ่กว่า 1 ใบหน้า หลีกเลี่ยงรูปที่ตาหรือปากถูกบัง มุมเสย/มุมด้านข้างจัดๆ และรูปที่มีใบหน้าอื่นอยู่ใกล้ตัวแบบหลักเกินไป
ครอปแนวนอนชิดเกินไป ภาพพอร์ตเทรตต้นฉบับน่าจะมีพื้นที่ด้านข้างไม่พอ ให้ใช้รูปที่กว้างกว่า หรือมีพื้นที่ว่างรอบตัวแบบมากกว่า
อวาตาร์ยังอยู่ระหว่างการเตรียม รอให้การเตรียมเสร็จก่อนใช้งานตัวละคร หากค้าง ให้รีเฟรชมุมมอง Characters และตรวจดูว่าอวาตาร์ปรากฏขึ้นแล้วหรือยัง ก่อนอัปโหลดซ้ำอีกครั้ง
ผลลัพธ์ดูไม่คม เริ่มจากรูปที่ความละเอียดสูงและโฟกัสดี และหลีกเลี่ยงการขยายใบหน้าที่เล็กเกินไปแบบหนักๆ ความละเอียดเอาต์พุตไม่สามารถกู้รายละเอียดที่หายไปจากรูปต้นฉบับได้
ทั้งหมดนี้คือวิธีทำให้รูปพูดได้: อัปโหลดภาพพอร์ตเทรต 1 รูป จับคู่เสียง จัดเฟรม แล้วสร้าง รูปของคุณจะกลายเป็นอวาตาร์พูดได้แบบใช้ซ้ำ ที่หยิบมาใช้ได้อีกทุกครั้งที่ต้องการ
อยากได้ขั้นตอนแบบครบทั้งสคริปต์ เสียง การตั้งค่า เครดิต และเวิร์กโฟลว์การสร้างทั้งหมดไหม? ไปต่อที่ How to Create an AI Talking Avatar หรือเปลี่ยนสคริปต์ยาวๆ ให้เป็น วิดีโอ AI จำนวนมากได้ หรือเริ่มเลยตอนนี้: สร้างรูปพูดได้ชิ้นแรกฟรี
