ดูวิดีโอสอนนี้บน YouTube

YouTube

การโคลนเสียงจะสร้างเสียงสังเคราะห์ที่นำกลับมาใช้ซ้ำได้จากไฟล์บันทึกเสียงจริง VisionStory จะวิเคราะห์ตัวอย่างต้นฉบับ เตรียมไฟล์เสียง ตรวจจับภาษาและลักษณะโทนเสียง สร้างเสียงโคลน และสร้างตัวอย่างพรีวิวให้คุณประเมินก่อนนำไปใช้ในวิดีโอ

การอัปโหลดเป็นเพียงขั้นตอนเชิงกลเท่านั้น ไฟล์บันทึกเสียงต้นฉบับเป็นตัวกำหนดว่าผลลัพธ์จะเหมือนแค่ไหน และฟังได้เสถียรเพียงใด โดยทั่วไป เสียงที่สะอาดและสม่ำเสมอเพียง 1 นาที มักมีประโยชน์มากกว่าหลายนาทีที่อัดด้วยไมโครโฟนต่างกันหรือคนละห้อง

ใช้เสียงอย่างมีความรับผิดชอบ โคลนเฉพาะเสียงของคุณเอง หรือเสียงที่คุณได้รับอนุญาตอย่างชัดเจนเท่านั้น ห้ามใช้การโคลนเสียงเพื่อแอบอ้างเป็นผู้อื่น เลี่ยงการขอความยินยอม หรือทำให้ผู้ชมเข้าใจผิด

  • แหล่งที่ดีที่สุด: เสียงสะอาด 1–2 นาที ที่มีผู้พูดคนเดียว
  • อัดเสียงแบบด่วน: สูงสุด 15 วินาที ภายในหน้าต่าง Clone
  • การใช้งาน: แพ็กเกจสมาชิก Pro ขึ้นไป

ขั้นตอนที่ 1: เปิด Voice Clone ใน AI Video

เปิด AI Video แล้วเลือกอวาตาร์ที่คุณจะใช้ ในแถวเสียงใต้กล่อง Script ให้คลิก Clone ที่อยู่ข้างเสียงปัจจุบัน หน้าต่าง Clone จะเปิดขึ้นโดยไม่เปลี่ยนเสียงเดิมของอวาตาร์

VisionStory AI Video editor with the Clone control highlighted beside the current voice
เริ่มใช้งาน Voice Clone ได้จากตัวควบคุมเสียงในตัวแก้ไข AI Video

ขั้นตอนที่ 2: เลือกอัปโหลดหรือบันทึกเสียง

หน้าต่างนี้มีวิธีเลือกแหล่งเสียง 2 แบบ เลือกตามว่าคุณกำลังทดสอบขั้นตอนการทำงาน หรือกำลังพยายามให้ได้เสียงที่ใกล้เคียงที่สุดในทางปฏิบัติ

  • อัปโหลดเสียง: แนะนำสำหรับคุณภาพ ใช้ตัวอย่างที่สะอาดความยาว 1–2 นาทีหากทำได้
  • บันทึกเสียง: เหมาะสำหรับทดสอบแบบเร็ว เครื่องบันทึกในแอปปัจจุบันบันทึกได้สูงสุด 15 วินาที

ไฟล์ที่อัปโหลดรองรับ .avi, .mp3, .mp4, .m4a, .wav หรือ .mov ช่วงเสียงที่เลือกต้องยาวอย่างน้อย 3 วินาที และยาวได้สูงสุด 120 วินาที

VisionStory Clone dialog comparing audio upload with the built-in recorder
การอัปโหลดให้วัสดุเสียงสะอาดเพียงพอเพื่อให้ได้เสียงที่ใกล้เคียงกว่า ส่วนการบันทึกเสียงคือวิธีที่เร็วกว่าในการทดสอบ

ขั้นตอนที่ 3: เตรียมไฟล์เสียงให้ได้ความเหมือนที่ใกล้เคียงยิ่งขึ้น

การโคลนเสียงไม่ได้คัดลอกแค่เอกลักษณ์ของเสียงเท่านั้น แต่ยังสามารถถอดแบบจังหวะการพูด น้ำเสียงและการเน้นคำ ลมหายใจ เสียงบรรยากาศในห้อง โทนสีของไมค์ และอาร์ติแฟกต์ที่ไม่ต้องการได้ด้วย บันทึกไฟล์ต้นฉบับในสไตล์ที่คุณอยากให้โคลนนำไปใช้ภายหลัง

  • ใช้ผู้พูดคนเดียว ตัดเพลง เสียงทับซ้อน และบทสนทนาพื้นหลังออก
  • อัดเสียงสะอาด 1–2 นาที ให้มีความหลากหลายตามธรรมชาติพอเหมาะ โดยไม่ผสมหลายเซสชันที่ไม่สม่ำเสมอกัน
  • เลือกห้องเงียบและไม่ก้อง เฟอร์นิเจอร์นุ่ม ๆ ช่วยลดเสียงก้องได้; หลีกเลี่ยงพัดลม เสียงจราจร และเสียงแอร์
  • ยึดไมโครโฟนให้นิ่ง รักษาระยะ มุม ระดับอินพุต และห้องให้เหมือนเดิมตลอดทั้งตัวอย่าง
  • พูดให้เป็นธรรมชาติและสม่ำเสมอ คงสำเนียง ความดัง จังหวะ และสไตล์การแสดงให้คงที่
  • หลีกเลี่ยงช่วงเงียบนาน ๆ ใช้คำพูดต่อเนื่องที่มีประโยชน์ แทนการเติมความเงียบลงในไฟล์
Voice clone recording checklist and current Pro, Advanced, and Ultra voice slot counts
ไฟล์เสียงต้นฉบับที่ดีกว่าจะช่วยเพิ่มความเหมือนได้อย่างสม่ำเสมอมากกว่าการเพิ่มจำนวนนาทีเพียงอย่างเดียว

เคล็ดลับ: หากโคลนครั้งแรกฟังดูไม่แน่น ให้เปลี่ยนไฟล์ต้นฉบับเป็นเสียงที่สะอาดและสม่ำเสมอกว่า ก่อนจะลองอัดไฟล์ที่ยาวขึ้นมาก ๆ วัสดุที่คุณภาพปะปนกันมักทำให้โคลน “เรียนรู้” ความไม่สม่ำเสมอที่คุณอยากกำจัดออกไป

ขั้นตอนที่ 4: อัปโหลด ตรวจทาน และตั้งชื่อตัวอย่าง

ลากไฟล์ไปที่ Import Audio หรือคลิกพื้นที่วางเพื่อเลือกไฟล์ หลังจากรูปคลื่นเสียงแสดงขึ้นมา ให้เล่นช่วงที่เลือกแล้วฟังว่ามีผู้พูดคนอื่น เพลง เสียงแตก (clipping) เสียงก้อง การตัดต่อที่กระชาก หรือช่วงเงียบนาน ๆ หรือไม่ หากปัญหาเหล่านี้ชัดเจน ให้เปลี่ยนไฟล์ต้นฉบับ

กรอกชื่อที่สื่อความหมายได้ยาวไม่เกิน 20 ตัวอักษร ใส่คำต่อท้ายระบุภาษา/โลแคลจะช่วยแยกเสียงสำหรับหลาย ๆ บทเรียนหรือแคมเปญได้ง่ายขึ้น เช่น Tutorial Voice-en.

Audio moving from the VisionStory upload area to a visible waveform ready for review and naming
ตรวจทานช่วงที่เลือกจริง จากนั้นใช้ชื่อสั้น ๆ ที่คุณจะจำได้ในคลังเสียง (Voice Library)

ขั้นตอนที่ 5: สร้างโคลนและให้ VisionStory ตรวจจับภาษา

คลิก Clone Now VisionStory จะประมวลผลตัวอย่างแบบอะซิงโครนัสและเปิดแท็บ Cloned Voice รายการจะรีเฟรชระหว่างประมวลผล และจะกดเล่นได้เมื่อพรีวิวพร้อม

คุณไม่จำเป็นต้องเลือกภาษาต้นฉบับด้วยตนเอง VisionStory จะวิเคราะห์การบันทึกและกำหนดภาษาที่ตรวจจับได้ให้อัตโนมัติ ควรใช้ภาษาเดียวอย่างสม่ำเสมอในไฟล์ตัวอย่าง เพื่อให้โลแคล สำเนียง และพรีวิวที่ตรวจจับได้ตัดสินได้ง่ายขึ้น

A ready VisionStory cloned voice with English detected automatically and a preview button
ภาษาที่ตรวจจับได้จะแสดงพร้อมโคลนที่พร้อมใช้งาน โดยไม่จำเป็นต้องเลือกภาษาระหว่างการโคลน

ขั้นตอนที่ 6: พรีวิว เลือก และทดสอบเสียงที่โคลน

ก่อนเลือก ให้กดปุ่มเล่นในแถวของเสียงที่โคลนเพื่อพรีวิวก่อน ฟังให้ครบทั้งเอกลักษณ์ของเสียง สำเนียง จังหวะการพูด การออกเสียง เสียงก้องของห้อง เสียงรบกวน และการเปลี่ยนโทนเสียงที่ไม่นิ่ง หากพรีวิวมีอาร์ติแฟกต์ชัดเจน ให้ปรับปรุงไฟล์ต้นฉบับตอนนี้เลย แทนที่จะไปเจอปัญหาเมื่อวิดีโอเสร็จแล้ว

เลือกเสียงที่โคลน พิมพ์ประโยคสั้นๆ 1 ประโยคในช่อง Script แล้วคลิก Preview Audio การทดสอบสั้นๆ จะช่วยให้เปรียบเทียบได้ง่ายขึ้น และยืนยันได้ว่าเสียงโคลนเหมาะกับประเภทคอนเทนต์ที่คุณจะทำ

VisionStory AI Video editor previewing a selected cloned voice with a short script
ทดสอบเสียงโคลนด้วยสคริปต์สั้นๆ ก่อนนำไปใช้กับงานโปรดักชันที่ยาวกว่า

แพ็กเกจ Voice Clone และข้อจำกัดจำนวนสล็อต

Voice Clone ใช้งานได้ในแพ็กเกจ Pro และสูงกว่า เสียงที่โคลนและบันทึกไว้แต่ละรายการจะใช้ 1 สล็อตจนกว่าจะถูกลบ

แพ็กเกจจำนวนสิทธิ์โคลนเสียงที่มีในปัจจุบัน
Freeไม่รวม
Pro10 สล็อต
Advanced20 สล็อต
Ultra50 สล็อต
Enterpriseปรับแต่งได้

เมื่อไม่ต้องใช้เสียงโคลนแล้ว ให้เปิด Cloned Voice ลบเสียงนั้น และยืนยันการดำเนินการ การลบเสียงโคลนจะคืนสล็อตให้ใช้งานได้อีกครั้ง หากเสียงที่ลบถูกเลือกอยู่ในเอดิเตอร์ VisionStory จะสลับกลับไปใช้เสียงเริ่มต้นที่ยังพร้อมใช้งาน

รองรับ 88 ภาษา

88 ภาษาที่ไม่ซ้ำกัน VisionStory ตรวจจับภาษาของตัวอย่างโคลนโดยอัตโนมัติ โดยตัวเลือกเสียงที่ใช้งานได้และลักษณะผลลัพธ์อาจแตกต่างกันไปตามภาษา รายการด้านล่างนับ 1 รายการต่อภาษา หลังรวมรูปแบบตามภูมิภาคและชื่อที่มีความหมายเท่ากันแล้ว

  • 🇿🇦 แอฟริคานส์
  • 🇦🇱 แอลเบเนีย
  • 🇪🇹 อัมฮาริก
  • 🇸🇦 อาหรับ
  • 🇦🇲 อาร์เมเนีย
  • 🇮🇳 อัสสัม
  • 🇦🇿 อาเซอร์ไบจาน
  • 🇪🇸 บาสก์
  • 🇧🇾 เบลารุส
  • 🇧🇩 เบงกาลี (บังลา)
  • 🇧🇦 บอสเนีย
  • 🇧🇬 บัลแกเรีย
  • 🇲🇲 พม่า
  • 🇭🇰 กวางตุ้ง
  • 🇪🇸 คาตาลัน
  • 🇵🇭 เซบูอาโน
  • 🇲🇼 ชีเชวา
  • 🇨🇳 จีน (แมนดาริน)
  • 🇭🇷 โครเอเชีย
  • 🇨🇿 เช็ก
  • 🇩🇰 เดนมาร์ก
  • 🇳🇱 ดัตช์
  • 🇬🇧 อังกฤษ
  • 🇪🇪 เอสโตเนีย
  • 🇵🇭 ฟิลิปปินส์
  • 🇫🇮 ฟินแลนด์
  • 🇫🇷 ฝรั่งเศส
  • 🇪🇸 กาลิเซีย
  • 🇬🇪 จอร์เจีย
  • 🇩🇪 เยอรมัน
  • 🇬🇷 กรีก
  • 🇮🇳 คุชราต
  • 🇭🇹 เฮติครีโอล
  • 🇳🇬 เฮาซา
  • 🇮🇱 ฮีบรู
  • 🇮🇳 ฮินดี
  • 🇭🇺 ฮังการี
  • 🇮🇸 ไอซ์แลนด์
  • 🇮🇩 อินโดนีเซีย
  • 🇮🇪 ไอริช
  • 🇮🇹 อิตาลี
  • 🇯🇵 ญี่ปุ่น
  • 🇮🇩 ชวา
  • 🇮🇳 กันนาดา
  • 🇰🇿 คาซัค
  • 🇮🇳 กอนกณี
  • 🇰🇷 เกาหลี
  • 🇰🇬 คีร์กีซ
  • 🇱🇦 ลาว
  • 🇻🇦 ละติน
  • 🇱🇻 ลัตเวีย
  • 🇨🇩 ลิงกาลา
  • 🇱🇹 ลิทัวเนีย
  • 🇱🇺 ลักเซมเบิร์ก
  • 🇲🇰 มาซิโดเนีย
  • 🇮🇳 ไมถิลี
  • 🇲🇬 มาลากาซี
  • 🇲🇾 มาเลย์
  • 🇮🇳 มาลายาลัม
  • 🇮🇳 มราฐี
  • 🇲🇳 มองโกเลีย
  • 🇳🇵 เนปาล
  • 🇳🇴 นอร์เวย์
  • 🇮🇳 โอเดีย
  • 🇦🇫 พาชตู
  • 🇮🇷 เปอร์เซีย
  • 🇵🇱 โปแลนด์
  • 🇵🇹 โปรตุเกส
  • 🇮🇳 ปัญจาบ
  • 🇷🇴 โรมาเนีย
  • 🇷🇺 รัสเซีย
  • 🇷🇸 เซอร์เบีย
  • 🇵🇰 สินธี
  • 🇱🇰 สิงหล
  • 🇸🇰 สโลวัก
  • 🇸🇮 สโลวีเนีย
  • 🇸🇴 โซมาลี
  • 🇪🇸 สเปน
  • 🇰🇪 สวาฮีลี
  • 🇸🇪 สวีเดน
  • 🇮🇳 ทมิฬ
  • 🇮🇳 เตลูกู
  • 🇹🇭 ไทย
  • 🇹🇷 ตุรกี
  • 🇺🇦 ยูเครน
  • 🇵🇰 อูรดู
  • 🇻🇳 เวียดนาม
  • 🇬🇧 เวลส์

วิธีการนับ: นับ 1 รายการต่อภาษา ไม่ใช่ต่อโลแคล — เช่น รูปแบบภาษาอังกฤษตามภูมิภาคนับครั้งเดียว, Norwegian Bokmål และ Nynorsk นับครั้งเดียว และ Bengali/Bangla นับครั้งเดียว

แก้ปัญหาโคลนเสียงที่ฟังดูไม่ใกล้เคียงพอ

เอกลักษณ์ของเสียงดูไม่ชัด

เปลี่ยนต้นฉบับเป็นตัวอย่างที่สะอาดกว่า ความยาว 1-2 นาที จากการอัดครั้งเดียวแบบไม่หยุดพัก รักษาไมโครโฟน ห้อง จังหวะ และการแสดงให้สม่ำเสมอ

เสียงโคลนมีนอยส์หรือฟังดูเป็นโลหะ

ฟังต้นฉบับด้วยหูฟัง แล้วเอาเพลงพื้นหลัง เสียงก้อง พัดลม เสียงจราจร การลดนอยส์ที่หนักเกินไป อาการคลิป และการเอ็กซ์พอร์ตแบบสูญเสียคุณภาพซ้ำๆ ออกไป ต้นฉบับที่สะอาดกว่ามักช่วยได้มากกว่าการปรุงแต่งเพิ่ม

จังหวะหรืออารมณ์ไม่ตรง

โคลนเรียนรู้ตัวเลือกการพูดเหล่านั้นจากตัวอย่าง ดังนั้นให้บันทึกต้นฉบับด้วยโทน พลัง จังหวะ และสไตล์การพูดที่คุณอยากได้ยินในภายหลัง

ภาษา หรือสำเนียง ไม่เป็นไปตามที่คาด

ใช้ภาษาเดียวตลอดทั้งตัวอย่าง และหลีกเลี่ยงการสลับภาษาระหว่างการบันทึกเพื่อโคลน เพื่อให้การออกเสียงและสำเนียงตรงที่สุด ให้โคลนและทดสอบด้วยภาษาที่คุณตั้งใจจะเผยแพร่

สร้างโคลนเสียงของคุณ

เตรียมไฟล์บันทึกต้นฉบับที่สะอาด 1 ไฟล์ เปิด วิดีโอ AI และพรีวิวผลลัพธ์ก่อนนำไปใช้ในงานที่ยาวขึ้น ดูเพิ่มเติมได้ที่ ฟีเจอร์โคลนเสียงของ VisionStory สำหรับเสียงแบบกำหนดเองและหลายภาษา

คำถามที่พบบ่อย

  • ถ้าต้องการคุณภาพที่ดีที่สุด แนะนำให้ใช้เสียงพูดที่ชัดเจนและสม่ำเสมอความยาว 1 ถึง 2 นาที ระบบรองรับการเลือกช่วงเสียงตั้งแต่ 3 ถึง 120 วินาที ส่วนการอัดเสียงโดยตรงจะจำกัดที่ 15 วินาทีสำหรับการทดสอบแบบเร็ว