Setiap video AI bermula dengan skrip, tetapi suaralah yang menentukan bagaimana skrip itu benar-benar sampai kepada audiens. Suara menetapkan loghat, umur, tekstur, tenaga dan personaliti pembentang anda — manakala kelajuan, jeda dan petunjuk penyampaian pula menentukan sama ada hasilnya berbunyi seperti manusia atau seperti mesin yang membaca sehelai kertas.
Ringkasnya: pilih suara AI dengan memadankan bahasa dan loghat serantau dengan audiens anda, menggunakan tag profil untuk menyusun senarai pendek, mempratonton setiap calon dengan skrip anda sendiri, kemudian membentuk penyampaian dengan kelajuan dan jeda sebelum anda menjana. Selebihnya panduan ini menerangkan proses tersebut langkah demi langkah dalam VisionStory, yang mempunyai pustaka suara AI dengan lebih daripada 1,000 suara dalam 88 bahasa.
Apa yang dibincangkan panduan ini: Pustaka Suara awam dan kawalan penyampaian di sekelilingnya. Membina suara daripada rakaman anda sendiri ialah aliran kerja yang berasingan — lihat cara mengklon suara anda dengan AI.
Langkah 1: Buka Pustaka Suara dan baca baris suara
Buka Video AI, pilih avatar yang ingin anda gunakan, dan klik suara semasa di bawah kotak Skrip. Pustaka Suara akan terbuka di atas editor.
Setiap baris membawa empat isyarat yang membolehkan anda meramalkan bunyi sesuatu suara sebelum anda menekan butang main:
- Tag bahasa — bahasa yang dituturkan oleh suara itu.
- Bendera — loghat serantau, bukan bahasa kedua. Suara bahasa Inggeris boleh membawa bendera AS, UK, Kanada dan bendera lain.
- Jantina dan umur — identiti penutur seperti yang dilihat pendengar.
- Ciri dan kes penggunaan — penerangan seperti jelas, mesra, santai, naratif, pendidikan atau media sosial.

Gunakan label untuk menyusun senarai pendek, bukan untuk membuat keputusan muktamad. Dua suara dengan tag yang hampir sama masih boleh berbeza jauh dari segi rentak, tekstur dan tenaga.
Langkah 2: Tapis, cari dan pratonton senarai pendek
Mulakan dengan skop yang cukup luas untuk mendengar perbezaan sebenar, kemudian persempitkan pilihan. Gunakan penapis Bahasa, Jantina, Umur dan Kes Penggunaan semasa anda masih meneroka. Jika anda sudah mengetahui nama sesuatu suara, taipkannya ke dalam medan carian.
- Susun senarai pendek. Tapis atau cari sehingga anda mendapat beberapa calon sahaja, bukan keseluruhan katalog.
- Dengar setiap calon dalam senarai pendek. Klik butang main di sebelah kanan baris suara untuk mendengar sampelnya.
- Jeda dan bandingkan. Klik butang yang sama sekali lagi untuk berhenti sebelum anda memainkan suara seterusnya.

Dengarkan apa yang benar-benar diperlukan oleh video anda: loghat serantau, kejelasan, tenaga, kemesraan, wibawa dan sepantas mana suara itu bergerak melalui satu ayat. Suara yang kedengaran hebat secara berasingan masih boleh tidak sesuai untuk skrip tutorial, jualan, berita atau skrip berteraskan watak.
Langkah 3: Padankan suara dengan kandungan dan audiens anda
Kebanyakan suara latar AI yang mengecewakan bukanlah masalah kualiti, sebaliknya masalah kesesuaian. Sebelum anda menetapkan pilihan, tentukan apa yang perlu dilakukan oleh suara ini untuk video tertentu ini.
| Jika anda menghasilkan | Cari | Elakkan |
|---|---|---|
| Tutorial, video penerangan, kursus | Sebutan yang jelas, rentak yang stabil, kemesraan neutral | Bacaan promosi bertenaga tinggi yang membaca istilah teknikal terlalu laju |
| Iklan, promosi, klip sosial pendek | Tenaga, ketegasan, profil yang yakin dan lebih muda | Naratif perlahan dan terukur yang menghilangkan daya tarikan awal |
| Berita, korporat, kemas kini produk | Wibawa, rentak sekata, tekstur vokal yang minimum | Suara santai atau yang terlalu bergaya watak |
| Penceritaan, temu bual, podcast | Personaliti dan julat ekspresi | Bacaan juruhebah yang datar tanpa dinamik |
| Versi setempat bagi satu video | Loghat serantau asli untuk setiap pasaran | Satu suara Inggeris membaca teks terjemahan |
Loghat ialah tetapan yang paling kerap disalahpilih. Jika audiens anda berada di London tetapi pembentang anda membawa bendera AS, pendengar akan perasan — walaupun setiap perkataan betul. Pilih bendera untuk audiens, bukan sekadar bahasanya.
Langkah 4: Tetapkan kelajuan pertuturan, kemudian tambah jeda
Klik baris suara untuk menggunakannya pada persediaan semasa. Kemudian buka menu kelajuan di sebelah suara yang dipilih dan pilih Perlahan, Normal, atau Pantas.
- Perlahan sesuai untuk penerangan yang mendalam dan sebarang kandungan yang mementingkan kefahaman berbanding kesegeraan.
- Normal ialah asas selamat untuk kebanyakan tutorial, pembentangan, dan video avatar bercakap.
- Pantas menambah tenaga pada promosi pendek dan klip sosial, tetapi skrip yang padat menjadi lebih sukar diikuti.
Kelajuan menetapkan tempo bagi keseluruhan persembahan. Untuk kawalan di dalam ayat, letakkan kursor di tempat rehat yang dikehendaki dan klik kawalan Jeda. Setiap klik menambah 0.5 saat; klik sekali lagi untuk jeda yang lebih panjang.

Petua: tambah jeda di tempat pembentang sebenar akan menarik nafas, bertukar idea, atau membiarkan sesuatu kenyataan meresap. Terlalu banyak jeda akan memecahkan penyampaian, jadi pratonton keseluruhan ayat selepas menyunting, bukan hanya bahagian yang anda ubah.
Langkah 5: Arahkan penyampaian dengan Voice Enhance
Klik Voice Enhance apabila perkataannya sudah tepat tetapi persembahan yang dihasratkan belum jelas. VisionStory menambah isyarat penyampaian untuk emosi, rentak, dan penekanan sambil mengekalkan susunan kata asal anda.
Semak skrip yang telah dipertingkatkan sebelum anda meneruskan. Pilih Kekalkan apabila isyarat itu menepati hasrat anda, atau Buat Asal untuk kembali kepada versi asal. Ciri ini paling berguna apabila skrip memerlukan arahan emosi yang jelas tetapi tidak sepatutnya diubah perkataannya.

Langkah 6: Pratonton skrip sebenar anda sebelum menjana
Klik Pratonton Audio setelah suara, kelajuan, jeda dan sebarang isyarat peningkatan sudah ditetapkan. Dengar keseluruhan rakaman dan jangan hanya menilai beberapa perkataan pertama; periksa sebutan, loghat, rentak, hujung ayat, jeda dan kesesuaian emosi.
Semasa anda masih membandingkan calon, mulakan dengan satu ayat pendek yang mewakili keseluruhan skrip. Apabila senarai pendek tinggal dua atau tiga suara, pratonton petikan yang mengandungi nama, nombor, istilah teknikal atau detik emosi yang paling penting dalam video akhir — di situlah perbezaan antara suara paling ketara.
Kuota pratonton: pratonton audio termasuk kuota aksara percuma yang disegarkan mengikut kitaran 24 jam bergulir. Selepas kuota itu habis digunakan, penjanaan pratonton berharga 1 kredit setiap 500 aksara. Lihat cara kredit VisionStory berfungsi untuk gambaran penuh.
Langkah 7: Jana sekali supaya avatar mengingati suara itu
Memilih suara akan mengubah tetapan editor semasa, tetapi pemilihan sahaja tidak menyimpan suara itu pada avatar. Jana satu video dengan suara yang anda pilih. VisionStory kemudian mengingati gandingan itu dan memulihkannya pada kali berikutnya anda menggunakan avatar yang sama.

Sebab itulah pilihan ini berbaloi dibuat dengan teliti. Setelah avatar dan suara dipasangkan, setiap video akan datang bermula daripada pembentang yang konsisten dan bukannya keputusan baharu setiap kali.
Mengapa suara AI berbunyi seperti robot — dan cara membetulkannya
Apabila suara latar yang dijana terasa sintetik, biasanya puncanya ialah salah satu daripada lima sebab yang boleh dibetulkan, bukan model suara itu sendiri.
- Suara yang salah untuk skrip. Suara naratif yang membaca teks iklan akan berbunyi hambar. Buat senarai pendek semula mengikut Kes Penggunaan sebelum anda menyalahkan kualiti.
- Tiada jeda. Penutur sebenar bernafas. Teks berterusan tanpa sebarang hentian akan berbunyi seperti mesin, jadi tambah jeda setengah saat pada sempadan antara idea.
- Kelajuan ditetapkan sekali lalu dilupakan. Pantas menjadikan ayat yang padat kedengaran kabur; Perlahan pula menjadikan promo pendek terasa lembap. Padankan tempo dengan jenis kandungan.
- Tanda baca yang kabur. Ayat yang berjela-jela, koma yang tertinggal dan singkatan yang tidak dieja penuh semuanya menolak suara ke arah nada mendatar. Kemaskan skrip dahulu.
- Tiada arahan emosi. Jika niat itu tiada dalam teks, suara tidak dapat mengagaknya — dan itulah tujuan Voice Enhance.
Betulkan lima perkara itu, dan kebanyakan aduan tentang suara AI yang berbunyi seperti robot akan hilang tanpa perlu menukar suara langsung.
Jika penyedia menghentikan suara yang anda gunakan
VisionStory memperoleh suara daripada beberapa penyedia, dan sesebuah penyedia boleh mengeluarkan suara daripada katalognya sendiri. Apabila itu berlaku, suara tersebut tidak dapat dipulihkan ke dalam Pustaka Suara awam.
Jika suara yang anda harapkan sudah tiada, cari petikan bersih daripada video terdahulu yang mengandungi suara itu sahaja, dan gunakannya sebagai audio sumber dalam Klon Suara. Klon itu boleh menghasilkan pengganti yang hampir sama, walaupun ia tidak sepatutnya dijangka berbunyi serupa sepenuhnya.

Kebenaran diperlukan: klon hanya audio yang anda miliki atau yang anda ada kebenaran jelas untuk menggunakannya, dan pratonton suara pengganti itu dengan skrip sebenar anda sebelum anda menerbitkannya.
Senarai semak suara AI anda sebelum menjana
- Pilih loghat serantau yang sesuai untuk audiens, bukan sekadar bahasanya.
- Gunakan tag profil untuk membuat senarai pendek, kemudian biarkan telinga anda membuat keputusan.
- Pratonton nama, nombor dan istilah sukar daripada skrip sebenar anda.
- Tetapkan kelajuan keseluruhan sebelum anda menambah jeda setempat.
- Gunakan Voice Enhance hanya apabila penyampaian memerlukan arahan yang lebih jelas.
- Dengar pratonton yang lengkap, bukan ayat pertama sahaja.
- Jana sekali apabila anda mahu avatar mengingati suara tersebut.
- Catatkan nama suara yang dipilih ke dalam nota jenama atau kempen anda.
Setelah suara ditetapkan, selebihnya berjalan pantas. Bawa tetapan yang sama sehingga menjadi video siap dengan cara mencipta avatar bercakap AI, atau buka teks ke pertuturan apabila anda hanya memerlukan bahagian audio sahaja.
