هر ویدیوی هوش مصنوعی با یک متن (اسکریپت) شروع میشود، اما این صدا است که تعیین میکند آن متن چگونه به مخاطب مینشیند. صدا لهجه، سن، بافت، انرژی و شخصیت مجری شما را مشخص میکند — و سرعت، مکثها و نشانههای اجرا تعیین میکنند که نتیجه شبیه صحبت یک انسان باشد یا شبیه ماشینی که از روی کاغذ میخواند.
خلاصهاش این است: صدای هوش مصنوعی را با تطبیق زبان و لهجهٔ منطقهای با مخاطبتان انتخاب کنید، با کمک برچسبهای پروفایل یک فهرست کوتاه بسازید، هر گزینه را با متن خودتان پیشنمایش بگیرید و پیش از تولید ویدیو، اجرا را با سرعت و مکث شکل دهید. ادامهٔ این راهنما همین روند را گامبهگام در VisionStory توضیح میدهد؛ کتابخانه صدای هوش مصنوعی آن بیش از 1,000 صدا به 88 زبان دارد.
این راهنما چه چیزی را پوشش میدهد: Voice Library عمومی و کنترلهای اجرای پیرامون آن. ساختن صدا از روی ضبط صدای خودتان یک فرایند جداگانه است — به چگونه صدای خود را با هوش مصنوعی شبیهسازی کنیم مراجعه کنید.
مرحله 1: Voice Library را باز کنید و ردیف صدا را بخوانید
ویدیوی هوش مصنوعی را باز کنید، آواتار موردنظرتان را انتخاب کنید و روی صدای فعلی در زیر کادر Script کلیک کنید. Voice Library روی ویرایشگر باز میشود.
هر ردیف چهار نشانه دارد که به شما امکان میدهد پیش از زدن دکمهٔ پخش، حدس بزنید صدای گوینده چگونه خواهد بود:
- برچسب زبان — زبانی که صدا به آن صحبت میکند.
- پرچم — نشاندهندهٔ لهجهٔ منطقهای است، نه زبان دوم. صداهای انگلیسی میتوانند پرچم آمریکا، بریتانیا، کانادا و کشورهای دیگر را داشته باشند.
- جنسیت و سن — هویتی که از گوینده برداشت میشود.
- ویژگیها و کاربرد — توصیفهایی مانند شفاف، گرم، محاورهای، روایت، آموزش یا شبکههای اجتماعی.

از برچسبها برای ساختن فهرست کوتاه استفاده کنید، نه برای تصمیم نهایی. دو صدا با برچسبهای تقریباً یکسان میتوانند از نظر ریتم، بافت و انرژی تفاوت زیادی داشته باشند.
مرحله 2: فیلتر کنید، جستوجو کنید و یک فهرست کوتاه را پیشنمایش بگیرید
بهاندازهٔ کافی گسترده شروع کنید تا تفاوتهای واقعی را بشنوید، سپس دایره را تنگتر کنید. تا وقتی هنوز در حال گشتن هستید، از فیلترهای Language (زبان)، Gender (جنسیت)، Age (سن) و Use Case (کاربرد) کمک بگیرید. اگر نام صدایی را از قبل میدانید، بهجای آن نام را در کادر جستوجو تایپ کنید.
- یک فهرست کوتاه بسازید. آنقدر فیلتر یا جستوجو کنید تا بهجای یک فهرست کامل، چند گزینهٔ محدود داشته باشید.
- همهٔ گزینههای فهرست کوتاه را گوش کنید. برای شنیدن نمونه، روی دکمهٔ پخش در سمت راست ردیف صدا کلیک کنید.
- مکث کنید و مقایسه کنید. پیش از پخش نمونهٔ بعدی، دوباره روی همان دکمه کلیک کنید تا پخش متوقف شود.

هنگام گوش دادن به چیزی توجه کنید که ویدیوی شما واقعاً به آن نیاز دارد: لهجهٔ منطقهای، شفافیت، انرژی، گرمی، اقتدار و سرعتی که صدا با آن یک جمله را پیش میبرد. صدایی که بهتنهایی عالی به نظر میرسد، باز هم ممکن است برای یک متن آموزشی، فروش، خبری یا شخصیتمحور مناسب نباشد.
مرحله 3: صدا را با محتوا و مخاطب خود متناسب کنید
بیشتر صداگذاریهای هوش مصنوعی که ناامیدکننده از آب درمیآیند، مشکل کیفیت ندارند؛ مشکل تناسب دارند. پیش از آنکه تصمیم نهایی را بگیرید، مشخص کنید این صدا قرار است برای همین ویدیوی خاص چه کاری انجام دهد.
| اگر در حال ساخت این هستید | دنبال این باشید | از این پرهیز کنید |
|---|---|---|
| آموزشها، ویدیوهای توضیحی، دورههای آموزشی | بیان شفاف، سرعت یکنواخت، لحن گرم و خنثی | اجرای پرانرژی تبلیغاتی که اصطلاحات فنی را با عجله میخواند |
| تبلیغات، معرفیهای تبلیغاتی، کلیپهای کوتاه شبکههای اجتماعی | انرژی، کوبندگی، صدایی بااعتمادبهنفس و جوانتر | روایت آهسته و سنجیدهای که قلاب توجه را از دست میدهد |
| اخبار، محتوای سازمانی، بهروزرسانیهای محصول | اقتدار، ریتم یکنواخت، بافت صوتی حداقلی | صداهای خودمانی یا بهشدت شخصیتمحور |
| داستانگویی، مصاحبهها، پادکستها | شخصیت و دامنه بیانی گسترده | اجرای یکنواخت و بیفرازوفرود در حد گوینده تشریفاتی |
| نسخههای بومیسازیشده از یک ویدیو | لهجه بومی و منطقهای متناسب با هر بازار | یک صدای انگلیسی که متن ترجمهشده را میخواند |
لهجه همان تنظیمی است که بیشتر از همه اشتباه انتخاب میشود. اگر مخاطب شما در لندن باشد و گویندهتان پرچم آمریکا داشته باشد، شنوندگان متوجه میشوند — حتی وقتی تکتک کلمات درست باشند. پرچم را متناسب با مخاطب انتخاب کنید، نه فقط بر اساس زبان.
مرحله 4: سرعت گفتار را تنظیم کنید، سپس مکث اضافه کنید
روی ردیف یک صدا کلیک کنید تا روی تنظیمات فعلی اعمال شود. سپس منوی سرعت کنار صدای انتخابشده را باز کنید و Slow (آهسته)، Normal (عادی) یا Fast (سریع) را انتخاب کنید.
- Slow برای توضیحهای تأملبرانگیز و هر محتوایی مناسب است که در آن درک مطلب مهمتر از شتاب است.
- Normal گزینه پایه و مطمئن برای بیشتر آموزشها، ارائهها و ویدیوهای آواتار سخنگو است.
- Fast به تیزرهای کوتاه و کلیپهای شبکههای اجتماعی انرژی میدهد، اما دنبال کردن متنهای فشرده را دشوارتر میکند.
سرعت، ریتم کل اجرا را تعیین میکند. برای کنترل درون یک جمله، مکاننما را دقیقاً همانجا بگذارید که مکث باید در آن باشد و روی کنترل Pause کلیک کنید. هر کلیک 0.5 ثانیه اضافه میکند؛ برای مکث طولانیتر دوباره کلیک کنید.

نکته کاربردی: مکثها را جایی اضافه کنید که یک گوینده واقعی نفس میکشد، موضوع را عوض میکند یا اجازه میدهد یک نکته جا بیفتد. مکث بیش از حد، اجرا را تکهتکه میکند؛ بنابراین پس از ویرایش، کل جمله را پیشنمایش بگیرید، نه فقط بخشی را که تغییر دادهاید.
مرحله 5: شیوه اجرا را با Voice Enhance هدایت کنید
وقتی کلمات درست هستند اما اجرای موردنظرتان هنوز بهروشنی مشخص نیست، روی Voice Enhance کلیک کنید. VisionStory نشانههای اجرایی برای احساس، ریتم و تأکید اضافه میکند و در عین حال متن اصلی شما را حفظ میکند.
پیش از ادامه، متن بهبودیافته را بررسی کنید. اگر نشانهها با منظور شما همخوانی داشت Keep را انتخاب کنید، یا برای بازگشت به نسخه اصلی Undo را بزنید. این قابلیت وقتی واقعاً به کار میآید که متن به جهتدهی احساسی روشنی نیاز دارد اما نباید بازنویسی شود.

مرحله 6: پیش از تولید، متن واقعی خود را پیشنمایش بگیرید
وقتی صدا، سرعت، مکثها و نشانههای Voice Enhance تنظیم شد، روی Preview Audio کلیک کنید. بهجای قضاوت بر اساس چند کلمهٔ اول، کل نسخه را گوش کنید و تلفظ، لهجه، ریتم، پایان جملهها، مکثها و تناسب احساسی را بررسی کنید.
وقتی هنوز در حال مقایسهٔ گزینهها هستید، با یک جملهٔ کوتاه و نماینده شروع کنید. بهمحض اینکه فهرست کوتاه به دو یا سه صدا رسید، بخشی را پیشنمایش بگیرید که شامل نامها، اعداد، اصطلاحات تخصصی یا لحظههای احساسی مهم ویدیوی نهایی باشد — تفاوت صداها دقیقاً همانجا مشخص میشود.
سهمیهٔ پیشنمایش: پیشنمایش صدا شامل سهمیهٔ رایگانی از کاراکتر است که در چرخهای متحرک و 24 ساعته تازه میشود. پس از مصرف این سهمیه، تولید پیشنمایش 1 اعتبار بهازای هر 500 کاراکتر هزینه دارد. برای تصویر کامل، نحوهٔ کار اعتبار VisionStory را ببینید.
مرحله 7: یکبار ویدیو بسازید تا آواتار صدا را به خاطر بسپارد
انتخاب یک صدا، تنظیمات فعلی ویرایشگر را تغییر میدهد، اما انتخاب بهتنهایی آن صدا را روی آواتار ذخیره نمیکند. با صدایی که انتخاب کردهاید یک ویدیو بسازید. آنگاه VisionStory این جفتشدن را به خاطر میسپارد و دفعهٔ بعد که از همان آواتار استفاده کنید، آن را بازیابی میکند.

به همین دلیل است که ارزش دارد این انتخاب را با دقت انجام دهید. وقتی یک آواتار و یک صدا با هم جفت شدند، هر ویدیوی بعدی بهجای یک تصمیم تازه، از یک گویندهٔ ثابت آغاز میشود.
چرا صداهای هوش مصنوعی رباتیک به گوش میرسند — و چطور آن را برطرف کنیم
وقتی یک صداگذاری تولیدشده مصنوعی به نظر میرسد، معمولاً یکی از پنج علت قابلرفع مقصر است، نه خودِ مدل صدا.
- صدای نامناسب برای متن. صدایی که برای روایت ساخته شده، هنگام خواندن متن تبلیغاتی بیروح به نظر میرسد. پیش از آنکه کیفیت را مقصر بدانید، دوباره بر اساس کاربرد فهرست کوتاه بسازید.
- نبودِ مکث. گویندگان واقعی نفس میکشند. دیواری از متن بدون هیچ وقفهای مثل ماشین خوانده میشود؛ پس در مرز بین ایدهها مکثهای نیمثانیهای اضافه کنید.
- سرعتی که یکبار تنظیم و بعد فراموش شده است. سریع، جملههای فشرده را نامفهوم میکند و آهسته، یک تیزر کوتاه را کِش میدهد. تمپو را با نوع محتوا هماهنگ کنید.
- نشانهگذاری مبهم. جملههای بیپایان، ویرگولهای جاافتاده و اختصارهای بازنشده، همگی صدا را به سمت یکنواختی میبرند. اول متن را تمیز کنید.
- نبودِ جهتدهی احساسی. اگر نیت در خودِ متن نباشد، صدا نمیتواند آن را حدس بزند — و کاربرد Voice Enhance دقیقاً همین است.
این پنج مورد را اصلاح کنید تا بیشتر گلایهها دربارهٔ رباتیک بودن صداهای هوش مصنوعی، بدون تغییر دادن خودِ صدا از بین برود.
اگر ارائهدهنده، صدایی را که استفاده میکنید از دسترس خارج کند
VisionStory صداها را از چند ارائهدهنده تأمین میکند و ممکن است یک ارائهدهنده صدایی را از کاتالوگ خودش حذف کند. در این حالت، آن صدا دیگر قابل بازگرداندن به Voice Library عمومی نیست.
اگر صدایی که به آن تکیه کرده بودید دیگر در دسترس نیست، بخشی تمیز از یکی از ویدیوهای قبلی خود را پیدا کنید که فقط همان صدا در آن شنیده میشود و آن را بهعنوان صدای منبع در Voice Clone استفاده کنید. شبیهسازی میتواند جایگزینی نزدیک بسازد، هرچند نباید انتظار داشت کاملاً یکسان به گوش برسد.

نیاز به مجوز: فقط صدایی را شبیهسازی کنید که مالک آن هستید یا مجوز روشنی برای استفاده از آن دارید، و پیش از انتشار، صدای جایگزین را با متن موردنظر خود پیشنمایش بگیرید.
چکلیست صدای هوش مصنوعی پیش از تولید
- لهجه منطقهای مناسب مخاطب را انتخاب کنید، نه فقط زبان را.
- با برچسبهای پروفایل یک فهرست کوتاه بسازید، سپس تصمیم نهایی را با گوش خود بگیرید.
- نامها، اعداد و اصطلاحهای دشوارِ متن واقعی خود را پیشنمایش بگیرید.
- سرعت کلی را پیش از افزودن مکثهای موضعی تنظیم کنید.
- از Voice Enhance فقط زمانی استفاده کنید که اجرا به راهنمایی روشنتری نیاز دارد.
- یک پیشنمایش کامل را گوش دهید، نه فقط جمله اول را.
- یک بار ویدیو تولید کنید تا آواتار صدا را به خاطر بسپارد.
- نام صدای انتخابشده را در یادداشتهای برند یا کمپین خود ثبت کنید.
وقتی صدا نهایی شد، بقیه کار سریع پیش میرود. همین تنظیمات را با نحوه ساخت آواتار سخنگوی هوش مصنوعی تا ویدیوی نهایی ادامه دهید، یا اگر فقط به بخش صوتی نیاز دارید، تبدیل متن به گفتار را باز کنید.
