فارسی

هر ویدیوی هوش مصنوعی با یک متن (اسکریپت) شروع می‌شود، اما این صدا است که تعیین می‌کند آن متن چگونه به مخاطب می‌نشیند. صدا لهجه، سن، بافت، انرژی و شخصیت مجری شما را مشخص می‌کند — و سرعت، مکث‌ها و نشانه‌های اجرا تعیین می‌کنند که نتیجه شبیه صحبت یک انسان باشد یا شبیه ماشینی که از روی کاغذ می‌خواند.

خلاصه‌اش این است: صدای هوش مصنوعی را با تطبیق زبان و لهجهٔ منطقه‌ای با مخاطبتان انتخاب کنید، با کمک برچسب‌های پروفایل یک فهرست کوتاه بسازید، هر گزینه را با متن خودتان پیش‌نمایش بگیرید و پیش از تولید ویدیو، اجرا را با سرعت و مکث شکل دهید. ادامهٔ این راهنما همین روند را گام‌به‌گام در VisionStory توضیح می‌دهد؛ کتابخانه صدای هوش مصنوعی آن بیش از 1,000 صدا به 88 زبان دارد.

این راهنما چه چیزی را پوشش می‌دهد: Voice Library عمومی و کنترل‌های اجرای پیرامون آن. ساختن صدا از روی ضبط صدای خودتان یک فرایند جداگانه است — به چگونه صدای خود را با هوش مصنوعی شبیه‌سازی کنیم مراجعه کنید.

مرحله 1: Voice Library را باز کنید و ردیف صدا را بخوانید

ویدیوی هوش مصنوعی را باز کنید، آواتار موردنظرتان را انتخاب کنید و روی صدای فعلی در زیر کادر Script کلیک کنید. Voice Library روی ویرایشگر باز می‌شود.

هر ردیف چهار نشانه دارد که به شما امکان می‌دهد پیش از زدن دکمهٔ پخش، حدس بزنید صدای گوینده چگونه خواهد بود:

  • برچسب زبان — زبانی که صدا به آن صحبت می‌کند.
  • پرچم — نشان‌دهندهٔ لهجهٔ منطقه‌ای است، نه زبان دوم. صداهای انگلیسی می‌توانند پرچم آمریکا، بریتانیا، کانادا و کشورهای دیگر را داشته باشند.
  • جنسیت و سن — هویتی که از گوینده برداشت می‌شود.
  • ویژگی‌ها و کاربرد — توصیف‌هایی مانند شفاف، گرم، محاوره‌ای، روایت، آموزش یا شبکه‌های اجتماعی.
راهنمای برچسب‌های زبان، لهجهٔ منطقه‌ای، جنسیت، سن، ویژگی‌ها و کاربرد روی یک ردیف صدا در VisionStory
پرچم همان لهجهٔ منطقه‌ای است — برچسبی که وقتی چند صدا در یک زبان را مقایسه می‌کنید، بیش از همه اهمیت دارد.

از برچسب‌ها برای ساختن فهرست کوتاه استفاده کنید، نه برای تصمیم نهایی. دو صدا با برچسب‌های تقریباً یکسان می‌توانند از نظر ریتم، بافت و انرژی تفاوت زیادی داشته باشند.

مرحله 2: فیلتر کنید، جست‌وجو کنید و یک فهرست کوتاه را پیش‌نمایش بگیرید

به‌اندازهٔ کافی گسترده شروع کنید تا تفاوت‌های واقعی را بشنوید، سپس دایره را تنگ‌تر کنید. تا وقتی هنوز در حال گشتن هستید، از فیلترهای Language (زبان)، Gender (جنسیت)، Age (سن) و Use Case (کاربرد) کمک بگیرید. اگر نام صدایی را از قبل می‌دانید، به‌جای آن نام را در کادر جست‌وجو تایپ کنید.

  1. یک فهرست کوتاه بسازید. آن‌قدر فیلتر یا جست‌وجو کنید تا به‌جای یک فهرست کامل، چند گزینهٔ محدود داشته باشید.
  2. همهٔ گزینه‌های فهرست کوتاه را گوش کنید. برای شنیدن نمونه، روی دکمهٔ پخش در سمت راست ردیف صدا کلیک کنید.
  3. مکث کنید و مقایسه کنید. پیش از پخش نمونهٔ بعدی، دوباره روی همان دکمه کلیک کنید تا پخش متوقف شود.
Voice Library در VisionStory با کادر جست‌وجو، فیلترهای Language، Gender، Age و Use Case و دکمهٔ پخش روی هر ردیف صدا
جست‌وجو و فیلترها کتابخانه‌ای با 1,000 صدا را قابل مدیریت می‌کنند؛ اما این پیش‌نمایش است که تناسب صدا را تأیید می‌کند.

هنگام گوش دادن به چیزی توجه کنید که ویدیوی شما واقعاً به آن نیاز دارد: لهجهٔ منطقه‌ای، شفافیت، انرژی، گرمی، اقتدار و سرعتی که صدا با آن یک جمله را پیش می‌برد. صدایی که به‌تنهایی عالی به نظر می‌رسد، باز هم ممکن است برای یک متن آموزشی، فروش، خبری یا شخصیت‌محور مناسب نباشد.

مرحله 3: صدا را با محتوا و مخاطب خود متناسب کنید

بیشتر صداگذاری‌های هوش مصنوعی که ناامیدکننده از آب درمی‌آیند، مشکل کیفیت ندارند؛ مشکل تناسب دارند. پیش از آنکه تصمیم نهایی را بگیرید، مشخص کنید این صدا قرار است برای همین ویدیوی خاص چه کاری انجام دهد.

اگر در حال ساخت این هستیددنبال این باشیداز این پرهیز کنید
آموزش‌ها، ویدیوهای توضیحی، دوره‌های آموزشیبیان شفاف، سرعت یکنواخت، لحن گرم و خنثیاجرای پرانرژی تبلیغاتی که اصطلاحات فنی را با عجله می‌خواند
تبلیغات، معرفی‌های تبلیغاتی، کلیپ‌های کوتاه شبکه‌های اجتماعیانرژی، کوبندگی، صدایی بااعتمادبه‌نفس و جوان‌ترروایت آهسته و سنجیده‌ای که قلاب توجه را از دست می‌دهد
اخبار، محتوای سازمانی، به‌روزرسانی‌های محصولاقتدار، ریتم یکنواخت، بافت صوتی حداقلیصداهای خودمانی یا به‌شدت شخصیت‌محور
داستان‌گویی، مصاحبه‌ها، پادکست‌هاشخصیت و دامنه بیانی گستردهاجرای یکنواخت و بی‌فرازوفرود در حد گوینده تشریفاتی
نسخه‌های بومی‌سازی‌شده از یک ویدیولهجه بومی و منطقه‌ای متناسب با هر بازاریک صدای انگلیسی که متن ترجمه‌شده را می‌خواند

لهجه همان تنظیمی است که بیشتر از همه اشتباه انتخاب می‌شود. اگر مخاطب شما در لندن باشد و گوینده‌تان پرچم آمریکا داشته باشد، شنوندگان متوجه می‌شوند — حتی وقتی تک‌تک کلمات درست باشند. پرچم را متناسب با مخاطب انتخاب کنید، نه فقط بر اساس زبان.

مرحله 4: سرعت گفتار را تنظیم کنید، سپس مکث اضافه کنید

روی ردیف یک صدا کلیک کنید تا روی تنظیمات فعلی اعمال شود. سپس منوی سرعت کنار صدای انتخاب‌شده را باز کنید و Slow (آهسته)، Normal (عادی) یا Fast (سریع) را انتخاب کنید.

  • Slow برای توضیح‌های تأمل‌برانگیز و هر محتوایی مناسب است که در آن درک مطلب مهم‌تر از شتاب است.
  • Normal گزینه پایه و مطمئن برای بیشتر آموزش‌ها، ارائه‌ها و ویدیوهای آواتار سخنگو است.
  • Fast به تیزرهای کوتاه و کلیپ‌های شبکه‌های اجتماعی انرژی می‌دهد، اما دنبال کردن متن‌های فشرده را دشوارتر می‌کند.

سرعت، ریتم کل اجرا را تعیین می‌کند. برای کنترل درون یک جمله، مکان‌نما را دقیقاً همان‌جا بگذارید که مکث باید در آن باشد و روی کنترل Pause کلیک کنید. هر کلیک 0.5 ثانیه اضافه می‌کند؛ برای مکث طولانی‌تر دوباره کلیک کنید.

مقایسه سرعت‌های گفتار Slow، Normal و Fast در کنار یک مکث نیم‌ثانیه‌ای که در متن درج شده است
از سرعت برای ریتم کلی استفاده کنید و از مکث‌ها برای همان لحظه‌های خاصی که معنا را منتقل می‌کنند.

نکته کاربردی: مکث‌ها را جایی اضافه کنید که یک گوینده واقعی نفس می‌کشد، موضوع را عوض می‌کند یا اجازه می‌دهد یک نکته جا بیفتد. مکث بیش از حد، اجرا را تکه‌تکه می‌کند؛ بنابراین پس از ویرایش، کل جمله را پیش‌نمایش بگیرید، نه فقط بخشی را که تغییر داده‌اید.

مرحله 5: شیوه اجرا را با Voice Enhance هدایت کنید

وقتی کلمات درست هستند اما اجرای موردنظرتان هنوز به‌روشنی مشخص نیست، روی Voice Enhance کلیک کنید. VisionStory نشانه‌های اجرایی برای احساس، ریتم و تأکید اضافه می‌کند و در عین حال متن اصلی شما را حفظ می‌کند.

پیش از ادامه، متن بهبودیافته را بررسی کنید. اگر نشانه‌ها با منظور شما هم‌خوانی داشت Keep را انتخاب کنید، یا برای بازگشت به نسخه اصلی Undo را بزنید. این قابلیت وقتی واقعاً به کار می‌آید که متن به جهت‌دهی احساسی روشنی نیاز دارد اما نباید بازنویسی شود.

مقایسه پیش و پس از استفاده از Voice Enhance که نشانه‌های اجرای آرام و سنجیده را بدون تغییر کلمات اضافه می‌کند
پیام همچنان از آنِ شماست؛ آنچه جهت‌دهی می‌شود، نحوه اجراست.

مرحله 6: پیش از تولید، متن واقعی خود را پیش‌نمایش بگیرید

وقتی صدا، سرعت، مکث‌ها و نشانه‌های Voice Enhance تنظیم شد، روی Preview Audio کلیک کنید. به‌جای قضاوت بر اساس چند کلمهٔ اول، کل نسخه را گوش کنید و تلفظ، لهجه، ریتم، پایان جمله‌ها، مکث‌ها و تناسب احساسی را بررسی کنید.

وقتی هنوز در حال مقایسهٔ گزینه‌ها هستید، با یک جملهٔ کوتاه و نماینده شروع کنید. به‌محض اینکه فهرست کوتاه به دو یا سه صدا رسید، بخشی را پیش‌نمایش بگیرید که شامل نام‌ها، اعداد، اصطلاحات تخصصی یا لحظه‌های احساسی مهم ویدیوی نهایی باشد — تفاوت صداها دقیقاً همان‌جا مشخص می‌شود.

سهمیهٔ پیش‌نمایش: پیش‌نمایش صدا شامل سهمیهٔ رایگانی از کاراکتر است که در چرخه‌ای متحرک و 24 ساعته تازه می‌شود. پس از مصرف این سهمیه، تولید پیش‌نمایش 1 اعتبار به‌ازای هر 500 کاراکتر هزینه دارد. برای تصویر کامل، نحوهٔ کار اعتبار VisionStory را ببینید.

مرحله 7: یک‌بار ویدیو بسازید تا آواتار صدا را به خاطر بسپارد

انتخاب یک صدا، تنظیمات فعلی ویرایشگر را تغییر می‌دهد، اما انتخاب به‌تنهایی آن صدا را روی آواتار ذخیره نمی‌کند. با صدایی که انتخاب کرده‌اید یک ویدیو بسازید. آنگاه VisionStory این جفت‌شدن را به خاطر می‌سپارد و دفعهٔ بعد که از همان آواتار استفاده کنید، آن را بازیابی می‌کند.

نمودار سه‌مرحله‌ای که نشان می‌دهد صدا انتخاب می‌شود، پس از ساخت یک ویدیو ذخیره می‌شود و هنگام استفادهٔ دوباره از آواتار بازیابی می‌گردد
مرز کار، همان تولید ویدیو است: صدا را انتخاب کنید، یک‌بار ویدیو بسازید و سپس از آواتار با همان صدای پیوست‌شده دوباره استفاده کنید.

به همین دلیل است که ارزش دارد این انتخاب را با دقت انجام دهید. وقتی یک آواتار و یک صدا با هم جفت شدند، هر ویدیوی بعدی به‌جای یک تصمیم تازه، از یک گویندهٔ ثابت آغاز می‌شود.

چرا صداهای هوش مصنوعی رباتیک به گوش می‌رسند — و چطور آن را برطرف کنیم

وقتی یک صداگذاری تولیدشده مصنوعی به نظر می‌رسد، معمولاً یکی از پنج علت قابل‌رفع مقصر است، نه خودِ مدل صدا.

  • صدای نامناسب برای متن. صدایی که برای روایت ساخته شده، هنگام خواندن متن تبلیغاتی بی‌روح به نظر می‌رسد. پیش از آنکه کیفیت را مقصر بدانید، دوباره بر اساس کاربرد فهرست کوتاه بسازید.
  • نبودِ مکث. گویندگان واقعی نفس می‌کشند. دیواری از متن بدون هیچ وقفه‌ای مثل ماشین خوانده می‌شود؛ پس در مرز بین ایده‌ها مکث‌های نیم‌ثانیه‌ای اضافه کنید.
  • سرعتی که یک‌بار تنظیم و بعد فراموش شده است. سریع، جمله‌های فشرده را نامفهوم می‌کند و آهسته، یک تیزر کوتاه را کِش می‌دهد. تمپو را با نوع محتوا هماهنگ کنید.
  • نشانه‌گذاری مبهم. جمله‌های بی‌پایان، ویرگول‌های جاافتاده و اختصارهای بازنشده، همگی صدا را به سمت یکنواختی می‌برند. اول متن را تمیز کنید.
  • نبودِ جهت‌دهی احساسی. اگر نیت در خودِ متن نباشد، صدا نمی‌تواند آن را حدس بزند — و کاربرد Voice Enhance دقیقاً همین است.

این پنج مورد را اصلاح کنید تا بیشتر گلایه‌ها دربارهٔ رباتیک بودن صداهای هوش مصنوعی، بدون تغییر دادن خودِ صدا از بین برود.

اگر ارائه‌دهنده، صدایی را که استفاده می‌کنید از دسترس خارج کند

VisionStory صداها را از چند ارائه‌دهنده تأمین می‌کند و ممکن است یک ارائه‌دهنده صدایی را از کاتالوگ خودش حذف کند. در این حالت، آن صدا دیگر قابل بازگرداندن به Voice Library عمومی نیست.

اگر صدایی که به آن تکیه کرده بودید دیگر در دسترس نیست، بخشی تمیز از یکی از ویدیوهای قبلی خود را پیدا کنید که فقط همان صدا در آن شنیده می‌شود و آن را به‌عنوان صدای منبع در Voice Clone استفاده کنید. شبیه‌سازی می‌تواند جایگزینی نزدیک بسازد، هرچند نباید انتظار داشت کاملاً یکسان به گوش برسد.

نمودار فرایندی که نشان می‌دهد چگونه صدای تمیز یک ویدیوی قبلی می‌تواند منبع ساخت یک شبیه‌سازی صدای جایگزین مشابه باشد
یک ویدیوی تأییدشده قبلی می‌تواند همان صدای تمیزی را فراهم کند که هنگام حذف شدن یک صدا از کاتالوگ، پیوستگی را حفظ می‌کند.

نیاز به مجوز: فقط صدایی را شبیه‌سازی کنید که مالک آن هستید یا مجوز روشنی برای استفاده از آن دارید، و پیش از انتشار، صدای جایگزین را با متن موردنظر خود پیش‌نمایش بگیرید.

چک‌لیست صدای هوش مصنوعی پیش از تولید

  • لهجه منطقه‌ای مناسب مخاطب را انتخاب کنید، نه فقط زبان را.
  • با برچسب‌های پروفایل یک فهرست کوتاه بسازید، سپس تصمیم نهایی را با گوش خود بگیرید.
  • نام‌ها، اعداد و اصطلاح‌های دشوارِ متن واقعی خود را پیش‌نمایش بگیرید.
  • سرعت کلی را پیش از افزودن مکث‌های موضعی تنظیم کنید.
  • از Voice Enhance فقط زمانی استفاده کنید که اجرا به راهنمایی روشن‌تری نیاز دارد.
  • یک پیش‌نمایش کامل را گوش دهید، نه فقط جمله اول را.
  • یک بار ویدیو تولید کنید تا آواتار صدا را به خاطر بسپارد.
  • نام صدای انتخاب‌شده را در یادداشت‌های برند یا کمپین خود ثبت کنید.

وقتی صدا نهایی شد، بقیه کار سریع پیش می‌رود. همین تنظیمات را با نحوه ساخت آواتار سخنگوی هوش مصنوعی تا ویدیوی نهایی ادامه دهید، یا اگر فقط به بخش صوتی نیاز دارید، تبدیل متن به گفتار را باز کنید.

سوالات متداول

  • از مخاطب شروع کنید: زبان و لهجهٔ منطقه‌ای را که پرچم نشان می‌دهد متناسب با مخاطب خود انتخاب کنید، سپس با برچسب‌های جنسیت، سن، ویژگی و کاربرد، فهرست کوتاهی از چند گزینه بسازید. هر گزینه را به‌جای یک نمونه عمومی، با جمله‌ای از متن واقعی خودتان پیش‌نمایش بگیرید و صدایی را انتخاب کنید که ریتم، انرژی و گرمای آن با نوع محتوا جور باشد. در پایان، سرعت گفتار را تنظیم کنید و مکث اضافه کنید تا شیوه اجرا با هدف شما هماهنگ شود.