فارسی

تغییر صدا با هوش مصنوعی برای همان لحظه‌ای است که اجرا عالی است اما صدا نه. شما از قبل یک ضبط دارید — یک روایت اولیه، دیالوگِ یک کاراکتر، یک ترکِ گوینده/سخنگو — و بدون اینکه حتی یک خط را دوباره ضبط کنید، به یک هویت صوتی متفاوت نیاز دارید. VisionStory اجرا را به یک صدای هدف تبدیل می‌کند و در همان اجرا، با آن یک آواتار سخنگو را به حرکت درمی‌آورد.

در این آموزش، یک روایت محصولِ انگلیسی 10 ثانیه‌ای را وارد می‌کنیم، آن را به Anika – Sweet and Lively تبدیل می‌کنیم و یک ویدیوی سخنگو با نسبت 16:9 و 1080p رندر می‌گیریم. قبل از شروع، مطمئن شوید حق استفاده از ضبط، ویدیو، تصویر کاراکتر و صدای هدفی را که می‌خواهید استفاده کنید دارید.

مرحله 1: آواتار را انتخاب کنید، سپس به Import بروید

فضای کاری ویدیوی هوش مصنوعی را باز کنید و یک ارائه‌دهنده دیجیتال انتخاب کنید که با خروجی نهایی هماهنگ باشد — از کتابخانه کاراکترها، یا با آپلود عکسی که حق استفاده از آن را دارید. سپس از سمت راست به تب Import بروید تا یک ضبط یا ترکِ صوتیِ یک ویدیو را وارد کنید.

VisionStory در حال حاضر فایل‌های AVI، MP3، MP4، M4A، WAV و MOV را وارد می‌کند. اگر هدف فقط جایگزین‌کردن صدای روایت است، یک فایل صوتیِ تمیز منبع بهتری است؛ اما اگر صدا داخل یک ویدیوی موجود است، خودِ ویدیو را مستقیماً با یکی از فرمت‌های پشتیبانی‌شده وارد کنید.

Choosing a digital presenter and opening the Import audio panel in the VisionStory AI Video workspace
اول کاراکتر روی صفحه را قطعی کنید، بعد Import — اجرای واردشده ویدیوی سخنگوی این آواتار را هدایت می‌کند.

مرحله 2: ضبط را وارد کنید و بخش قابل استفاده را بررسی کنید

روی ناحیه آپلود کلیک کنید و ضبط یا ویدیوی منبع را وارد کنید. پنل شکل موج، مدت‌زمان کل و بازه انتخاب‌شده را نشان می‌دهد — اینجا کل بازه 00:00–00:10 از یک روایت 10 ثانیه‌ای.

یک‌بار نسخه اصلی را گوش دهید و مطمئن شوید ابتدا و انتهای فایل بریده نشده است. اگر نویز واضحِ محیط وجود دارد، حذف نویز را فعال کنید — اما دنبال سکوتِ مطلق نباشید؛ حذف نویزِ بیش از حد نفس‌ها، هجاهای نرم و جزئیات احساسی را از بین می‌برد؛ همان چیزهایی که باعث می‌شود صدای تبدیل‌شده انسانی به نظر برسد.

The VisionStory Import panel showing the loaded audio waveform, duration, Remove Noise, and the Change Voice entry
نام فایل، طول و بازه انتخاب‌شده را چک کنید، درباره حذف نویز تصمیم بگیرید، سپس برای انتخاب صدای هدف روی Change Voice کلیک کنید.

مرحله 3: صدای هدف را از Voice Library انتخاب کنید

برای باز کردن Voice Library روی Change Voice کلیک کنید. بر اساس Language، Gender، Age و Use Case فیلتر کنید و با دکمه پخش روی هر کارت صدا، گزینه‌ها را پیش‌نمایش بگیرید.

در این مثال، Anika انتخاب می‌شود تا یک روایت محصولِ تخت و بی‌روح را به صدایی زنانه، روشن‌تر و مناسب شبکه‌های اجتماعی تبدیل کند. تبلیغات، آموزش، داستان‌های کاراکتری و ویدیوهای توضیحی هرکدام وزن متفاوتی به وضوح، انرژی و سن می‌دهند — بر اساس کاری که محتوا باید انجام بدهد انتخاب کنید، نه صرفاً اینکه کدام نمونه خوشایندتر است. روش کامل انتخاب در how to choose an AI voice آمده است.

Filtering the VisionStory Voice Library by language, gender, age, and use case to pick a target AI voice
چند گزینه را پیش‌نمایش و مقایسه کنید، سپس صدایی را انتخاب کنید که با هدف محتوا، کاراکتر و مخاطب هماهنگ باشد.

مرحله 4: صدای هدف و تنظیمات خروجی را تأیید کنید

حالا که به صفحه ساخت برگشته‌اید، کنترل Change Voice صدای هدف انتخاب‌شده را نشان می‌دهد. بقیه تنظیمات را هم انجام دهید: آواتار، نسبت تصویر، مدل ویدیو و وضوح تصویر. در این مثال به 16:9 با V-Character 4.0 در 1080p تغییر می‌دهیم — مناسب برای یک ویدیوی توضیحی محصول به صورت افقی یا یوتیوب.

تغییر صدا فقط هویت صوتی را عوض می‌کند؛ قرار نیست بهترین ارائه‌دهنده یا کادربندی را به جای شما انتخاب کند. قبل از تولید، صدای هدف را با سنِ ظاهری آواتار، بیان جنسیت و لحن محتوا تطبیق دهید — اگر با هم نمی‌خوانند، به Voice Library یا کتابخانه کاراکترها برگردید.

VisionStory showing the selected Anika target voice with 16:9, V-Character 4.0, and 1080p output settings
صفحه، صدای انتخاب‌شده را شفاف نشان می‌دهد — همین حالا نسبت، مدل و وضوح تصویر را تأیید کنید تا بعداً مجبور به رندر مجدد نشوید.

مرحله 5: تولید کنید، سپس ویدیوی تغییرصدا داده‌شده را بازبینی کنید

روی Generate Talking Video کلیک کنید. VisionStory اجرای اصلی را به صدای هدف تبدیل می‌کند و لیپ‌سینک و حالت‌های چهره آواتار را با همان صدا هدایت می‌کند. وقتی رندر آماده شد، آن را کامل پخش کنید.

به اسم‌های خاص، هجاهای نرم، مکث‌ها و حسِ پایان جمله گوش دهید و در بخش‌های سریع، حرکت دهان را زیر نظر بگیرید. اگر صدا با کاراکتر یا محتوا سازگار نیست، برگردید و صدای هدف را عوض کنید. اگر مشکل نویز یا برش بد است، صدای منبع را اصلاح کنید — تبدیل صدا نمی‌تواند مواد خراب را نجات دهد.

Playing back a finished AI voice-changed avatar spokesperson video in VisionStory
بازبینی نهایی باید روی ویدیوی کامل باشد، نه نمونه داخل کتابخانه: هویت صدا، اجرای اصلی، آواتار و لیپ‌سینک باید با هم جور دربیایند.

مشکلات رایج و روش رفع آن‌ها

  • صدای تبدیل‌شده کدر یا پرنویز است. منبع را از نظر نویز پس‌زمینه، کلیپ‌شدن و حجم پایین بررسی کنید؛ حذف نویز را فعال کنید یا تمیزتر دوباره ضبط کنید. تبدیل نمی‌تواند فایل‌هایی را که شدیداً دچار اعوجاج شده‌اند ترمیم کند.
  • صدا طبیعی است اما به آواتار نمی‌آید. دوباره صدایی نزدیک‌تر به سن کاراکتر، بیان جنسیت و انرژی انتخاب کنید — یا آواتار را عوض کنید. صدا و کاراکتر با هم و به‌عنوان یک واحد بررسی می‌شوند.
  • احساس با ضبط اصلی فرق دارد. تبدیل، ریتم و نشانه‌های احساسی اجرا را حفظ می‌کند، اما صداها از نظر طنین و دامنه بیان متفاوت‌اند. چند گزینه را مقایسه کنید؛ اگر لازم شد اجرای واضح‌تری دوباره ضبط کنید.
  • لیپ‌سینک در جمله‌های سریع شل می‌شود. منبع را از نظر تندگویی، نامفهوم‌گویی یا چسبیدن کلمات به هم بررسی کنید. جمله‌های کوتاه‌تر و یک برداشت تمیز، بهتر از امتحان‌کردن صداهای بیشتر است.

یک ویدیوی تغییرصدا داده‌شده و قابل استفاده، هرگز فقط «صدای A به جای صدای B» نیست. نتیجه از یک اجرای منبع تمیز، یک صدای هدف مناسب، یک آواتار هماهنگ و یک بازبینی کاملِ ویدیوی نهایی به دست می‌آید. اول اجرا را قطعی کنید، دوم صدا را انتخاب کنید و در آخر لیپ‌سینک و کاراکتر را ارزیابی کنید — این ترتیب بیشترین صرفه‌جویی را در ضبط دوباره دارد. اگر به‌جای آن می‌خواهید صدای قابل استفاده مجددِ خودتان را بسازید، cloning your voice with AI را ببینید.

سوالات متداول

  • تغییر صدا با هوش مصنوعی، صدای یک ضبط موجود یا ترک ویدیو را به صدای هدفِ انتخابی تبدیل می‌کند و در عین حال ریتم، مکث‌ها و احساس اجرای اصلی را حفظ می‌کند. VisionStory ترکِ تبدیل‌شده را مستقیم وارد ویدیوی سخنگوی آواتار می‌کند.