فارسی

این آموزش را در یوتیوب تماشا کنید

YouTube

می‌خواهید یک عکس ثابت را سخنگو کنید—مثل یک پرتره که دهانش را باز می‌کند، پلک می‌زند و هر چیزی را که تایپ کنید می‌گوید؟ با VisionStory دقیقاً می‌توانید همین کار را فقط با یک تصویر، مستقیم در مرورگرتان انجام دهید؛ بدون دوربین و بدون هیچ تجربه‌ای در تدوین. ویدیوی بالا کل فرایند را نشان می‌دهد و راهنمای مرحله‌به‌مرحله‌ی پایین هم همه بخش‌ها را با جزئیات پوشش می‌دهد.

در این مسیر، یک پرتره آپلود می‌کنید و آن را به‌عنوان آواتار قابل‌استفاده مجددِ خودتان آماده می‌کنید. کاربران دیگر نمی‌توانند آن را ببینند و شما می‌توانید برای ویدیوهای بعدی دوباره همان را انتخاب کنید، بدون اینکه هر بار همان تصویر را آپلود کنید. همه‌چیز با یک حساب رایگان داخل ابزار عکس سخنگوی VisionStory اجرا می‌شود.

مرحله 1: یک پرتره واضح آپلود کنید

AI Video را باز کنید. در پنل کاراکترها، Upload را انتخاب کنید و یک تصویر از دستگاه‌تان بردارید، یا عکس را مستقیم داخل ناحیه رها کردن بکشید. از یک تصویر واضحِ رو‌به‌رو استفاده کنید که صورت و شانه‌ها مشخص باشند، چشم‌ها و دهان پوشیده نباشند و کمی هم اطراف سوژه فضا داشته باشید تا بعداً بتوانید کادر را دوباره تنظیم کنید.

  • فایل‌های پشتیبانی‌شده: JPG، JPEG، PNG، WebP و HEIC.
  • حداکثر حجم فایل: 30 MB.
  • اندازه پیشنهادی برای شروع: حداقل 512 x 768 پیکسل برای یک پرتره.
  • رفتار آپلود: هر بار فقط یک تصویر منبع.
Dragging a portrait onto the Upload control in the VisionStory Characters panel

ترکیب‌بندی تصویر را با جایی که ویدیو قرار است منتشر شود هماهنگ کنید. یک پرتره با برش خیلی تنگ ممکن است در 9:16 خوب جواب بدهد، اما در 16:9 تبدیل به یک برشِ بیش‌ازحد تنگ از صورت می‌شود، چون در چپ و راست تصویر فضایی برای پر کردن قابِ عریض‌تر وجود ندارد.

مرحله 2: بگذارید VisionStory آواتار را بررسی و آماده کند

بعد از آپلود، VisionStory بررسی می‌کند آیا تصویر شامل یک شخص قابل‌استفاده هست یا نه و آن را به‌عنوان یک کاراکتر آماده می‌کند. ناموفق بودن آپلود تقریباً همیشه به عکس منبع برمی‌گردد: ممکن است صورت خیلی کوچک باشد، زیاد پوشیده شده باشد، بیش‌ازحد به پهلو چرخیده باشد، تار باشد یا خیلی به صورت دیگری نزدیک باشد.

اگر آماده‌سازی ناموفق شد، همان برش را مدام دوباره امتحان نکنید. یک تصویر واضح‌تر انتخاب کنید که یک صورت بزرگ‌تر داشته باشد، زاویه مستقیم‌تری داشته باشد، شانه‌ها مشخص باشند، نور یکنواخت باشد و پوشیدگی کمتر باشد.

VisionStory avatar preview beside a checklist for a clear, unobstructed source photo

وقتی پردازش تمام شد، آواتار بالای کتابخانه کاراکترهای عمومی ظاهر می‌شود و در پیش‌نمایش آواتار باز می‌شود. این آواتار فقط برای شما قابل مشاهده است.

مرحله 3: صدا را پیش‌نمایش کنید یا تغییر دهید

VisionStory بر اساس سن و جنسیتِ ظاهری فرد، به‌طور خودکار یک صدای شروعِ مناسب اختصاص می‌دهد. می‌توانید همان را نگه دارید، پیش‌نمایش کنید یا با صدای دیگری جایگزینش کنید.

  1. روی صدای فعلی کلیک کنید تا کتابخانه صدا باز شود.
  2. از دکمه پخشِ سمت راست هر صدا استفاده کنید تا نمونه‌اش را بشنوید.
  3. اگر مناسب نبود، با Language، Gender، Age و Use Case فیلتر کنید.
  4. چند گزینه را پیش‌نمایش کنید و بعد صدایی را انتخاب کنید که هم با آواتار و هم با هدف ویدیو هماهنگ باشد.
VisionStory Voice Library with Language, Gender, Age, and Use Case filters and a preview button

ممکن است یک صدا با سن و جنسیت ظاهری فرد همخوان باشد، اما برای روایت، آموزش، تبلیغات یا محتوای محاوره‌ای حس درست ندهد. هم شخص را در نظر بگیرید و هم هدف را—نه فقط ویژگی‌های جمعیت‌شناختی را.

مرحله 4: کادر عکس را برای مقصدش تنظیم کنید

با پیش‌نمایش آواتار تصمیم بگیرید چه مقدار از فرد در ویدیوی نهایی دیده شود. عکس را بکشید تا سوژه را جابه‌جا کنید و با کنترل‌های زوم نزدیک‌تر یا دورتر شوید. سپس نسبت تصویر مناسب جایی را که قرار است منتشر کنید انتخاب کنید:

  • پرتره 9:16 برای TikTok، Instagram Reels، YouTube Shorts و سایر موقعیت‌های موبایل‌محور.
  • مربع 1:1 برای پست‌های مربع شبکه‌های اجتماعی، چیدمان‌های مبتنی بر پروفایل و جاسازی‌های انعطاف‌پذیر.
  • افقی 16:9 برای YouTube، ارائه‌ها، وب‌سایت‌ها و دوره‌های عریض.
The same VisionStory avatar shown in 9:16, 1:1, and 16:9 aspect ratios

زوم نمی‌تواند پیکسل‌هایی را نشان دهد که وجود ندارند. اگر فرد همین حالا هم به تمام لبه‌های عکس منبع چسبیده، به‌جای اینکه برشِ عریض‌تر را زورکی اعمال کنید، با تصویری شروع کنید که پس‌زمینه بیشتری دارد.

مرحله 5: تفاوت Change Look و Generate Image را بدانید

کنار آواتار، دو ابزار تصویرِ هوش مصنوعی قرار دارد و بهتر است قبل از استفاده، تفاوت‌شان را بدانید.

Change Look یک گفت‌وگوی هوش مصنوعی را باز می‌کند که آواتار فعلی‌تان از قبل به آن وصل است؛ بنابراین می‌توانید لباس، محیط یا سبک جدید را توصیف کنید. این یک فرایند image-to-image است و آواتار اصلی همچنان در دسترس می‌ماند. Generate Image به‌جای عکس، از یک توضیح متنی برای کاراکتر شروع می‌کند؛ پس یک فرایند text-to-image است. در هر دو حالت می‌توانید با ادامه گفت‌وگو نتیجه را دقیق‌تر کنید.

VisionStory Change Look chat opened with the current avatar attached as the starting image

خلاصه‌اش: وقتی کاراکتر از قبل وجود دارد و فقط به یک ظاهر جدید نیاز دارد از Change Look استفاده کنید؛ و وقتی می‌خواهید از روی یک پرامپت کاراکتر بسازید از Generate Image استفاده کنید.

مرحله 6: یک متن کوتاه اضافه کنید و ویدیوی سخنگو را بسازید

در حالی‌که آواتار آپلودشده‌تان انتخاب شده، در کادر Script یک جمله کوتاه و محاوره‌ای تایپ کنید. یک خط کوتاه سریع‌تر رندر می‌شود و کمک می‌کند عکس، برش، صدا، هماهنگی لب و حرکت را یک‌جا راحت‌تر ارزیابی کنید.

روی Generate Talking Video کلیک کنید. VisionStory با استفاده از آواتار انتخاب‌شده، کادربندی، متن و صدا، چهره را متحرک می‌کند، لب‌ها را با صدا هماهنگ می‌کند و پلک‌زدن طبیعی و حرکت سر را اضافه می‌کند. رندر کردن چند دقیقه زمان می‌برد.

A short VisionStory script generating a talking-avatar result from the uploaded portrait

این نتیجه اول را مثل یک تست عملیِ عکس منبع در نظر بگیرید. آن را از چهار جهت بررسی کنید:

  • صورت در اندازه نهایی به‌اندازه کافی شارپ می‌ماند.
  • چشم‌ها و دهان هنگام حرکت پوشیده نمی‌شوند.
  • سر و شانه‌ها داخل نسبت تصویر انتخاب‌شده راحت جا می‌گیرند.
  • آواتارِ متحرک همچنان شبیه همان شخص در تصویر منبع است.

اگر برش خیلی تنگ است یا صورت در حرکت نرم/تار به نظر می‌رسد، اول تصویر منبع یا کادربندی را اصلاح کنید. تغییر متن، مشکلِ ترکیب‌بندی را حل نمی‌کند.

مرحله 7: آواتار عکس سخنگوی خود را دوباره استفاده کنید یا حذف کنید

در لیست کاراکترها، آواتار آپلودشده شما بالای کتابخانه کاراکترهای عمومی قرار می‌گیرد و هر وقت دوباره همان ارائه‌دهنده را بخواهید می‌توانید انتخابش کنید. کاربران دیگر نمی‌توانند آن را ببینند و مشترک‌ها می‌توانند آواتارهای نامحدود بسازند و نگه دارند.

  • دوباره استفاده کنید: به‌جای آپلود دوباره، همان آواتار را انتخاب کنید.
  • ظاهر را عوض کنید: آواتار را باز کنید و یکی از تصویرهای کوچکِ ظاهرهای ذخیره‌شده‌اش را انتخاب کنید.
  • حذفش کنید: نشانگر را روی آواتار ببرید تا دکمه حذف در گوشه بالا-راست ظاهر شود، سپس قبل از حذف آواتار و ظاهرهایش تأیید کنید.
A reusable uploaded avatar in VisionStory Characters with the delete control and confirmation dialog

رفع مشکل‌های رایج عکس

VisionStory نمی‌تواند یک چهره قابل‌استفاده پیدا کند. از یک تصویر روشن‌تر و واضح‌تر استفاده کنید که یک چهره بزرگ‌تر و رو‌به‌رو دارد. از چشم‌ها یا دهانِ پوشیده، زاویه‌های شدید نیم‌رخ و عکس‌هایی که صورت دیگری خیلی به سوژه اصلی نزدیک است دوری کنید.

برش افقی خیلی نزدیک است. احتمالاً پرتره منبع در کناره‌ها فضای کافی ندارد. از یک تصویر عریض‌تر استفاده کنید یا تصویری که فضای خالی بیشتری دور سوژه دارد.

آواتار هنوز در حال آماده‌سازی است. قبل از استفاده از کاراکتر، صبر کنید آماده‌سازی تمام شود. اگر گیر کرد، نمای کاراکترها را رفرش کنید و بررسی کنید آیا آواتار از قبل ظاهر شده یا نه—قبل از اینکه یک کپی دیگر آپلود کنید.

نتیجه نرم/تار به نظر می‌رسد. با یک عکس با وضوح بالاتر و فوکوس‌شده شروع کنید و صورت کوچک را بیش‌ازحد بزرگ نکنید. وضوح خروجی نمی‌تواند جزئیاتی را که در تصویر منبع وجود نداشته برگرداند.

برای سخنگو کردن یک عکس همین کافی است: یک پرتره آپلود کنید، یک صدا هماهنگ کنید، کادر را تنظیم کنید و تولید کنید. حالا عکس شما یک آواتار سخنگوی قابل‌استفاده مجدد است که هر وقت نیاز داشتید می‌توانید دوباره از آن استفاده کنید.

برای فرایند کاملِ متن، صدا، تنظیمات، اعتبارها و روند تولید آماده‌اید؟ آموزش چطور یک آواتار سخنگوی هوش مصنوعی بسازیم را دنبال کنید، یا متن‌های کامل را در مقیاس بالا به ویدیوی هوش مصنوعی تبدیل کنید. یا همین حالا شروع کنید: اولین عکس سخنگوی خود را رایگان بسازید.

سوالات متداول

  • یک عکس واضح از روبه‌رو را در ابزار عکس سخنگوی VisionStory آپلود کنید، یک جمله کوتاه برای گفتن تایپ کنید، صدای اختصاص‌داده‌شده را نگه دارید یا یکی دیگر انتخاب کنید و روی Generate Talking Video کلیک کنید. در پلن رایگان، ظرف چند دقیقه و در مرورگرتان یک ویدیوی سخنگو با هماهنگی لب دریافت می‌کنید—بدون نیاز به نصب هیچ نرم‌افزاری.