میخواهید یک عکس ثابت را سخنگو کنید—مثل یک پرتره که دهانش را باز میکند، پلک میزند و هر چیزی را که تایپ کنید میگوید؟ با VisionStory دقیقاً میتوانید همین کار را فقط با یک تصویر، مستقیم در مرورگرتان انجام دهید؛ بدون دوربین و بدون هیچ تجربهای در تدوین. ویدیوی بالا کل فرایند را نشان میدهد و راهنمای مرحلهبهمرحلهی پایین هم همه بخشها را با جزئیات پوشش میدهد.
در این مسیر، یک پرتره آپلود میکنید و آن را بهعنوان آواتار قابلاستفاده مجددِ خودتان آماده میکنید. کاربران دیگر نمیتوانند آن را ببینند و شما میتوانید برای ویدیوهای بعدی دوباره همان را انتخاب کنید، بدون اینکه هر بار همان تصویر را آپلود کنید. همهچیز با یک حساب رایگان داخل ابزار عکس سخنگوی VisionStory اجرا میشود.
مرحله 1: یک پرتره واضح آپلود کنید
AI Video را باز کنید. در پنل کاراکترها، Upload را انتخاب کنید و یک تصویر از دستگاهتان بردارید، یا عکس را مستقیم داخل ناحیه رها کردن بکشید. از یک تصویر واضحِ روبهرو استفاده کنید که صورت و شانهها مشخص باشند، چشمها و دهان پوشیده نباشند و کمی هم اطراف سوژه فضا داشته باشید تا بعداً بتوانید کادر را دوباره تنظیم کنید.
- فایلهای پشتیبانیشده: JPG، JPEG، PNG، WebP و HEIC.
- حداکثر حجم فایل: 30 MB.
- اندازه پیشنهادی برای شروع: حداقل 512 x 768 پیکسل برای یک پرتره.
- رفتار آپلود: هر بار فقط یک تصویر منبع.

ترکیببندی تصویر را با جایی که ویدیو قرار است منتشر شود هماهنگ کنید. یک پرتره با برش خیلی تنگ ممکن است در 9:16 خوب جواب بدهد، اما در 16:9 تبدیل به یک برشِ بیشازحد تنگ از صورت میشود، چون در چپ و راست تصویر فضایی برای پر کردن قابِ عریضتر وجود ندارد.
مرحله 2: بگذارید VisionStory آواتار را بررسی و آماده کند
بعد از آپلود، VisionStory بررسی میکند آیا تصویر شامل یک شخص قابلاستفاده هست یا نه و آن را بهعنوان یک کاراکتر آماده میکند. ناموفق بودن آپلود تقریباً همیشه به عکس منبع برمیگردد: ممکن است صورت خیلی کوچک باشد، زیاد پوشیده شده باشد، بیشازحد به پهلو چرخیده باشد، تار باشد یا خیلی به صورت دیگری نزدیک باشد.
اگر آمادهسازی ناموفق شد، همان برش را مدام دوباره امتحان نکنید. یک تصویر واضحتر انتخاب کنید که یک صورت بزرگتر داشته باشد، زاویه مستقیمتری داشته باشد، شانهها مشخص باشند، نور یکنواخت باشد و پوشیدگی کمتر باشد.

وقتی پردازش تمام شد، آواتار بالای کتابخانه کاراکترهای عمومی ظاهر میشود و در پیشنمایش آواتار باز میشود. این آواتار فقط برای شما قابل مشاهده است.
مرحله 3: صدا را پیشنمایش کنید یا تغییر دهید
VisionStory بر اساس سن و جنسیتِ ظاهری فرد، بهطور خودکار یک صدای شروعِ مناسب اختصاص میدهد. میتوانید همان را نگه دارید، پیشنمایش کنید یا با صدای دیگری جایگزینش کنید.
- روی صدای فعلی کلیک کنید تا کتابخانه صدا باز شود.
- از دکمه پخشِ سمت راست هر صدا استفاده کنید تا نمونهاش را بشنوید.
- اگر مناسب نبود، با Language، Gender، Age و Use Case فیلتر کنید.
- چند گزینه را پیشنمایش کنید و بعد صدایی را انتخاب کنید که هم با آواتار و هم با هدف ویدیو هماهنگ باشد.

ممکن است یک صدا با سن و جنسیت ظاهری فرد همخوان باشد، اما برای روایت، آموزش، تبلیغات یا محتوای محاورهای حس درست ندهد. هم شخص را در نظر بگیرید و هم هدف را—نه فقط ویژگیهای جمعیتشناختی را.
مرحله 4: کادر عکس را برای مقصدش تنظیم کنید
با پیشنمایش آواتار تصمیم بگیرید چه مقدار از فرد در ویدیوی نهایی دیده شود. عکس را بکشید تا سوژه را جابهجا کنید و با کنترلهای زوم نزدیکتر یا دورتر شوید. سپس نسبت تصویر مناسب جایی را که قرار است منتشر کنید انتخاب کنید:
- پرتره 9:16 برای TikTok، Instagram Reels، YouTube Shorts و سایر موقعیتهای موبایلمحور.
- مربع 1:1 برای پستهای مربع شبکههای اجتماعی، چیدمانهای مبتنی بر پروفایل و جاسازیهای انعطافپذیر.
- افقی 16:9 برای YouTube، ارائهها، وبسایتها و دورههای عریض.

زوم نمیتواند پیکسلهایی را نشان دهد که وجود ندارند. اگر فرد همین حالا هم به تمام لبههای عکس منبع چسبیده، بهجای اینکه برشِ عریضتر را زورکی اعمال کنید، با تصویری شروع کنید که پسزمینه بیشتری دارد.
مرحله 5: تفاوت Change Look و Generate Image را بدانید
کنار آواتار، دو ابزار تصویرِ هوش مصنوعی قرار دارد و بهتر است قبل از استفاده، تفاوتشان را بدانید.
Change Look یک گفتوگوی هوش مصنوعی را باز میکند که آواتار فعلیتان از قبل به آن وصل است؛ بنابراین میتوانید لباس، محیط یا سبک جدید را توصیف کنید. این یک فرایند image-to-image است و آواتار اصلی همچنان در دسترس میماند. Generate Image بهجای عکس، از یک توضیح متنی برای کاراکتر شروع میکند؛ پس یک فرایند text-to-image است. در هر دو حالت میتوانید با ادامه گفتوگو نتیجه را دقیقتر کنید.

خلاصهاش: وقتی کاراکتر از قبل وجود دارد و فقط به یک ظاهر جدید نیاز دارد از Change Look استفاده کنید؛ و وقتی میخواهید از روی یک پرامپت کاراکتر بسازید از Generate Image استفاده کنید.
مرحله 6: یک متن کوتاه اضافه کنید و ویدیوی سخنگو را بسازید
در حالیکه آواتار آپلودشدهتان انتخاب شده، در کادر Script یک جمله کوتاه و محاورهای تایپ کنید. یک خط کوتاه سریعتر رندر میشود و کمک میکند عکس، برش، صدا، هماهنگی لب و حرکت را یکجا راحتتر ارزیابی کنید.
روی Generate Talking Video کلیک کنید. VisionStory با استفاده از آواتار انتخابشده، کادربندی، متن و صدا، چهره را متحرک میکند، لبها را با صدا هماهنگ میکند و پلکزدن طبیعی و حرکت سر را اضافه میکند. رندر کردن چند دقیقه زمان میبرد.

این نتیجه اول را مثل یک تست عملیِ عکس منبع در نظر بگیرید. آن را از چهار جهت بررسی کنید:
- صورت در اندازه نهایی بهاندازه کافی شارپ میماند.
- چشمها و دهان هنگام حرکت پوشیده نمیشوند.
- سر و شانهها داخل نسبت تصویر انتخابشده راحت جا میگیرند.
- آواتارِ متحرک همچنان شبیه همان شخص در تصویر منبع است.
اگر برش خیلی تنگ است یا صورت در حرکت نرم/تار به نظر میرسد، اول تصویر منبع یا کادربندی را اصلاح کنید. تغییر متن، مشکلِ ترکیببندی را حل نمیکند.
مرحله 7: آواتار عکس سخنگوی خود را دوباره استفاده کنید یا حذف کنید
در لیست کاراکترها، آواتار آپلودشده شما بالای کتابخانه کاراکترهای عمومی قرار میگیرد و هر وقت دوباره همان ارائهدهنده را بخواهید میتوانید انتخابش کنید. کاربران دیگر نمیتوانند آن را ببینند و مشترکها میتوانند آواتارهای نامحدود بسازند و نگه دارند.
- دوباره استفاده کنید: بهجای آپلود دوباره، همان آواتار را انتخاب کنید.
- ظاهر را عوض کنید: آواتار را باز کنید و یکی از تصویرهای کوچکِ ظاهرهای ذخیرهشدهاش را انتخاب کنید.
- حذفش کنید: نشانگر را روی آواتار ببرید تا دکمه حذف در گوشه بالا-راست ظاهر شود، سپس قبل از حذف آواتار و ظاهرهایش تأیید کنید.

رفع مشکلهای رایج عکس
VisionStory نمیتواند یک چهره قابلاستفاده پیدا کند. از یک تصویر روشنتر و واضحتر استفاده کنید که یک چهره بزرگتر و روبهرو دارد. از چشمها یا دهانِ پوشیده، زاویههای شدید نیمرخ و عکسهایی که صورت دیگری خیلی به سوژه اصلی نزدیک است دوری کنید.
برش افقی خیلی نزدیک است. احتمالاً پرتره منبع در کنارهها فضای کافی ندارد. از یک تصویر عریضتر استفاده کنید یا تصویری که فضای خالی بیشتری دور سوژه دارد.
آواتار هنوز در حال آمادهسازی است. قبل از استفاده از کاراکتر، صبر کنید آمادهسازی تمام شود. اگر گیر کرد، نمای کاراکترها را رفرش کنید و بررسی کنید آیا آواتار از قبل ظاهر شده یا نه—قبل از اینکه یک کپی دیگر آپلود کنید.
نتیجه نرم/تار به نظر میرسد. با یک عکس با وضوح بالاتر و فوکوسشده شروع کنید و صورت کوچک را بیشازحد بزرگ نکنید. وضوح خروجی نمیتواند جزئیاتی را که در تصویر منبع وجود نداشته برگرداند.
برای سخنگو کردن یک عکس همین کافی است: یک پرتره آپلود کنید، یک صدا هماهنگ کنید، کادر را تنظیم کنید و تولید کنید. حالا عکس شما یک آواتار سخنگوی قابلاستفاده مجدد است که هر وقت نیاز داشتید میتوانید دوباره از آن استفاده کنید.
برای فرایند کاملِ متن، صدا، تنظیمات، اعتبارها و روند تولید آمادهاید؟ آموزش چطور یک آواتار سخنگوی هوش مصنوعی بسازیم را دنبال کنید، یا متنهای کامل را در مقیاس بالا به ویدیوی هوش مصنوعی تبدیل کنید. یا همین حالا شروع کنید: اولین عکس سخنگوی خود را رایگان بسازید.
