想令一張靜態相片開口講嘢—好似人像會張口、眨眼,仲可以講出你輸入嘅任何內容?用 VisionStory,你只要一張圖片就可以喺瀏覽器入面做到,唔使相機,亦唔需要任何剪片經驗。上面嘅影片會帶你行一次完整流程,而下面嘅一步步指南就會逐個細節講清楚。
跟住做嘅時候,你會上載一張人像相片,並將佢準備成你自己可重用嘅虛擬人像。其他用戶睇唔到,你之後整新影片時亦可以直接再揀返佢,唔使每次都重複上載同一張相。用免費帳戶就可以喺 VisionStory 嘅會說話相片工具 入面完成晒。
第 1 步:上載一張清晰人像
打開 AI 影片。喺 Characters 面板入面,揀 Upload,再由你嘅裝置選擇圖片;或者直接將相片拖入上載區。建議用一位清晰、正面嘅人物相,面部同膊頭要見到,眼同口唔好有遮擋,周圍留少少空位,方便之後重新構圖。
- 支援檔案:JPG、JPEG、PNG、WebP 同 HEIC。
- 最大檔案大小:30 MB。
- 建議起步尺寸:人像至少 512 x 768 像素。
- 上載方式:一次只可上載 1 張來源圖片。

記得將來源相片嘅構圖同你最終要出片嘅畫面對齊。一張裁得好緊嘅人像相喺 9:16 可能仲OK,但去到 16:9 就會變成「面太近」嘅尷尬裁切,因為左右兩邊冇多餘畫面可以填闊幅畫框。
第 2 步:等 VisionStory 驗證並準備虛擬人像
上載之後,VisionStory 會檢查張相係咪有可用嘅人物,並將佢準備成一個角色。上載失敗幾乎都係來源相片嘅問題:可能塊面太細、遮擋太多、側面角度太大、模糊,或者同另一張面太貼近。
如果準備失敗,唔好一直重試同一個裁切。改用一張更清晰嘅來源相:一張更大嘅面、更正面嘅角度、見到膊頭、光線平均,同埋更少遮擋。

處理完成之後,你嘅虛擬人像會出現喺公開角色庫上面,並自動開啟預覽。呢個虛擬人像只會畀你自己睇到。
第 3 步:預覽或更改已指定嘅音色
VisionStory 會按人物嘅外觀年齡同性別,自動分配一個合適嘅起始音色。你可以保留、預覽,或者換另一個。
- 揀選目前嘅音色,打開音色庫。
- 撳音色右邊嘅播放鍵,聽範例。
- 如果唔啱,用 Language、Gender、Age 同 Use Case 篩選。
- 多試幾個,再揀一個同虛擬人像同影片用途都最夾嘅音色。

有啲音色可能同人物外觀年齡同性別好夾,但用嚟做旁白、教學、廣告,或者對話內容又未必啱。記住要「對人、對用途」,唔好淨係睇人口特徵。
第 4 步:按發布位置重新構圖
用虛擬人像預覽去決定最終影片要出現幾多人物畫面。你可以拖動相片去重新定位主體,再用縮放控制拉近或拉遠。之後揀一個適合你要發布平台嘅畫面比例:
- 9:16 直向:適合 TikTok、Instagram Reels、YouTube Shorts 等以手機為主嘅版位。
- 1:1 正方形:適合正方形社交帖、以頭像為主嘅版面同靈活嵌入。
- 16:9 橫向:適合 YouTube、簡報、網站,同闊螢幕課程。

縮放唔可以變出原本唔存在嘅像素。如果人物已經貼住來源相片嘅每一條邊,最好由一張背景留得更多嘅相開始,而唔係硬推一個更闊嘅裁切。
第 5 步:搞清 Change Look 同 Generate Image 做咩
虛擬人像旁邊有兩個 AI 圖片工具,用之前先分清楚佢哋嘅分別會更好。
Change Look 會開啟一個 AI 對話,並已經自動附上你而家嘅虛擬人像,等你描述新衫著、場景或者風格。呢個係一個以圖生圖流程,而原本嘅虛擬人像仍然會保留。Generate Image 就係由文字角色描述開始,而唔係由相片開始,所以係以文生圖流程。兩者都可以繼續對話去微調結果。

簡單講:角色已經存在但想換造型,就用 Change Look;想由提示詞重新創作一個角色,就用 Generate Image。
第 6 步:加一句短講稿,生成會說話影片
揀返你上載嘅虛擬人像之後,喺 Script 文字框輸入一句短、口語嘅句子。短句渲染會更快,亦更容易一次過判斷相片質素、裁切、音色、對口型同動作效果。
撳 Generate Talking Video。VisionStory 會用你揀好嘅虛擬人像、構圖、講稿同音色去幫面部做動畫、同步嘴形,並加入逼真嘅眨眼同頭部動作。渲染大概需要幾分鐘。

將第一次生成嘅結果,當成一次實用嘅「來源相片測試」。你可以重點檢查 4 樣嘢:
- 塊面喺最終尺寸下仍然夠清晰。
- 眼同口喺動作期間都冇畀遮擋。
- 頭同膊頭喺所選比例入面擺位舒服。
- 郁緊嘅虛擬人像仍然似來源人物。
如果裁切太緊,或者動起嚟塊面變得「鬆散」唔夠清,先處理來源相片或構圖。改講稿唔會解決構圖問題。
第 7 步:重用或移除你嘅會說話相片虛擬人像
返到 Characters 清單,你上載嘅虛擬人像會喺公開角色庫上面;當你下次想用同一位主持,就可以隨時再揀返佢。其他用戶睇唔到,而訂閱用戶可以建立同保留無限個虛擬人像。
- 重用:直接揀返個虛擬人像,唔使再上載相片。
- 切換造型:打開虛擬人像,揀返其中一個已儲存嘅造型縮圖。
- 移除:將滑鼠移到虛擬人像上面,右上角會出現刪除按鈕;確認後就會刪除虛擬人像同其造型。

常見相片問題排解
VisionStory 搵唔到可用嘅人面。 用一張更光、更清晰,而且有一張更大、正面人面嘅相。避免眼或口有遮擋、強烈側面角度,同埋另一張面太貼近主體嘅相片。
16:9 橫向裁切太近。 來源人像相左右兩邊可能冇足夠畫面。改用一張更闊嘅來源相,或者人物四周留得更空嘅相。
虛擬人像仲喺準備中。 等佢處理完成先用。如果卡住咗,重新整理 Characters 畫面,睇吓個虛擬人像係咪已經出現咗,先好再上載另一份。
生成結果睇落唔夠清。 由一張更高解像度、對焦清楚嘅相開始,避免將本身好細嘅面放大得太誇張。輸出解像度補唔返來源相片本身缺失嘅細節。
整到相片開口講嘢其實就係咁簡單:上載一張人像、配返音色、調好構圖,然後生成。你而家已經有一個可重用嘅會說話虛擬人像,之後有需要就可以再用。
想睇完整嘅講稿、音色、設定、點數同生成流程?可以跟 How to Create an AI Talking Avatar,或者將完整講稿批量變成 AI 影片。又或者而家就開始:免費整你第一張會說話相片。
