在 YouTube 觀看此教學

YouTube

想令一張靜態相片開口講嘢—好似人像會張口、眨眼,仲可以講出你輸入嘅任何內容?用 VisionStory,你只要一張圖片就可以喺瀏覽器入面做到,唔使相機,亦唔需要任何剪片經驗。上面嘅影片會帶你行一次完整流程,而下面嘅一步步指南就會逐個細節講清楚。

跟住做嘅時候,你會上載一張人像相片,並將佢準備成你自己可重用嘅虛擬人像。其他用戶睇唔到,你之後整新影片時亦可以直接再揀返佢,唔使每次都重複上載同一張相。用免費帳戶就可以喺 VisionStory 嘅會說話相片工具 入面完成晒。

第 1 步:上載一張清晰人像

打開 AI 影片。喺 Characters 面板入面,揀 Upload,再由你嘅裝置選擇圖片;或者直接將相片拖入上載區。建議用一位清晰、正面嘅人物相,面部同膊頭要見到,眼同口唔好有遮擋,周圍留少少空位,方便之後重新構圖。

  • 支援檔案:JPG、JPEG、PNG、WebP 同 HEIC。
  • 最大檔案大小:30 MB。
  • 建議起步尺寸:人像至少 512 x 768 像素。
  • 上載方式:一次只可上載 1 張來源圖片。
Dragging a portrait onto the Upload control in the VisionStory Characters panel

記得將來源相片嘅構圖同你最終要出片嘅畫面對齊。一張裁得好緊嘅人像相喺 9:16 可能仲OK,但去到 16:9 就會變成「面太近」嘅尷尬裁切,因為左右兩邊冇多餘畫面可以填闊幅畫框。

第 2 步:等 VisionStory 驗證並準備虛擬人像

上載之後,VisionStory 會檢查張相係咪有可用嘅人物,並將佢準備成一個角色。上載失敗幾乎都係來源相片嘅問題:可能塊面太細、遮擋太多、側面角度太大、模糊,或者同另一張面太貼近。

如果準備失敗,唔好一直重試同一個裁切。改用一張更清晰嘅來源相:一張更大嘅面、更正面嘅角度、見到膊頭、光線平均,同埋更少遮擋。

VisionStory avatar preview beside a checklist for a clear, unobstructed source photo

處理完成之後,你嘅虛擬人像會出現喺公開角色庫上面,並自動開啟預覽。呢個虛擬人像只會畀你自己睇到。

第 3 步:預覽或更改已指定嘅音色

VisionStory 會按人物嘅外觀年齡同性別,自動分配一個合適嘅起始音色。你可以保留、預覽,或者換另一個。

  1. 揀選目前嘅音色,打開音色庫。
  2. 撳音色右邊嘅播放鍵,聽範例。
  3. 如果唔啱,用 Language、Gender、Age 同 Use Case 篩選。
  4. 多試幾個,再揀一個同虛擬人像同影片用途都最夾嘅音色。
VisionStory Voice Library with Language, Gender, Age, and Use Case filters and a preview button

有啲音色可能同人物外觀年齡同性別好夾,但用嚟做旁白、教學、廣告,或者對話內容又未必啱。記住要「對人、對用途」,唔好淨係睇人口特徵。

第 4 步:按發布位置重新構圖

用虛擬人像預覽去決定最終影片要出現幾多人物畫面。你可以拖動相片去重新定位主體,再用縮放控制拉近或拉遠。之後揀一個適合你要發布平台嘅畫面比例:

  • 9:16 直向:適合 TikTok、Instagram Reels、YouTube Shorts 等以手機為主嘅版位。
  • 1:1 正方形:適合正方形社交帖、以頭像為主嘅版面同靈活嵌入。
  • 16:9 橫向:適合 YouTube、簡報、網站,同闊螢幕課程。
The same VisionStory avatar shown in 9:16, 1:1, and 16:9 aspect ratios

縮放唔可以變出原本唔存在嘅像素。如果人物已經貼住來源相片嘅每一條邊,最好由一張背景留得更多嘅相開始,而唔係硬推一個更闊嘅裁切。

第 5 步:搞清 Change Look 同 Generate Image 做咩

虛擬人像旁邊有兩個 AI 圖片工具,用之前先分清楚佢哋嘅分別會更好。

Change Look 會開啟一個 AI 對話,並已經自動附上你而家嘅虛擬人像,等你描述新衫著、場景或者風格。呢個係一個以圖生圖流程,而原本嘅虛擬人像仍然會保留。Generate Image 就係由文字角色描述開始,而唔係由相片開始,所以係以文生圖流程。兩者都可以繼續對話去微調結果。

VisionStory Change Look chat opened with the current avatar attached as the starting image

簡單講:角色已經存在但想換造型,就用 Change Look;想由提示詞重新創作一個角色,就用 Generate Image。

第 6 步:加一句短講稿,生成會說話影片

揀返你上載嘅虛擬人像之後,喺 Script 文字框輸入一句短、口語嘅句子。短句渲染會更快,亦更容易一次過判斷相片質素、裁切、音色、對口型同動作效果。

Generate Talking Video。VisionStory 會用你揀好嘅虛擬人像、構圖、講稿同音色去幫面部做動畫、同步嘴形,並加入逼真嘅眨眼同頭部動作。渲染大概需要幾分鐘。

A short VisionStory script generating a talking-avatar result from the uploaded portrait

將第一次生成嘅結果,當成一次實用嘅「來源相片測試」。你可以重點檢查 4 樣嘢:

  • 塊面喺最終尺寸下仍然夠清晰。
  • 眼同口喺動作期間都冇畀遮擋。
  • 頭同膊頭喺所選比例入面擺位舒服。
  • 郁緊嘅虛擬人像仍然似來源人物。

如果裁切太緊,或者動起嚟塊面變得「鬆散」唔夠清,先處理來源相片或構圖。改講稿唔會解決構圖問題。

第 7 步:重用或移除你嘅會說話相片虛擬人像

返到 Characters 清單,你上載嘅虛擬人像會喺公開角色庫上面;當你下次想用同一位主持,就可以隨時再揀返佢。其他用戶睇唔到,而訂閱用戶可以建立同保留無限個虛擬人像。

  • 重用:直接揀返個虛擬人像,唔使再上載相片。
  • 切換造型:打開虛擬人像,揀返其中一個已儲存嘅造型縮圖。
  • 移除:將滑鼠移到虛擬人像上面,右上角會出現刪除按鈕;確認後就會刪除虛擬人像同其造型。
A reusable uploaded avatar in VisionStory Characters with the delete control and confirmation dialog

常見相片問題排解

VisionStory 搵唔到可用嘅人面。 用一張更光、更清晰,而且有一張更大、正面人面嘅相。避免眼或口有遮擋、強烈側面角度,同埋另一張面太貼近主體嘅相片。

16:9 橫向裁切太近。 來源人像相左右兩邊可能冇足夠畫面。改用一張更闊嘅來源相,或者人物四周留得更空嘅相。

虛擬人像仲喺準備中。 等佢處理完成先用。如果卡住咗,重新整理 Characters 畫面,睇吓個虛擬人像係咪已經出現咗,先好再上載另一份。

生成結果睇落唔夠清。 由一張更高解像度、對焦清楚嘅相開始,避免將本身好細嘅面放大得太誇張。輸出解像度補唔返來源相片本身缺失嘅細節。

整到相片開口講嘢其實就係咁簡單:上載一張人像、配返音色、調好構圖,然後生成。你而家已經有一個可重用嘅會說話虛擬人像,之後有需要就可以再用。

想睇完整嘅講稿、音色、設定、點數同生成流程?可以跟 How to Create an AI Talking Avatar,或者將完整講稿批量變成 AI 影片又或者而家就開始:免費整你第一張會說話相片

常見問題

  • 將一張清晰、正面嘅相片上載到 VisionStory 嘅會說話相片工具,打一句短句畀佢講,揀選或保留已指定嘅音色,然後撳 Generate Talking Video 就得。用免費方案,你幾分鐘就可以喺瀏覽器入面整到嘴形同步嘅會說話影片,完全唔使安裝軟件。