在 YouTube 上觀看本教學

YouTube

想讓一張靜態照片開口說話—像人像會張嘴、眨眼,並把你輸入的內容說出來嗎?用 VisionStory 只要一張圖片,就能直接在瀏覽器中完成,不需要相機,也不需要任何剪輯經驗。上方影片會帶你跑完整流程;下方的一步步指南,則會把每個環節講得更清楚。

跟著做的同時,你會上傳 1 張人像照,並把它準備成你自己的可重複使用虛擬人像。其他使用者看不到它;之後做新影片時,你也能直接再次選用,不必每次都重複上傳同一張圖片。以上所有流程,都可用免費帳戶在 VisionStory 的會說話照片工具中完成。

步驟 1:上傳 1 張清晰人像照

開啟 AI 影片。在 Characters 面板中選擇 Upload,從裝置挑選圖片,或把照片直接拖曳到上傳區。建議使用 1 位清晰、正面的人像,臉部與肩膀可見、眼睛與嘴巴不被遮擋,並在人物周圍留一點空間,方便後續重新取景。

  • 支援檔案:JPG、JPEG、PNG、WebP、HEIC。
  • 檔案大小上限:30 MB。
  • 建議起始尺寸:人像照至少 512 x 768 像素。
  • 上傳方式:一次 1 張來源圖片。
Dragging a portrait onto the Upload control in the VisionStory Characters panel

來源照片的構圖要對齊你最後要輸出的影片版型。裁得很緊的人像照在 9:16 也許沒問題,但轉成 16:9 時可能會變成臉部過近、看起來很壓迫,因為左右沒有多餘的畫面可以補滿更寬的畫幅。

步驟 2:讓 VisionStory 檢查並準備虛擬人像

上傳後,VisionStory 會檢查圖片是否包含可用的人物,並把它準備成角色。上傳失敗幾乎都與來源照片有關:例如臉太小、遮擋太多、側轉角度過大、模糊,或與另一張臉靠得太近。

如果準備失敗,別一直重試同一個裁切版本。改用更清晰的來源:臉更大、角度更正、肩膀可見、光線更均勻、遮擋更少。

VisionStory avatar preview beside a checklist for a clear, unobstructed source photo

處理完成後,你的虛擬人像會出現在公開角色庫的上方,並在預覽中開啟。它只會對你本人可見。

步驟 3:預覽或更換指派的音色

VisionStory 會依據人物看起來的年齡與性別,自動指派一個合適的起始音色。你可以保留它、先聽聽看,或改用其他音色。

  1. 點選目前的音色以開啟音色庫。
  2. 使用每個音色右側的播放鍵聆聽範例。
  3. 如果不合適,可用 Language、Gender、Age、Use Case 篩選。
  4. 多預覽幾個選項後,挑選最符合虛擬人像與影片用途的音色。
VisionStory Voice Library with Language, Gender, Age, and Use Case filters and a preview button

某個音色可能符合人物的年齡與性別,但用在旁白、教學、廣告或對話內容時仍會不對味。要對齊的是「人物」與「用途」,不只是人口特徵。

步驟 4:依發佈平台重新取景

在虛擬人像預覽中,決定最後影片要露出人物多少畫面。拖曳照片來調整人物位置,再用縮放控制拉近或拉遠。接著選擇符合你要發佈位置的長寬比:

  • 9:16 直式:適合 TikTok、Instagram Reels、YouTube Shorts 等以手機為主的版位。
  • 1:1 正方形:適合方形社群貼文、人物導向版面與彈性嵌入。
  • 16:9 橫式:適合 YouTube、簡報、網站與寬螢幕課程。
The same VisionStory avatar shown in 9:16, 1:1, and 16:9 aspect ratios

縮放不可能變出原圖沒有的像素。如果人物在來源照片中已經貼到四邊,建議改用背景留白更多的圖片,而不是硬要裁成更寬的畫面。

步驟 5:搞懂 Change Look 與 Generate Image 的差別

虛擬人像旁邊有 2 個 AI 圖片工具,使用前先搞懂差異會更順。

Change Look 會開啟 AI 對話,並自動附上你目前的虛擬人像,讓你描述新的穿搭、場景或風格。它是以圖生圖流程,原本的虛擬人像依然會保留。Generate Image 則是從文字角色描述開始,而不是從照片開始,因此是以文生圖流程。兩者都可以透過持續對話來微調結果。

VisionStory Change Look chat opened with the current avatar attached as the starting image

簡單說:角色已存在、只想換造型就用 Change Look;想用提示詞從零建立角色就用 Generate Image。

步驟 6:加入短腳本並生成會說話影片

選取你上傳的虛擬人像後,在 Script 欄位輸入 1 句簡短、口語的句子。短句渲染更快,也更容易一次評估照片、裁切、音色、對嘴與動作的整體效果。

點擊 Generate Talking Video。VisionStory 會使用你選定的虛擬人像、取景、腳本與音色,讓臉部動起來、同步嘴型,並加入逼真的眨眼與頭部動作。渲染通常只要幾分鐘。

A short VisionStory script generating a talking-avatar result from the uploaded portrait

把這次的第一版結果,當作實用的來源照片測試。建議檢查 4 件事:

  • 臉部在最終尺寸下仍足夠清晰。
  • 動起來時眼睛與嘴巴不會被遮擋。
  • 頭部與肩膀在選定比例中看起來舒服、不擁擠。
  • 動態虛擬人像依然像原本的那個人。

如果裁切太緊,或動起來臉變得偏糊,先回頭修來源圖片或取景。改腳本無法解決構圖問題。

步驟 7:重複使用或移除你的會說話照片虛擬人像

回到 Characters 清單,你上傳的虛擬人像會顯示在公開角色庫上方;只要想再次用同一位講者,隨時都能選它。其他使用者看不到它;訂閱者則可建立並保留不限數量的虛擬人像。

  • 重複使用:直接選取虛擬人像,不用再上傳照片。
  • 切換造型:打開虛擬人像,選擇已儲存的造型縮圖。
  • 移除:滑鼠移到虛擬人像上,右上角會出現刪除按鈕;確認後即可刪除虛擬人像與其造型。
A reusable uploaded avatar in VisionStory Characters with the delete control and confirmation dialog

常見照片問題排解

VisionStory 找不到可用的臉。 請改用更亮、更清晰、臉更大且正面的照片。避免眼睛或嘴巴被遮住、側臉角度太強,以及有另一張臉靠近主體的照片。

16:9 橫式裁切太近。 來源人像照左右可能沒有足夠的畫面。改用更寬的來源圖,或人物周圍留白更多的照片。

虛擬人像仍在準備中。 請等待準備完成再使用角色。若看起來卡住了,重新整理 Characters 視圖,並確認虛擬人像是否其實已經出現,再決定是否需要再上傳一份。

結果看起來偏糊。 請從更高解析度、對焦清楚的照片開始,並避免把原本很小的臉放大太多。輸出解析度無法補回來源缺失的細節。

讓照片開口說話其實就這麼簡單:上傳 1 張人像照、配上音色、調整取景,然後生成。你的照片現在已經是一個可重複使用的會說話虛擬人像,需要時隨時都能再用。

想進一步了解完整腳本、音色、設定、點數與生成流程?請參考 How to Create an AI Talking Avatar,或把完整腳本批量轉成 AI 影片或直接開始:免費製作你的第一張會說話照片

常見問題

  • 將一張清晰、正面朝向的照片上傳到 VisionStory 的會說話照片工具,輸入一句簡短台詞、選擇或保留指派的音色,然後點擊 Generate Talking Video 即可。使用免費方案,你可在瀏覽器中於幾分鐘內得到嘴型同步的會說話影片,無需安裝任何軟體。