輸入是什麼、輸出會得到什麼

適用對象

敘事與 IP 團隊

以集數形式講故事的團隊:角色驅動的短篇系列、動畫敘事,以及下個月還要再回來、而且必須一眼被認出的品牌 IP 角色。

起始素材

你已經定案的角色

文字版的角色設定或參考圖片、你的劇本或對白,以及(若角色建立在真實人物的臉或音色之上)該人物的書面授權。

你會得到

可重複使用的人設與其鏡頭

一個固定的角色設定檔,以及由它生成的場景圖片、動態鏡頭與交付尺寸的主視覺,會以檔案形式交付,方便你自行剪輯與發布。

當角色不再走樣,會改變什麼

角色驅動的作品,往往會以一種很特定的方式失敗:不是敗在劇本,也不是敗在渲染,而是觀眾在某一刻不再相信——第 5 集螢幕上的那個人,就是他們在第 1 集認識的那個人。以下內容都在談:如何讓這份「相信」能跨越不同場景、不同季數,以及每週輪到不同人製作時依然維持;以及其中哪些部分可以靠工作流程承擔,哪些部分仍必須由人做決定。

第 9 集看起來仍是第 1 集的同一個人

第 3 集一上線,底下第一則留言就在問:那還是第 1 集的那個女孩嗎?技術上是。但下顎變窄了、分線換到另一邊、眼睛也淡了一階;觀眾一旦注意到,就會開始盯著臉看,而不是看故事。把第 1 集有效的描述再丟一次提示詞,回來的會是「表親」,不是那個角色。

解法是:別再「描述」角色,改成「重複使用」她。只要先建立一次人設,就能把臉、音色與外觀固定成參考基準;之後每個場景都以這個基準來生成,而不是依據某人憑記憶重寫的一段文字。VisionStory 讓角色維持可辨識,但不會替你決定她是誰。你仍然要把角色設定寫清楚,也仍然要盯住每個新場景的第一幀,檢查那些最容易走樣的細節:服裝、髮際線、那道必須永遠留在同一邊臉頰的小疤。

把對話場寫成可剪輯的鏡頭,而不是一條提示詞

這個節拍很容易描述、卻很難生成:兩個角色坐在桌邊,其中一個在說謊,另一個晚了 1 秒才意識到。若只用一條提示詞要一個多角色場景,回來常常是兩個人同時對著鏡頭說話、彼此不看對方,承載整段節拍的那個停頓也不見了。素材根本沒有可剪的點,因為鏡頭從一開始就不是為了剪輯而搭出來的。

用剪輯師會收到的方式來搭建場景。每個角色都有自己的鏡頭,從各自鎖定的角色檔生成,讓臉始終一致;而你可以決定每句台詞由誰入鏡、台詞落點時視線看向哪裡。輪流接話、慢半拍才出現的反應、回答前那段沉默——那都是你做的剪接,而不是去調的設定。VisionStory 負責產出鏡頭與音色;讓場景成立的節奏,仍然由你來導演決定。

角色是一套規則,不是一個截圖資料夾

最懂這個角色的人,往往只有某位接案者;他知道的一切,不是躺在他筆電的參考資料夾裡,就是放在他腦中。兩季之間合約一結束,下一個人打開檔案庫,只能從劇照往回推、靠猜:那件外套是角色設定的一部分,還是只出現在第 4 集?她會不會在第一幕就說出那句口頭禪?她應該給人幾歲的感覺?演到第 10 集,沒人能不滑檔案就回答得出來。

把角色當作四樣會一起移動的東西:一張臉、一個音色、一種說話方式,以及一小份「外觀規則清單」——這些都不允許漂移。把它們收成一個可重複使用的人設,旁邊再配一個有命名的場景資料庫,交接就能順暢完成。新的協作者打開角色檔,直接從它生成下一場戲,而不是去逆向拆解上一場。規則由你來寫,而且值得在第 2 集之前就寫好,而不是拖到第 9 集之後才補。

當角色建立在真實人物之上

很多故事角色都從某個真實人物出發:成為品牌吉祥物的創辦人、被選角進劇集的演員、或是一位大家早就把他的聲音和節目連在一起的同事。促成一切的那聲「好」,可能只在一次會議裡說過,當時談的是一個誰都不確定會不會超過 6 集的試播集。兩季之後,同一張臉卻在另一個市場做付費置入,還用著那個人根本不會說的語言——而這些都不在當初的對話裡。

授權不是一道只要通過一次的關卡;它是一個有邊界的範圍,而節目越做越大,踩到邊界的次數就越多。能讓作品「可用」的,是一份白紙黑字寫清楚角色、內容、投放市場與期間的授權;因此每一次擴張,都應該在生成畫面之前就回頭把範圍加寬,而不是等活動上線才補救:新一季、新地區、付費置入、衍生作品、合作品牌。邊界之內,工作就很日常:把臉放進靜態圖時保留原本的打光與構圖;既有的錄音保留節奏與重音,同時交付的音色成為角色的聲音。超出邊界,沒有任何流程能讓素材變得可公開發布。

會說話的角色,觀眾看的是嘴和眼睛

大家都點頭的角色設定表,可能在角色一開口的那一刻就崩掉。觀眾不再「看圖」,而是開始「讀嘴」:嘴型有沒有對上子音?眼神是看著對話對象,還是飄到鏡頭旁邊?台詞都落點了,頭還會不會繼續漂移?這些在靜態圖裡都看不出來,而把靜態圖修得更漂亮也解決不了。

所以,把「說話鏡頭」當成有時長的鏡頭,而不是音訊多長就跟著跑多長的片段。生成角色的一鏡到底,通常只能穩住幾秒鐘的台詞;再往後小誤差會累積,臉就開始顯得不真實。真正面對長台詞的誠實解法是剪:切到聽的人、切到反應、切到手部,再切回來。眼神線在生成前就先決定好,不要生成後才跟它爭;每個 take 保持夠短才會乾淨;在台詞上剪,而不是把鏡頭硬撐到它承載不了的長度。當某個瞬間真的必須拉長,解法是導演調度,而不是把渲染時間拉更長。

角色驅動的團隊如何使用 VisionStory

要做出 AI 角色影片,簡單說就是:先把角色定下來,後面所有內容都以它為基準生成。角色檔比角色描述更有價值,差別在你放了什麼進去:一張臉、一個音色、一種說話方式,以及一小份絕不允許變動的外觀規則清單。這四件事一旦定稿,後面大多就是執行。下面 6 個步驟也標出「人仍然必須做決定」的地方——尤其是涉及真實臉孔或音色,以及最終要對外發布的內容。

在任何內容發布之前,內容負責人需要確認角色臉孔與音色背後的授權範圍、來源圖片與錄音已核准可用於此用途,並確保生成角色絕不會被呈現成真實人物。

  1. 01

    第一場戲出現之前,先把角色定稿

    把角色一次建好,做成可重複登場的人設,讓臉、音色與外觀在所有由它生成的影片裡都保持固定,接著把這個人設當作後續一切的參考基準。在產品裡,這個人設就是一個 avatar:一份儲存好的角色檔,之後每一場都指向它,而不是每次重打描述。並在旁邊寫清楚哪些「不能動」:角色應該給人的年齡感、髮際線、服裝規則、口音、以及讓對白聽起來像她的 2 個口頭習慣。VisionStory 會讓這個人設在不同場景之間保持穩定。至於角色是誰、哪些特徵讓她一眼就能被認出來——這部分由你決定。

    工具 AI 虛擬網紅
    AI 虛擬網紅
    打造一個可反覆登場的虛擬人設,固定臉孔、音色與整體形象,讓每支影片都一眼可辨。
  2. 02

    先讓角色動起來,再開始打造周遭的一切

    人物設定定下來後,下一步要先確認的是:它真的能動。用 Image to Video 把一張已授權的角色圖片,做成動作可控的短片段;一次做一個鏡頭,而不是一口氣做完整場景。可剪接的鏡頭,才組得出對話來回,也讓你有地方放進「慢半拍才落下」的反應。動作只做當下情緒需要的程度就好,因為角色在畫面裡漂來漂去,看起來更像特效而不是演出。這麼早就看到角色動起來,也能在還很便宜、很好改的時候,確認角色輪廓是否正確。把這些片段剪成一場戲的剪輯方式,由你決定。

    工具 圖片轉影片
    圖片轉影片
    將一張已核准的人像、產品或場景圖片,以可控動作製作成短影片片段。
  3. 03

    不用重演整場戲,也能給角色一個固定音色

    你可以自己把台詞演一遍,或重用你已有的錄音版本,然後丟進 Voice Changer,讓輸出的音色變成角色的,同時保留原本表演的節奏、重音與停頓,完全跟著演員放的位置走。當一段念法除了音色以外都很到位時,它就特別有用;也適合用在同一個角色必須跨整季、由不同人、在不同日子錄製,卻仍要聽起來一致的情境。若目標音色是以真人為原型,在你生成任何內容之前,必須先取得對方的書面同意。

    功能 變聲器
    變聲器
    在保留原本節奏與演繹的前提下,替既有錄音更換輸出的音色。
  4. 04

    打造角色所生活的世界

    當角色動起來看對了,就用 AI 圖片生成器把周遭的一切都做齊:配角、場景需要的房間與街景、道具、封面圖和每集縮圖。把成果存進以「集數」與「節拍」命名的場景資料庫,讓專案裡第三位編劇也能直接找到第二集的廚房,而不是又生成一個新的。連戲問題更常出在環境與道具,而不是角色本身,所以每張新圖入庫前,都要先對照角色規則檢查一次,也要拿去跟上一集比對觀眾會注意到的細節。

    工具 AI 圖片生成器
    AI 圖片生成器
    從提示詞或參考素材生成相關的封面圖、角色、場景與輔助視覺。
  5. 05

    只替換你有權使用的臉

    Face Swap 會把靜態圖片中的臉替換成已授權的肖像,同時保留原本的打光與構圖;這也是以真人為原型的角色,能在主視覺與劇照之間維持一致性的方式。它只適用於靜態圖,不適用於已完成的影片片段。在任何一格畫面出現之前,先向本人取得書面同意,並清楚寫明角色名稱、內容與投放/播放的場域;而且絕對不要把結果宣稱為他/她的真實影像。如果授權不夠明確,就改用生成的角色。

    工具 換臉
    換臉
    在靜態圖片中以已授權的肖像替換臉部,同時保留原本的光線與構圖。
  6. 06

    把角色素材拉到交付尺寸

    把主視覺、角色人像、場景參考圖與縮圖都丟進 Upscale Image,讓它們在成片母帶的交付尺寸下仍然站得住腳,包括 4K 特寫、臉占滿整個畫面的情況。最容易在這一步出問題的,往往是為了第一次測試、隨便用某個尺寸快速做出的角色設計表,所以請用全尺寸檢查觀眾真的會盯著看的部位:眼睛、髮際線、嘴巴。放大能提升清晰度與可用尺寸,但不會憑空補上原圖不存在的細節;因此小尺寸就不對的臉,大尺寸也一樣不對,正確做法是回到人物設定重新生成。

    工具 圖片放大
    圖片放大
    提升人像、產品照、縮圖與參考圖片的清晰度與可用尺寸。

常見問題

  • 別再每次重寫角色描述,改成重用同一份人物設定。把臉、音色與整體造型一次建好,存成可保存的虛擬人像;之後每個場景都以這份人物設定為基準生成,而不是每次都從新提示詞開始。同時寫一份很短的「不可變更清單」:她看起來幾歲、髮縫在哪邊、固定穿什麼、聽起來是什麼聲線。接著把每個新場景的第一格,拿去跟上一集對照,因為走樣通常會先出現在很細的地方,大家一時還說不上來。

用戶愛用 VisionStory

了解內容創作者與行銷人員為何信賴 VisionStory 滿足他們的 AI 影片需求。從強大功能到流暢體驗,我們的社群對 VisionStory 的成果讚不絕口。

查看 G2 的所有評論