文字轉影片係最快將「未存在」嘅鏡頭變成現實嘅方法。用文字描述一個場景,AI 影片生成器就會將佢變成由幾秒到十幾秒以上嘅短片 — 可以係產品揭曉、開場建立鏡頭、故事節拍,或者用嚟做更大剪輯嘅 B-roll。

不過,呢個工具唔會幫你由頭到尾砌好一條多場景影片。如果你想由一個主題一併生成講稿、分鏡、虛擬人像、旁白同字幕,改用 AI Video Agent。呢篇教學只解決一個清晰任務:將一段文字提示變成一個可檢視、可下載嘅影片鏡頭。

Step 1: 開啟 Generate Video 模式

喺 VisionStory 嘅 AI Tools 入面打開 AI 影片生成器,並確保頂部已選取 Generate Video。呢個模式只靠文字就可以生成新場景 — 唔需要起始圖片。如果你一定要保留某件產品、人物或場景嘅精確外觀,請改用 Image to Video。

落筆之前,先決定呢個鏡頭喺成片入面負責咩工作:社交短片頭 3 秒嘅吸睛位、產品特寫、建立鏡頭、轉場 B-roll,或者故事入面嘅一個動作。工作越清楚,提示就越易寫。

Generate Video mode selected in the VisionStory AI Video Generator for making an AI video from text
Generate Video 會由文字描述生成新鏡頭;Image to Video 則會為你已有嘅圖片加入動態。

Step 2: 寫清楚主體、動作、場景同鏡頭

有效嘅 AI 影片提示唔只係一個名詞。至少要涵蓋 4 樣嘢:主體係乜、主體做乜、場景同光線係點,以及鏡頭點樣郁。拍產品鏡頭嘅話,亦要寫明必須保持準確嘅材質、顏色同結構。

  • 主體 — 人物、產品、動物、建築或環境。
  • 動作 — 打開、旋轉、行走、倒出、揭曉、掠過、變形。
  • 場景 — 影樓、街道、辦公室、自然環境,再加埋時間同光線。
  • 鏡頭 — 特寫或遠景、固定或跟拍、推近、環繞、俯拍。
  • 限制 — 無文字、無額外人物、無品牌錯誤、無變形、無多餘雜物。
以電影感 16:9 拍攝嘅產品揭曉:霧面黑色無線耳機盒喺昏暗影樓枱面上打開,
柔和紫色輪廓光,鏡頭慢慢推近,真實反光,高級商業廣告風格,無文字。
Typing a product-reveal video prompt into the VisionStory AI video generator
一段提示就帶齊產品、打開動作、影樓場景、紫色輪廓光同慢推鏡。

Step 3: 選擇模型、時長、畫面比例同解像度

打開設定面板,將輸出配合鏡頭會喺邊度使用。橫向 16:9 適合 YouTube、網站同簡報;9:16 適合 TikTok、Instagram Reels 同 YouTube Shorts;1:1 適合產品卡片同部分資訊流版位。

短片段係測試構圖同動作方向最平嘅方法 — 先確認提示有效,再渲染更長或更清晰嘅版本。唔同模型喺人物動作、產品一致性、鏡頭運動同原生音訊方面都會有差異,所以正式大量製作前,最好用同一段提示先比對幾個小樣本。

Resolution, duration, and aspect ratio settings in the VisionStory AI video generator
呢個例子用橫向 16:9、10 秒同 1080p,適合產品展示鏡頭。

Step 4: 生成並喺 Videos 清單搵返結果

撳提示框右下角嘅生成按鈕。渲染完成後,新片段會出現喺下面 Videos 清單嘅最頂,並標示時長、解像度、標題同建立時間。先睇縮圖:佢係咪已經展示到你提示入面嘅核心主體同構圖?

如果縮圖已經明顯唔啱 — 例如產品顏色錯、主體唔見咗、構圖用唔到 — 就唔好放入正式專案。返去改提示,加返必須保留嘅特徵同必須避免出現嘅元素,再生成一次。

A finished text-to-video result showing at the top of the Videos list in VisionStory
最新嗰張卡會帶住標題、時長、解像度同縮圖,方便你快速做第一輪檢查。

Step 5: 預覽完整鏡頭,再下載

打開影片卡,由頭開始播放。留意主體喺整個鏡頭入面有冇保持穩定、動作有冇符合物理、鏡頭有冇跳動,以及產品結構、手部、文字或背景有冇喺任何位置崩壞。Generation Details 會保留原始提示、模型同解像度,方便重跑同對比。

鏡頭通過檢視之後先下載,然後再剪入你嘅成片、你嘅 AI Video Agent 專案,或者其他工作流程。千祈唔好因為第一格好睇就直接發布 — 中段同最後幾格一樣要仔細檢查。

Previewing a text-generated video in the VisionStory Video Viewer with its prompt and model details
Video Viewer 會播放完整結果,並保留今次使用嘅提示、模型同輸出設定。

常見問題同解法

  • 條片幾乎係靜止畫面。 請明確寫出主體動作同鏡頭運動 — 例如「盒蓋打開」、「慢慢推近」、「環繞產品」— 唔好只係描述一張相。
  • 主體喺中途變形。 減少單一鏡頭入面嘅動作數量、縮短時長,並清楚寫明必須保持穩定嘅材質、顏色同結構。
  • 鏡頭好花巧但講唔到嘢。 先決定鏡頭要承載邊個賣點或故事節拍;之後先再揀光線同鏡頭運動。
  • 畫面比例同平台唔夾。 生成前先揀啱比例。將橫向鏡頭硬裁成直向,通常會裁走主體同動作。
  • 出現多餘文字或 Logo。 喺提示加上「無文字、無 logo」— 但發布前仍然要逐格檢查。

文字轉影片最強嘅地方,係可以提供你本來拍唔到嘅動態鏡頭。先定清楚鏡頭嘅工作,再清楚寫好主體、動作、場景同鏡頭,並檢視完整時間線 — 唔好只睇縮圖。如果你嘅起點係一張相而唔係提示,請改用 將圖片變成影片

常見問題

  • 文字轉影片是一種 AI 生成方法,可根據文字提示詞製作全新的動態鏡頭。優質提示詞會涵蓋主體、動作、場景與光線、鏡頭運動,以及畫面中必須不要出現的內容。