日本語

Text-to-videoは、まだ存在しないショットを作る最速の方法です。シーンを言葉で描写すれば、AI video generatorが数秒から10秒以上のクリップに変換します。商品のリビール、導入のエスタブリッシングショット、ストーリーのワンビート、大きな編集に使うBロールまで自在です。

ただし、このツールはマルチシーンの動画全体を一括で作るものではありません。トピックから脚本・絵コンテ・アバター・ボイスオーバー・字幕までまとめて生成したい場合は、代わりにAI Video Agentを使ってください。このチュートリアルで解決するのは、明確に1つの作業です。書いたプロンプトを、確認してダウンロードできる1つの動画ショットに変換すること。

Step 1: Generate Videoモードを開く

VisionStoryのAI ToolsでAI Video Generatorを開き、上部でGenerate Videoが選択されていることを確認します。このモードはテキストだけから新しいシーンを作成します—開始画像は不要です。商品・人物・シーンの見た目を正確に保つ必要がある場合は、代わりにImage to Videoへ切り替えてください。

書き始める前に、このショットが完成動画の中でどんな役割を持つかを決めましょう。SNSクリップの冒頭3秒フック、商品のクローズアップ、エスタブリッシングショット、トランジション用のBロール、物語の中の1アクションなどです。役割が明確なほど、プロンプトは書きやすくなります。

Generate Video mode selected in the VisionStory AI Video Generator for making an AI video from text
Generate Videoはテキストの説明から新しいショットを作成します。Image to Videoは、すでにある画像に動きを加えます。

Step 2: 被写体・動き・場所・カメラを書く

効果的なAI動画プロンプトは、名詞を置くだけではありません。少なくとも次の4点を押さえましょう。被写体が何か、被写体が何をするか、シーンと光の見え方、そしてカメラの動き。商品ショットでは、正確さを保つべき素材・色・構造も明記します。

  • Subject — 人、商品、動物、建物、または環境。
  • Action — 開く、回転する、歩く、注ぐ、見せる、飛び去る、変形する。
  • Setting — スタジオ、街中、オフィス、自然に加え、時間帯とライティング。
  • Camera — クローズアップ/ワイド、固定/トラッキング、プッシュイン、オービット、俯瞰。
  • Limits — テキストなし、余計な人物なし、ブランドの誤りなし、モーフィングなし、不要物なし。
暗いスタジオテーブルの上で、マットブラックのワイヤレスイヤホンケースが開くシネマティックな16:9の商品リビール、
柔らかなパープルのリムライト、ゆっくりしたカメラのプッシュイン、リアルな反射、上質なコマーシャル調、テキストなし。
Typing a product-reveal video prompt into the VisionStory AI video generator
この1つのプロンプトに、商品、開く動作、スタジオ設定、パープルのリムライト、ゆっくりしたプッシュインがすべて含まれています。

Step 3: モデル・尺・アスペクト比・解像度を選ぶ

設定パネルを開き、ショットを使う場所に合わせて出力を揃えます。横長16:9はYouTube、Webサイト、プレゼン向き。9:16はTikTok、Instagram Reels、YouTube Shorts向き。1:1は商品カードや一部のフィード配置に向きます。

短いクリップは、構図と動きの方向性をテストする最も安い方法です—長尺や高精細でレンダリングする前に、プロンプトが狙い通りに効くか確認しましょう。モデルによって、人の動き、商品の一貫性、カメラワーク、ネイティブ音声が異なるため、本番制作の前に同じプロンプトで小さなサンプルを比較するのがおすすめです。

Resolution, duration, and aspect ratio settings in the VisionStory AI video generator
この例では、商品紹介ショットとして横長16:9、10秒、1080pを使用しています。

Step 4: 生成して、Videosリストで結果を見つける

プロンプト欄の右下にある生成ボタンをクリックします。レンダリングが完了すると、新しいクリップが下のVideosリスト最上部に表示され、尺、解像度、タイトル、作成時刻が付いています。まずサムネイルを確認してください。プロンプトの核となる被写体と構図が、すでに出ていますか?

サムネイルが明らかに違う場合—商品の色が違う、被写体がいない、フレーミングが使えない—実案件にそのまま入れないでください。プロンプトに戻り、維持すべき特徴と、出てきてはいけない要素を追加して、もう一度生成しましょう。

A finished text-to-video result showing at the top of the Videos list in VisionStory
最新のカードには、タイトル、尺、解像度、そして素早い一次チェック用のサムネイルが表示されます。

Step 5: 全編をプレビューしてからダウンロード

ビデオカードを開き、冒頭から再生します。被写体がショット全体で安定しているか、動きが物理に反していないか、カメラが急に跳ねないか、商品構造・手・文字・背景が途中で破綻していないかを確認してください。Generation Detailsには元のプロンプト、モデル、解像度が保持されるため、再実行や比較に役立ちます。

ショットがレビューを通ってからダウンロードし、編集に組み込むか、AI Video Agentのプロジェクト、またはワークフローの次工程へ渡しましょう。最初のフレームが良く見えるからといって公開しないでください—中盤と終盤のフレームも同じ厳しさでチェックが必要です。

Previewing a text-generated video in the VisionStory Video Viewer with its prompt and model details
Video Viewerでは完成結果を通しで再生でき、この実行で使ったプロンプト、モデル、出力設定も保持されます。

よくある問題とその直し方

  • 動画がほぼ静止画になっている。 写真の描写ではなく、被写体の動きとカメラの動きを明示しましょう—フタが開く、ゆっくりプッシュイン、商品をオービットする、など。
  • 被写体が途中で変形してしまう。 1ショットに入れる動作数を減らし、尺を短くし、安定させたい素材・色・構造を具体的に書きます。
  • 派手だけど何も伝わらないショットになる。 まず、そのショットが運ぶべき売り(訴求点)やストーリーのビートを決め、ライティングやカメラワークはその後に選びましょう。
  • アスペクト比がプラットフォームに合っていない。 生成前に正しい比率を選びます。横長ショットを縦にクロップすると、被写体や動きが切れてしまうことが多いです。
  • 不要な文字やロゴが出てくる。 プロンプトにno text、no logoを入れ—それでも公開前に必ず全フレームを確認してください。

Text-to-videoが最も力を発揮するのは、本来なら撮れない「動きのあるショット」を補えるときです。まずショットの役割を固定し、被写体・動き・場所・カメラを明確に書き、サムネイルだけでなくタイムライン全体をレビューしましょう。出発点がプロンプトではなく画像の場合は、画像を動画にするへ切り替えてください。

よくある質問

  • テキスト→動画は、文章で書いたプロンプトからまったく新しい動くショットを生成するAI生成手法です。良いプロンプトには、被写体、動き、設定と光、カメラの動き、そしてフレーム内に出してはいけない要素まで含めます。