AI動画はどれもスクリプトから始まりますが、そのスクリプトが実際にどう伝わるかを決めるのは音声です。アクセント、年齢感、声質、勢い、そしてプレゼンターの人柄は音声で決まります — さらに、話す速度、間、話し方の指示によって、仕上がりが人の話し声に聞こえるか、機械が原稿を読み上げているように聞こえるかが分かれます。
結論から言うと、AI音声は、言語と地域アクセントを視聴者に合わせて選び、プロフィールのタグで候補を絞り込み、自分のスクリプトで一つひとつプレビューし、生成前に速度と間で話し方を整える、という流れで選びます。本ガイドでは、この手順をVisionStoryで一つずつ解説します。VisionStoryのAI音声ライブラリには、88言語にわたる1,000種類を超える音声がそろっています。
このガイドで扱う範囲:公開されている音声ライブラリと、その周辺にある話し方の調整機能です。自分の録音から音声を作成するのは別のワークフローです — AIで自分の声をクローンする方法をご覧ください。
ステップ1:音声ライブラリを開き、音声の行を読み解く
AI動画を開き、使用したいアバターを選択し、スクリプトボックスの下に表示されている現在の音声をクリックします。エディターの上に音声ライブラリが開きます。
各行には、再生する前に声の印象を予測できる4つの手がかりが表示されています。
- 言語タグ — その音声が話す言語です。
- 国旗 — 第二言語ではなく、地域アクセントを示します。英語の音声には、米国・英国・カナダなどさまざまな国旗が付きます。
- 性別と年齢 — 聞き手が受け取る話し手の印象です。
- 特徴と使用例 — クリア、温かみのある、会話調、ナレーション、教育、SNSといった説明です。

ラベルは候補を絞り込むために使い、最終判断には使わないでください。タグがほぼ同じ音声でも、テンポ・声質・勢いは大きく異なることがあります。
ステップ2:絞り込み・検索して候補をプレビューする
まずは違いがはっきり分かる程度に広く探し、そこから絞り込みます。まだ探している段階では、言語、性別、年齢、使用例のフィルターを使いましょう。名前が分かっている音声があれば、検索欄に入力してください。
- 候補を絞り込む。カタログ全体ではなく数件の候補になるまで、フィルターまたは検索で絞り込みます。
- 候補を聴き比べる。音声の行の右端にある再生ボタンをクリックして、サンプルを再生します。
- 一時停止して比較する。次の音声を再生する前に、同じボタンをもう一度クリックして停止します。

動画に本当に必要な要素を聴き取りましょう。地域アクセント、明瞭さ、勢い、温かみ、説得力、そして1文を話し進めるスピードです。単体で聴くと魅力的な音声でも、解説・セールス・ニュース・キャラクター中心のスクリプトには合わないことがあります。
ステップ3:コンテンツと視聴者に合う音声を選ぶ
AIナレーションが期待外れになる原因は、たいてい品質ではなく「相性」です。決定する前に、この動画でその音声に何をさせたいのかをはっきりさせましょう。
| 制作するもの | 選ぶポイント | 避けたいもの |
|---|---|---|
| チュートリアル、解説動画、オンライン講座 | 明瞭な発音、安定したテンポ、ニュートラルで温かみのある声 | 専門用語を早口で流してしまう、テンションの高いプロモ調の読み |
| 広告、プロモーション、SNS向けショート動画 | 勢い、力強さ、自信のある若めの声質 | 冒頭のフックが弱まる、ゆっくり落ち着いたナレーション |
| ニュース、企業向け、製品アップデート | 信頼感、均一なテンポ、癖の少ない声質 | カジュアルすぎる声や、キャラクター性の強すぎる声 |
| ストーリーテリング、インタビュー、ポッドキャスト | 個性と表現の幅 | 抑揚のない平坦なアナウンス調の読み |
| 同じ動画の多言語ローカライズ版 | 市場ごとにネイティブの地域アクセント | 翻訳した原稿を1つの英語音声で読ませること |
最も間違えやすい設定がアクセントです。視聴者がロンドンにいるのに、プレゼンターに米国の国旗が付いていれば、聞き手はその違和感に気づきます — たとえ一語一句が正確でも同じです。言語だけで決めず、視聴者に合わせて国旗を選びましょう。
ステップ4:話す速度を設定し、ポーズを加える
音声の行をクリックすると、現在の設定に適用されます。次に、選択した音声の横にあるスピードメニューを開き、遅い、標準、速いのいずれかを選びます。
- 遅いは、じっくり考えさせる解説や、スピード感よりも理解しやすさが重要なコンテンツに向いています。
- 標準は、ほとんどのチュートリアル、プレゼンテーション、トーキングアバター動画に使える無難な基準です。
- 速いはショートプロモやSNS動画に勢いを加えますが、情報量の多いスクリプトは聞き取りにくくなります。
速度は読み全体のテンポを決めます。文中の間(ま)を細かく調整したいときは、間を入れたい位置にカーソルを置き、ポーズボタンをクリックします。1回のクリックで0.5秒追加され、もう一度クリックすればさらに長い間になります。

ノウハウ:実際の話し手が息を継ぐ場所、話題が切り替わる場所、主張を印象づけたい場所にポーズを入れましょう。ポーズが多すぎると読みが途切れ途切れになるため、編集後は変更した部分だけでなく文全体をプレビューしてください。
ステップ5:音声強化で話し方を整える
文言は問題ないのに、狙った話し方がまだ明確に伝わらないときは音声強化をクリックします。VisionStoryが元の文言はそのままに、感情・テンポ・強調といった話し方の指示を追加します。
先へ進む前に、強化されたスクリプトを確認しましょう。指示が意図どおりであれば保持を、元の状態に戻したい場合は元に戻すを選びます。文言は変えずに感情表現をはっきり指示したいときにこそ効果を発揮します。

ステップ6:生成する前に実際のスクリプトでプレビューする
音声、速度、ポーズ、そして強化の指示がひと通り整ったら、オーディオプレビューをクリックします。最初の数語だけで判断せず、テイク全体を通して聴き、発音、アクセント、リズム、文末の処理、ポーズ、感情の合い方を確認しましょう。
候補を比較している段階では、代表的な短い1文から始めます。候補が2〜3件に絞れたら、完成動画で最も重要になる名前、数字、専門用語、感情の山場を含む一節をプレビューしましょう — 音声の差が出るのはまさにそこです。
プレビューの無料枠:オーディオプレビューには無料の文字数枠があり、24時間のローリング周期でリセットされます。この枠を使い切ると、プレビューの生成には500文字あたり1クレジットがかかります。全体像はVisionStoryクレジットの仕組みをご覧ください。
ステップ7:一度生成してアバターに音声を記憶させる
音声を選ぶと現在のエディター設定は変わりますが、選択しただけではその音声はアバターに保存されません。選んだ音声で動画を1本生成してください。するとVisionStoryがその組み合わせを記憶し、次に同じアバターを使うときに復元します。

だからこそ、この選択は慎重に行う価値があります。アバターと音声がいったん紐づけば、以降のすべての動画は毎回選び直すことなく、一貫したプレゼンターから始められます。
AI音声が機械的に聞こえる理由 — とその直し方
生成したナレーションが合成音声っぽく感じられるとき、原因は音声モデルそのものではなく、たいてい修正できる5つの要因のいずれかです。
- スクリプトに合わない音声。ナレーション向けの音声で広告コピーを読ませると平板に聞こえます。品質のせいにする前に、使用例で候補を絞り直しましょう。
- ポーズがない。実際の話し手は息継ぎをします。切れ目のない文章の壁は機械のように聞こえるので、意味の区切りに0.5秒のポーズを入れましょう。
- 速度を一度決めたきり。「速い」は情報量の多い文をぼやけさせ、「遅い」は短いプロモーションを間延びさせます。テンポはコンテンツの種類に合わせましょう。
- あいまいな句読点。だらだらと続く文、抜けた読点、展開されていない略語は、いずれも音声を単調な話し方へ引き寄せます。まずはスクリプトを整えましょう。
- 感情の方向づけがない。意図がテキストに書かれていなければ、音声はそれを推測できません — まさにそのための音声強化です。
この5つを直せば、AI音声が機械的だという不満のほとんどは、音声をまったく変えなくても解消します。
使用中の音声が提供元で提供終了になった場合
VisionStoryは複数の提供元から音声を集めており、提供元が自社のカタログから音声を削除することがあります。その場合、その音声を公開の音声ライブラリに戻すことはできません。
頼りにしていた音声がなくなったときは、過去の動画からその音声だけが入っているクリーンな箇所を探し、それを音声クローンの元音声として使いましょう。クローンで近い代替音声を作れますが、まったく同じ声になるとは限りません。

許可が必要です:クローンに使えるのは、自分が権利を持つ音声、または使用の明確な許可を得ている音声だけです。公開前に、実際に使うスクリプトで代替音声をプレビューしてください。
生成前のAI音声チェックリスト
- 言語だけでなく、視聴者に合う地域アクセントまで選ぶ。
- プロフィールのタグで候補を絞り、最終判断は自分の耳で行う。
- 実際のスクリプトにある固有名詞・数字・読みにくい用語をプレビューで確認する。
- 個別のポーズを入れる前に、全体の速度を決める。
- 話し方にもっと明確な方向づけが必要なときだけ音声強化を使う。
- 最初の1文だけでなく、通しのプレビューを最後まで聴く。
- アバターにその音声を記憶させたい場合は、一度生成しておく。
- 選んだ音声の名前を、ブランドやキャンペーンの記録に書き残す。
音声が決まれば、あとはスムーズです。同じ設定のまま完成動画まで進めるならAIトーキングアバターの作り方へ、音声だけが必要ならテキスト読み上げを開いてください。
