모든 AI 비디오는 스크립트에서 시작하지만, 그 스크립트가 실제로 어떻게 전달될지는 음성이 결정합니다. 음성은 진행자의 억양, 나이, 음색, 에너지, 개성을 결정하며 — 속도, 일시정지, 전달 방식 지시는 결과물이 사람처럼 들릴지, 아니면 기계가 원고를 읽는 것처럼 들릴지를 좌우합니다.
간단히 말하면 다음과 같습니다. 언어와 지역 억양을 시청자에 맞추고, 프로필 태그로 후보를 추리고, 각 후보를 직접 작성한 스크립트로 미리 들어본 뒤, 생성하기 전에 속도와 일시정지로 전달 방식을 다듬어 AI 음성을 선택하세요. 이 가이드의 나머지 부분에서는 VisionStory에서 그 과정을 단계별로 살펴봅니다. VisionStory의 AI 음성 라이브러리에는 88개 언어에 걸쳐 1,000개가 넘는 음성이 준비되어 있습니다.
이 가이드에서 다루는 내용: 공개 음성 라이브러리와 그 주변의 전달 방식 조절 기능입니다. 직접 녹음한 음성으로 나만의 음성을 만드는 것은 별도의 작업 흐름입니다 — AI로 내 목소리를 복제하는 방법을 참고하세요.
1단계: 음성 라이브러리를 열고 음성 행 읽기
AI 비디오를 열고 사용할 아바타를 선택한 다음, 스크립트 입력창 아래의 현재 음성을 클릭하세요. 편집기 위에 음성 라이브러리가 열립니다.
각 행에는 재생 버튼을 누르기 전에 화자의 목소리를 예측할 수 있는 네 가지 정보가 담겨 있습니다.
- 언어 태그 — 해당 음성이 구사하는 언어입니다.
- 국기 — 제2 언어가 아니라 지역 억양을 나타냅니다. 영어 음성에는 미국, 영국, 캐나다 등 여러 국기가 붙을 수 있습니다.
- 성별과 나이 — 화자에게서 느껴지는 인상입니다.
- 특성과 사용 사례 — 또렷함, 따뜻함, 대화체, 내레이션, 교육, 소셜 미디어 같은 설명입니다.

라벨은 최종 결정을 내리는 기준이 아니라 후보를 추리는 데 사용하세요. 태그가 거의 같은 두 음성도 말의 속도, 음색, 에너지에서 크게 다를 수 있습니다.
2단계: 필터링, 검색, 후보 미리 듣기
실제 차이를 들을 수 있을 만큼 넓게 시작한 다음 범위를 좁히세요. 아직 탐색 중이라면 언어, 성별, 나이, 사용 사례 필터를 사용하세요. 이미 이름을 알고 있는 음성이 있다면 검색창에 바로 입력하면 됩니다.
- 후보를 추리세요. 전체 목록이 아니라 몇 개의 후보만 남을 때까지 필터링하거나 검색하세요.
- 후보를 차례로 들어보세요. 음성 행 오른쪽의 재생 버튼을 클릭하면 샘플이 재생됩니다.
- 멈추고 비교하세요. 다음 음성을 재생하기 전에 같은 버튼을 다시 클릭해 정지하세요.

비디오에 실제로 필요한 요소를 기준으로 들어보세요. 지역 억양, 또렷함, 에너지, 따뜻함, 신뢰감, 그리고 한 문장을 지나가는 속도입니다. 단독으로 들었을 때 훌륭한 음성도 설명형, 세일즈, 뉴스, 캐릭터 중심 스크립트에는 맞지 않을 수 있습니다.
3단계: 콘텐츠와 시청자에 맞는 음성 고르기
실망스러운 AI 보이스오버는 대부분 품질 문제가 아니라 적합성 문제입니다. 음성을 확정하기 전에, 이 비디오에서 이 음성이 어떤 역할을 해야 하는지부터 정하세요.
| 만들려는 콘텐츠 | 이런 특징을 찾으세요 | 피해야 할 것 |
|---|---|---|
| 튜토리얼, 설명 영상, 강의 | 또렷한 발음, 일정한 속도, 담백하고 따뜻한 톤 | 전문 용어를 급하게 흘려버리는 하이텐션 광고 톤 |
| 광고, 프로모션, 짧은 소셜 클립 | 에너지와 힘, 자신감 있는 젊은 톤 | 훅을 살리지 못하는 느리고 차분한 내레이션 |
| 뉴스, 기업 콘텐츠, 제품 업데이트 | 신뢰감, 균일한 속도, 과하지 않은 음색 | 캐주얼하거나 캐릭터성이 지나치게 강한 음성 |
| 스토리텔링, 인터뷰, 팟캐스트 | 개성과 폭넓은 표현력 | 강약 없이 밋밋한 아나운서 톤 |
| 같은 비디오의 현지화 버전 | 시장별 원어민 지역 억양 | 번역문을 그대로 읽는 하나의 영어 음성 |
억양은 사람들이 가장 자주 잘못 고르는 설정입니다. 시청자가 런던에 있는데 진행자에 미국 국기가 붙어 있다면 듣는 사람은 금방 알아챕니다 — 모든 단어가 정확하더라도 말이죠. 언어만 보지 말고, 시청자에 맞는 국기를 고르세요.
4단계: 말하기 속도를 설정한 뒤 일시정지 추가하기
음성 행을 클릭하면 현재 설정에 그 음성이 적용됩니다. 이어서 선택한 음성 옆의 속도 메뉴를 열어 느리게, 보통, 빠르게 중에서 선택하세요.
- 느리게는 차분한 설명, 그리고 속도보다 이해가 더 중요한 콘텐츠에 어울립니다.
- 보통은 대부분의 튜토리얼, 프레젠테이션, 말하는 아바타 비디오에 무난한 기본값입니다.
- 빠르게는 짧은 프로모션과 소셜 클립에 활력을 더하지만, 정보가 빽빽한 스크립트는 따라가기 어려워집니다.
속도는 낭독 전체의 템포를 정합니다. 문장 안에서 세밀하게 조절하려면 원하는 위치에 커서를 놓고 일시정지 컨트롤을 클릭하세요. 한 번 클릭할 때마다 0.5초가 추가되며, 더 길게 쉬려면 한 번 더 클릭하면 됩니다.

노하우: 실제 진행자라면 숨을 쉬거나, 화제를 바꾸거나, 한마디를 각인시킬 만한 지점에 일시정지를 넣으세요. 일시정지가 너무 많으면 전달이 조각조각 끊기므로, 편집한 부분만이 아니라 문장 전체를 미리 들어 보세요.
5단계: 음성 향상으로 전달 방식 연출하기
문장은 마음에 드는데 원하는 전달 톤이 아직 분명히 드러나지 않는다면 음성 향상을 클릭하세요. VisionStory가 원래 문구는 그대로 둔 채 감정, 속도, 강조에 대한 전달 지시를 더해 줍니다.
계속 진행하기 전에 향상된 스크립트를 확인하세요. 지시가 의도와 맞으면 유지를, 원본으로 돌아가려면 되돌리기를 선택합니다. 문구는 바꾸고 싶지 않지만 감정 연출이 분명히 필요한 스크립트에서 특히 진가를 발휘합니다.

6단계: 생성하기 전에 실제 스크립트로 미리 들어보기
음성과 속도, 일시정지, 그리고 향상 지시어까지 모두 설정했다면 오디오 미리보기를 클릭하세요. 앞부분 몇 단어만 듣고 판단하지 말고 전체를 끝까지 들으면서 발음, 억양, 리듬, 문장 끝맺음, 일시정지, 감정의 어울림을 확인하세요.
아직 여러 후보를 비교하는 단계라면 대표적인 짧은 문장 하나로 시작하세요. 후보가 두세 개로 좁혀지면, 완성된 비디오에서 가장 중요한 이름, 숫자, 전문 용어, 감정이 실리는 대목이 들어간 문단을 미리 들어보세요 — 음성 간의 차이는 바로 여기서 드러납니다.
미리보기 무료 한도: 오디오 미리보기에는 24시간 주기로 갱신되는 무료 글자 수 한도가 포함되어 있습니다. 이 한도를 모두 사용한 뒤에는 미리보기 생성에 500자당 1 크레딧이 소모됩니다. 자세한 내용은 VisionStory 크레딧 작동 방식에서 확인하세요.
7단계: 한 번 생성해서 아바타가 음성을 기억하게 하기
음성을 선택하면 현재 편집 화면의 설정은 바뀌지만, 선택만으로는 그 음성이 아바타에 저장되지 않습니다. 선택한 음성으로 비디오를 한 번 생성하세요. 그러면 VisionStory가 이 조합을 기억했다가 다음에 같은 아바타를 사용할 때 그대로 되살려 줍니다.

그래서 음성 선택은 신중하게 할 가치가 있습니다. 아바타와 음성이 한 번 짝을 이루면, 이후의 모든 비디오는 매번 새로 고민할 필요 없이 일관된 진행자에서 시작됩니다.
AI 음성이 기계처럼 들리는 이유 — 그리고 해결 방법
생성된 보이스오버가 합성음처럼 어색하게 느껴진다면, 대개는 음성 모델 자체가 아니라 충분히 고칠 수 있는 다섯 가지 원인 중 하나 때문입니다.
- 스크립트에 맞지 않는 음성. 내레이션용 음성으로 광고 카피를 읽으면 밋밋하게 들립니다. 품질을 탓하기 전에 용도 기준으로 후보를 다시 추려 보세요.
- 일시정지가 없음. 실제 사람은 말하면서 숨을 쉽니다. 끊김 없이 이어지는 텍스트 덩어리는 기계처럼 들리므로, 의미가 바뀌는 지점에 0.5초 일시정지를 넣으세요.
- 속도를 한 번 정하고 잊어버림. 빠르게는 정보가 빽빽한 문장을 뭉개고, 느리게는 짧은 홍보 비디오를 늘어지게 만듭니다. 콘텐츠 유형에 맞게 템포를 맞추세요.
- 모호한 문장 부호. 지나치게 길게 이어지는 문장, 빠진 쉼표, 풀어 쓰지 않은 약어는 모두 음성을 단조롭게 만듭니다. 먼저 스크립트를 정리하세요.
- 감정 지시가 없음. 의도가 텍스트에 드러나 있지 않으면 음성은 그것을 추론할 수 없습니다 — 바로 그럴 때 쓰라고 있는 기능이 음성 향상입니다.
이 다섯 가지만 바로잡으면 음성을 바꾸지 않고도 AI 음성이 기계 같다는 불만은 대부분 사라집니다.
사용하던 음성을 제공업체가 중단한 경우
VisionStory는 여러 제공업체로부터 음성을 공급받으며, 제공업체가 자체 카탈로그에서 음성을 삭제할 수 있습니다. 이런 경우 해당 음성은 공개 음성 라이브러리로 복원할 수 없습니다.
즐겨 쓰던 음성이 사라졌다면, 이전 비디오에서 그 음성만 담긴 깨끗한 구간을 찾아 음성 복제의 원본 오디오로 사용하세요. 음성 복제로 상당히 비슷한 대체 음성을 만들 수 있지만, 완전히 똑같은 소리를 기대해서는 안 됩니다.

권한 필요: 본인이 소유했거나 사용 허가가 명확한 오디오만 복제하고, 게시하기 전에 실제 사용할 스크립트로 대체 음성을 미리 들어보세요.
생성 전 확인하는 AI 음성 체크리스트
- 언어만 보지 말고, 시청자에 맞는 지역 억양까지 고르세요.
- 프로필 태그로 후보를 좁힌 다음, 최종 판단은 귀로 하세요.
- 실제 스크립트에 나오는 이름, 숫자, 까다로운 용어를 미리 들어보세요.
- 구간별 일시정지를 넣기 전에 전체 속도를 먼저 설정하세요.
- 전달 방식에 더 명확한 방향이 필요할 때만 음성 향상을 사용하세요.
- 첫 문장만 듣지 말고, 전체 미리 듣기를 끝까지 확인하세요.
- 아바타가 해당 음성을 기억하게 하려면 한 번 생성해 두세요.
- 선택한 음성 이름을 브랜드 또는 캠페인 노트에 기록해 두세요.
음성이 정해지면 나머지는 빠르게 진행됩니다. AI 말하는 아바타 만드는 방법에서 같은 설정을 완성된 비디오까지 이어가거나, 오디오만 필요하다면 텍스트 음성 변환을 열어보세요.
