한국어

YouTube에서 이 튜토리얼 보기

YouTube

음성 클로닝은 실제 녹음 파일을 바탕으로 재사용 가능한 합성 음성을 만들어 줍니다. VisionStory는 원본 샘플을 분석하고, 오디오를 준비한 뒤, 언어와 음성 특성을 감지하고, 클론을 생성한 다음, 비디오에 사용하기 전에 확인할 수 있는 미리보기를 생성합니다.

업로드는 그저 기계적인 과정일 뿐입니다. 결과가 얼마나 비슷하고 얼마나 안정적으로 들리는지는 원본 녹음이 좌우합니다. 보통은 서로 다른 마이크나 다른 공간에서 여러 분을 녹음한 것보다, 깨끗하고 일관된 1분짜리 샘플이 훨씬 유용합니다.

음성은 책임감 있게 사용하세요. 본인 음성이거나 사용 허가를 명확히 받은 음성만 클로닝하세요. 음성 클로닝을 이용해 누군가를 사칭하거나, 동의를 우회하거나, 시청자를 오도하지 마세요.

  • 최적의 소스: 1–2분 분량의 깨끗한 단일 화자 오디오.
  • 빠른 녹음: Clone 대화상자에서 최대 15초.
  • 이용 가능: Pro 이상 구독 플랜.

Step 1: AI Video에서 Voice Clone 열기

AI Video를 열고 사용할 아바타를 선택하세요. Script 박스 아래의 음성 행에서 현재 음성 옆에 있는 Clone을 클릭합니다. 아바타의 기존 음성은 바꾸지 않은 채로 Clone 대화상자가 열립니다.

VisionStory AI Video editor with the Clone control highlighted beside the current voice
Voice Clone은 AI Video 편집기의 음성 컨트롤에서 시작합니다.

Step 2: 업로드 또는 녹음 선택

대화상자에서는 두 가지 소스 방법을 제공합니다. 워크플로를 테스트하는지, 아니면 가능한 한 가장 유사한 결과를 원하는지에 따라 선택하세요.

  • 오디오 업로드: 품질 면에서 권장됩니다. 가능하다면 1–2분의 깨끗한 샘플을 사용하세요.
  • 녹음: 빠르게 테스트할 때 유용합니다. 앱 내 레코더는 현재 최대 15초까지 녹음할 수 있습니다.

업로드 파일은 .avi, .mp3, .mp4, .m4a, .wav, .mov를 사용할 수 있습니다. 선택한 오디오 구간은 최소 3초여야 하며 최대 120초까지 가능합니다.

VisionStory Clone dialog comparing audio upload with the built-in recorder
업로드는 더 비슷한 결과를 위한 충분히 깨끗한 자료를 제공하고, 녹음은 더 빠르게 테스트하는 방법입니다.

Step 3: 더 높은 유사도를 위한 오디오 준비

음성 클론은 목소리의 정체성만 복사하는 것이 아닙니다. 말하는 속도, 억양, 호흡, 공간 울림, 마이크 특성, 원치 않는 잡음/아티팩트까지 재현할 수 있어요. 나중에 클론이 그대로 따라 하길 원하는 스타일로 원본을 녹음하세요.

  • 화자는 1명만. 음악, 겹치는 음성, 뒤쪽 대화 소음을 제거하세요.
  • 깔끔한 1–2분을 녹음. 세션이 들쭉날쭉 섞이지 않게 하면서 자연스러운 변화를 충분히 담아 주세요.
  • 조용하고 울림이 적은 공간 선택. 패브릭 등 부드러운 소품은 잔향을 줄이는 데 도움이 됩니다. 선풍기, 차량 소리, 에어컨 소음은 피하세요.
  • 마이크는 고정. 샘플 전체에서 거리, 각도, 입력 레벨, 공간을 동일하게 유지하세요.
  • 자연스럽고 일관되게 말하기. 억양(액센트), 음량, 말하는 속도, 연기 스타일을 안정적으로 유지하세요.
  • 긴 무음 구간은 피하기. 파일을 무음으로 채우기보다, 끊기지 않는 유용한 발화를 담아 주세요.
Voice clone recording checklist and current Pro, Advanced, and Ultra voice slot counts
시간을 더 늘리는 것보다, 더 좋은 원본 오디오가 유사도를 더 안정적으로 높입니다.

Know-how: 첫 클론이 약하게 들린다면, 훨씬 긴 녹음을 시도하기 전에 더 깨끗하고 더 일관된 오디오로 원본을 교체하세요. 품질이 섞인 자료는 제거하고 싶었던 ‘불일치’를 클론에게 학습시키는 경우가 많습니다.

Step 4: 업로드하고, 검토한 뒤, 샘플 이름 지정

파일을 Import Audio로 드래그하거나 드롭 영역을 클릭해 선택하세요. 파형이 표시되면 선택한 구간을 재생하면서 다른 화자, 음악, 클리핑, 에코, 갑작스러운 편집, 긴 무음이 있는지 들어보세요. 문제가 확실하다면 원본을 교체하세요.

최대 20자까지 설명적인 이름을 입력하세요. 로케일 접미사를 붙이면 여러 튜토리얼/캠페인 음성을 쉽게 구분할 수 있습니다. 예: Tutorial Voice-en.

Audio moving from the VisionStory upload area to a visible waveform ready for review and naming
실제로 선택된 구간을 검토한 뒤, Voice Library에서 알아볼 수 있는 짧은 이름을 사용하세요.

Step 5: 클론 생성 및 VisionStory의 언어 자동 감지

Clone Now를 클릭하세요. VisionStory가 샘플을 비동기적으로 처리하고 Cloned Voice 탭을 엽니다. 처리 중에는 항목이 갱신되며, 미리보기가 준비되면 재생할 수 있습니다.

원본 언어를 수동으로 선택할 필요가 없습니다. VisionStory가 녹음을 분석해 감지된 언어를 자동으로 지정합니다. 감지된 로케일, 액센트, 미리보기를 더 쉽게 판단할 수 있도록 원본 샘플에서는 한 가지 언어를 일관되게 사용하세요.

A ready VisionStory cloned voice with English detected automatically and a preview button
준비된 클론에 감지된 언어가 함께 표시되며, 클로닝 중에는 언어 선택기가 필요하지 않습니다.

6단계: 클론 미리보기, 선택 및 테스트

선택하기 전에 클론 행의 재생 버튼을 사용하세요. 음성 정체성, 억양, 말 속도, 발음, 공간 잔향, 잡음, 톤의 불안정한 변화가 있는지 들어보세요. 미리보기에서 뚜렷한 아티팩트가 들린다면, 완성된 비디오에서 문제를 발견하기보다 지금 원본 소스를 개선하는 것이 좋습니다.

복제된 음성을 선택한 다음 Script 박스에 짧은 문장 1개를 입력하고 Preview Audio를 클릭하세요. 짧게 테스트하면 비교가 쉬워지고, 클론이 앞으로 만들 콘텐츠 유형에 잘 맞는지도 확인할 수 있습니다.

VisionStory AI Video editor previewing a selected cloned voice with a short script
긴 제작에 사용하기 전에 짧은 스크립트로 클론을 테스트하세요.

Voice Clone 요금제 및 슬롯 제한

Voice Clone은 Pro 이상 요금제에서 사용할 수 있습니다. 저장된 복제 음성 1개는 삭제되기 전까지 슬롯 1개를 차지합니다.

요금제현재 음성 복제 제공량
Free미포함
Pro10 슬롯
Advanced20 슬롯
Ultra50 슬롯
Enterprise맞춤형

더 이상 클론이 필요 없으면 Cloned Voice를 열고 해당 음성을 삭제한 뒤 작업을 확인하세요. 클론을 삭제하면 슬롯이 해제됩니다. 삭제된 음성이 편집기에서 선택되어 있었다면, VisionStory는 사용 가능한 기본 음성으로 자동 전환됩니다.

지원 언어 88개

고유 언어 88개. VisionStory는 클론 샘플의 언어를 자동으로 감지하며, 사용 가능한 음성 옵션과 출력 특성은 언어에 따라 달라질 수 있습니다. 아래 목록은 지역 변형과 동의어 표기를 통합한 뒤, 언어별로 1개 항목만 집계했습니다.

  • 🇿🇦 아프리칸스어
  • 🇦🇱 알바니아어
  • 🇪🇹 암하라어
  • 🇸🇦 아랍어
  • 🇦🇲 아르메니아어
  • 🇮🇳 아삼어
  • 🇦🇿 아제르바이잔어
  • 🇪🇸 바스크어
  • 🇧🇾 벨라루스어
  • 🇧🇩 벵골어(방글라)
  • 🇧🇦 보스니아어
  • 🇧🇬 불가리아어
  • 🇲🇲 버마어
  • 🇭🇰 광둥어
  • 🇪🇸 카탈루냐어
  • 🇵🇭 세부아노어
  • 🇲🇼 치체와어
  • 🇨🇳 중국어(표준어)
  • 🇭🇷 크로아티아어
  • 🇨🇿 체코어
  • 🇩🇰 덴마크어
  • 🇳🇱 네덜란드어
  • 🇬🇧 영어
  • 🇪🇪 에스토니아어
  • 🇵🇭 필리핀어
  • 🇫🇮 핀란드어
  • 🇫🇷 프랑스어
  • 🇪🇸 갈리시아어
  • 🇬🇪 조지아어
  • 🇩🇪 독일어
  • 🇬🇷 그리스어
  • 🇮🇳 구자라트어
  • 🇭🇹 아이티 크리올어
  • 🇳🇬 하우사어
  • 🇮🇱 히브리어
  • 🇮🇳 힌디어
  • 🇭🇺 헝가리어
  • 🇮🇸 아이슬란드어
  • 🇮🇩 인도네시아어
  • 🇮🇪 아일랜드어
  • 🇮🇹 이탈리아어
  • 🇯🇵 일본어
  • 🇮🇩 자바어
  • 🇮🇳 칸나다어
  • 🇰🇿 카자흐어
  • 🇮🇳 콘카니어
  • 🇰🇷 한국어
  • 🇰🇬 키르기스어
  • 🇱🇦 라오어
  • 🇻🇦 라틴어
  • 🇱🇻 라트비아어
  • 🇨🇩 링갈라어
  • 🇱🇹 리투아니아어
  • 🇱🇺 룩셈부르크어
  • 🇲🇰 마케도니아어
  • 🇮🇳 마이틸리어
  • 🇲🇬 말라가시어
  • 🇲🇾 말레이어
  • 🇮🇳 말라얄람어
  • 🇮🇳 마라티어
  • 🇲🇳 몽골어
  • 🇳🇵 네팔어
  • 🇳🇴 노르웨이어
  • 🇮🇳 오디아어
  • 🇦🇫 파슈토어
  • 🇮🇷 페르시아어
  • 🇵🇱 폴란드어
  • 🇵🇹 포르투갈어
  • 🇮🇳 펀자브어
  • 🇷🇴 루마니아어
  • 🇷🇺 러시아어
  • 🇷🇸 세르비아어
  • 🇵🇰 신디어
  • 🇱🇰 싱할라어
  • 🇸🇰 슬로바키아어
  • 🇸🇮 슬로베니아어
  • 🇸🇴 소말리어
  • 🇪🇸 스페인어
  • 🇰🇪 스와힐리어
  • 🇸🇪 스웨덴어
  • 🇮🇳 타밀어
  • 🇮🇳 텔루구어
  • 🇹🇭 태국어
  • 🇹🇷 터키어
  • 🇺🇦 우크라이나어
  • 🇵🇰 우르두어
  • 🇻🇳 베트남어
  • 🇬🇧 웨일스어

집계 방식: 로케일별이 아니라 언어별로 1개 항목만 집계합니다. 예를 들어 영어의 지역 변형은 1회로, 노르웨이어 보크몰과 뉘노르스크는 1회로, 벵골어/방글라는 1회로 집계됩니다.

음성 클론이 충분히 비슷하게 들리지 않을 때 문제 해결

음성 정체성이 약하게 느껴짐

끊김 없는 하나의 녹음에서 더 깨끗한 1~2분 샘플로 소스를 교체해 보세요. 마이크, 공간, 말하는 속도, 퍼포먼스를 일관되게 유지하세요.

클론 음성이 거칠거나 금속성으로 들림

헤드폰으로 소스를 들어보세요. 배경 음악, 에코, 선풍기 소리, 교통 소음, 과도한 잡음 제거, 클리핑, 반복된 손실 압축 내보내기를 제거하세요. 보통은 추가 처리보다 더 깨끗한 원본이 훨씬 도움이 됩니다.

속도나 감정이 어색하게 느껴짐

클론은 샘플에서 그런 전달 방식을 학습합니다. 나중에 듣고 싶은 톤, 에너지, 말하는 속도, 화법으로 소스를 녹음하세요.

언어나 억양이 예상과 다름

샘플 전체에서 한 가지 언어만 사용하고, 클로닝 녹음 중에는 언어를 바꿔 말하지 마세요. 발음과 억양을 가장 잘 맞추려면, 공개할 예정인 언어로 클론을 만들고 테스트하세요.

내 음성 클론 만들기

깨끗한 소스 녹음 1개를 준비한 다음 AI 비디오를 열고, 더 긴 제작에 사용하기 전에 결과를 미리 확인하세요. 맞춤형 및 다국어 음성에 대한 자세한 내용은 VisionStory 음성 클로닝 기능을 확인해 보세요.

자주 묻는 질문

  • 품질이 중요하다면 1~2분 분량의 깨끗하고 일관된 음성을 사용하는 것이 좋아요. 이 제품은 3~120초 구간을 선택해 사용할 수 있으며, 직접 녹음은 빠른 테스트용으로 최대 15초까지 가능합니다.