Tiếng Việt

Xem hướng dẫn này trên YouTube

YouTube

Nhân bản giọng nói tạo ra một giọng nói tổng hợp có thể tái sử dụng từ bản ghi thật. VisionStory phân tích mẫu nguồn, xử lý âm thanh, nhận diện ngôn ngữ và đặc điểm giọng nói, tạo bản nhân bản và tạo bản xem trước để bạn đánh giá trước khi dùng trong video.

Tải lên chỉ là phần cơ học. Bản ghi nguồn quyết định kết quả nghe giống đến đâu và ổn định đến mức nào. Thường thì 1 phút ghi âm sạch, nhất quán sẽ hữu ích hơn vài phút được ghi bằng các micro khác nhau hoặc ở các phòng khác nhau.

Hãy sử dụng giọng nói một cách có trách nhiệm. Chỉ nhân bản giọng của chính bạn hoặc giọng mà bạn có quyền sử dụng rõ ràng. Không dùng nhân bản giọng nói để mạo danh người khác, lách sự đồng thuận hoặc đánh lừa khán giả.

  • Nguồn tốt nhất: 1–2 phút âm thanh sạch, chỉ 1 người nói.
  • Ghi nhanh: tối đa 15 giây ngay trong hộp thoại Clone.
  • Khả dụng: gói đăng ký Pro trở lên.

Bước 1: Mở Voice Clone trong Video AI

Mở Video AI và chọn avatar bạn dự định sử dụng. Ở dòng giọng nói bên dưới ô Script, nhấp Clone cạnh giọng hiện tại. Hộp thoại Clone sẽ mở ra mà không thay đổi giọng hiện có của avatar.

VisionStory AI Video editor with the Clone control highlighted beside the current voice
Voice Clone bắt đầu từ các điều khiển giọng nói trong trình chỉnh sửa Video AI.

Bước 2: Chọn Upload hoặc Record

Hộp thoại cung cấp 2 phương thức lấy nguồn. Hãy chọn dựa trên việc bạn đang thử quy trình hay muốn có mức độ giống nhất trong thực tế.

  • Upload audio: ưu tiên cho chất lượng. Khi có thể, hãy dùng mẫu sạch trong khoảng 1 đến 2 phút.
  • Record: hữu ích để thử nhanh. Trình ghi âm trong ứng dụng hiện ghi tối đa 15 giây.

Tệp tải lên có thể dùng .avi, .mp3, .mp4, .m4a, .wav hoặc .mov. Đoạn âm thanh được chọn phải dài ít nhất 3 giây và có thể lên đến 120 giây.

VisionStory Clone dialog comparing audio upload with the built-in recorder
Upload cung cấp đủ dữ liệu sạch để khớp giống hơn; Record là cách nhanh hơn để thử.

Bước 3: Chuẩn bị âm thanh để khớp giống hơn

Một bản sao Giọng nói không chỉ sao chép “danh tính” giọng. Nó còn có thể tái tạo nhịp nói, ngữ điệu, hơi thở, âm phòng, màu mic và các tạp âm/khuyết tật không mong muốn. Hãy ghi âm nguồn theo đúng phong cách bạn muốn bản sao sử dụng về sau.

  • Chỉ dùng một người nói. Loại bỏ nhạc, giọng chồng chéo và các cuộc trò chuyện ở nền.
  • Ghi 1–2 phút sạch. Tạo đủ biến thiên tự nhiên nhưng không trộn các phiên ghi thiếu nhất quán.
  • Chọn phòng yên tĩnh, không vọng. Nội thất mềm giúp giảm dội âm; tránh tiếng quạt, xe cộ và điều hòa.
  • Giữ mic ổn định. Duy trì cùng khoảng cách, góc, mức đầu vào và không gian phòng cho toàn bộ mẫu.
  • Nói tự nhiên và nhất quán. Giữ ổn định giọng địa phương, độ to, tốc độ và phong cách thể hiện.
  • Tránh các khoảng lặng dài. Dùng lời nói liên tục, hữu ích thay vì “đệm” im lặng vào tệp.
Voice clone recording checklist and current Pro, Advanced, and Ultra voice slot counts
Âm thanh nguồn tốt hơn giúp tăng độ giống một cách đáng tin cậy hơn so với chỉ đơn giản là thêm nhiều phút ghi âm.

Mẹo: nếu bản sao đầu tiên nghe không ổn, hãy thay nguồn bằng âm thanh sạch và nhất quán hơn trước khi thử một bản ghi dài hơn nhiều. Tư liệu chất lượng lẫn lộn thường “dạy” cho bản sao chính những điểm thiếu nhất quán mà bạn muốn loại bỏ.

Bước 4: Tải lên, rà soát và đặt tên mẫu

Kéo thả tệp vào Import Audio hoặc nhấp vào vùng thả để chọn tệp. Khi dạng sóng xuất hiện, hãy phát đoạn đã chọn và nghe xem có người nói khác, nhạc, vỡ tiếng, tiếng vọng, cắt dựng gắt hoặc im lặng dài không. Nếu các vấn đề này rõ ràng, hãy thay nguồn.

Nhập tên mô tả tối đa 20 ký tự. Thêm hậu tố theo locale giúp phân biệt nhiều giọng cho tutorial hoặc chiến dịch dễ hơn; ví dụ: Tutorial Voice-en.

Audio moving from the VisionStory upload area to a visible waveform ready for review and naming
Rà soát đúng đoạn đã chọn, rồi dùng một tên ngắn mà bạn sẽ nhận ra trong Thư viện Giọng nói.

Bước 5: Tạo bản sao và để VisionStory tự phát hiện ngôn ngữ

Nhấp Clone Now. VisionStory xử lý mẫu theo cách bất đồng bộ và mở tab Cloned Voice. Mục này sẽ tự làm mới trong khi xử lý và có thể phát khi bản xem trước sẵn sàng.

Bạn không cần chọn ngôn ngữ nguồn thủ công. VisionStory phân tích bản ghi và tự gán ngôn ngữ được phát hiện. Hãy dùng nhất quán một ngôn ngữ trong mẫu nguồn để locale, giọng địa phương và bản xem trước dễ đánh giá hơn.

A ready VisionStory cloned voice with English detected automatically and a preview button
Ngôn ngữ được phát hiện sẽ hiển thị cùng bản sao đã sẵn sàng; không cần bộ chọn ngôn ngữ trong lúc tạo bản sao.

Bước 6: Xem trước, chọn và kiểm tra bản sao

Hãy dùng nút phát trên hàng bản sao trước khi chọn. Lắng nghe để kiểm tra “chất” giọng, giọng vùng miền, nhịp độ, phát âm, tiếng vọng trong phòng, tạp âm và các thay đổi tông giọng không ổn định. Nếu bản xem trước có lỗi/“artifact” rõ rệt, hãy cải thiện nguồn âm ngay bây giờ thay vì chỉ phát hiện vấn đề khi video đã hoàn thiện.

Chọn giọng nói đã clone, nhập một câu ngắn vào ô Script và nhấp Preview Audio. Một bài test ngắn giúp bạn so sánh dễ hơn và xác nhận bản clone phù hợp với kiểu nội dung bạn dự định tạo.

VisionStory AI Video editor previewing a selected cloned voice with a short script
Hãy kiểm tra bản clone bằng một đoạn script ngắn trước khi dùng cho một bản sản xuất dài hơn.

Các gói Voice Clone và giới hạn slot

Voice Clone có trên gói Pro trở lên. Mỗi giọng nói đã clone và lưu sẽ chiếm 1 slot cho đến khi bạn xóa.

GóiHạn mức voice clone hiện tại
FreeKhông bao gồm
Pro10 slot
Advanced20 slot
Ultra50 slot
EnterpriseTùy chỉnh

Khi không còn cần một bản clone, hãy mở Cloned Voice, xóa giọng đó và xác nhận thao tác. Xóa bản clone sẽ giải phóng slot tương ứng. Nếu giọng đã xóa đang được chọn trong editor, VisionStory sẽ tự chuyển sang một giọng mặc định còn khả dụng.

88 Ngôn Ngữ Được Hỗ Trợ

88 ngôn ngữ độc nhất. VisionStory tự động phát hiện ngôn ngữ của mẫu clone; các tùy chọn giọng nói khả dụng và đặc tính đầu ra có thể khác nhau theo từng ngôn ngữ. Danh sách bên dưới tính một mục cho mỗi ngôn ngữ sau khi gộp các biến thể theo vùng và các tên gọi tương đương.

  • 🇿🇦 Afrikaans
  • 🇦🇱 Tiếng Albania
  • 🇪🇹 Tiếng Amharic
  • 🇸🇦 Tiếng Ả Rập
  • 🇦🇲 Tiếng Armenia
  • 🇮🇳 Tiếng Assamese
  • 🇦🇿 Tiếng Azerbaijan
  • 🇪🇸 Tiếng Basque
  • 🇧🇾 Tiếng Belarus
  • 🇧🇩 Tiếng Bengali (Bangla)
  • 🇧🇦 Tiếng Bosnia
  • 🇧🇬 Tiếng Bulgaria
  • 🇲🇲 Tiếng Myanmar
  • 🇭🇰 Tiếng Quảng Đông
  • 🇪🇸 Tiếng Catalan
  • 🇵🇭 Tiếng Cebuano
  • 🇲🇼 Tiếng Chichewa
  • 🇨🇳 Tiếng Trung (Quan Thoại)
  • 🇭🇷 Tiếng Croatia
  • 🇨🇿 Tiếng Séc
  • 🇩🇰 Tiếng Đan Mạch
  • 🇳🇱 Tiếng Hà Lan
  • 🇬🇧 Tiếng Anh
  • 🇪🇪 Tiếng Estonia
  • 🇵🇭 Tiếng Filipino
  • 🇫🇮 Tiếng Phần Lan
  • 🇫🇷 Tiếng Pháp
  • 🇪🇸 Tiếng Galicia
  • 🇬🇪 Tiếng Georgia
  • 🇩🇪 Tiếng Đức
  • 🇬🇷 Tiếng Hy Lạp
  • 🇮🇳 Tiếng Gujarati
  • 🇭🇹 Tiếng Creole Haiti
  • 🇳🇬 Tiếng Hausa
  • 🇮🇱 Tiếng Do Thái
  • 🇮🇳 Tiếng Hindi
  • 🇭🇺 Tiếng Hungary
  • 🇮🇸 Tiếng Iceland
  • 🇮🇩 Tiếng Indonesia
  • 🇮🇪 Tiếng Ireland
  • 🇮🇹 Tiếng Ý
  • 🇯🇵 Tiếng Nhật
  • 🇮🇩 Tiếng Java
  • 🇮🇳 Tiếng Kannada
  • 🇰🇿 Tiếng Kazakh
  • 🇮🇳 Tiếng Konkani
  • 🇰🇷 Tiếng Hàn
  • 🇰🇬 Tiếng Kyrgyz
  • 🇱🇦 Tiếng Lào
  • 🇻🇦 Tiếng Latin
  • 🇱🇻 Tiếng Latvia
  • 🇨🇩 Tiếng Lingala
  • 🇱🇹 Tiếng Litva
  • 🇱🇺 Tiếng Luxembourg
  • 🇲🇰 Tiếng Macedonia
  • 🇮🇳 Tiếng Maithili
  • 🇲🇬 Tiếng Malagasy
  • 🇲🇾 Tiếng Mã Lai
  • 🇮🇳 Tiếng Malayalam
  • 🇮🇳 Tiếng Marathi
  • 🇲🇳 Tiếng Mông Cổ
  • 🇳🇵 Tiếng Nepali
  • 🇳🇴 Tiếng Na Uy
  • 🇮🇳 Tiếng Odia
  • 🇦🇫 Tiếng Pashto
  • 🇮🇷 Tiếng Ba Tư
  • 🇵🇱 Tiếng Ba Lan
  • 🇵🇹 Tiếng Bồ Đào Nha
  • 🇮🇳 Tiếng Punjabi
  • 🇷🇴 Tiếng Romania
  • 🇷🇺 Tiếng Nga
  • 🇷🇸 Tiếng Serbia
  • 🇵🇰 Tiếng Sindhi
  • 🇱🇰 Tiếng Sinhala
  • 🇸🇰 Tiếng Slovakia
  • 🇸🇮 Tiếng Slovenia
  • 🇸🇴 Tiếng Somali
  • 🇪🇸 Tiếng Tây Ban Nha
  • 🇰🇪 Tiếng Swahili
  • 🇸🇪 Tiếng Thụy Điển
  • 🇮🇳 Tiếng Tamil
  • 🇮🇳 Tiếng Telugu
  • 🇹🇭 Tiếng Thái
  • 🇹🇷 Tiếng Thổ Nhĩ Kỳ
  • 🇺🇦 Tiếng Ukraine
  • 🇵🇰 Tiếng Urdu
  • 🇻🇳 Tiếng Việt
  • 🇬🇧 Tiếng Wales

Cách tính: một mục cho mỗi ngôn ngữ thay vì theo từng locale — ví dụ, các biến thể tiếng Anh theo vùng chỉ tính 1 lần, tiếng Na Uy Bokmål và Nynorsk tính 1 lần, và Bengali/Bangla tính 1 lần.

Khắc phục sự cố khi Giọng Nói Clone không giống như mong đợi

Cảm giác nhận diện giọng nói bị yếu

Thay nguồn bằng một mẫu sạch hơn dài 1-2 phút từ một bản ghi liền mạch, không bị ngắt quãng. Giữ micro, không gian, nhịp nói và cách thể hiện nhất quán.

Giọng clone nghe ồn hoặc kiểu kim loại

Nghe lại bản nguồn bằng tai nghe. Loại bỏ nhạc nền, tiếng vọng, tiếng quạt, tiếng xe cộ, khử nhiễu quá mạnh, bị vỡ tiếng (clipping), và việc xuất file nén nhiều lần. Bản gốc sạch hơn thường giúp nhiều hơn so với xử lý thêm.

Nhịp nói hoặc cảm xúc không đúng

Giọng clone học các lựa chọn thể hiện đó từ mẫu. Hãy ghi âm bản nguồn với tông giọng, năng lượng, nhịp nói và phong cách bạn muốn nghe về sau.

Ngôn ngữ hoặc giọng (accent) không như dự kiến

Dùng một ngôn ngữ xuyên suốt mẫu và tránh chuyển đổi ngôn ngữ khi ghi âm để clone. Để khớp phát âm và accent tốt nhất, hãy clone và thử nghiệm với ngôn ngữ bạn dự định xuất bản.

Tạo Giọng Nói Clone của bạn

Chuẩn bị một bản ghi nguồn sạch, mở Video AI và xem trước kết quả trước khi dùng trong một sản xuất dài hơn. Xem tính năng voice cloning của VisionStory để biết thêm về giọng nói tùy chỉnh và đa ngôn ngữ.

Câu hỏi thường gặp

  • Hãy dùng mẫu lời nói sạch, nhất quán dài 1 đến 2 phút khi bạn cần chất lượng tốt. Sản phẩm chấp nhận một đoạn được chọn từ 3 đến 120 giây, còn ghi âm trực tiếp bị giới hạn 15 giây để test nhanh.