Tiếng Việt

Xem hướng dẫn này trên YouTube

YouTube

Bạn muốn biến một bức ảnh tĩnh thành ảnh biết nói—một bức chân dung có thể há miệng, chớp mắt và nói bất cứ điều gì bạn gõ vào? Với VisionStory, bạn có thể làm điều đó chỉ từ một ảnh duy nhất, ngay trên trình duyệt, không cần máy quay và không cần kinh nghiệm chỉnh sửa. Video phía trên sẽ hướng dẫn toàn bộ quy trình, còn hướng dẫn từng bước bên dưới sẽ đi vào chi tiết từng phần.

Trong quá trình thực hiện, bạn sẽ tải lên một ảnh chân dung và chuẩn bị nó thành avatar tái sử dụng của riêng bạn. Người dùng khác không thể nhìn thấy avatar này, và bạn có thể chọn lại cho các video sau thay vì phải tải cùng một ảnh lên mỗi lần. Mọi thứ chạy ngay trong công cụ ảnh biết nói của VisionStory với tài khoản miễn phí.

Bước 1: Tải lên một ảnh chân dung rõ nét

Mở Video AI. Trong bảng Characters, chọn Upload và chọn ảnh từ thiết bị, hoặc kéo thả ảnh trực tiếp vào vùng tải lên. Hãy dùng ảnh một người rõ nét, nhìn thẳng, thấy cả khuôn mặt và vai, mắt và miệng không bị che, và chừa một chút khoảng trống xung quanh để dễ căn khung lại về sau.

  • Tệp hỗ trợ: JPG, JPEG, PNG, WebP và HEIC.
  • Dung lượng tệp tối đa: 30 MB.
  • Kích thước khởi điểm khuyến nghị: tối thiểu 512 x 768 pixel cho ảnh chân dung.
  • Cách tải lên: mỗi lần 1 ảnh nguồn.
Dragging a portrait onto the Upload control in the VisionStory Characters panel

Hãy căn bố cục ảnh nguồn theo nơi bạn sẽ xuất bản video. Một ảnh chân dung cắt quá sát có thể ổn ở tỷ lệ 9:16 nhưng lại thành cận mặt khó chịu ở 16:9, vì không còn phần ảnh bên trái và phải để lấp đầy khung hình rộng hơn.

Bước 2: Để VisionStory kiểm tra và chuẩn bị avatar

Sau khi tải lên, VisionStory sẽ kiểm tra xem ảnh có chứa người dùng được hay không và chuẩn bị ảnh thành một nhân vật. Lỗi tải lên gần như luôn xuất phát từ ảnh nguồn: khuôn mặt có thể quá nhỏ, bị che nhiều, quay quá nghiêng, bị mờ hoặc quá sát một khuôn mặt khác.

Nếu bước chuẩn bị thất bại, đừng thử lại mãi với cùng một phần cắt. Hãy chọn ảnh nguồn sắc nét hơn với một khuôn mặt lớn hơn, góc chụp trực diện hơn, thấy vai, ánh sáng đều và ít bị che khuất hơn.

VisionStory avatar preview beside a checklist for a clear, unobstructed source photo

Khi xử lý xong, avatar sẽ xuất hiện phía trên thư viện nhân vật công khai và mở trong phần xem trước avatar. Chỉ bạn mới nhìn thấy avatar này.

Bước 3: Nghe thử hoặc đổi giọng nói được gán

VisionStory sẽ tự động gán một Giọng nói khởi đầu phù hợp dựa trên độ tuổi và giới tính ước tính của nhân vật. Bạn có thể giữ nguyên, nghe thử hoặc đổi sang giọng khác.

  1. Chọn giọng hiện tại để mở Voice Library.
  2. Dùng nút phát ở bên phải của một giọng để nghe mẫu.
  3. Nếu chưa phù hợp, hãy lọc theo Language, Gender, Age và Use Case.
  4. Nghe thử vài lựa chọn, rồi chọn giọng khớp với cả avatar lẫn mục đích của video.
VisionStory Voice Library with Language, Gender, Age, and Use Case filters and a preview button

Một giọng nói có thể hợp với độ tuổi và giới tính ước tính nhưng vẫn “lệch” khi dùng cho thuyết minh, giáo dục, quảng cáo hoặc nội dung hội thoại. Hãy khớp cả nhân vật lẫn mục đích, không chỉ nhân khẩu học.

Bước 4: Căn lại khung hình cho nơi bạn sẽ đăng

Dùng phần xem trước avatar để quyết định sẽ hiển thị bao nhiêu phần của nhân vật trong video cuối. Kéo ảnh để đổi vị trí chủ thể và dùng zoom để tiến gần hoặc lùi xa. Sau đó chọn Tỷ lệ khung hình phù hợp với nơi bạn sẽ xuất bản:

  • 9:16 dọc cho TikTok, Instagram Reels, YouTube Shorts và các vị trí ưu tiên di động khác.
  • 1:1 vuông cho bài đăng mạng xã hội dạng vuông, bố cục tập trung vào hồ sơ và nhúng linh hoạt.
  • 16:9 ngang cho YouTube, thuyết trình, website và khóa học màn hình rộng.
The same VisionStory avatar shown in 9:16, 1:1, and 16:9 aspect ratios

Zoom không thể tạo ra pixel vốn không tồn tại. Nếu nhân vật đã chạm mọi cạnh của ảnh nguồn, hãy bắt đầu từ ảnh có nhiều nền hơn thay vì ép cắt rộng ra.

Bước 5: Hiểu Change Look và Generate Image dùng để làm gì

Có 2 công cụ hình ảnh AI nằm cạnh avatar, và bạn nên hiểu sự khác nhau trước khi dùng.

Change Look mở một cuộc trò chuyện AI với avatar hiện tại đã được đính kèm sẵn, để bạn mô tả trang phục, bối cảnh hoặc phong cách mới. Đây là quy trình image-to-image, và avatar gốc vẫn luôn có sẵn. Generate Image bắt đầu từ mô tả nhân vật bằng chữ thay vì ảnh, nên đây là quy trình text-to-image. Với cả hai, bạn có thể tiếp tục chat để tinh chỉnh kết quả.

VisionStory Change Look chat opened with the current avatar attached as the starting image

Tóm lại: dùng Change Look khi nhân vật đã có sẵn và cần đổi “diện mạo”, còn dùng Generate Image khi bạn muốn tạo nhân vật từ prompt.

Bước 6: Thêm kịch bản ngắn và tạo video biết nói

Khi đã chọn avatar bạn tải lên, hãy gõ một câu ngắn theo kiểu hội thoại trong ô Script. Một câu ngắn sẽ render nhanh hơn và giúp bạn dễ đánh giá tổng thể: ảnh, khung cắt, giọng nói, đồng bộ khẩu hình và chuyển động.

Nhấn Generate Talking Video. VisionStory sẽ tạo chuyển động cho khuôn mặt, đồng bộ khẩu hình theo Giọng nói, và thêm nháy mắt cùng chuyển động đầu chân thực dựa trên avatar, khung hình, kịch bản và giọng bạn đã chọn. Quá trình render mất vài phút.

A short VisionStory script generating a talking-avatar result from the uploaded portrait

Hãy coi kết quả đầu tiên này như một bài test thực tế cho ảnh nguồn. Kiểm tra 4 điểm sau:

  • Khuôn mặt vẫn đủ nét ở kích thước cuối.
  • Mắt và miệng không bị che khi chuyển động.
  • Đầu và vai nằm gọn trong tỷ lệ đã chọn.
  • Avatar khi chuyển động vẫn giống người trong ảnh nguồn.

Nếu khung cắt quá sát hoặc khuôn mặt trông bị mềm khi chuyển động, hãy xử lý ảnh nguồn hoặc khung hình trước. Đổi kịch bản sẽ không sửa được vấn đề bố cục.

Bước 7: Tái sử dụng hoặc xóa avatar ảnh biết nói của bạn

Quay lại danh sách Characters, avatar bạn tải lên sẽ nằm phía trên thư viện nhân vật công khai và có thể được chọn bất cứ khi nào bạn muốn dùng lại cùng một người dẫn. Người dùng khác không thể nhìn thấy, và người đăng ký có thể tạo và lưu không giới hạn avatar.

  • Tái sử dụng: chọn avatar thay vì tải ảnh lên lại.
  • Đổi giao diện: mở avatar và chọn một thumbnail diện mạo đã lưu.
  • Xóa: đưa chuột lên avatar để hiện nút xóa ở góc trên bên phải, rồi xác nhận trước khi xóa avatar và các diện mạo của nó.
A reusable uploaded avatar in VisionStory Characters with the delete control and confirmation dialog

Khắc phục các lỗi ảnh phổ biến

VisionStory không tìm thấy khuôn mặt dùng được. Dùng ảnh sáng và nét hơn, với một khuôn mặt lớn hơn, nhìn thẳng. Tránh ảnh che mắt/miệng, góc nghiêng kiểu profile quá mạnh, và ảnh có khuôn mặt khác ở quá gần chủ thể chính.

Khung cắt ngang quá sát. Ảnh chân dung nguồn có thể không đủ phần ảnh ở hai bên. Hãy dùng ảnh nguồn rộng hơn hoặc ảnh có nhiều khoảng trống xung quanh người.

Avatar vẫn đang chuẩn bị. Chờ xử lý xong rồi hãy dùng nhân vật. Nếu bị đứng, hãy làm mới phần Characters và kiểm tra xem avatar đã xuất hiện chưa trước khi tải thêm một bản khác.

Kết quả trông bị mềm. Hãy bắt đầu từ ảnh độ phân giải cao, lấy nét tốt và tránh phóng to khuôn mặt nhỏ quá mức. Độ phân giải đầu ra không thể khôi phục chi tiết vốn thiếu ở ảnh nguồn.

Chỉ vậy là bạn đã làm cho ảnh biết nói: tải lên một ảnh chân dung, khớp giọng, căn khung hình và tạo video. Ảnh của bạn giờ đã là một avatar biết nói có thể tái sử dụng bất cứ khi nào bạn cần.

Muốn xem quy trình đầy đủ về kịch bản, giọng nói, cài đặt, Credit và workflow tạo video? Hãy xem Cách Tạo AI Talking Avatar, hoặc biến kịch bản dài thành Video AI với quy mô lớn. Hoặc bắt đầu ngay: tạo ảnh biết nói đầu tiên miễn phí.

Câu hỏi thường gặp

  • Tải lên một ảnh rõ nét, chụp chính diện vào công cụ ảnh biết nói của VisionStory, gõ một câu ngắn để ảnh nói, chọn hoặc giữ nguyên giọng nói được gán, rồi nhấn Generate Talking Video. Bạn sẽ nhận được video biết nói đồng bộ khẩu hình ngay trên trình duyệt chỉ trong vài phút với gói miễn phí, không cần cài đặt phần mềm.