Tiếng Việt

Hoán đổi khuôn mặt trong video phù hợp khi phần diễn xuất đã ổn — chuyển động, cách thể hiện, góc máy — nhưng người xuất hiện trên màn hình cần được thay đổi, với sự cho phép. Các trường hợp phổ biến: tạo phiên bản quảng cáo với người mẫu đã được cấp phép khác cho cùng một cảnh quay, cho nhân vật ảo của bạn tái sử dụng một màn trình diễn, hoặc điều chỉnh danh tính nhân vật mà không phải quay lại hành động hay bối cảnh.

Hướng dẫn này dùng một clip người phát ngôn hư cấu dài 6 giây, tỷ lệ 16:9 làm nguồn, và chèn khuôn mặt tham chiếu của một người hư cấu khác. Tất cả các khuôn mặt trong bài đều được tạo ra cho tutorial này và không liên quan đến bất kỳ người thật nào. Không tải lên cảnh quay hay khuôn mặt khi chưa được cho phép, và tuyệt đối không dùng hoán đổi video để mạo danh ai, đánh lừa người xem, hoặc vượt qua các bước kiểm tra danh tính.

Bước 1: Mở Face Swap và chọn chế độ Video

Trong công cụ Face Swap của VisionStory, chọn Video ở phía trên. Trang này hỗ trợ tải lên MP4, MOV và WEBM, và các mẫu Quick Start sẽ cho bạn thấy định dạng đầu vào mong đợi.

Khi làm thật, hãy tải lên footage mà bạn có quyền sử dụng. Nên chọn video chỉ có một chủ thể với khuôn mặt đủ lớn, rõ nét và ánh sáng ổn định — nhiều người, khuôn mặt bị che thường xuyên, và chuyển động mạnh đều khiến việc theo dõi liên tục khó hơn.

The Video tab highlighted in VisionStory Face Swap with the upload area and supported formats below
Chọn tab Video được tô sáng trước, rồi tải lên clip có người trên màn hình sẽ được thay thế.

Bước 2: Tải video nguồn lên và xem từ đầu đến cuối

Nhấn Choose Files or Drag & Drop và tải clip nguồn lên. Nó sẽ được tải ở bên trái dưới dạng Source Video, có thanh tua và điều khiển âm thanh. Ví dụ là một cảnh quay ngang dài 6 giây, trong đó người dẫn nói, chớp mắt và hơi quay đầu.

Đừng đánh giá chỉ dựa vào khung hình đầu tiên. Hãy phát toàn bộ clip và xác nhận chỉ có một chủ thể chính, khuôn mặt không rời khung hình quá lâu, và không có thứ gì — tay, tóc, micro, chuyển động nhanh — che khuôn mặt trong một đoạn dài. Hoán đổi sẽ giữ nguyên chuyển động, trang phục, hậu cảnh và âm thanh của video nguồn, mọi thứ trừ khuôn mặt, nên các yếu tố đó phải đúng sẵn trước khi bạn tiêu Credit.

A six-second spokesperson clip loaded as the Source Video in VisionStory video face swap
Tua toàn bộ Source Video để kiểm tra quay đầu, chớp mắt, lời thoại và các đoạn bị che, thay vì chỉ soi khung hình đại diện.

Bước 3: Tải khuôn mặt đích lên và xác nhận chi phí Credit

Nhấn Upload/Select Avatar ở bên phải và thêm khuôn mặt đích đã được cho phép qua hộp thoại Add Character. Hãy dùng ảnh tham chiếu rõ nét, không bị che, có góc mặt gần với góc nhìn chủ đạo của video — tránh kính dày, tránh tay che mặt.

Quay lại trang, bên trái là video nguồn và bên phải là khuôn mặt đích. Nút tạo sẽ tính giá tác vụ hiện tại theo Credit; ví dụ 6 giây này hiển thị 24 Credit tại thời điểm gửi. Hãy coi con số hiển thị trên trang là chuẩn — nó thay đổi theo độ dài video và quy tắc sản phẩm.

VisionStory video face swap with the source clip on the left, the target face on the right, and the Generate Video button
Hãy xác nhận đúng thứ tự đầu vào trước khi tạo: Source Video cung cấp chuyển động và bối cảnh, Target Avatar cung cấp danh tính mới.

Bước 4: Tạo và tìm kết quả trong History

Nhấn Generate Video. Tác vụ sẽ xuất hiện trong lịch sử Videos bên dưới — hiển thị Generating khi đang chạy, sau đó hiện thời lượng, độ phân giải và tiêu đề khi hoàn tất. Ví dụ trả về 00:06 ở 720p, khớp với clip đã gửi.

Đừng gửi lại cùng một tác vụ khi đang tạo. Hãy chờ thẻ có thể phát được, rồi mở trong Video Viewer.

The VisionStory Face Swap history showing a completed six-second 720p video face swap task
Các tác vụ đã xong sẽ nằm trong danh sách Videos — mở thẻ để phát lại lần cuối và tải xuống.

Bước 5: Kiểm tra bám khuôn mặt theo từng đoạn, rồi tải xuống

Phát kết quả từ đầu và tua qua phần mở đầu, giữa và cuối. Quan sát khóe miệng khi nói, nhịp chớp mắt, lông mày, đường chân tóc và đường viền hàm — và xem danh tính có giữ vững khi đầu quay không.

Ví dụ tạm dừng gần cuối ở một khung hình tự nhiên, mắt mở: khuôn mặt đích vẫn bám theo biểu cảm và góc mặt của nguồn, trong khi bộ đồ màu cam, chuyển động cơ thể, nền sofa, âm thanh và thời lượng đều không đổi. Chỉ sau khi xác nhận không bị nháy trở lại khuôn mặt gốc, không bị trôi viền, và không bị nhảy tông da, bạn mới nên nhấn tải xuống.

The VisionStory Video Viewer paused on a natural frame of a completed video face swap near the end of the clip
Cả video nguồn lẫn kết quả đều nên được đánh giá trên các khung hình tự nhiên, nhìn rõ — và vẫn phải tua qua mọi biểu cảm và mọi góc quay đầu.

Các vấn đề thường gặp và cách khắc phục

  • Khuôn mặt gốc nháy trở lại giữa video. Kiểm tra mốc thời gian đó xem có quay đầu nhanh, khuôn mặt rời khung hình, mờ do chuyển động, hay bị che lâu không. Cắt video về đoạn mà khuôn mặt luôn nhìn thấy thường hiệu quả hơn việc tạo lại một clip khó nhiều lần.
  • Miệng, mắt hoặc đường chân tóc bị trôi khi chuyển động. Dùng ảnh tham chiếu sắc nét hơn, đầy đủ hơn, có góc mặt giống góc nhìn chủ đạo của video; đồng thời đảm bảo khuôn mặt nguồn có đủ pixel — không bị nén quá mạnh hoặc bị nhiễu.
  • Danh tính ổn nhưng lệch với cơ thể hoặc trang phục. Hoán đổi không chạm vào cơ thể, tóc, quần áo hay bối cảnh. Hãy chọn khuôn mặt đích hài hòa với tuổi, tông da và phong cách của nhân vật nguồn — hoặc đổi video nguồn.
  • Âm thanh không thay đổi. Đây là điều bình thường. Hoán đổi khuôn mặt trong video chỉ thay khuôn mặt; giọng nói vẫn thuộc về video nguồn. Hãy đổi riêng bằng quy trình Thay Đổi Giọng Nói AI đã được cho phép.

Một hoán đổi khuôn mặt trong video đáng tin cậy cần đồng thời 3 yếu tố: khuôn mặt nguồn luôn rõ nét và nhìn thấy, ảnh tham chiếu được cho phép và khớp góc, cùng việc rà soát toàn bộ timeline. Hoán đổi ảnh chỉ bị đánh giá trong một khung hình — còn hoán đổi video phải “sống sót” qua mọi lần chớp mắt, từng từ nói ra và mỗi lần quay đầu, vì vậy đừng bao giờ để một khung hình xem trước đại diện cho clip hoàn thiện. Với ảnh tĩnh, hãy bắt đầu từ hoán đổi khuôn mặt trong ảnh.

Câu hỏi thường gặp

  • Tính năng này phát hiện và theo dõi khuôn mặt xuyên suốt các khung hình của video, rồi áp dụng danh tính mục tiêu cho từng khung hình — kể cả khi nói chuyện, nháy mắt hay quay đầu — đồng thời giữ nguyên chuyển động, trang phục, bối cảnh và âm thanh của video nguồn.