Tiếng Việt

Đầu vào là gì và đầu ra nhận được gì

Dành cho ai

Đội ngũ kể chuyện và IP

Các đội ngũ kể chuyện theo tập: series ngắn lấy nhân vật làm trung tâm, chuyện kể hoạt hình, và nhân vật IP thương hiệu cần quay lại vào tháng sau mà vẫn phải được nhận ra.

Bạn bắt đầu với

Một nhân vật bạn đã chốt sẵn

Mô tả nhân vật bằng văn bản hoặc ảnh tham chiếu, kịch bản hoặc lời thoại của bạn, và sự cho phép bằng văn bản đối với mọi gương mặt hoặc giọng nói thật mà nhân vật được xây dựng dựa trên đó.

Bạn nhận được

Một persona có thể tái sử dụng và các shot tương ứng

Một hồ sơ nhân vật cố định, kèm ảnh cảnh, các shot hoạt ảnh và key art ở kích thước xuất bản được tạo từ đó, bàn giao dưới dạng file để bạn tự dựng và phát hành.

Điều gì thay đổi khi nhân vật không còn “trôi” nữa

Nội dung lấy nhân vật làm trung tâm thường “hỏng” theo một cách rất đặc thù. Không phải ở phần viết và cũng không phải ở phần render, mà là ở khoảnh khắc người xem thôi tin rằng người trên màn hình ở tập 5 chính là người họ gặp ở tập 1. Tất cả nội dung bên dưới đều xoay quanh việc giữ vững niềm tin đó xuyên suốt các cảnh, các mùa và bất kỳ ai tình cờ đang làm việc tuần đó — đồng thời làm rõ phần nào quy trình có thể gánh giúp và phần nào vẫn phải là quyết định của con người.

Tập 9 vẫn trông như tập 1

Tập 3 vừa lên, bình luận đầu tiên bên dưới đã hỏi: có phải cô gái này là người ở tập 1 không. Về mặt kỹ thuật thì đúng. Nhưng xương hàm thon hơn, ngôi tóc đổi sang phía còn lại và mắt nhạt màu hơn một tông; một khi người xem đã nhận ra, họ sẽ nhìn gương mặt thay vì theo dõi câu chuyện. Prompt lại đúng đoạn mô tả từng hiệu quả ở tập 1 chỉ trả về “họ hàng”, chứ không phải nhân vật đó.

Cách khắc phục là ngừng mô tả nhân vật và bắt đầu tái sử dụng cô ấy. Một persona được dựng một lần sẽ giữ gương mặt, giọng nói và diện mạo như một tham chiếu cố định; mọi cảnh về sau được tạo dựa trên tham chiếu đó thay vì dựa trên một đoạn văn ai đó viết lại theo trí nhớ. VisionStory giúp nhân vật luôn dễ nhận ra; nhưng không quyết định cô ấy là ai. Bạn vẫn cần ghi lại nhân vật, và vẫn phải xem khung hình đầu tiên của mỗi cảnh mới để phát hiện các chi tiết bị “trôi”: trang phục, đường chân tóc, vết sẹo nhỏ phải luôn nằm trên cùng một bên má.

Viết cảnh hội thoại như một bản dựng, không phải một prompt

Nhịp diễn thì dễ mô tả nhưng khó tạo: hai nhân vật ngồi ở bàn, một người nói dối, người kia nhận ra muộn hơn đúng 1 nhịp. Nếu chỉ yêu cầu bằng một prompt, cảnh nhiều nhân vật thường trả về hai người cùng nói thẳng vào máy quay, không ai nhìn ai, và khoảng lặng tạo nên cả nhịp diễn thì biến mất. Trong footage cũng không có gì để cắt dựng, vì shot vốn dĩ chưa bao giờ được tạo ra để có thể cắt.

Dựng cảnh theo đúng cách mà một biên tập viên sẽ nhận. Mỗi nhân vật có bộ cảnh quay riêng, được tạo từ hồ sơ đã khóa của chính họ, nên gương mặt luôn nhất quán trong khi bạn quyết định ai xuất hiện cho từng câu thoại và họ sẽ nhìn về đâu khi câu thoại rơi xuống. Việc thay lượt nói, phản ứng đến muộn, khoảng lặng trước khi trả lời — đó là những cú cắt do bạn quyết định, không phải “cài đặt”. VisionStory tạo ra các cảnh quay và giọng nói; nhịp điệu làm cho cảnh hoạt động vẫn là quyết định đạo diễn của bạn.

Một nhân vật là một bộ quy tắc, không phải một thư mục ảnh chụp màn hình

Người hiểu rõ nhân vật thường chỉ là một freelancer, và thứ họ biết nằm trong một thư mục tài liệu tham chiếu trên laptop của họ và trong đầu họ. Hợp đồng kết thúc giữa các mùa. Người tiếp theo mở kho lưu trữ, lần ngược từ ảnh tĩnh rồi đoán: chiếc áo khoác có phải “thuộc về” nhân vật không hay chỉ là tập 4, cô ấy có bao giờ nói câu cửa miệng ở hồi 1 không, trông cô ấy phải “đọc” như bao nhiêu tuổi. Đến tập thứ 10, chẳng ai trả lời được nếu không phải cuộn đi cuộn lại.

Hãy coi nhân vật là 4 thứ luôn đi cùng nhau: một gương mặt, một giọng nói, một cách nói chuyện, và một danh sách ngắn các quy tắc ngoại hình không được phép thay đổi. Khi được giữ như một “persona” có thể tái sử dụng kèm theo một thư viện cảnh có tên bên cạnh, bộ đó có thể bàn giao trơn tru. Cộng tác viên mới chỉ việc mở hồ sơ và tạo cảnh tiếp theo từ đó, thay vì phải “giải mã ngược” cảnh trước. Chính bạn là người viết ra các quy tắc ấy, và đáng để viết chúng trước tập 2, chứ không phải sau tập 9.

Khi nhân vật được xây dựng từ một người thật

Rất nhiều nhân vật trong câu chuyện bắt đầu từ một người thật: nhà sáng lập trở thành linh vật thương hiệu, một diễn viên được chọn cho series, hay một đồng nghiệp có giọng nói mà ai cũng gắn với chương trình. Cái “đồng ý” khởi đầu mọi thứ chỉ được nói một lần, trong một cuộc họp, cho một tập pilot mà chẳng ai chắc sẽ đi quá 6 tập. Hai mùa sau, cùng một gương mặt lại xuất hiện trong một quảng cáo trả phí ở thị trường khác, bằng một ngôn ngữ mà người đó không nói — và không điều nào trong số đó từng có trong cuộc trao đổi ban đầu.

Sự cho phép không phải là một “cánh cổng” bạn đi qua một lần là xong; nó là một phạm vi có ranh giới — và chính ranh giới đó là thứ một chương trình đang lớn lên liên tục vượt qua. Sự cho phép bằng văn bản, nêu rõ nhân vật, nội dung, thị trường và thời hạn, mới là thứ khiến sản phẩm có thể sử dụng được; vì vậy, mỗi lần mở rộng đều là lý do để quay lại và nới phạm vi trước khi khung hình được tạo ra, chứ không phải sau khi chiến dịch đã chạy: mùa mới, lãnh thổ mới, placement trả phí, spin-off, thương hiệu đối tác. Ở trong ranh giới đó, công việc diễn ra bình thường: một gương mặt được đặt vào ảnh tĩnh trong khi vẫn giữ ánh sáng và bố cục ban đầu, và một bản đọc đã thu giữ nguyên nhịp và điểm nhấn trong khi giọng nói xuất ra trở thành giọng của nhân vật. Còn ngoài ranh giới ấy, không quy trình nào có thể khiến footage đủ điều kiện để xuất bản.

Nhân vật biết nói được đánh giá qua miệng và đôi mắt

Một bộ character sheet được mọi người duyệt có thể “vỡ” ngay khoảnh khắc nhân vật bắt đầu nói. Khán giả ngừng “đọc” bức ảnh và bắt đầu đọc cái miệng: hình miệng có khớp với phụ âm không, ánh mắt có hướng về người đang được nói chuyện cùng hay nhìn lệch qua ống kính, đầu có tiếp tục trôi đi sau khi câu đã rơi xuống không. Những thứ đó không thể thấy trong ảnh tĩnh, và cũng không thể sửa bằng cách làm ảnh tĩnh đẹp hơn.

Vì vậy, hãy coi một cảnh thoại là một cảnh có độ dài, không phải một clip cứ chạy dài bằng đúng thời lượng audio. Một take liên tục của nhân vật được tạo thường chỉ “giữ” ổn trong vài giây thoại, trước khi các lỗi nhỏ tích tụ và gương mặt bắt đầu cho cảm giác giả, khiến câu trả lời chân thực cho một đoạn thoại dài chính là cắt cảnh: sang người nghe, sang phản ứng, sang đôi tay, rồi quay lại. Hãy quyết định hướng nhìn trước khi tạo thay vì tranh cãi với nó về sau, giữ mỗi take đủ ngắn để sạch, và cắt đúng nhịp câu thoại thay vì kéo một cảnh vượt quá khả năng “gánh”. Khi một khoảnh khắc thật sự phải kéo dài, cách sửa là đạo diễn, không phải render lâu hơn.

Cách các team lấy nhân vật làm trung tâm dùng VisionStory

Câu trả lời ngắn gọn cho việc làm video nhân vật AI là: chốt nhân vật trước, rồi mọi thứ sau đó được tạo dựa trên nhân vật ấy. Một hồ sơ nhân vật giá trị hơn nhiều so với mô tả nhân vật — khác biệt nằm ở những gì bạn đưa vào: một gương mặt, một giọng nói, một cách nói chuyện, và một danh sách ngắn các quy tắc ngoại hình không bao giờ được thay đổi. Chốt được 4 thứ đó thì phần lớn những gì còn lại chỉ là triển khai. 6 bước dưới đây cũng chỉ ra những điểm mà con người vẫn phải ra quyết định, đặc biệt là với gương mặt/giọng nói thật và với những gì cuối cùng sẽ được xuất bản.

Trước khi xuất bản bất cứ thứ gì, người phụ trách nội dung xác nhận phạm vi cho phép đằng sau gương mặt và giọng nói của nhân vật, rằng các ảnh và bản ghi nguồn đã được cấp phép cho mục đích sử dụng này, và rằng một nhân vật được tạo ra tuyệt đối không bao giờ được trình bày như một người thật.

  1. 01

    Chốt nhân vật trước khi cảnh đầu tiên tồn tại

    Xây nhân vật một lần như một persona lặp lại, với gương mặt, giọng nói và ngoại hình được giữ cố định trong mọi video tạo từ đó, rồi coi persona ấy là tham chiếu cho toàn bộ các bước về sau. Trong sản phẩm, persona đó chính là một avatar: một hồ sơ đã lưu để bạn “trỏ” mọi cảnh tiếp theo vào, thay vì gõ lại mô tả. Ghi rõ bên cạnh những gì tuyệt đối không được thay đổi: độ tuổi mà nhân vật cần “đọc” ra, đường chân tóc, quy tắc trang phục, giọng địa phương, 2 thói quen lời thoại khiến hội thoại nghe đúng là cô ấy. VisionStory giữ persona ổn định xuyên suốt các cảnh. Việc quyết định nhân vật là ai, và điều gì khiến cô ấy dễ nhận ra, là phần thuộc về bạn.

    Công cụ Influencer AI
    Influencer AI
    Xây dựng một nhân vật ảo xuất hiện xuyên suốt với gương mặt, giọng nói và diện mạo cố định, luôn dễ nhận ra trong mọi video.
  2. 02

    Cho nhân vật chuyển động trước khi bạn xây dựng mọi thứ xung quanh

    Khi persona đã chốt, điều tiếp theo cần chứng minh là nó có thể chuyển động. Dùng Image to Video để biến một ảnh nhân vật đã được cấp quyền thành clip ngắn với chuyển động được kiểm soát — làm theo từng shot thay vì làm cả cảnh một lần. Những shot có thể cắt dựng chính là chất liệu tạo nên nhịp đối thoại, và cũng cho bạn chỗ để đặt những phản ứng đến trễ một nhịp. Hãy giữ chuyển động đúng mức khoảnh khắc cần, vì một nhân vật cứ trôi quanh khung hình sẽ giống hiệu ứng hơn là diễn xuất. Thấy nhân vật chuyển động sớm như vậy cũng giúp bạn biết profile đã ổn chưa, khi việc chỉnh sửa vẫn còn “rẻ”. Phần dựng để biến các clip đó thành một cảnh là của bạn.

    Công cụ Chuyển Ảnh Thành Video
    Chuyển Ảnh Thành Video
    Hoạt ảnh hóa một ảnh chân dung, sản phẩm hoặc bối cảnh đã được duyệt thành clip video ngắn với chuyển động được kiểm soát.
  3. 03

    Cho nhân vật một giọng nói mà không cần diễn lại cảnh

    Tự bạn đọc lời thoại, hoặc dùng lại một take bạn đã có, rồi đưa qua Thay Đổi Giọng Nói để giọng nói đầu ra trở thành giọng của nhân vật — trong khi nhịp, điểm nhấn và khoảng ngắt của màn thể hiện gốc vẫn giữ đúng chỗ diễn viên đã đặt. Công cụ này “đáng giá” khi phần đọc đúng mọi thứ trừ giọng, và khi nhân vật cần nghe đồng nhất xuyên suốt một mùa được thu bởi nhiều người vào nhiều ngày khác nhau. Nếu giọng mục tiêu được mô phỏng theo người thật, bạn phải có sự cho phép bằng văn bản của người đó trước khi tạo ra bất cứ thứ gì.

    Tính năng Thay Đổi Giọng Nói
    Thay Đổi Giọng Nói
    Thay đổi giọng nói trong bản ghi có sẵn, đồng thời giữ nguyên nhịp thời gian và cách thể hiện ban đầu.
  4. 04

    Xây dựng thế giới mà nhân vật đang sống

    Khi nhân vật lên hình và chuyển động đã “đúng”, hãy dùng Trình Tạo Hình Ảnh AI cho mọi thứ xung quanh: dàn nhân vật phụ, các căn phòng và con phố mà cảnh cần, đạo cụ, key art và thumbnail từng tập. Lưu kết quả vào một thư viện bối cảnh được đặt tên theo tập và beat, để người viết thứ ba trong dự án có thể tìm đúng căn bếp của tập 2 thay vì phải tạo lại cái mới. Lỗi continuity thường xảy ra ở phần thế giới xung quanh này nhiều hơn là ở chính nhân vật, vì vậy hãy đối chiếu từng ảnh mới với bộ quy tắc nhân vật trước khi đưa vào thư viện, và đối chiếu với tập trước về những chi tiết mà khán giả sẽ nhận ra.

    Công cụ Trình Tạo Hình Ảnh AI
    Trình Tạo Hình Ảnh AI
    Tạo ảnh bìa liên quan, nhân vật, bối cảnh và hình ảnh hỗ trợ từ prompt hoặc tài liệu tham chiếu.
  5. 05

    Chỉ hoán đổi khuôn mặt khi bạn có quyền sử dụng

    Face Swap thay khuôn mặt trong một ảnh tĩnh bằng diện mạo đã được cấp quyền và giữ nguyên ánh sáng lẫn bố cục khung hình ban đầu — nhờ vậy, một nhân vật dựa trên người thật có thể nhất quán giữa key art và các ảnh tĩnh của cảnh. Công cụ này dùng cho ảnh tĩnh, không dùng cho clip đã hoàn thiện. Trước khi có frame đầu tiên, hãy xin phép bằng văn bản từ người đó, nêu rõ nhân vật, nội dung và các nơi sẽ phát hành, và tuyệt đối không trình bày kết quả như footage thật của họ. Nếu quyền cho phép không rõ ràng, hãy tạo nhân vật theo hướng khác.

    Công cụ Hoán Đổi Khuôn Mặt
    Hoán Đổi Khuôn Mặt
    Thay khuôn mặt trong ảnh tĩnh bằng hình ảnh chân dung đã được cấp quyền, đồng thời giữ nguyên ánh sáng và bố cục ban đầu.
  6. 06

    Nâng chất lượng artwork nhân vật lên đúng kích thước xuất bản

    Cho key art, chân dung nhân vật, ảnh tham chiếu bối cảnh và thumbnail chạy qua Nâng Cấp Độ Phân Giải Ảnh để chúng giữ được chất lượng ở kích thước bản master cuối cùng cần xuất, bao gồm cả cận cảnh 4K khi khuôn mặt chiếm trọn màn hình. Các character sheet làm vội theo kích thước “đủ để test” thường sẽ lộ vấn đề ở bước này, nên hãy kiểm tra kết quả ở kích thước đầy đủ, tập trung vào những phần khán giả thực sự nhìn: đôi mắt, đường chân tóc, miệng. Upscale giúp tăng độ rõ và kích thước sử dụng được; nó không thể “đẻ” thêm chi tiết mà nguồn chưa từng có, vì vậy khuôn mặt sai khi nhỏ thì phóng to cũng vẫn sai — cách đúng là tạo lại từ persona.

    Công cụ Nâng Cấp Độ Phân Giải Ảnh
    Nâng Cấp Độ Phân Giải Ảnh
    Tăng độ rõ nét và kích thước sử dụng được cho ảnh chân dung, ảnh sản phẩm, thumbnail và ảnh tham chiếu.

Câu hỏi thường gặp

  • Đừng tả lại nhân vật từ đầu nữa — hãy bắt đầu tái sử dụng một persona duy nhất. Tạo khuôn mặt, giọng nói và ngoại hình một lần dưới dạng avatar đã lưu, rồi tạo mọi cảnh về sau dựa trên persona đó thay vì viết prompt mới mỗi lần; đồng thời giữ một danh sách ngắn những thứ tuyệt đối không được đổi: nhìn như bao nhiêu tuổi, ngôi tóc ở đâu, luôn mặc gì, và nghe giọng ra sao. Sau đó, đối chiếu frame đầu của mỗi cảnh mới với tập trước, vì sự “trôi” thường lộ ra ở các chi tiết nhỏ trước khi ai đó gọi tên được nó.

Người dùng yêu thích VisionStory

Khám phá lý do tại sao các nhà sáng tạo nội dung và marketer tin tưởng VisionStory cho nhu cầu video AI của họ. Từ các tính năng mạnh mẽ đến trải nghiệm người dùng dễ dàng, cộng đồng của chúng tôi không ngừng khen ngợi kết quả đạt được với VisionStory.

Xem tất cả đánh giá trên G2