Měnič hlasu s AI se hodí ve chvíli, kdy je výkon skvělý, ale hlas ne. Nahrávku už máte — pracovní namluvení, čtení postavy, stopu mluvčího — a potřebujete jinou hlasovou identitu, aniž byste museli znovu nahrát jedinou větu. VisionStory převede výkon do cílového hlasu a v tom samém kroku jím zároveň rozpohybuje mluvícího avatara.

V tomto návodu naimportujeme 10sekundové anglické produktové namluvení, převedeme ho na Anika – Sweet and Lively a vyrenderujeme video mluvčího v poměru 16:9 a 1080p. Než začnete, ověřte si, že máte práva k nahrávce, videu, obrázku postavy i cílovému hlasu, který chcete použít.

Krok 1: Vyberte avatara a poté přepněte na Import

Otevřete pracovní prostor AI video a vyberte digitálního prezentéra, který odpovídá výslednému videu — z knihovny postav, nebo nahráním fotky, ke které máte práva. Poté na pravé straně přepněte na záložku Import a přidejte nahrávku nebo zvukovou stopu z videa.

VisionStory aktuálně importuje AVI, MP3, MP4, M4A, WAV a MOV. Pokud chcete jen nahradit hlas vypravěče, lepším zdrojem je čistý audio soubor; pokud je hlas součástí existujícího videa, naimportujte video přímo v podporovaném formátu.

Choosing a digital presenter and opening the Import audio panel in the VisionStory AI Video workspace
Nejdřív si ujasněte postavu na obrazovce, pak Import — importovaný výkon bude řídit mluvící video tohoto avatara.

Krok 2: Naimportujte nahrávku a zkontrolujte použitelný úsek

Klikněte do oblasti pro nahrání a importujte zdrojovou nahrávku nebo video. Panel ukáže průběh vlny, celkovou délku a vybraný rozsah — zde celý úsek 00:00–00:10 z 10sekundového namluvení.

Pusťte si originál jednou a ověřte, že začátek ani konec nejsou oříznuté. Pokud je slyšet výrazný šum v místnosti, zapněte Odstranit šum — ale nežeňte se za absolutním tichem; příliš agresivní odšumění odstraní nádechy, jemné slabiky i emoční detaily, díky kterým převedený hlas zní lidsky.

The VisionStory Import panel showing the loaded audio waveform, duration, Remove Noise, and the Change Voice entry
Zkontrolujte název souboru, délku a vybraný rozsah, rozhodněte o odstranění šumu a pak klikněte na Change Voice, abyste vybrali cílový hlas.

Krok 3: Vyberte cílový hlas v knihovně hlasů

Klikněte na Change Voice a otevře se Knihovna hlasů. Filtrujte podle jazyka, pohlaví, věku a použití a kandidáty si poslechněte tlačítkem přehrávání na kartě každého hlasu.

V příkladu volíme Aniku, aby se z plochého produktového namluvení stal jasnější, „social-ready“ ženský hlas. Reklamy, školení, příběhy postav i vysvětlující videa kladou různý důraz na srozumitelnost, energii a věk — vybírejte podle toho, k čemu má obsah sloužit, ne jen podle toho, který vzorek zní příjemně. Celý postup výběru najdete v článku jak vybrat AI hlas.

Filtering the VisionStory Voice Library by language, gender, age, and use case to pick a target AI voice
Poslechněte si a porovnejte několik kandidátů a vyberte hlas, který odpovídá účelu obsahu, postavě i publiku.

Krok 4: Potvrďte cílový hlas a nastavení výstupu

Zpět na stránce tvorby teď ovladač Change Voice zobrazuje vybraný cílový hlas. Projděte zbytek nastavení: avatar, poměr stran, video model a rozlišení. Příklad přepíná na 16:9 s V-Character 4.0 v 1080p — ideální pro produktové vysvětlující video na šířku nebo pro YouTube.

Měnič hlasu vymění hlasovou identitu; nevybere za vás správného prezentéra ani záběr. Před generováním porovnejte cílový hlas se zdánlivým věkem avatara, genderovým vyjádřením a tónem obsahu — pokud se to tluče, vraťte se do knihovny hlasů nebo do knihovny postav.

VisionStory showing the selected Anika target voice with 16:9, V-Character 4.0, and 1080p output settings
Stránka vybraný hlas jasně ukazuje — potvrďte si poměr, model a rozlišení teď, místo abyste později renderovali znovu.

Krok 5: Vygenerujte a poté zkontrolujte video se změněným hlasem

Klikněte na Generate Talking Video. VisionStory převede původní výkon na cílový hlas a tím zároveň řídí synchronizaci rtů i mimiku avatara. Jakmile je render hotový, přehrajte si ho celý.

Sledujte vlastní jména, jemné slabiky, pauzy a emoci na konci věty a u rychlých pasáží kontrolujte ústa. Pokud se hlas „pere“ s postavou nebo obsahem, vraťte se a změňte cílový hlas. Pokud je problém v šumu nebo špatném ořezu, opravte zdrojové audio — převod hlasu nezachrání poškozený materiál.

Playing back a finished AI voice-changed avatar spokesperson video in VisionStory
Finální kontrola je hotové video, ne ukázka z knihovny: hlasová identita, původní výkon, avatar i lip-sync musí fungovat dohromady.

Časté problémy a jak je řešit

  • Převedený hlas zní zahuhlaně nebo šumí. Zkontrolujte zdroj kvůli hluku na pozadí, přebuzení a nízké hlasitosti; zapněte Odstranit šum nebo nahrajte čistší záznam. Konverze neumí opravit silně zkreslený materiál.
  • Hlas zní přirozeně, ale k avatarovi se nehodí. Vyberte znovu hlas bližší věku postavy, genderovému vyjádření a energii — nebo změňte avatara. Hlas a postava se posuzují jako jeden celek.
  • Emoce se liší od původní nahrávky. Konverze zachová tempo i emoční vodítka výkonu, ale hlasy se liší barvou i expresivním rozsahem. Porovnejte více kandidátů; pokud je to potřeba, nahrajte zřetelnější výkon.
  • Synchronizace rtů se u rychlých vět rozjíždí. Zkontrolujte zdroj, zda nejsou slova uspěchaná, „mazaná“ nebo slévaná. Kratší věty a čistší záběr jsou lepší než zkoušet stále další hlasy.

Použitelné video se změněným hlasem nikdy není jen o tom, že se hlas A prohodí za hlas B. Vzniká z čistého zdrojového výkonu, vhodného cílového hlasu, odpovídajícího avatara a důkladné kontroly hotového videa. Nejdřív uzamkněte výkon, pak vyberte hlas a nakonec prověřte lip-sync a postavu — v tomhle pořadí ušetříte nejvíc přetáčení. Pokud si místo toho chcete vytvořit vlastní znovupoužitelný hlas, podívejte se na klonování hlasu pomocí AI.

Často kladené otázky

  • Měnič hlasu s AI převede hlas v existující nahrávce nebo video stopě na vybraný cílový hlas a přitom zachová tempo, pauzy i emoce původního projevu. VisionStory pak převedenou stopu rovnou použije pro mluvící video avatara.