Měnič hlasu s AI se hodí ve chvíli, kdy je výkon skvělý, ale hlas ne. Nahrávku už máte — pracovní namluvení, čtení postavy, stopu mluvčího — a potřebujete jinou hlasovou identitu, aniž byste museli znovu nahrát jedinou větu. VisionStory převede výkon do cílového hlasu a v tom samém kroku jím zároveň rozpohybuje mluvícího avatara.
V tomto návodu naimportujeme 10sekundové anglické produktové namluvení, převedeme ho na Anika – Sweet and Lively a vyrenderujeme video mluvčího v poměru 16:9 a 1080p. Než začnete, ověřte si, že máte práva k nahrávce, videu, obrázku postavy i cílovému hlasu, který chcete použít.
Krok 1: Vyberte avatara a poté přepněte na Import
Otevřete pracovní prostor AI video a vyberte digitálního prezentéra, který odpovídá výslednému videu — z knihovny postav, nebo nahráním fotky, ke které máte práva. Poté na pravé straně přepněte na záložku Import a přidejte nahrávku nebo zvukovou stopu z videa.
VisionStory aktuálně importuje AVI, MP3, MP4, M4A, WAV a MOV. Pokud chcete jen nahradit hlas vypravěče, lepším zdrojem je čistý audio soubor; pokud je hlas součástí existujícího videa, naimportujte video přímo v podporovaném formátu.

Krok 2: Naimportujte nahrávku a zkontrolujte použitelný úsek
Klikněte do oblasti pro nahrání a importujte zdrojovou nahrávku nebo video. Panel ukáže průběh vlny, celkovou délku a vybraný rozsah — zde celý úsek 00:00–00:10 z 10sekundového namluvení.
Pusťte si originál jednou a ověřte, že začátek ani konec nejsou oříznuté. Pokud je slyšet výrazný šum v místnosti, zapněte Odstranit šum — ale nežeňte se za absolutním tichem; příliš agresivní odšumění odstraní nádechy, jemné slabiky i emoční detaily, díky kterým převedený hlas zní lidsky.

Krok 3: Vyberte cílový hlas v knihovně hlasů
Klikněte na Change Voice a otevře se Knihovna hlasů. Filtrujte podle jazyka, pohlaví, věku a použití a kandidáty si poslechněte tlačítkem přehrávání na kartě každého hlasu.
V příkladu volíme Aniku, aby se z plochého produktového namluvení stal jasnější, „social-ready“ ženský hlas. Reklamy, školení, příběhy postav i vysvětlující videa kladou různý důraz na srozumitelnost, energii a věk — vybírejte podle toho, k čemu má obsah sloužit, ne jen podle toho, který vzorek zní příjemně. Celý postup výběru najdete v článku jak vybrat AI hlas.

Krok 4: Potvrďte cílový hlas a nastavení výstupu
Zpět na stránce tvorby teď ovladač Change Voice zobrazuje vybraný cílový hlas. Projděte zbytek nastavení: avatar, poměr stran, video model a rozlišení. Příklad přepíná na 16:9 s V-Character 4.0 v 1080p — ideální pro produktové vysvětlující video na šířku nebo pro YouTube.
Měnič hlasu vymění hlasovou identitu; nevybere za vás správného prezentéra ani záběr. Před generováním porovnejte cílový hlas se zdánlivým věkem avatara, genderovým vyjádřením a tónem obsahu — pokud se to tluče, vraťte se do knihovny hlasů nebo do knihovny postav.

Krok 5: Vygenerujte a poté zkontrolujte video se změněným hlasem
Klikněte na Generate Talking Video. VisionStory převede původní výkon na cílový hlas a tím zároveň řídí synchronizaci rtů i mimiku avatara. Jakmile je render hotový, přehrajte si ho celý.
Sledujte vlastní jména, jemné slabiky, pauzy a emoci na konci věty a u rychlých pasáží kontrolujte ústa. Pokud se hlas „pere“ s postavou nebo obsahem, vraťte se a změňte cílový hlas. Pokud je problém v šumu nebo špatném ořezu, opravte zdrojové audio — převod hlasu nezachrání poškozený materiál.

Časté problémy a jak je řešit
- Převedený hlas zní zahuhlaně nebo šumí. Zkontrolujte zdroj kvůli hluku na pozadí, přebuzení a nízké hlasitosti; zapněte Odstranit šum nebo nahrajte čistší záznam. Konverze neumí opravit silně zkreslený materiál.
- Hlas zní přirozeně, ale k avatarovi se nehodí. Vyberte znovu hlas bližší věku postavy, genderovému vyjádření a energii — nebo změňte avatara. Hlas a postava se posuzují jako jeden celek.
- Emoce se liší od původní nahrávky. Konverze zachová tempo i emoční vodítka výkonu, ale hlasy se liší barvou i expresivním rozsahem. Porovnejte více kandidátů; pokud je to potřeba, nahrajte zřetelnější výkon.
- Synchronizace rtů se u rychlých vět rozjíždí. Zkontrolujte zdroj, zda nejsou slova uspěchaná, „mazaná“ nebo slévaná. Kratší věty a čistší záběr jsou lepší než zkoušet stále další hlasy.
Použitelné video se změněným hlasem nikdy není jen o tom, že se hlas A prohodí za hlas B. Vzniká z čistého zdrojového výkonu, vhodného cílového hlasu, odpovídajícího avatara a důkladné kontroly hotového videa. Nejdřív uzamkněte výkon, pak vyberte hlas a nakonec prověřte lip-sync a postavu — v tomhle pořadí ušetříte nejvíc přetáčení. Pokud si místo toho chcete vytvořit vlastní znovupoužitelný hlas, podívejte se na klonování hlasu pomocí AI.
