Az AI Hangváltó arra a pillanatra való, amikor az előadás tökéletes, de a hang nem az. Már van egy felvételed — egy próbafelmondás, egy karakterhang, egy szóvivő-sáv — és másfajta hangazonosságra van szükséged úgy, hogy egyetlen sort sem kell újra felvenned. A VisionStory a meglévő előadást a kiválasztott célhanggá alakítja, és ugyanabban a menetben ezzel mozgatja a beszélő avatárt is.

Ebben az útmutatóban importálunk egy 10 másodperces angol terméknarrációt, átalakítjuk Anika – Sweet and Lively hangra, majd kirenderelünk egy 16:9-es, 1080p-s szóvivővideót. Mielőtt belevágsz, győződj meg róla, hogy rendelkezel a felvételhez, a videóhoz, a karakterképhez és a használni tervezett célhanghoz szükséges jogokkal.

1. lépés: Válaszd ki az avatárt, majd válts az Importálásra

Nyisd meg az AI videó munkaterületet, és válassz a kész videóhoz illő digitális műsorvezetőt — a karakterkönyvtárból, vagy egy olyan fotó feltöltésével, amelyhez jogaid vannak. Ezután a jobb oldalon válts az Import fülre, hogy behúzz egy felvételt vagy egy videó hangsávját.

A VisionStory jelenleg AVI, MP3, MP4, M4A, WAV és MOV fájlokat importál. Ha a cél csak a narráció hangjának cseréje, a tiszta hangfájl a jobb forrás; ha a hang egy meglévő videóban van, importáld közvetlenül a videót támogatott formátumban.

Choosing a digital presenter and opening the Import audio panel in the VisionStory AI Video workspace
Először rögzítsd a képernyőn látható karaktert, aztán Import — az importált előadás hajtja meg ennek az avatárnak a beszélő videóját.

2. lépés: Importáld a felvételt, és ellenőrizd a használható szakaszt

Kattints a feltöltési területre, és importáld a forrásfelvételt vagy videót. A panelen látszik a hullámforma, a teljes hossz és a kijelölt tartomány — itt egy 10 másodperces narráció teljes 00:00–00:10 szakasza.

Hallgasd meg egyszer az eredetit, és ellenőrizd, hogy az eleje és a vége nincs-e levágva. Ha egyértelmű a helyiségzaj, kapcsold be a Zaj eltávolítása opciót — de ne hajszold a tökéletes csendet; a túl agresszív zajszűrés eltünteti a levegővételeket, a lágy szótagokat és azokat az érzelmi részleteket, amelyek emberivé teszik az átalakított hangot.

The VisionStory Import panel showing the loaded audio waveform, duration, Remove Noise, and the Change Voice entry
Ellenőrizd a fájlnevet, a hosszt és a kijelölt tartományt, dönts a zajeltávolításról, majd kattints a Change Voice-ra a célhang kiválasztásához.

3. lépés: Válaszd ki a célhangot a Hangkönyvtárból

Kattints a Change Voice gombra a Hangkönyvtár megnyitásához. Szűrj Nyelv, Nem, Életkor és Felhasználási cél szerint, és hallgasd meg a jelölteket az egyes hangkártyák lejátszás gombjával.

A példa Anikát választja, hogy a lapos terméknarrációból fényesebb, közösségi felhasználásra kész női hang legyen. Hirdetések, tréningek, karaktertörténetek és magyarázó videók mind másként súlyozzák a tisztaságot, az energiát és az életkort — a tartalom feladatához válassz, ne csak ahhoz, amelyik minta kellemesen hangzik. A teljes kiválasztási módszer itt található: how to choose an AI voice.

Filtering the VisionStory Voice Library by language, gender, age, and use case to pick a target AI voice
Hallgass meg és hasonlíts össze több jelöltet, majd válaszd azt a hangot, amely illik a tartalom céljához, a karakterhez és a közönséghez.

4. lépés: Erősítsd meg a célhangot és a kimeneti beállításokat

Visszatérve a készítési oldalra, a Change Voice vezérlő már a kiválasztott célhangot mutatja. Menj végig a többi beállításon is: az avatár, a képarány, a videómodell és a felbontás. A példa 16:9-re vált V-Character 4.0-val 1080p-n — ideális fekvő termékmagyarázóhoz vagy YouTube-ra.

A Hangváltó a hangazonosságot cseréli; nem választ helyetted megfelelő műsorvezetőt vagy képkivágást. Generálás előtt vesd össze a célhangot az avatár látszólagos életkorával, nemi megjelenésével és a tartalom hangulatával — ha ütköznek, menj vissza a hangkönyvtárba vagy a karakterkönyvtárba.

VisionStory showing the selected Anika target voice with 16:9, V-Character 4.0, and 1080p output settings
Az oldal egyértelműen mutatja a választott hangot — most ellenőrizd a képarányt, a modellt és a felbontást, ahelyett hogy később újra kellene renderelned.

5. lépés: Generálj, majd ellenőrizd a hangcserés videót

Kattints a Generate Talking Video gombra. A VisionStory az eredeti előadást a célhanggá alakítja, és ezzel hajtja az avatár szájmozgását és arckifejezéseit. Amikor elkészül a render, nézd végig elejétől a végéig.

Figyelj a tulajdonnevekre, a lágy szótagokra, a szünetekre és a mondatvégi érzelemre, és nézd a szájat a gyors részeknél. Ha a hang nem passzol a karakterhez vagy a tartalomhoz, menj vissza és válassz másik célhangot. Ha a gond zaj vagy rossz vágás, javítsd a forráshangot — a hangkonverzió nem tudja megmenteni a hibás alapanyagot.

Playing back a finished AI voice-changed avatar spokesperson video in VisionStory
A végső ellenőrzés a teljes videó, nem a könyvtári minta: a hangazonosságnak, az eredeti előadásnak, az avatárnak és a szinkronnak együtt kell működnie.

Gyakori problémák és megoldások

  • Az átalakított hang tompa vagy zajos. Ellenőrizd a forrást háttérzaj, túlvezérlés és alacsony hangerő szempontjából; kapcsold be a Zaj eltávolítása opciót, vagy vedd fel újra tisztábban. A konverzió nem javítja a súlyosan torz anyagot.
  • A hang természetes, de nem illik az avatárhoz. Válassz újra a karakter életkorához, nemi megjelenéséhez és energiájához közelebbi hangot — vagy válts avatárt. A hangot és a karaktert egy egységként érdemes értékelni.
  • Az érzelem eltér az eredeti felvételtől. A konverzió megtartja az előadás tempóját és érzelmi jelzéseit, de a hangok hangszínben és kifejező tartományban eltérnek. Hasonlíts össze több jelöltet; ha kell, vegyél fel tisztább előadást.
  • A szájmozgás gyors mondatoknál meglazul. Ellenőrizd, nem kapkodott-e, elmosódott-e vagy összefolyó-e a beszéd a forrásban. A rövidebb mondatok és egy tisztább felvétel többet érnek, mint még több hang végigpróbálása.

Egy jól használható, hangcserés videó sosem csak annyi, hogy A hangot B hangra cseréljük. Tiszta forráselőadásból, jól megválasztott célhangból, passzoló avatárból és a kész videó alapos ellenőrzéséből áll össze. Először rögzítsd az előadást, másodjára válaszd a hangot, és a végén ellenőrizd a szinkront és a karaktert — ez a sorrend spórolja meg a legtöbb újrafelvételt. Ha inkább saját, újrahasznosítható hangot építenél, nézd meg ezt: cloning your voice with AI.

Gyakran ismételt kérdések

  • Az AI hangváltó egy meglévő felvétel vagy videósáv hangját a kiválasztott célhanggá alakítja, miközben megőrzi az eredeti előadás tempóját, szüneteit és érzelmi tónusát. A VisionStory a konvertált sávot közvetlenül az avatár beszélő videójába tölti be.