Minden AI videó egy szöveggel kezdődik, de azt, hogy ez a szöveg valóban hogyan hat, a hang dönti el. A hang adja az előadód akcentusát, korát, tónusát, energiáját és személyiségét — a tempó, a szünetek és az előadásmódot irányító jelzések pedig azt döntik el, hogy az eredmény embernek hangzik-e, vagy inkább egy gépnek, amely felolvas egy oldalt.

Röviden: úgy válassz AI hangot, hogy a nyelvet és a regionális akcentust a közönségedhez igazítod, a profilcímkék alapján összeállítasz egy szűkített listát, minden jelöltet a saját szövegeddel hallgatsz meg, majd generálás előtt a tempóval és a szünetekkel formálod meg az előadásmódot. Az útmutató további része lépésről lépésre végigvezet ezen a folyamaton a VisionStoryban, amelynek AI hangkönyvtára több mint 1000 hangot tartalmaz 88 nyelven.

Amit ez az útmutató lefed: a nyilvános Hangkönyvtár és a köré épülő előadásmód-vezérlők. A saját felvételedből készített hang külön munkafolyamat — lásd: hogyan klónozd a hangod AI-jal.

1. lépés: Nyisd meg a Hangkönyvtárat, és olvasd le a hangsor adatait

Nyisd meg az AI videó felületet, válaszd ki a használni kívánt avatárt, majd kattints a Szöveg mező alatti aktuális hangra. A Hangkönyvtár a szerkesztő fölött nyílik meg.

Minden sor négy jelzést hordoz, amelyekből már lejátszás előtt megjósolhatod, hogyan fog szólni az adott beszélő:

  • Nyelvcímke — a nyelv, amelyen a hang beszél.
  • Zászló — a regionális akcentus, nem pedig egy második nyelv. Az angol hangok mellett szerepelhet amerikai, brit, kanadai és egyéb zászló.
  • Nem és életkor — a beszélő érzékelt identitása.
  • Jellemzők és felhasználási eset — olyan leírások, mint tiszta, meleg tónusú, társalgási, narráció, oktatás vagy közösségi média.
Útmutató a VisionStory hangsorában látható címkékhez: nyelv, regionális akcentus, nem, életkor, jellemzők és felhasználási eset
A zászló a regionális akcentust jelöli — ez a legfontosabb címke, amikor több azonos nyelvű hangot hasonlítasz össze.

A címkék alapján szűkítsd a listát, ne ezek alapján hozd meg a végső döntést. Két, szinte azonos címkékkel ellátott hang tempóban, tónusban és energiában így is jelentősen eltérhet.

2. lépés: Szűrj, keress, és hallgasd meg a szűkített listát

Indulj elég tágan ahhoz, hogy valódi különbségeket hallj, aztán szűkíts. Amíg még felfedezel, használd a Nyelv, Nem, Életkor és Felhasználási eset szűrőket. Ha már név szerint ismersz egy hangot, inkább írd be a keresőmezőbe.

  1. Állíts össze egy szűkített listát. Szűrj vagy keress addig, amíg a teljes katalógus helyett csak néhány jelölt marad.
  2. Hallgasd végig a szűkített listát. A hangsor jobb szélén lévő lejátszás gombra kattintva meghallgathatod a mintát.
  3. Állítsd meg és hasonlítsd össze. Ugyanarra a gombra kattintva állítsd le a lejátszást, mielőtt a következőt elindítod.
A VisionStory Hangkönyvtára keresőmezővel, Nyelv, Nem, Életkor és Felhasználási eset szűrőkkel, valamint minden hangsorban lejátszás gombbal
A kereső és a szűrők kezelhetővé teszik az 1000 hangot tartalmazó könyvtárat; azt viszont a meghallgatás igazolja, hogy tényleg illik-e a hang.

Arra figyelj, amire a videódnak valóban szüksége van: regionális akcentus, érthetőség, energia, melegség, tekintély, és hogy milyen gyorsan halad végig a hang egy mondaton. Egy önmagában remekül szóló hang még lehet rossz választás egy oktató, értékesítési, hírjellegű vagy karakterközpontú szöveghez.

3. lépés: Igazítsd a hangot a tartalmadhoz és a közönségedhez

A csalódást keltő AI hangalámondások mögött legtöbbször nem minőségi, hanem illeszkedési probléma áll. Mielőtt véglegesítenéd a döntést, tisztázd, mit kell megoldania ennek a hangnak ebben a konkrét videóban.

Ha ilyet készíteszEzt keresdEzt kerüld
Oktatóanyagok, magyarázó videók, kurzusokTiszta artikuláció, egyenletes tempó, semleges melegségPörgős reklámhangok, amelyek elhadarják a szakkifejezéseket
Hirdetések, promók, rövid közösségi videókEnergia, lendület, magabiztos és fiatalabb karakterLassú, kimért narráció, amelyben elvész a figyelemfelkeltő nyitás
Hírek, vállalati tartalmak, termékfrissítésekTekintélyt sugárzó hangvétel, egyenletes tempó, visszafogott hangszínLaza vagy erősen karakteres, szerepjátékos hangok
Történetmesélés, interjúk, podcastokEgyéniség és széles kifejezőkészségLapos, bemondós felolvasás mindenféle dinamika nélkül
Ugyanannak a videónak a lokalizált változataiMinden piachoz anyanyelvi, helyi akcentusEgyetlen angol hang, amely a lefordított szöveget olvassa fel

Az akcentus az a beállítás, amit a legtöbben elrontanak. Ha a közönséged Londonban van, az előadód mellett viszont amerikai zászló szerepel, a hallgatók észreveszik — még akkor is, ha minden szó helyes. A zászlót a közönséghez válaszd, ne csak a nyelvhez.

4. lépés: Állítsd be a beszédsebességet, majd add hozzá a szüneteket

Kattints egy hang sorára, hogy alkalmazd az aktuális beállításra. Ezután nyisd meg a kiválasztott hang melletti sebességmenüt, és válaszd a Lassú, Normál vagy Gyors lehetőséget.

  • A Lassú az elgondolkodtató magyarázatokhoz illik, és minden olyan tartalomhoz, ahol a megértés fontosabb a sürgetésnél.
  • A Normál a biztonságos alapbeállítás a legtöbb oktatóanyaghoz, prezentációhoz és beszélő avatáros videóhoz.
  • A Gyors energiát ad a rövid promóknak és a közösségi videóknak, de a sűrű szövegeket nehezebb követni.

A sebesség a teljes előadás tempóját határozza meg. A mondaton belüli szabályozáshoz vidd a kurzort oda, ahová a szünet kell, és kattints a Szünet gombra. Minden kattintás 0,5 másodpercet ad hozzá; kattints újra a hosszabb szünethez.

A Lassú, Normál és Gyors beszédsebesség összehasonlítása egy szövegbe beszúrt fél másodperces szünet mellett
A sebességgel az általános tempót állítsd be, a szünetekkel pedig azokat a pillanatokat, amelyek jelentést hordoznak.

Jó tudni: oda tegyél szünetet, ahol egy valódi előadó levegőt venne, témát váltana, vagy hagyná leülepedni az elhangzottakat. A túl sok szünet széttördeli az előadásmódot, ezért szerkesztés után a teljes mondatot hallgasd meg, ne csak a módosított részt.

5. lépés: Irányítsd az előadásmódot a Hangjavítás funkcióval

Kattints a Hangjavítás gombra, ha a szavak már jók, de a kívánt előadásmód még nincs egyértelműen jelölve. A VisionStory érzelmi, tempóra és hangsúlyra vonatkozó jelöléseket ad hozzá, miközben az eredeti megfogalmazásod változatlan marad.

Mielőtt továbblépnél, nézd át a javított szöveget. Válaszd a Megtartás lehetőséget, ha a jelölések megfelelnek a szándékodnak, vagy a Visszavonás gombot az eredetihez való visszatéréshez. Akkor van igazán helye, ha a szövegnek egyértelmű érzelmi iránymutatásra van szüksége, de a megfogalmazását nem szabad megváltoztatni.

Előtte-utána összehasonlítás: a Hangjavítás nyugodt és kimért előadásmódra utaló jelöléseket ad hozzá a szavak megváltoztatása nélkül
Az üzenet a tiéd marad; iránymutatást csak az előadásmód kap.

6. lépés: Hallgasd meg a tényleges szövegedet a generálás előtt

Kattints a Hang előnézet gombra, amint a hang, a sebesség, a szünetek és a Hangjavítás esetleges jelölései a helyükön vannak. Ne az első néhány szó alapján ítélj, hanem hallgasd végig a teljes felvételt, és ellenőrizd a kiejtést, az akcentust, a ritmust, a mondatvégeket, a szüneteket és az érzelmi illeszkedést.

Amíg még több jelöltet hasonlítasz össze, indulj egyetlen rövid, jellemző mondattal. Ha a lista már csak két-három hangra szűkült, olyan részletet hallgass meg előnézetben, amely a kész videó szempontjából legfontosabb neveket, számokat, szakkifejezéseket vagy érzelmi csúcspontokat tartalmazza — itt válnak el élesen egymástól a hangok.

Előnézeti keret: a hangelőnézethez ingyenes karakterkeret tartozik, amely gördülő 24 órás ciklusonként újratöltődik. Ha ezt felhasználtad, az előnézet generálása 500 karakterenként 1 kreditbe kerül. A teljes képért lásd: hogyan működnek a VisionStory Kreditek.

7. lépés: Generálj egyszer, hogy az avatár megjegyezze a hangot

A hang kiválasztása az aktuális szerkesztői beállítást módosítja, de önmagában a kiválasztás nem menti el a hangot az avatárhoz. Generálj egy videót a kiválasztott hanggal. A VisionStory ekkor megjegyzi a párosítást, és legközelebb, amikor ugyanazt az avatárt használod, visszaállítja.

Háromlépéses ábra: a hang kiválasztása, mentése egyetlen videógenerálás után, majd visszaállítása az avatár újbóli használatakor
A választóvonal a generálás: válaszd ki a hangot, generálj egyszer, majd használd újra az avatárt, amelyhez már hozzá van rendelve ez a hang.

Ezért érdemes körültekintően választani. Ha egy avatár és egy hang egyszer össze van párosítva, minden későbbi videó egy következetes előadóval indul, nem pedig egy újabb döntéssel.

Miért hangzanak robotikusan az AI hangok — és hogyan javíthatod ezt

Ha egy generált narráció mesterségesnek hat, az általában nem magára a hangmodellre vezethető vissza, hanem öt kijavítható ok valamelyikére.

  • A szöveghez nem illő hang. Egy narrátorhang, amely reklámszöveget olvas fel, laposan szól. Mielőtt a minőséget hibáztatnád, szűkítsd újra a listát felhasználási eset szerint.
  • Nincsenek szünetek. Az igazi beszélők levegőt vesznek. A tagolatlan szövegfal gépiesen hat, ezért illessz be fél másodperces szüneteket a gondolati egységek határán.
  • A sebességet egyszer beállítod, aztán elfelejted. A Gyors beállítás elmossa a sűrű mondatokat, a Lassú pedig vontatottá tesz egy rövid promót. Igazítsd a tempót a tartalom típusához.
  • Kétértelmű központozás. Az összefolyó mondatok, a hiányzó vesszők és a fel nem oldott rövidítések mind a monotonitás felé tolják a hangot. Előbb tisztítsd meg a szöveget.
  • Nincs érzelmi instrukció. Ha a szándék nem szerepel a szövegben, a hang nem tudja kitalálni — pontosan erre való a Hangjavítás.

Javítsd ki ezt az ötöt, és a robotikus AI hangokkal kapcsolatos panaszok nagy része eltűnik anélkül, hogy egyáltalán hangot kellene váltanod.

Ha egy szolgáltató kivezet egy általad használt hangot

A VisionStory több szolgáltatótól szerzi be a hangokat, és egy szolgáltató bármikor eltávolíthat egy hangot a saját katalógusából. Ilyenkor a hangot már nem lehet visszaállítani a nyilvános Hangkönyvtárba.

Ha eltűnt egy hang, amelyre építettél, keress egy tiszta részletet egy korábbi videóból, amelyben csak az a hang hallható, és használd forrásanyagként a Hangklónozásban. A klón közeli helyettesítőt tud készíteni, de ne számíts arra, hogy pontosan ugyanúgy szól majd.

Folyamatábra arról, hogyan szolgálhat egy korábbi videó tiszta hanganyaga forrásként egy hasonló, helyettesítő hangklónhoz
Egy korábbi, jóváhagyott videó biztosíthatja azt a tiszta hanganyagot, amely megőrzi a folytonosságot, amikor egy katalógusbeli hangot kivezetnek.

Engedély szükséges: csak olyan hanganyagot klónozz, amely a sajátod, vagy amelyre egyértelmű engedélyed van, és publikálás előtt hallgasd meg a helyettesítő hang előnézetét a valódi szövegeddel.

Ellenőrzőlista az AI hanghoz, mielőtt generálsz

  • A közönséghez válaszd ki a regionális akcentust is, ne csak a nyelvet.
  • A profilcímkékkel szűkítsd a listát, a végső döntést pedig bízd a füledre.
  • A valódi szövegedből származó neveket, számokat és nehéz szakkifejezéseket hallgasd meg az előnézetben.
  • Előbb állítsd be az általános sebességet, és csak utána illessz be helyi szüneteket.
  • A Hangjavítást csak akkor használd, ha az előadásmódnak határozottabb irányra van szüksége.
  • Teljes előnézetet hallgass meg, ne csak az első mondatot.
  • Generálj egyszer, ha azt szeretnéd, hogy az avatár megjegyezze a hangot.
  • Írd be a kiválasztott hang nevét a márka- vagy kampányjegyzeteidbe.

Ha a hang megvan, a többi már gyorsan megy. Vidd végig ugyanezt a beállítást egy kész videóig a hogyan készíts AI beszélő avatárt útmutatóval, vagy nyisd meg a szövegfelolvasást, ha csak a hangra van szükséged.

Gyakran ismételt kérdések

  • Indulj ki a közönségből: illeszd a nyelvet és a zászló által jelzett regionális akcentust, majd a nem, az életkor, a jellemző és a felhasználási eset címkéi alapján állíts össze egy szűkített listát néhány jelöltből. Mindegyiket az igazi szövegedből vett mondattal hallgasd meg, ne általános mintával, és azt a hangot válaszd, amelynek a tempója, energiája és melegsége illik a tartalom típusához. Végül állítsd be a beszédsebességet, és adj hozzá szüneteket, hogy az előadásmód megfeleljen a szándékodnak.