Szeretnéd, hogy egy állókép „beszéljen”—egy portré kinyissa a száját, pislogjon, és azt mondja, amit beírsz? A VisionStory-val ezt pontosan meg tudod csinálni egyetlen képből, közvetlenül a böngésződben, kamera és bármilyen vágási tapasztalat nélkül. A fenti videó végigvezet a teljes folyamaton, az alábbi lépésről lépésre útmutató pedig minden részt részletesen bemutat.
Közben feltöltesz egy portrét, és előkészíted saját, újra felhasználható avatárodat. Más felhasználók nem látják, te pedig a jövőbeni videókhoz újra kiválaszthatod, ahelyett hogy minden alkalommal ugyanazt a képet töltenéd fel. Mindez a VisionStory beszélő fotó eszközében fut, ingyenes fiókkal is.
1. lépés: Tölts fel egy tiszta portrét
Nyisd meg az AI videó funkciót. A Karakterek panelen válaszd a Feltöltés lehetőséget, és jelölj ki egy képet az eszközödről, vagy húzd a fotót közvetlenül a feltöltési területre. Olyan tiszta, szemből készült képet használj, ahol az arc és a vállak látszanak, a szem és a száj nincs eltakarva, és marad egy kis tér a téma körül, hogy később könnyen újra tudj keretezni.
- Támogatott fájlok: JPG, JPEG, PNG, WebP és HEIC.
- Maximális fájlméret: 30 MB.
- Ajánlott kiinduló méret: portréhoz legalább 512 x 768 pixel.
- Feltöltési működés: egyszerre 1 forráskép.

Igazítsd a forráskép kompozícióját ahhoz, ahová a videó végül kerül. Egy szorosan vágott portré működhet 9:16-ban, de 16:9-ben kellemetlenül szoros arckivágássá válhat, mert a bal és a jobb oldalon nincs képrész, ami kitöltené a szélesebb képkivágást.
2. lépés: Engedd, hogy a VisionStory ellenőrizze és előkészítse az avatárt
A feltöltés után a VisionStory ellenőrzi, hogy a képen van-e használható személy, majd karakterként előkészíti. A sikertelen feltöltés szinte mindig a forrásfotóra vezethető vissza: lehet, hogy az arc túl kicsi, erősen takart, túl oldalra van fordulva, elmosódott, vagy túl közel van egy másik archoz.
Ha az előkészítés sikertelen, ne próbálkozz újra ugyanazzal a kivágással. Válassz élesebb forrást egy nagyobb arccal, direktebb szöggel, látható vállakkal, egyenletes megvilágítással és kevesebb takarással.

Amikor a feldolgozás befejeződik, az avatár megjelenik a nyilvános karakterkönyvtár felett, és megnyílik az avatár-előnézetben. Csak te látod.
3. lépés: Nézd meg az előnézetet, vagy cseréld le a hozzárendelt hangot
A VisionStory automatikusan hozzárendel egy megfelelő kezdőhangot a személy látszólagos kora és neme alapján. Megtarthatod, meghallgathatod az előnézetét, vagy lecserélheted egy másikra.
- Kattints az aktuális hangra a Hangkönyvtár megnyitásához.
- A hang jobb oldalán lévő lejátszás gombbal meghallgathatsz egy mintát.
- Ha nem illik, szűrj Nyelv, Nem, Életkor és Felhasználási eset szerint.
- Hallgass meg néhány alternatívát, majd válaszd azt, ami passzol az avatárhoz és a videó céljához is.

Egy hang illeszkedhet a személy látszólagos korához és neméhez, mégis rossznak tűnhet narrációhoz, oktatáshoz, hirdetéshez vagy beszélgetős tartalomhoz. A személyhez és a célhoz igazítsd, ne csak a demográfiához.
4. lépés: Keretezd újra a fotót a felhasználási helyhez
Az avatár-előnézetben döntheted el, mennyit látszódjon a személyből a végső videóban. Húzd a fotót a téma áthelyezéséhez, és a zoom vezérlőkkel közelíts vagy távolíts. Ezután válaszd ki azt a képarányt, ami illik ahhoz, ahol publikálni fogsz:
- 9:16 álló TikTokhoz, Instagram Reelshez, YouTube Shortshoz és más, mobilra optimalizált felületekhez.
- 1:1 négyzet négyzetes közösségi posztokhoz, profilközpontú elrendezésekhez és rugalmas beágyazásokhoz.
- 16:9 fekvő YouTube-hoz, prezentációkhoz, weboldalakhoz és szélesvásznú kurzusokhoz.

A zoom nem tud olyan pixeleket felfedni, amelyek nem léteznek. Ha a személy már a forrásfotó minden széléhez hozzáér, inkább olyan képből indulj, amin több háttér van, ne pedig erőltesd a szélesebb kivágást.
5. lépés: Tudd, mire való a Change Look és a Generate Image
Két AI képeszköz található az avatár mellett, és érdemes ismerni a különbséget, mielőtt használod őket.
A Change Look megnyit egy AI chatet, amelyhez az aktuális avatárod már csatolva van, így leírhatod az új ruhát, környezetet vagy stílust. Ez egy image-to-image munkafolyamat, és az eredeti avatár továbbra is elérhető marad. A Generate Image ezzel szemben nem fotóból indul ki, hanem egy leírt karakterjellemzésből, tehát text-to-image munkafolyamat. Mindkettőnél tovább chatelhetsz a finomításhoz.

Röviden: a Change Look-ot akkor használd, ha a karakter már megvan, és új vizuális megjelenést szeretnél neki; a Generate Image-et pedig akkor, ha egy promptból szeretnél karaktert létrehozni.
6. lépés: Adj hozzá egy rövid szöveget, és generáld le a beszélő videót
Miután kiválasztottad a feltöltött avatárt, írj be a Szöveg mezőbe egy rövid, beszélgetős mondatot. Egy rövid sor gyorsabban renderel, és könnyebb vele együtt megítélni a fotót, a kivágást, a hangot, a szájmozgás-szinkront és a mozgást.
Kattints a Generate Talking Video gombra. A VisionStory a kiválasztott avatár, keretezés, szöveg és hang alapján animálja az arcot, a szájat a hanghoz szinkronizálja, és élethű pislogást, valamint fejmozgást ad hozzá. A renderelés pár percet vesz igénybe.

Tekints erre az első eredményre úgy, mint egy praktikus forrásfotó-tesztre. Nézd át 4 szempontból:
- Az arc elég éles marad a végső méreten is.
- A szem és a száj mozgás közben sincs eltakarva.
- A fej és a vállak kényelmesen elférnek a választott képarányban.
- A mozgó avatár továbbra is hasonlít a forrásképen lévő személyre.
Ha a kivágás túl szoros, vagy az arc mozgás közben „lágy” lesz, először a forrásképet vagy a keretezést javítsd. A szöveg megváltoztatása nem old meg kompozíciós problémát.
7. lépés: Használd újra, vagy távolítsd el a beszélő fotó avatárodat
Visszatérve a Karakterek listájához, a feltöltött avatárod a nyilvános karakterkönyvtár felett látható, és bármikor kiválaszthatod, amikor ugyanazt a prezentert szeretnéd újra. Más felhasználók nem látják, és az előfizetők korlátlan számú avatárt hozhatnak létre és tarthatnak meg.
- Újrahasználat: válaszd ki az avatárt ahelyett, hogy újra feltöltenéd a fotót.
- Megjelenés váltása: nyisd meg az avatárt, és válaszd ki az egyik elmentett megjelenés-bélyegképet.
- Eltávolítás: vidd az egeret az avatár fölé, hogy megjelenjen a törlés gomb a jobb felső sarokban, majd erősítsd meg, mielőtt törlöd az avatárt és a megjelenéseit.

Gyakori fotóproblémák megoldása
A VisionStory nem talál használható arcot. Használj világosabb, élesebb képet, amin 1 nagyobb, szemből látható arc szerepel. Kerüld az eltakaró szemeket vagy szájat, az erős profil-szögeket, és azokat a fotókat, ahol egy másik arc közel van a fő témához.
A fekvő kivágás túl közeli. Valószínűleg a forrásportrén nincs elég képrész a két oldalon. Használj szélesebb forrást, vagy olyat, amin több üres tér van a személy körül.
Az avatár még előkészítés alatt áll. Várd meg, amíg az előkészítés befejeződik, mielőtt használnád a karaktert. Ha elakad, frissítsd a Karakterek nézetet, és nézd meg, nem jelent-e már meg az avatár, mielőtt újabb másolatot töltenél fel.
Az eredmény „lágy” lesz. Indulj nagyobb felbontású, fókuszban lévő fotóból, és ne nagyíts rá túl agresszíven egy kisméretű arcra. A kimeneti felbontás nem tudja visszahozni azt a részletességet, ami a forrásból hiányzott.
Ennyi kell ahhoz, hogy egy fotót beszélővé tegyél: tölts fel egy portrét, párosíts hozzá egy hangot, keretezd be, és generálj. A fotódból így egy újra felhasználható beszélő avatár lesz, amit bármikor elővehetsz, amikor szükséged van rá.
Készen állsz a teljes szkript-, hang-, beállítás-, kredit- és generálási munkafolyamatra? Kövesd a How to Create an AI Talking Avatar útmutatót, vagy alakíts teljes szkripteket skálázhatóan AI videókká. Vagy kezdj bele most: készítsd el ingyen az első beszélő fotódat.
