Elke AI-video begint met een script, maar de stem bepaalt hoe dat script daadwerkelijk overkomt. De stem legt het accent, de leeftijd, de klankkleur, de energie en de persoonlijkheid van je presentator vast — en snelheid, pauzes en voordrachtaanwijzingen bepalen of het resultaat klinkt als een mens of als een machine die een pagina voorleest.
Kort samengevat: kies een AI-stem door de taal en het regionale accent af te stemmen op je publiek, gebruik de profiellabels om een shortlist samen te stellen, beluister elke kandidaat met je eigen script en geef de voordracht daarna vorm met snelheid en pauzes voordat je genereert. De rest van deze gids doorloopt dat proces stap voor stap in VisionStory, waarvan de AI-stembibliotheek meer dan 1.000 stemmen in 88 talen bevat.
Wat deze gids behandelt: de openbare Stembibliotheek en de voordrachtinstellingen eromheen. Een stem opbouwen vanuit je eigen opname is een aparte workflow — zie hoe je je stem kloont met AI.
Stap 1: Open de Stembibliotheek en lees de stemrij
Open AI-video, selecteer de avatar die je wilt gebruiken en klik op de huidige stem onder het Script-vak. De Stembibliotheek opent over de editor heen.
Elke rij bevat vier signalen waarmee je kunt voorspellen hoe een spreker klinkt voordat je op afspelen drukt:
- Taallabel — de taal die de stem spreekt.
- Vlag — het regionale accent, niet een tweede taal. Engelse stemmen kunnen een Amerikaanse, Britse, Canadese of andere vlag dragen.
- Geslacht en leeftijd — de waargenomen identiteit van de spreker.
- Eigenschappen en use case — beschrijvingen zoals helder, warm, conversationeel, narratie, onderwijs of social media.

Gebruik de labels om een shortlist samen te stellen, niet om de knoop door te hakken. Twee stemmen met vrijwel identieke labels kunnen alsnog sterk verschillen in tempo, klankkleur en energie.
Stap 2: Filter, zoek en beluister een shortlist
Begin breed genoeg om echte verschillen te horen en beperk je selectie daarna. Gebruik de filters Taal, Geslacht, Leeftijd, Use Case en Provider zolang je nog aan het verkennen bent. Ken je een stem al bij naam, typ die dan in het zoekveld.
Provider, het laatste filter in de rij, is de spraakengine achter een stem. VisionStory gebruikt er meerdere, en elk is ergens anders het sterkst in. Laat dit bij je eerste ronde op All staan — je wilt de beste stem voor dit script, ongeacht welke engine hem heeft gemaakt. Gebruik het filter pas als je al weet wat je nodig hebt, zoals een Cantonese voordracht of één stem die meerdere talen moet kunnen dragen. In stap 3 lees je welke engine je in die gevallen kiest.
- Stel een shortlist samen. Filter of zoek tot je een handvol kandidaten overhoudt in plaats van een volledige catalogus.
- Beluister de hele shortlist. Klik op de afspeelknop rechts van een stemrij om de sample te horen.
- Pauzeer en vergelijk. Klik nogmaals op dezelfde knop om te stoppen voordat je de volgende start.

Luister naar wat je video echt nodig heeft: regionaal accent, helderheid, energie, warmte, autoriteit en hoe snel de stem door een zin heen gaat. Een stem die op zichzelf geweldig klinkt, kan alsnog verkeerd zijn voor een instructie-, sales-, nieuws- of personagegedreven script.
Stap 3: Kies een stem die past bij je content en je publiek
De meeste teleurstellende AI-voice-overs hebben geen kwaliteitsprobleem, maar een matchprobleem. Bepaal voordat je een keuze vastlegt wat deze stem voor deze specifieke video moet doen.
| Wat je maakt | Waar je op let | Vermijd |
|---|---|---|
| Tutorials, uitlegvideo's, cursussen | Duidelijke articulatie, gelijkmatig tempo, neutrale warmte | Energieke promostemmen die door vaktermen heen razen |
| Advertenties, promo's, korte socialmediaclips | Energie, pit, een zelfverzekerd en jonger profiel | Langzame, beheerste vertelling die de hook laat vallen |
| Nieuws, corporate, productupdates | Autoriteit, gelijkmatig tempo, weinig uitgesproken stemkleur | Informele of sterk gekarakteriseerde stemmen |
| Storytelling, interviews, podcasts | Persoonlijkheid en expressief bereik | Vlakke omroepersstemmen zonder dynamiek |
| Gelokaliseerde versies van één video | Een authentiek regionaal accent voor elke markt | Eén Engelse stem die vertaalde teksten voorleest |
| Eén video, meerdere taalversies, dezelfde presentator | Een meertalige stem, zodat elke versie dezelfde stemidentiteit behoudt | Een andere stem per taal, waardoor het elke keer als een ander persoon klinkt |
Het accent is de instelling die het vaakst misgaat. Zit je publiek in Londen en heeft je presentator een Amerikaanse vlag, dan valt dat luisteraars op — ook als elk woord klopt. Kies de vlag die bij je publiek past, niet alleen de taal.
De laatste twee rijen trekken in tegengestelde richtingen, en allebei zijn ze juist — je kiest tussen lokale geloofwaardigheid en een consistente presentator. Kies per markt een native accent als elke versie lokaal moet aanvoelen; kies één meertalige stem als de video’s duidelijk dezelfde persoon zijn die verschillende doelgroepen aanspreekt.
Bij Chinees telt accent het meest, omdat “Chinees” eigenlijk drie verschillende doelgroepen zijn. Mandarijn voor het vasteland. Taiwanees Mandarijn voor Taiwan — de schrijftaal is gedeeld, maar intonatie en woordkeuze verraden een vasteland-voordracht meteen. En Cantonees voor Hongkong en Guangdong; dat is een aparte gesproken taal in plaats van een accent, dus een Mandarijnse stem werkt daar niet. Zet het Taal-filter op wat je kijkers echt spreken en beluister daarna: een kijker uit Taipei hoort een vasteland-Mandarijnse stem op dezelfde manier als een kijker uit Londen een Amerikaanse.
Kiezen op basis van spraakengine
Het Provider-filter uit stap 2 groepeert de bibliotheek op de engine die elke stem genereert. Je hebt het niet vaak nodig, maar als een van deze situaties op jou van toepassing is, scheelt het veel scrollen.
- ElevenLabs — de grootste bibliotheek en het breedste emotionele bereik. Begin hier voor Engelse narratie, personagewerk en elk script dat moet acteren in plaats van aankondigen.
- Gemini — de meertalige stemmen. Eén stem behoudt zijn identiteit over meerdere talen heen; dit is dus de plek als dezelfde video in meerdere talen uitkomt en je in alle versies dezelfde presentator wilt. Deze stemmen verschijnen ongeacht op welke Taal je filtert.
- MiniMax — het meest natuurlijke Cantonees. Gebruik dit voor doelgroepen in Hongkong en Guangdong.
- Seed — Chinees op native niveau, inclusief Taiwanees Mandarijn, plus native Japanse, Koreaanse, Spaanse, Portugese en Indonesische stemmen. Probeer dit als ‘vloeiend maar buitenlands’ niet goed genoeg is voor de markt.
Past niets daarvan bij je video, laat Provider dan op All staan en laat de preview beslissen. De match is veel belangrijker dan welke engine de stem heeft gemaakt.
Stap 4: Stel de spreeksnelheid in en voeg daarna pauzes toe
Klik op een stemrij om die op je huidige opzet toe te passen. Open daarna het snelheidsmenu naast de geselecteerde stem en kies Langzaam, Normaal of Snel.
- Langzaam past bij bedachtzame uitleg en bij alle content waarbij begrip belangrijker is dan urgentie.
- Normaal is de veilige basis voor de meeste tutorials, presentaties en talking-avatarvideo's.
- Snel geeft korte promo's en socialmediaclips extra energie, maar dichte scripts worden lastiger te volgen.
De snelheid bepaalt het tempo van de hele voordracht. Wil je binnen een zin sturen, zet dan de cursor op de plek waar de rust hoort en klik op de knop Pauze. Elke klik voegt 0,5 seconde toe; klik nogmaals voor een langere rust.

Handig om te weten: voeg pauzes toe waar een echte presentator adem zou halen, van gedachte zou wisselen of een uitspraak zou laten landen. Te veel pauzes maken de voordracht rommelig, dus beluister na het bewerken de hele zin in de preview, niet alleen het stuk dat je hebt aangepast.
Stap 5: Stuur de voordracht bij met Voice Enhance
Klik op Voice Enhance wanneer de woorden kloppen, maar de gewenste voordracht nog niet expliciet is. VisionStory voegt aanwijzingen toe voor emotie, tempo en nadruk en houdt daarbij je oorspronkelijke formulering intact.
Beoordeel het verbeterde script voordat je verdergaat. Kies Keep als de aanwijzingen overeenkomen met je bedoeling, of Undo om terug te keren naar het origineel. De functie bewijst haar nut wanneer een script duidelijke emotionele regie nodig heeft, maar niet geherformuleerd mag worden.

Stap 6: Beluister je echte script voordat je genereert
Klik op Preview Audio zodra de stem, de snelheid, de pauzes en eventuele verbeteringsaanwijzingen goed staan. Luister de hele opname af in plaats van te oordelen op basis van de eerste paar woorden, en let op uitspraak, accent, ritme, zinseindes, pauzes en emotionele aansluiting.
Zolang je nog kandidaten vergelijkt, begin je met één korte, representatieve zin. Zodra je shortlist is teruggebracht tot twee of drie stemmen, beluister je een passage met de namen, cijfers, vaktermen of emotionele momenten die in de uiteindelijke video het zwaarst wegen — daar laten stemmen zich pas echt onderscheiden.
Previewtegoed: de audiopreview bevat een gratis tegoed aan tekens dat doorlopend elke 24 uur wordt vernieuwd. Is dat tegoed op, dan kost het genereren van een preview 1 credit per 500 tekens. Bekijk hoe VisionStory-credits werken voor het volledige plaatje.
Stap 7: Genereer één keer zodat de avatar de stem onthoudt
Een stem selecteren verandert de huidige instelling in de editor, maar alleen selecteren slaat die stem niet op bij de avatar. Genereer één video met de stem die je hebt gekozen. VisionStory onthoudt de combinatie dan en herstelt die de volgende keer dat je dezelfde avatar gebruikt.

Daarom is het de moeite waard om die keuze zorgvuldig te maken. Zodra een avatar en een stem gekoppeld zijn, start elke volgende video vanuit een consistente presentator in plaats van vanuit een nieuwe beslissing.
Waarom AI-stemmen robotachtig klinken — en hoe je dat oplost
Als een gegenereerde voice-over synthetisch aanvoelt, ligt dat meestal aan een van vijf oplosbare oorzaken en niet aan het stemmodel zelf.
- Verkeerde stem voor het script. Een vertelstem die reclametekst voorleest, klinkt vlak. Stel je shortlist opnieuw samen op use case voordat je de kwaliteit de schuld geeft.
- Geen pauzes. Echte sprekers ademen. Een muur van tekst zonder rustmomenten klinkt als een machine, dus voeg pauzes van een halve seconde toe op de grenzen tussen ideeën.
- Snelheid één keer ingesteld en daarna vergeten. Met Snel worden dichte zinnen brijerig; met Langzaam gaat een korte promo slepen. Stem het tempo af op het type content.
- Onduidelijke interpunctie. Aaneengeregen zinnen, ontbrekende komma's en niet-uitgeschreven afkortingen duwen een stem allemaal richting monotoon. Poets eerst het script op.
- Geen emotionele regie. Staat de bedoeling niet in de tekst, dan kan de stem die niet afleiden — en daar is Voice Enhance precies voor bedoeld.
Los die vijf punten op en de meeste klachten over robotachtige AI-stemmen verdwijnen zonder dat je de stem hoeft te veranderen.
Als een aanbieder een stem die je gebruikt uit de catalogus haalt
VisionStory betrekt stemmen van meerdere aanbieders, en een aanbieder kan een stem uit zijn eigen catalogus verwijderen. Gebeurt dat, dan kan de stem niet worden teruggezet in de openbare Stembibliotheek.
Is een stem waarop je vertrouwde verdwenen, zoek dan een schoon fragment uit een eerdere video waarin alleen die stem te horen is, en gebruik dat als bronaudio in Voice Clone. De kloon kan een sterk gelijkende vervanging opleveren, al moet je niet verwachten dat die identiek klinkt.

Toestemming vereist: kloon alleen audio waarvan je de rechten hebt of waarvoor je duidelijke toestemming hebt, en beluister de vervanging met je beoogde script voordat je publiceert.
Checklist voor je AI-stem voordat je genereert
- Kies het regionale accent dat bij je publiek past, niet alleen de taal.
- Gebruik de profiellabels om een shortlist te maken en laat je oren daarna beslissen.
- Beluister de namen, cijfers en lastige termen uit je echte script.
- Stel de algemene snelheid in voordat je pauzes op specifieke plekken toevoegt.
- Gebruik Voice Enhance alleen als de voordracht duidelijkere aanwijzingen nodig heeft.
- Luister een volledige preview af, niet alleen de eerste zin.
- Genereer één keer als je wilt dat de avatar de stem onthoudt.
- Noteer de naam van de gekozen stem in je merk- of campagnenotities.
Zodra de stem vaststaat, gaat de rest snel. Breng dezelfde instellingen door naar een afgeronde video met hoe je een AI-sprekende avatar maakt, of open tekst naar spraak als je alleen de audio nodig hebt.
