Jedes KI-Video beginnt mit einem Skript, aber die Stimme entscheidet darüber, wie dieses Skript tatsächlich ankommt. Sie bestimmt Akzent, Alter, Klangfarbe, Energie und Persönlichkeit Ihres Sprechers — und Geschwindigkeit, Pausen sowie Vortragshinweise entscheiden, ob das Ergebnis nach einem Menschen klingt oder nach einer Maschine, die eine Seite vorliest.

Kurz gesagt: Wählen Sie eine KI-Stimme, indem Sie Sprache und regionalen Akzent auf Ihr Publikum abstimmen, mithilfe der Profil-Tags eine engere Auswahl erstellen, jeden Kandidaten mit Ihrem eigenen Skript in der Vorschau anhören und den Vortrag anschließend über Geschwindigkeit und Pausen formen, bevor Sie generieren. Der Rest dieser Anleitung führt Sie Schritt für Schritt durch genau diesen Ablauf in VisionStory, dessen KI-Stimmenbibliothek mehr als 1.000 Stimmen in 88 Sprachen umfasst.

Worum es in dieser Anleitung geht: um die öffentliche Stimmenbibliothek und die dazugehörigen Steuerungen für den Vortrag. Eine Stimme aus Ihrer eigenen Aufnahme zu erstellen, ist ein separater Workflow — siehe So klonen Sie Ihre Stimme mit KI.

Schritt 1: Die Stimmenbibliothek öffnen und eine Stimmzeile lesen

Öffnen Sie KI-Video, wählen Sie den gewünschten Avatar aus und klicken Sie unter dem Skriptfeld auf die aktuelle Stimme. Die Stimmenbibliothek öffnet sich über dem Editor.

Jede Zeile enthält vier Signale, mit denen Sie vorhersagen können, wie ein Sprecher klingen wird, bevor Sie auf Play drücken:

  • Sprach-Tag — die Sprache, welche die Stimme spricht.
  • Flagge — der regionale Akzent, nicht eine zweite Sprache. Englische Stimmen können US-, UK-, kanadische und weitere Flaggen tragen.
  • Geschlecht und Alter — die wahrgenommene Identität des Sprechers.
  • Eigenschaften und Anwendungsfall — Beschreibungen wie klar, warm, umgangssprachlich, Erzählung, Bildung oder soziale Medien.
Übersicht über die Kennzeichnungen für Sprache, regionalen Akzent, Geschlecht, Alter, Eigenschaften und Anwendungsfall in einer VisionStory-Stimmzeile
Die Flagge steht für den regionalen Akzent — das Label, das am meisten zählt, wenn Sie mehrere Stimmen derselben Sprache vergleichen.

Nutzen Sie die Labels, um eine engere Auswahl zu erstellen, nicht um die endgültige Entscheidung zu treffen. Zwei Stimmen mit nahezu identischen Tags können sich in Tempo, Klangfarbe und Energie trotzdem deutlich unterscheiden.

Schritt 2: Filtern, suchen und eine engere Auswahl in der Vorschau anhören

Beginnen Sie breit genug, um echte Unterschiede zu hören, und grenzen Sie dann ein. Nutzen Sie die Filter Sprache, Geschlecht, Alter und Anwendungsfall, solange Sie noch ausprobieren. Wenn Sie eine Stimme bereits mit Namen kennen, geben Sie ihn stattdessen in das Suchfeld ein.

  1. Engere Auswahl erstellen. Filtern oder suchen Sie so lange, bis Sie eine Handvoll Kandidaten statt eines ganzen Katalogs vor sich haben.
  2. Die Auswahl durchhören. Klicken Sie rechts in einer Stimmzeile auf die Play-Schaltfläche, um die Hörprobe abzuspielen.
  3. Pausieren und vergleichen. Klicken Sie erneut auf dieselbe Schaltfläche, um zu stoppen, bevor Sie die nächste starten.
Die VisionStory-Stimmenbibliothek mit Suchfeld, den Filtern Sprache, Geschlecht, Alter und Anwendungsfall sowie einer Play-Schaltfläche in jeder Stimmzeile
Suche und Filter machen eine Bibliothek mit 1.000 Stimmen beherrschbar; erst die Vorschau bestätigt, dass die Stimme passt.

Achten Sie beim Hören darauf, was Ihr Video tatsächlich braucht: regionalen Akzent, Verständlichkeit, Energie, Wärme, Autorität und wie schnell sich die Stimme durch einen Satz bewegt. Eine Stimme, die für sich allein großartig klingt, kann für ein Skript aus den Bereichen Anleitung, Vertrieb, Nachrichten oder Charaktererzählung trotzdem falsch sein.

Schritt 3: Stimme auf Inhalt und Publikum abstimmen

Die meisten enttäuschenden KI-Voiceovers sind kein Qualitätsproblem, sondern ein Problem der Passung. Legen Sie fest, was die Stimme für genau dieses Video leisten soll, bevor Sie sich festlegen.

Wenn Sie Folgendes erstellenAchten Sie aufVermeiden Sie
Tutorials, Erklärvideos, KurseKlare Artikulation, gleichmäßiges Tempo, neutrale WärmeEnergiegeladene Werbeansagen, die über Fachbegriffe hinweghetzen
Anzeigen, Promos, kurze Social-ClipsEnergie, Punch, ein selbstbewusstes und jüngeres ProfilLangsame, bedächtige Erzählstimmen, die den Hook verpuffen lassen
Nachrichten, Corporate, Produkt-UpdatesAutorität, gleichmäßiges Tempo, wenig StimmfärbungLockere oder stark charakterisierte Stimmen
Storytelling, Interviews, PodcastsPersönlichkeit und AusdrucksbreiteFlache Ansagerstimmen ohne jede Dynamik
Lokalisierte Versionen ein und desselben VideosEinen muttersprachlichen regionalen Akzent für jeden MarktEine englische Stimme, die übersetzte Texte vorliest

Der Akzent ist die Einstellung, bei der die meisten danebenliegen. Wenn Ihr Publikum in London sitzt und Ihr Moderator eine US-Flagge trägt, fällt das den Zuhörern auf — selbst wenn jedes Wort korrekt ist. Wählen Sie die Flagge passend zum Publikum, nicht nur zur Sprache.

Schritt 4: Sprechgeschwindigkeit einstellen, dann Pausen setzen

Klicken Sie auf eine Stimmzeile, um sie auf das aktuelle Setup anzuwenden. Öffnen Sie dann das Geschwindigkeitsmenü neben der ausgewählten Stimme und wählen Sie Langsam, Normal oder Schnell.

  • Langsam passt zu ruhigen Erklärungen und allen Inhalten, bei denen Verständlichkeit wichtiger ist als Tempo.
  • Normal ist die sichere Grundeinstellung für die meisten Tutorials, Präsentationen und Sprechavatar-Videos.
  • Schnell bringt Energie in kurze Promos und Social-Clips, macht dichte Skripte aber schwerer verständlich.

Die Geschwindigkeit bestimmt das Tempo des gesamten Vortrags. Für die Feinsteuerung innerhalb eines Satzes setzen Sie den Cursor an die passende Stelle und klicken auf die Schaltfläche Pause. Jeder Klick fügt 0,5 Sekunden hinzu; klicken Sie erneut für eine längere Pause.

Vergleich der Sprechgeschwindigkeiten Langsam, Normal und Schnell neben einer in ein Skript eingefügten Pause von einer halben Sekunde
Nutzen Sie die Geschwindigkeit für das Gesamttempo und Pausen für die einzelnen Momente, die Bedeutung tragen.

Know-how: Setzen Sie Pausen dort, wo ein echter Moderator atmen, den Gedanken wechseln oder eine Aussage wirken lassen würde. Zu viele Pausen zerstückeln den Vortrag — hören Sie sich nach dem Bearbeiten deshalb den ganzen Satz in der Vorschau an, nicht nur die geänderte Stelle.

Schritt 5: Den Vortrag mit „Stimme optimieren“ steuern

Klicken Sie auf Stimme optimieren, wenn der Text stimmt, der gewünschte Vortrag aber noch nicht klar vorgegeben ist. VisionStory ergänzt Hinweise zu Emotion, Tempo und Betonung, ohne Ihren Wortlaut zu verändern.

Prüfen Sie das optimierte Skript, bevor Sie fortfahren. Wählen Sie Behalten, wenn die Hinweise Ihrer Absicht entsprechen, oder Rückgängig, um zum Original zurückzukehren. Die Funktion lohnt sich, wenn ein Skript klare emotionale Führung braucht, aber nicht umformuliert werden soll.

Vorher-Nachher-Vergleich: „Stimme optimieren“ ergänzt Hinweise für einen ruhigen, bedächtigen Vortrag, ohne die Worte zu ändern
Die Botschaft bleibt Ihre; Regie bekommt nur der Vortrag.

Schritt 6: Das echte Skript vor dem Generieren vorhören

Klicken Sie auf Audio-Vorschau, sobald Stimme, Geschwindigkeit, Pausen und eventuelle Optimierungshinweise stehen. Hören Sie sich die komplette Aufnahme an, statt schon nach den ersten Wörtern zu urteilen, und prüfen Sie Aussprache, Akzent, Rhythmus, Satzenden, Pausen und die emotionale Passung.

Solange Sie noch mehrere Kandidaten vergleichen, starten Sie mit einem kurzen, repräsentativen Satz. Sobald die engere Auswahl auf zwei oder drei Stimmen geschrumpft ist, hören Sie sich eine Passage an, die die Namen, Zahlen, Fachbegriffe oder emotionalen Höhepunkte enthält, auf die es im fertigen Video am meisten ankommt — genau dort zeigen sich die Unterschiede zwischen den Stimmen.

Vorschau-Kontingent: Die Audio-Vorschau enthält ein kostenloses Zeichenkontingent, das sich in einem rollierenden 24-Stunden-Zyklus erneuert. Ist dieses Kontingent aufgebraucht, kostet die Vorschau-Generierung 1 Credit pro 500 Zeichen. Alle Details finden Sie unter So funktionieren VisionStory Credits.

Schritt 7: Einmal generieren, damit der Avatar sich die Stimme merkt

Die Auswahl einer Stimme ändert die aktuelle Einrichtung im Editor, aber die Auswahl allein speichert diese Stimme nicht am Avatar. Generieren Sie ein Video mit der gewählten Stimme. VisionStory merkt sich dann diese Kombination und stellt sie wieder her, wenn Sie denselben Avatar das nächste Mal verwenden.

Dreistufiges Diagramm: Eine Stimme wird ausgewählt, nach einer Videogenerierung gespeichert und bei erneuter Verwendung des Avatars wiederhergestellt
Entscheidend ist die Generierung: Stimme auswählen, einmal generieren, danach den Avatar mit der bereits zugewiesenen Stimme weiterverwenden.

Deshalb lohnt es sich, die Wahl sorgfältig zu treffen. Sobald Avatar und Stimme verknüpft sind, beginnt jedes weitere Video mit einem einheitlichen Sprecher statt mit einer neuen Entscheidung.

Warum KI-Stimmen roboterhaft klingen — und wie Sie das beheben

Wenn ein generiertes Voiceover synthetisch wirkt, liegt das meist an einer von fünf behebbaren Ursachen und nicht am Stimmmodell selbst.

  • Falsche Stimme für das Skript. Eine Erzählerstimme, die Werbetext liest, klingt flach. Grenzen Sie die Auswahl erneut nach Anwendungsfall ein, bevor Sie die Qualität verantwortlich machen.
  • Keine Pausen. Echte Sprecher atmen. Eine Textwand ohne Taktung wirkt maschinell, fügen Sie also an den Sinngrenzen Pausen von einer halben Sekunde ein.
  • Geschwindigkeit einmal eingestellt und vergessen. Schnell lässt dichte Sätze verwaschen klingen, Langsam zieht einen kurzen Werbeclip in die Länge. Passen Sie das Tempo an die Art des Inhalts an.
  • Unklare Zeichensetzung. Endlose Schachtelsätze, fehlende Kommas und nicht ausgeschriebene Abkürzungen treiben jede Stimme in Richtung Monotonie. Bereinigen Sie zuerst das Skript.
  • Keine emotionale Regieanweisung. Wenn die Absicht nicht im Text steht, kann die Stimme sie nicht erraten — genau dafür gibt es die Funktion „Stimme optimieren“.

Beheben Sie diese fünf Punkte, und die meisten Klagen über roboterhafte KI-Stimmen verschwinden, ohne dass Sie die Stimme überhaupt wechseln müssen.

Wenn ein Anbieter eine von Ihnen genutzte Stimme einstellt

VisionStory bezieht Stimmen von mehreren Anbietern, und ein Anbieter kann eine Stimme aus seinem eigenen Katalog entfernen. Passiert das, lässt sich die Stimme nicht in die öffentliche Stimmenbibliothek zurückholen.

Wenn eine Stimme, auf die Sie sich verlassen haben, nicht mehr verfügbar ist, suchen Sie in einem älteren Video eine saubere Passage, in der nur diese Stimme zu hören ist, und verwenden Sie sie als Quellaudio in Stimme klonen. Der Klon kann einen sehr ähnlichen Ersatz liefern, auch wenn er nicht identisch klingen wird.

Prozessdiagramm, das zeigt, wie sauberes Audio aus einem früheren Video als Quelle für einen ähnlichen Ersatz-Stimmklon dient
Ein früher freigegebenes Video kann das saubere Audio liefern, das für Kontinuität sorgt, wenn eine Katalogstimme eingestellt wird.

Berechtigung erforderlich: Klonen Sie nur Audio, das Ihnen gehört oder für das Sie eine eindeutige Erlaubnis haben, und hören Sie sich den Ersatz mit Ihrem geplanten Skript an, bevor Sie veröffentlichen.

Ihre Checkliste für die KI-Stimme vor dem Generieren

  • Wählen Sie den regionalen Akzent passend zum Publikum, nicht nur die Sprache.
  • Nutzen Sie die Profil-Tags für die Vorauswahl und entscheiden Sie dann nach Gehör.
  • Hören Sie die Namen, Zahlen und schwierigen Begriffe aus Ihrem echten Skript vorab an.
  • Legen Sie die Gesamtgeschwindigkeit fest, bevor Sie einzelne Pausen einfügen.
  • Setzen Sie „Stimme optimieren“ nur ein, wenn der Vortrag klarere Vorgaben braucht.
  • Hören Sie sich eine vollständige Vorschau an, nicht nur den ersten Satz.
  • Generieren Sie einmal, wenn der Avatar sich die Stimme merken soll.
  • Notieren Sie den Namen der gewählten Stimme in Ihren Marken- oder Kampagnenunterlagen.

Sobald die Stimme feststeht, geht der Rest schnell. Führen Sie dasselbe Setup mit So erstellen Sie einen KI-Sprechavatar bis zum fertigen Video, oder öffnen Sie Text zu Sprache, wenn Sie nur die Audiospur brauchen.

Häufig gestellte Fragen

  • Beginnen Sie beim Publikum: Stimmen Sie die Sprache und den regionalen Akzent ab, den die Flagge anzeigt, und stellen Sie dann mit den Tags für Geschlecht, Alter, Eigenschaften und Anwendungsfall eine engere Auswahl aus wenigen Kandidaten zusammen. Hören Sie jede Stimme mit einem Satz aus Ihrem echten Skript an statt mit einer allgemeinen Hörprobe und wählen Sie die Stimme, deren Tempo, Energie und Wärme zur Art des Inhalts passen. Legen Sie zum Schluss die Sprechgeschwindigkeit fest und fügen Sie Pausen ein, damit der Vortrag Ihrer Absicht entspricht.