Möchten Sie ein stilles Foto sprechen lassen—ein Porträt, das den Mund öffnet, blinzelt und sagt, was immer Sie tippen? Mit VisionStory geht das aus nur einem Bild direkt in Ihrem Browser, ganz ohne Kamera und ohne Bearbeitungserfahrung. Das Video oben zeigt den kompletten Ablauf, und die Schritt-für-Schritt-Anleitung unten erklärt jeden Teil im Detail.
Dabei laden Sie ein Porträt hoch und bereiten es als Ihren eigenen wiederverwendbaren Avatar vor. Andere Nutzer können ihn nicht sehen, und Sie können ihn für zukünftige Videos erneut auswählen, statt jedes Mal dasselbe Bild hochzuladen. Alles läuft in VisionStorys Talking-Photo-Tool mit einem kostenlosen Konto.
Schritt 1: Ein klares Porträt hochladen
Öffnen Sie KI-Video. Wählen Sie im Bereich „Charaktere“ Upload und wählen Sie ein Bild von Ihrem Gerät aus, oder ziehen Sie das Foto direkt in den Drop-Bereich. Verwenden Sie eine klare, frontal aufgenommene Person, bei der Gesicht und Schultern sichtbar sind, Augen und Mund nicht verdeckt sind und rund um das Motiv etwas Platz bleibt, damit Sie später neu zuschneiden können.
- Unterstützte Dateien: JPG, JPEG, PNG, WebP und HEIC.
- Maximale Dateigröße: 30 MB.
- Empfohlene Ausgangsgröße: mindestens 512 x 768 Pixel für ein Porträt.
- Upload-Verhalten: jeweils ein Quellbild.

Passen Sie die Komposition des Ausgangsbildes an das Ziel-Format des Videos an. Ein eng zugeschnittenes Porträt kann in 9:16 gut funktionieren, in 16:9 aber zu einem unangenehm engen Gesichtsausschnitt werden, weil links und rechts keine Bildfläche vorhanden ist, um den breiteren Rahmen zu füllen.
Schritt 2: Den Avatar von VisionStory prüfen und vorbereiten lassen
Nach dem Upload prüft VisionStory, ob das Bild eine nutzbare Person enthält, und bereitet es als Charakter vor. Ein fehlgeschlagener Upload liegt fast immer am Ausgangsfoto: Das Gesicht kann zu klein sein, stark verdeckt, zu weit zur Seite gedreht, unscharf oder zu nah an einem anderen Gesicht.
Wenn die Vorbereitung fehlschlägt, versuchen Sie nicht immer wieder denselben Zuschnitt. Wählen Sie stattdessen eine schärfere Quelle mit einem größeren Gesicht, einem direkteren Winkel, sichtbaren Schultern, gleichmäßiger Beleuchtung und weniger Verdecken.

Wenn die Verarbeitung abgeschlossen ist, erscheint der Avatar oberhalb der öffentlichen Charakterbibliothek und öffnet sich in der Avatar-Vorschau. Er ist nur für Sie sichtbar.
Schritt 3: Die zugewiesene Stimme anhören oder ändern
VisionStory weist automatisch eine passende Start-Stimme zu, basierend auf dem geschätzten Alter und Geschlecht der Person. Sie können sie beibehalten, in der Vorschau anhören oder gegen eine andere austauschen.
- Wählen Sie die aktuelle Stimme aus, um die Voice Library zu öffnen.
- Nutzen Sie die Wiedergabetaste rechts neben einer Stimme, um ein Beispiel zu hören.
- Wenn sie nicht passt, filtern Sie nach Sprache, Geschlecht, Alter und Anwendungsfall.
- Hören Sie sich ein paar Alternativen an und wählen Sie dann die Stimme, die sowohl zum Avatar als auch zum Zweck des Videos passt.

Eine Stimme kann zum geschätzten Alter und Geschlecht passen und sich trotzdem für Erzählen, Bildung, Werbung oder dialogartige Inhalte falsch anfühlen. Stimmen Sie Person und Zweck ab, nicht nur die Demografie.
Schritt 4: Das Foto fürs Ziel-Format zuschneiden
Nutzen Sie die Avatar-Vorschau, um festzulegen, wie viel von der Person im finalen Video zu sehen ist. Ziehen Sie das Foto, um das Motiv neu zu positionieren, und verwenden Sie die Zoom-Regler, um näher heranzugehen oder weiter weg zu gehen. Wählen Sie anschließend das Seitenverhältnis, das zu Ihrem Veröffentlichungsort passt:
- 9:16 Hochformat für TikTok, Instagram Reels, YouTube Shorts und andere mobile Platzierungen.
- 1:1 Quadrat für quadratische Social-Posts, profilzentrierte Layouts und flexible Einbettungen.
- 16:9 Querformat für YouTube, Präsentationen, Websites und Widescreen-Kurse.

Zoom kann keine Pixel sichtbar machen, die nicht existieren. Wenn die Person bereits jede Kante des Ausgangsfotos berührt, starten Sie lieber mit einem Bild mit mehr Hintergrund, statt einen breiteren Zuschnitt zu erzwingen.
Schritt 5: Was Change Look und Generate Image leisten
Neben dem Avatar stehen zwei KI-Bildtools zur Verfügung—und es hilft, den Unterschied zu kennen, bevor Sie sie nutzen.
Change Look öffnet einen KI-Chat, in dem Ihr aktueller Avatar bereits angehängt ist, sodass Sie ein neues Outfit, Setting oder einen Stil beschreiben können. Das ist ein Image-to-Image-Workflow, und der ursprüngliche Avatar bleibt verfügbar. Generate Image startet dagegen mit einer schriftlichen Charakterbeschreibung statt mit einem Foto—das ist ein Text-to-Image-Workflow. In beiden Fällen können Sie weiter chatten, um das Ergebnis zu verfeinern.

Kurz gesagt: Nutzen Sie Change Look, wenn der Charakter bereits existiert und nur einen neuen Look braucht, und Generate Image, wenn Sie einen Charakter aus einem Prompt erstellen möchten.
Schritt 6: Ein kurzes Skript hinzufügen und das Sprechvideo generieren
Während Ihr hochgeladener Avatar ausgewählt ist, tippen Sie im Skriptfeld einen kurzen, dialogartigen Satz ein. Eine kurze Zeile rendert schneller und macht es leichter, Foto, Zuschnitt, Stimme, Lip-Sync und Bewegung zusammen zu beurteilen.
Klicken Sie auf Generate Talking Video. VisionStory animiert das Gesicht, synchronisiert die Lippen mit der Stimme und fügt lebensechtes Blinzeln sowie Kopfbewegungen hinzu—auf Basis des gewählten Avatars, Zuschnitts, Skripts und der Stimme. Das Rendering dauert ein paar Minuten.

Betrachten Sie dieses erste Ergebnis als praktischen Test für das Ausgangsfoto. Prüfen Sie es auf vier Punkte:
- Das Gesicht bleibt in der finalen Größe scharf genug.
- Augen und Mund bleiben während der Bewegung frei sichtbar.
- Kopf und Schultern sitzen angenehm innerhalb des gewählten Seitenverhältnisses.
- Der bewegte Avatar sieht weiterhin wie die Person aus dem Ausgangsfoto aus.
Wenn der Zuschnitt zu eng ist oder das Gesicht in Bewegung weich wirkt, korrigieren Sie zuerst das Ausgangsbild oder das Framing. Ein anderes Skript löst kein Kompositionsproblem.
Schritt 7: Ihren Talking-Photo-Avatar wiederverwenden oder entfernen
Zurück in der Charakterliste steht Ihr hochgeladener Avatar oberhalb der öffentlichen Charakterbibliothek und kann jederzeit ausgewählt werden, wenn Sie denselben Presenter erneut verwenden möchten. Andere Nutzer können ihn nicht sehen, und Abonnenten können unbegrenzt viele Avatare erstellen und behalten.
- Wiederverwenden: Wählen Sie den Avatar aus, statt das Foto erneut hochzuladen.
- Looks wechseln: Öffnen Sie den Avatar und wählen Sie eines seiner gespeicherten Look-Thumbnails.
- Entfernen: Fahren Sie mit der Maus über den Avatar, um oben rechts die Löschen-Schaltfläche einzublenden, und bestätigen Sie, bevor Sie den Avatar und seine Looks löschen.

Fehlerbehebung bei häufigen Fotoproblemen
VisionStory findet kein nutzbares Gesicht. Verwenden Sie ein helleres, schärferes Bild mit einem größeren, frontal aufgenommenen Gesicht. Vermeiden Sie verdeckte Augen oder Münder, starke Profilwinkel und Fotos, auf denen ein anderes Gesicht nah am Hauptmotiv ist.
Der Querformat-Zuschnitt ist zu nah. Das Ausgangsporträt hat vermutlich nicht genug Bildfläche an den Seiten. Nutzen Sie eine breitere Quelle oder ein Bild mit mehr Leerraum um die Person.
Der Avatar wird noch vorbereitet. Warten Sie, bis die Vorbereitung abgeschlossen ist, bevor Sie den Charakter verwenden. Wenn es hängen bleibt, aktualisieren Sie die Charakter-Ansicht und prüfen Sie, ob der Avatar bereits erschienen ist, bevor Sie eine weitere Kopie hochladen.
Das Ergebnis wirkt weich. Starten Sie mit einem höher aufgelösten, scharfen Foto und vermeiden Sie es, ein kleines Gesicht zu stark zu vergrößern. Die Ausgabeauflösung kann keine Details wiederherstellen, die in der Quelle fehlen.
Mehr braucht es nicht, um ein Foto zum Sprechen zu bringen: ein Porträt hochladen, eine Stimme zuordnen, zuschneiden und generieren. Ihr Foto ist jetzt ein wiederverwendbarer Sprechavatar, den Sie jederzeit wieder nutzen können.
Bereit für das komplette Skript-, Stimmen-, Einstellungen-, Credits- und Generierungs-Workflow? Folgen Sie How to Create an AI Talking Avatar, oder verwandeln Sie ganze Skripte in großem Maßstab in KI-Videos. Oder starten Sie einfach jetzt: Erstellen Sie Ihr erstes sprechendes Foto kostenlos.
