Każde wideo AI zaczyna się od skryptu, ale to głos decyduje o tym, jak ten skrypt naprawdę trafi do odbiorców. Ustala akcent, wiek, barwę, energię i osobowość Twojego prezentera — a tempo, pauzy i wskazówki dotyczące sposobu mówienia przesądzają o tym, czy efekt brzmi jak człowiek, czy jak maszyna czytająca stronę tekstu.

W skrócie: wybierz głos AI, dopasowując język i akcent regionalny do swojej publiczności, korzystając z etykiet profilu do stworzenia krótkiej listy, odsłuchując każdego kandydata z własnym skryptem, a następnie kształtując sposób mówienia za pomocą tempa i pauz, zanim rozpoczniesz generowanie. Dalsza część tego przewodnika krok po kroku omawia ten proces w VisionStory, którego biblioteka głosów AI zawiera ponad 1000 głosów w 88 językach.

Co obejmuje ten przewodnik: publiczną Bibliotekę głosów oraz otaczające ją ustawienia sposobu mówienia. Tworzenie głosu z własnego nagrania to osobny proces — zobacz jak sklonować swój głos za pomocą AI.

Krok 1: Otwórz Bibliotekę głosów i odczytaj wiersz głosu

Otwórz Wideo AI, wybierz awatara, którego chcesz użyć, i kliknij bieżący głos pod polem Skrypt. Biblioteka głosów otworzy się nad edytorem.

Każdy wiersz zawiera cztery wskazówki, dzięki którym przewidzisz, jak zabrzmi dany głos, zanim naciśniesz odtwarzanie:

  • Etykieta języka — język, w którym mówi dany głos.
  • Flagaakcent regionalny, a nie drugi język. Angielskie głosy mogą mieć flagę amerykańską, brytyjską, kanadyjską i inne.
  • Płeć i wiek — postrzegana tożsamość mówiącego.
  • Cechy i przypadek użycia — opisy takie jak wyrazisty, ciepły, konwersacyjny, narracja, edukacja czy media społecznościowe.
Przewodnik po etykietach języka, akcentu regionalnego, płci, wieku, cech i przypadku użycia w wierszu głosu w VisionStory
Flaga oznacza akcent regionalny — etykietę, która ma największe znaczenie przy porównywaniu kilku głosów w tym samym języku.

Etykiety służą do stworzenia krótkiej listy, a nie do podjęcia ostatecznej decyzji. Dwa głosy o niemal identycznych etykietach mogą się nadal mocno różnić tempem, barwą i energią.

Krok 2: Filtruj, wyszukuj i odsłuchaj krótką listę

Zacznij od szerokiego wyboru, aby usłyszeć rzeczywiste różnice, a potem zawężaj. Dopóki wciąż poszukujesz, korzystaj z filtrów Język, Płeć, Wiek i Przypadek użycia. Jeśli znasz już nazwę konkretnego głosu, wpisz ją zamiast tego w polu wyszukiwania.

  1. Stwórz krótką listę. Filtruj lub wyszukuj, aż zostanie Ci kilku kandydatów zamiast całego katalogu.
  2. Odsłuchaj całą krótką listę. Kliknij przycisk odtwarzania po prawej stronie wiersza głosu, aby usłyszeć próbkę.
  3. Zatrzymuj i porównuj. Kliknij ten sam przycisk ponownie, aby zatrzymać odtwarzanie przed uruchomieniem kolejnej próbki.
Biblioteka głosów VisionStory z polem wyszukiwania, filtrami Język, Płeć, Wiek i Przypadek użycia oraz przyciskiem odtwarzania w każdym wierszu głosu
Wyszukiwarka i filtry pozwalają zapanować nad biblioteką 1000 głosów; dopiero odsłuch potwierdza trafność wyboru.

Słuchaj pod kątem tego, czego naprawdę potrzebuje Twoje wideo: akcentu regionalnego, wyrazistości, energii, ciepła, autorytetu oraz tego, jak szybko głos przechodzi przez zdanie. Głos, który sam w sobie brzmi świetnie, może nadal nie pasować do skryptu instruktażowego, sprzedażowego, informacyjnego czy opartego na postaci.

Krok 3: Dopasuj głos do treści i odbiorców

Większość rozczarowujących lektorów AI to nie problem jakości, tylko dopasowania. Zanim podejmiesz decyzję, ustal, co ten głos ma zrobić w tym konkretnym filmie.

Jeśli tworzyszSzukajUnikaj
Poradniki, materiały wyjaśniające, kursyWyraźnej artykulacji, równego tempa, neutralnego ciepłaEnergicznych odczytów promocyjnych, które połykają terminy techniczne
Reklamy, promocje, krótkie klipy na social mediaEnergii, wyrazistości, pewnego siebie i młodszego profiluWolnej, wyważonej narracji, która gubi haczyk przyciągający uwagę
Wiadomości, materiały korporacyjne, aktualizacje produktuAutorytetu, równomiernego tempa, oszczędnej barwy głosuSwobodnych lub mocno stylizowanych, charakterystycznych głosów
Opowiadanie historii, wywiady, podcastyCharakteru i szerokiej skali ekspresjiPłaskich, lektorskich odczytów bez dynamiki
Zlokalizowane wersje jednego wideoRodzimego akcentu regionalnego dla każdego rynkuJednego angielskiego głosu czytającego przetłumaczony tekst

Akcent to ustawienie, w którym najczęściej popełnia się błąd. Jeśli Twoi odbiorcy są w Londynie, a przy prezenterze widnieje flaga USA, słuchacze to wychwycą — nawet jeśli każde słowo jest poprawne. Wybieraj flagę pod odbiorców, nie tylko pod język.

Krok 4: Ustaw szybkość mówienia, a potem dodaj pauzy

Kliknij wiersz głosu, aby zastosować go w bieżącej konfiguracji. Następnie otwórz menu szybkości obok wybranego głosu i wybierz Wolno, Normalnie lub Szybko.

  • Wolno pasuje do spokojnych wyjaśnień i wszystkich treści, w których zrozumienie liczy się bardziej niż tempo.
  • Normalnie to bezpieczna baza dla większości poradników, prezentacji i filmów z mówiącym awatarem.
  • Szybko dodaje energii krótkim promocjom i klipom na social media, ale gęste skrypty stają się trudniejsze do śledzenia.

Szybkość ustala tempo całej wypowiedzi. Aby zapanować nad rytmem wewnątrz zdania, ustaw kursor w miejscu przerwy i kliknij przycisk Pauza. Każde kliknięcie dodaje 0,5 sekundy; kliknij ponownie, aby wydłużyć przerwę.

Porównanie szybkości mówienia Wolno, Normalnie i Szybko obok półsekundowej pauzy wstawionej w skrypt
Szybkością steruj ogólnym tempem, a pauzami — konkretnymi przerwami, które niosą znaczenie.

Wskazówka: dodawaj pauzy tam, gdzie prawdziwy prezenter wziąłby oddech, zmieniłby wątek albo pozwoliłby wybrzmieć jakiejś tezie. Zbyt wiele pauz rozbija wypowiedź, więc po edycji odsłuchaj całe zdanie, a nie tylko zmieniony fragment.

Krok 5: Pokieruj interpretacją za pomocą Ulepszenia głosu

Kliknij Ulepszenie głosu, gdy słowa są już dobre, ale zamierzona interpretacja nie została jeszcze wyrażona wprost. VisionStory dodaje wskazówki dotyczące emocji, tempa i akcentowania, zachowując Twoje oryginalne sformułowania.

Zanim przejdziesz dalej, przejrzyj ulepszony skrypt. Wybierz Zachowaj, jeśli wskazówki odpowiadają Twoim zamiarom, albo Cofnij, aby wrócić do oryginału. Ta funkcja sprawdza się wtedy, gdy skrypt potrzebuje wyraźnego kierunku emocjonalnego, ale jego treść nie powinna się zmieniać.

Porównanie przed i po pokazujące, jak Ulepszenie głosu dodaje wskazówki spokojnej i wyważonej interpretacji bez zmiany słów
Przekaz pozostaje Twój; kierunek nadawany jest wyłącznie interpretacji.

Krok 6: Odsłuchaj podgląd prawdziwego skryptu przed generowaniem

Kliknij Podgląd audio, gdy masz już ustawiony głos, szybkość, pauzy oraz ewentualne wskazówki dla Ulepszenia głosu. Odsłuchaj całe nagranie, zamiast oceniać je po pierwszych kilku słowach, i sprawdź wymowę, akcent, rytm, zakończenia zdań, pauzy oraz dopasowanie emocjonalne.

Gdy wciąż porównujesz kandydatów, zacznij od jednego krótkiego, reprezentatywnego zdania. Kiedy lista zawęzi się do dwóch lub trzech głosów, odsłuchaj fragment zawierający nazwy, liczby, terminy techniczne lub momenty emocjonalne, które są najważniejsze w gotowym wideo — to właśnie tam głosy się od siebie różnią.

Limit podglądu: podgląd audio obejmuje bezpłatną pulę znaków, która odnawia się w ruchomym cyklu 24-godzinnym. Po jej wykorzystaniu wygenerowanie podglądu kosztuje 1 kredyt za 500 znaków. Zobacz, jak działają kredyty VisionStory, aby poznać pełny obraz.

Krok 7: Wygeneruj raz, aby awatar zapamiętał głos

Wybór głosu zmienia bieżące ustawienia edytora, ale sam wybór nie zapisuje tego głosu przy awatarze. Wygeneruj jedno wideo z wybranym głosem. VisionStory zapamięta wtedy to powiązanie i przywróci je przy następnym użyciu tego samego awatara.

Trzyetapowy diagram pokazujący wybór głosu, jego zapisanie po wygenerowaniu jednego wideo i przywrócenie przy ponownym użyciu awatara
Granicą jest generowanie: wybierz głos, wygeneruj raz, a potem korzystaj ponownie z awatara, który ma już przypisany ten głos.

Dlatego warto dokonać tego wyboru starannie. Gdy awatar i głos zostaną ze sobą powiązane, każde kolejne wideo zaczyna się od spójnego prezentera, a nie od podejmowania decyzji od nowa.

Dlaczego głosy AI brzmią robotycznie — i jak to naprawić

Gdy wygenerowany lektor brzmi sztucznie, zwykle odpowiada za to jedna z pięciu możliwych do naprawienia przyczyn, a nie sam model głosu.

  • Zły głos do danego skryptu. Głos lektorski czytający tekst reklamowy brzmi płasko. Zawęź listę według przypadku użycia, zanim zaczniesz obwiniać jakość.
  • Brak pauz. Prawdziwi mówcy oddychają. Ściana tekstu bez oddechów brzmi jak maszyna, więc dodaj półsekundowe pauzy na granicach myśli.
  • Szybkość ustawiona raz i zapomniana. Opcja Szybko sprawia, że gęste zdania stają się niewyraźne, a Wolno powoduje, że krótka promocja się wlecze. Dopasuj tempo do rodzaju treści.
  • Niejednoznaczna interpunkcja. Zdania bez wyraźnego końca, brakujące przecinki i nierozwinięte skróty popychają głos w stronę monotonii. Najpierw uporządkuj skrypt.
  • Brak wskazówek emocjonalnych. Jeśli intencji nie ma w tekście, głos jej nie odgadnie — i właśnie do tego służy Ulepszenie głosu.

Napraw te pięć rzeczy, a większość zastrzeżeń do robotycznego brzmienia głosów AI zniknie bez zmiany samego głosu.

Gdy dostawca wycofa głos, którego używasz

VisionStory pozyskuje głosy od kilku dostawców, a każdy z nich może usunąć głos ze swojego katalogu. Kiedy tak się stanie, głosu nie da się przywrócić do publicznej Biblioteki głosów.

Jeśli używany dotąd głos zniknął, znajdź czysty fragment wcześniejszego wideo, w którym słychać wyłącznie ten głos, i użyj go jako audio źródłowego w Klonowaniu głosu. Klon pozwala uzyskać zbliżony zamiennik, choć nie należy oczekiwać identycznego brzmienia.

Schemat procesu pokazujący, jak czyste audio z wcześniejszego wideo może posłużyć do stworzenia zbliżonego zamiennika w postaci klonu głosu
Wcześniej zatwierdzone wideo może dostarczyć czystego audio, które zachowa ciągłość brzmienia, gdy głos zostanie wycofany z katalogu.

Wymagana zgoda: klonuj wyłącznie audio, do którego masz prawa lub wyraźną zgodę na jego wykorzystanie, a przed publikacją odsłuchaj podgląd zamiennika z docelowym skryptem.

Lista kontrolna głosu AI przed generowaniem

  • Dobierz akcent regionalny do odbiorców, nie tylko sam język.
  • Zawężaj wybór za pomocą tagów w profilu głosu, a ostateczną decyzję zostaw uszom.
  • Odsłuchaj podgląd z nazwami, liczbami i trudnymi terminami z prawdziwego skryptu.
  • Ustaw ogólne tempo, zanim dodasz pauzy w konkretnych miejscach.
  • Sięgaj po Ulepszenie głosu tylko wtedy, gdy sposób czytania wymaga wyraźniejszych wskazówek.
  • Przesłuchaj cały podgląd, a nie tylko pierwsze zdanie.
  • Wygeneruj jedno wideo, gdy chcesz, aby awatar zapamiętał głos.
  • Zapisz nazwę wybranego głosu w notatkach marki lub kampanii.

Gdy głos jest już ustalony, reszta idzie szybko. Doprowadź te same ustawienia do gotowego wideo dzięki poradnikowi jak stworzyć mówiącego awatara AI albo otwórz tekst na mowę, gdy potrzebujesz wyłącznie warstwy audio.

Najczęściej zadawane pytania

  • Zacznij od odbiorców: dopasuj język i akcent regionalny wskazany przez flagę, a następnie skorzystaj z etykiet płci, wieku, cech i przypadku użycia, aby stworzyć krótką listę kilku kandydatów. Każdego z nich odsłuchaj na zdaniu z prawdziwego skryptu, a nie na uniwersalnej próbce, i wybierz głos, którego tempo, energia i ciepło pasują do rodzaju treści. Na koniec ustaw szybkość mówienia i dodaj pauzy, aby sposób czytania odpowiadał Twoim intencjom.