ElevenLabs krok po kroku: lektor z tekstu po polsku w kilka minut
Jak zrobić lektora w ElevenLabs: wybór polskiego głosu, model, ustawienia Stability i Similarity, pobieranie nagrań i klonowanie własnego głosu.

👁 114 przeczytań
- Lektor z tekstu w ElevenLabs powstaje w kilka minut, jeśli decyzje podejmujesz we właściwej kolejności: najpierw głos, potem model, a na końcu suwaki.
- Na planie darmowym limit jednej generacji wynosi 2500 znaków, na planach płatnych 5000, więc dłuższy tekst trzeba dzielić na części.
- Do polskiego tekstu dokumentacja zaleca głos nagrany przez osobę mówiącą po polsku - głos anglojęzyczny zdradza się akcentem już w pierwszym zdaniu.
W ElevenLabs lektor do filmu powstaje w kilka minut, pod warunkiem że wiesz, w jakiej kolejności podejmować decyzje. Oficjalna dokumentacja mówi to wprost: najważniejszy jest wybór głosu, potem modelu, a dopiero na końcu ustawienia. Ten samouczek prowadzi dokładnie w tej kolejności.
Kroki opieram na przewodniku ElevenLabs po funkcji Text to Speech. Nazwy sekcji podaję tak, jak występują w aplikacji, bo interfejs jest po angielsku.
Krok 1. Tekst, który dobrze brzmi na głos
Zanim cokolwiek wkleisz, przygotuj tekst pod czytanie, a nie pod czytanie oczami. Dokumentacja ElevenLabs radzi, żeby liczby i symbole zapisywać słownie, bo wtedy model wymawia je tak, jak chcesz. „2026″ może zostać przeczytane różnie, „dwa tysiące dwadzieścia sześć” zawsze tak samo.
Krótsze zdania i przecinki tam, gdzie chcesz pauzy, robią więcej niż jakiekolwiek ustawienie. Na płatnych planach w jednej generacji zmieścisz do 5 000 znaków, na darmowym 2 500, więc dłuższy tekst dzielisz na części.
Krok 2. Wybór głosu
W sekcji Text to Speech wklejasz tekst do okna, a głos wybierasz z listy w lewym dolnym rogu. Masz kilka źródeł głosów:
- Default Voices, czyli głosy domyślne,
- Voice Library, bibliotekę głosów udostępnionych przez innych,
- Voice Design, gdzie opisujesz głos, a ElevenLabs go tworzy,
- Instant Voice Cloning i Professional Voice Cloning, czyli klon własnego głosu.
Do polskiego tekstu szukaj w Voice Library głosu nagranego przez osobę mówiącą po polsku. Dokumentacja wprost zaleca głosy w języku ojczystym, bo wtedy wymowa i akcent brzmią naturalnie. Głos anglojęzyczny czytający po polsku zdradza się już w pierwszym zdaniu.
Krok 3. Model
ElevenLabs ma kilka modeli, a każdy nadaje się do czegoś innego. W dokumentacji znajdziesz Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 i Eleven Flash v2.5. Najnowszy nie zawsze znaczy najlepszy do Twojego tekstu, więc przy dłuższym materiale zrób krótką próbę na dwóch modelach i porównaj.
Krok 4. Ustawienia głosu
Tu większość ludzi przesadza. Suwaki są cztery:
- Stability decyduje, jak stabilny jest głos i jak bardzo różnią się kolejne generacje. Domyślnie 50.
- Similarity określa, jak blisko model trzyma się oryginalnego głosu.
- Speed ustawia tempo w zakresie od 0,7 do 1,2.
- Style exaggeration wzmacnia styl mówcy. Dokumentacja zaleca zostawić go na 0.
Similarity i Speed nie działają w modelu v3, więc jeśli suwak nic nie zmienia, sprawdź, który model masz wybrany. Moja rada: zacznij od ustawień domyślnych i zmieniaj jeden suwak naraz.
Krok 5. Generowanie i pobieranie
Klikasz Generate i po chwili masz nagranie. Od razu pobierzesz je jako MP3 w 128 kbps albo WAV. W historii generacji są dodatkowe formaty: MP3 w wyższej jakości, M4A i FLAC. Do filmu na YouTube wystarczy MP3 w wyższej jakości, do dalszej obróbki dźwięku lepszy jest WAV albo FLAC.
Klonowanie własnego głosu
Jeśli chcesz, żeby lektorem byłeś Ty, masz do wyboru szybkie klonowanie i profesjonalne. Zasada z dokumentacji brzmi prosto: dobre nagranie na wejściu daje dobry głos na wyjściu. Nagrywaj w cichym pomieszczeniu, tym samym mikrofonem, w tym samym tonie. Szum, pogłos i zmiany głośności przechodzą do klona.
Przykład od początku do końca: lektor do minutowego filmu
Żeby wszystko złożyć w całość, oto jak wygląda przygotowanie lektora do krótkiego filmu produktowego, krok po kroku.
- Scenariusz. Piszesz tekst na mniej więcej minutę mówienia, krótkimi zdaniami. Ceny i daty zapisujesz słownie, a nazwę produktu tak, jak ma być wymówiona.
- Głos. W Voice Library filtrujesz głosy polskie i odsłuchujesz kilka próbek na tym samym zdaniu z Twojego scenariusza, a nie na przykładzie z biblioteki.
- Próba. Generujesz tylko pierwszy akapit na ustawieniach domyślnych. Jeśli głos brzmi zbyt monotonnie, obniżasz Stability o kilka punktów. Jeśli zbyt nierówno, podnosisz.
- Całość. Gdy pierwszy akapit brzmi dobrze, generujesz resztę na tych samych ustawieniach, akapit po akapicie.
- Poprawki. Jeśli jedno zdanie wyszło źle, generujesz ponownie tylko je, a nie cały tekst.
Generowanie akapitami ma jeszcze jedną zaletę: przy montażu łatwiej dopasować ścieżkę do obrazu, bo każdy fragment jest osobnym plikiem.
Jak poprawić jedno źle wymówione słowo
Nazwy własne, skróty i obce słowa to najczęstszy problem w polskich nagraniach. Najprostszy sposób: zapisz słowo w tekście tak, jak ma brzmieć. Zamiast skrótu wpisz jego rozwinięcie albo zapis fonetyczny, a nazwę angielską rozbij tak, jak wymawia się ją po polsku. Wygląda to dziwnie w pliku tekstowym, ale słuchacz nie widzi tekstu, tylko słyszy efekt.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Najczęstsze błędy
- Anglojęzyczny głos do polskiego tekstu, stąd akcent.
- Liczby zapisane cyframi, stąd dziwna wymowa dat i kwot.
- Kręcenie wszystkimi suwakami naraz, stąd brak powtarzalności.
- Jeden długi blok tekstu, który przekracza limit znaków.
Ile kosztują poszczególne plany i czym się różnią, rozpisałem w tekście Ile kosztuje ElevenLabs. Roczny plan Creator z klonowaniem głosu sprzedaję taniej niż w oficjalnym cenniku w sklepie kinetyka.pl.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Jak wybrać dobry głos po polsku w ElevenLabs?
W sekcji Text to Speech otwierasz Voice Library i filtrujesz głosy polskie, a następnie odsłuchujesz próbki na własnym zdaniu z tekstu, a nie na przykładzie z biblioteki. Dokumentacja ElevenLabs wprost zaleca głosy w języku ojczystym, bo wtedy wymowa i akcent brzmią naturalnie.
Co zrobić, gdy ElevenLabs źle wymawia liczby lub daty po polsku?
Liczby i symbole należy zapisywać słownie, np. zamiast '2026' wpisać 'dwa tysiące dwadzieścia sześć'. Dokumentacja ElevenLabs wyjaśnia, że zapis słowny gwarantuje jednoznaczną wymowę, podczas gdy cyfry mogą zostać odczytane różnie.
Co robią suwaki Stability i Style exaggeration w ElevenLabs?
Stability decyduje o tym, jak stabilny jest głos i jak bardzo różnią się kolejne generacje - domyślna wartość to 50, a jeśli głos brzmi zbyt monotonnie, obniżasz ją o kilka punktów. Style exaggeration wzmacnia styl mówcy, ale dokumentacja zaleca zostawiać go na 0.
W jakim formacie pobierać nagranie z ElevenLabs do montażu wideo?
Bezpośrednio po generowaniu możesz pobrać plik jako MP3 w 128 kbps albo WAV, a z historii generacji dostępne są też MP3 w wyższej jakości, M4A i FLAC. Do filmu na YouTube wystarczy MP3 w wyższej jakości, natomiast do dalszej obróbki dźwięku lepiej wybrać WAV albo FLAC.
Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.
