Porównanie lektorów AI: 8 głosów czyta ten sam polski tekst
Ten sam polski tekst z datą, kwotą i łamańcami przeczytało 8 lektorów AI. Ślepy test, ceny, licencje i błędy wymowy.

👁 117 przeczytań
- Spośród 8 testowanych lektorów AI tylko ElevenLabs Eleven v4 przeczytał polski tekst bez błędu, zdobywając 15 na 15 punktów kontrolnych.
- Największy problem sprawiały liczby: kwotę 1249,99 zł poprawnie - ze złotymi i groszami - odczytał wyłącznie Eleven v4, a datę źle podało 6 z 8 lektorów.
- Najtańszą opcją okazał się GPT Audio Mini (ok. 0,005 USD za 1000 znaków), ale pominął całe zdanie tekstu, co dyskwalifikuje go tam, gdzie kompletność jest wymagana.
Ten sam polski tekst - 62 słowa z datą, kwotą, numerem pociągu, telefonem, pytaniem, wykrzyknikiem, „Szczebrzeszynem” i „chrząszczem” - przeczytało 8 lektorów AI: z chmury, za darmo i całkiem lokalnie na moim RTX 4090. Najpierw posłuchaj w ciemno, potem odsłoń etykiety. Bez błędu przeszedł tylko jeden głos, a dwa darmowe modele lokalne poległy na liczbach.
Stan na 8 października 2026
- 8 nagrań tego samego tekstu (401 znaków), wyrównana głośność (-16 LUFS), pliki mp3 bez nazw modeli w adresie.
- Źródła: Edge TTS (2 głosy), ElevenLabs Eleven v4, OpenAI GPT Audio i GPT Audio Mini (przez OpenRouter), lokalnie Piper, XTTS v2 i Chatterbox Multilingual.
- Wynik bez błędu (15 z 15 punktów kontrolnych): tylko Eleven v4.
- Koszt całego testu: ok. 0,17 USD na OpenRouterze plus 401 znaków z mojego limitu ElevenLabs.
- Gemini TTS nie wszedł do zestawienia - opisuję niżej dlaczego.
To jest uzupełnienie mojego rankingu 14 modeli TTS po polsku. Tam liczyłem błędy w trzech długich tekstach. Tutaj chodzi o coś innego: o ucho. Jeden krótki tekst, osiem głosów obok siebie, ślepy test i tabela, która mówi, ile to kosztuje i czy wolno tego użyć komercyjnie.
Tekst testowy
Każdy lektor dostał dokładnie to samo, w zwykłym zapisie, bez rozpisywania liczb słownie:
Szczebrzeszyn, 17 października 2026 roku, godzina 9:45. Chrząszcz brzmi w trzcinie, a doktor Agnieszka Brzęczyszczykiewicz kupuje bilet za 1249,99 zł na pociąg IC 5316 do Łodzi. Czy zdąży, skoro pociąg ma już 25 minut spóźnienia? Źdźbło, gżegżółka, pszczółka - spróbuj to powtórzyć bez zająknięcia! A teraz zapisz: 15% zniżki, numer 601 234 567. Dziękuję i do usłyszenia w przyszły czwartek w Gdańsku!
W tym tekście siedzi 15 punktów kontrolnych:
- nazwy i łamańce: Szczebrzeszyn, chrząszcz, Brzęczyszczykiewicz, źdźbło, gżegżółka, pszczółka;
- liczby w poprawnej formie: „siedemnastego października dwa tysiące dwudziestego szóstego roku”, „dziewiąta czterdzieści pięć”, „tysiąc dwieście czterdzieści dziewięć złotych dziewięćdziesiąt dziewięć groszy”, „dwadzieścia pięć minut”, „piętnaście procent”;
- skrót IC i numer pociągu, numer telefonu czytany grupami;
- intonacja pytania w zdaniu „Czy zdąży…?”;
- kompletność - czy lektor czegoś nie pominął albo nie dodał.
Ślepy test: posłuchaj, zanim zobaczysz nazwy
Kolejność jest losowa, głośność wyrównana, a w adresach plików nie ma nazw modeli. Zapisz sobie literę swojego faworyta i dopiero potem kliknij „Pokaż, kto czyta”.
Głos A
Pokaż, kto czyta
OpenAI GPT Audio (głos cedar, przez OpenRouter). 13/15 - przeczytał kwotę jako „dwanaście czterdzieści dziewięć…” i dał „siedemnasty” zamiast „siedemnastego”.
Głos B
Pokaż, kto czyta
Piper, głos gosia (lokalnie, na procesorze). 6/15 - „Przedbrzeszyn”, „cząszcz”, „ździebło”, telefon jako „sześćset jeden milionów…”.
Głos C
Pokaż, kto czyta
ElevenLabs Eleven v4, głos Adam z biblioteki. 15/15 - jedyny bez błędu, z wyraźnym pytaniem i wykrzyknikiem.
Głos D
Pokaż, kto czyta
Edge TTS, głos Zofia (pl-PL-ZofiaNeural). 9/15 - „siedemnaście października roku dwa tysiące…”, „IC” jako jedno słowo, płaskie pytanie.
Głos E
Pokaż, kto czyta
XTTS v2 (Coqui), głos Damien Black, lokalnie na RTX 4090. 10/15 - łamańce dobrze, liczby w mianowniku („dziewięć czterdzieści pięć”, „przecinek”), mocny obcy akcent.
Głos F
Pokaż, kto czyta
Chatterbox Multilingual (Resemble AI), lokalnie na RTX 4090. 4/15 - na cyfrach zaczyna bełkotać, kilka słów wymyśla.
Głos G
Pokaż, kto czyta
Edge TTS, głos Marek (pl-PL-MarekNeural). 9/15 - „wsząszcz” zamiast „chrząszcz”, zła forma daty, „setnych złotego”.
Głos H
Pokaż, kto czyta
OpenAI GPT Audio Mini (głos cedar, przez OpenRouter). 10/15 - pominął całe zdanie „spróbuj to powtórzyć bez zająknięcia! A teraz zapisz:”.
Swój typ porównaj z wynikami poniżej - punktacja nie zawsze pokrywa się z tym, co brzmi najprzyjemniej. Pod tekstem możesz jednym kliknięciem ocenić, czy taki ślepy test jest przydatny - jeśli tak, w kolejnej edycji dołożę wspólną tablicę głosów czytelników.
Wyniki: wymowa w 15 punktach kontrolnych
Jak oceniałem: każde nagranie przepuściłem przez Whisper large-v3 (lokalnie) i przez Gemini 3.8 Flash z poleceniem, żeby zapisał słownie, jak co zabrzmiało, i ocenił każdy punkt. Błąd liczyłem, gdy widać go było w obu zapisach albo gdy Gemini podał konkretną złą formę (np. „siedemnasty”). Jedną ocenę sędziego poprawiłem ręcznie: Piper przeczytał „IC pięć tysięcy trzysta szesnaście” - to dopuszczalne, więc uznałem punkt.
Najczęstsze błędy w trudnych słowach
- Data - 6 z 8 lektorów użyło złej formy: „siedemnasty” albo „siedemnaście października” zamiast „siedemnastego”. Oba głosy Edge dokleiły do tego nadmiarowe „roku” („października roku dwa tysiące…”).
- Kwota 1249,99 zł - poprawnie (ze złotymi i groszami) tylko Eleven v4. Edge czyta „dziewięćdziesiąt dziewięć setnych złotego”, XTTS i Piper mówią „przecinek”, GPT Audio zgubił tysiąc.
- Chrząszcz - Edge Marek powiedział „wsząszcz”, Piper „cząszcz”, Chatterbox „ksząszcz”.
- Źdźbło - Edge Zofia „źbło”, GPT Audio Mini „żdźbło”, Piper „ździebło”.
- Szczebrzeszyn i Brzęczyszczykiewicz - poradzili sobie prawie wszyscy, wyjątkiem jest Piper („Przedbrzeszyn”, „Brzęcz-szczykiewicz”).
- Pytanie - wznoszącą intonację w „Czy zdąży…?” dały tylko Eleven v4, GPT Audio, GPT Audio Mini i Chatterbox. Edge, XTTS i Piper czytają pytanie jak zdanie oznajmujące.
- Numer telefonu - Piper przeczytał go jako jedną liczbę („sześćset jeden milionów…”). Eleven v4 przeczytał cyfra po cyfrze - to akurat poprawne.
Tabela: cena, polskie głosy, licencja, opóźnienie
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Opóźnienie to czas od wysłania tekstu do pierwszego dźwięku (dla usług ze strumieniowaniem) albo do gotowego pliku (modele lokalne). Mierzyłem z Polski, 8 października 2026, jedno wywołanie na model, więc traktuj to jako orientację, a nie benchmark.
| Lektor | Cena (1000 znaków) | Polskie głosy | Licencja komercyjna | Opóźnienie w moim teście |
|---|---|---|---|---|
| Eleven v4 (ElevenLabs) | 0,022 USD do 12.10, potem 0,08 USD | dziesiątki w bibliotece (np. Adam) | tak, na płatnym planie | 2,7 s do pierwszego dźwięku |
| GPT Audio (OpenAI) | ok. 0,14 USD (z mojego rachunku) | brak dedykowanych, głosy wielojęzyczne | tak, wg zasad OpenAI (trzeba ujawnić głos AI) | 0,8 s |
| GPT Audio Mini (OpenAI) | ok. 0,005 USD (z mojego rachunku) | jak wyżej | tak, jak wyżej | 1,0 s |
| Edge TTS Marek / Zofia | 0 (nieoficjalnie); te same głosy w Azure ok. 16 USD za 1 mln znaków | 2 w Edge (Marek, Zofia), 3 w Azure (+ Agnieszka) | nie przez Edge TTS; tak przez płatne Azure Speech | 3,3-4,5 s |
| XTTS v2 (lokalnie) | 0 (prąd) | wbudowane głosy wielojęzyczne + klonowanie | nie (Coqui Public Model License) | 17,6 s na 53 s nagrania, ładowanie 15 s |
| Chatterbox Multilingual (lokalnie) | 0 (prąd) | polski w 23 językach + klonowanie | tak (MIT), nagrania mają znak wodny Perth | 26,4 s na 33 s nagrania, ładowanie 13 s |
| Piper gosia (lokalnie) | 0 (prąd) | 5 polskich głosów | silnik GPL-3.0, głos gosia na zbiorze CC0 - sprawdź kartę głosu | 5,8 s na procesorze |
Ceny w dolarach z cenników producentów i z mojego rachunku na OpenRouterze. Za Azure podaję stawkę z zestawień cenowych - oficjalna strona nie pokazała mi liczb bez logowania, więc sprawdź ją przed zakupem.
Lokalnie na RTX 4090: pomiary
| Model | Ładowanie | Generowanie | Długość nagrania | Zajęta pamięć karty |
|---|---|---|---|---|
| XTTS v2 | 15,1 s | 17,6 s | 53,5 s | ok. 3,0 GB |
| Chatterbox Multilingual | 13,2 s | 26,4 s | 33,3 s | ok. 5,3 GB |
| Piper gosia | 6,4 s | 5,8 s (procesor) | 36,2 s | 0 (bez karty) |
XTTS czyta wolno (53 sekundy przy 35-43 s u reszty) i z wyraźnym obcym akcentem, ale nazwy własne wymawia zaskakująco dobrze. Chatterbox wymaga tekstu bez cyfr - w zapisie „17 października” albo „1249,99 zł” generuje bełkot, którego nie ma w żadnym słowniku. Piper działa nawet na słabym laptopie, ale brzmi jak nawigacja sprzed dekady. Więcej o samej instalacji i ładowaniu modeli opisuję w przewodniku po lokalnym AI.
Dlaczego nie ma Gemini TTS
Gemini 3.8 Flash TTS i 3.1 Flash TTS wypadły bardzo dobrze w moim poprzednim rankingu (3.1 Flash TTS bezbłędnie). Tym razem nie miałem do nich dostępu: OpenRouter nie ma modeli Gemini z wyjściem audio, a bramka, przez którą testowałem je we wrześniu, była zablokowana do doładowania konta. Nie zakładałem nowego konta tylko dla jednego nagrania. Dołożę Gemini do ślepego testu, gdy wróci dostęp.
Który lektor AI do czego
- Lektor do filmów i reklam po polsku - Eleven v4. Jedyny bez błędu, z naturalną intonacją. Do 12 października jest wyjątkowo tani, potem kosztuje 0,08 USD za 1000 znaków. Szczegóły w przewodniku ElevenLabs.
- Asystent głosowy, rozmowa na żywo - GPT Audio: najkrótsze opóźnienie (0,8 s), dobre pytania, ale sprawdzaj kwoty. Wersja Mini jest prawie 30 razy tańsza, ale potrafi pominąć zdanie.
- Za darmo, do własnych notatek i audiobooków - Edge TTS. Rozsądna jakość, ale liczby i daty lepiej rozpisać słownie przed czytaniem. Komercyjnie - tylko przez płatne Azure.
- Offline, bez wysyłania tekstu do chmury - XTTS v2, jeśli nie zarabiasz na nagraniach, albo Chatterbox (MIT), jeśli zarabiasz i rozpiszesz liczby słownie.
- Bardzo słaby komputer - Piper. Brzmi sztucznie, ale działa wszędzie.
Najczęstsze pytania
Jaki jest najlepszy generator głosu AI po polsku?
W tym teście Eleven v4 od ElevenLabs - 15 na 15 punktów kontrolnych i najbardziej naturalne brzmienie. W szerszym rankingu 14 modeli remisuje z nim Gemini 3.1 Flash TTS.
Czy jest darmowy lektor AI po polsku?
Tak: Edge TTS (głosy Marek i Zofia) oraz modele lokalne Piper, XTTS v2 i Chatterbox. Edge TTS to nieoficjalny dostęp do głosów Microsoftu, więc do zastosowań komercyjnych się nie nadaje. Z lokalnych komercyjnie wolno używać Chatterboxa (MIT) i Pipera (zależnie od głosu).
Który lektor AI najlepiej czyta liczby i daty?
Eleven v4. Pozostali najczęściej mylą formę daty („siedemnasty października”) i kwoty („przecinek”, „setnych złotego”). Jeśli używasz tańszego modelu, rozpisz liczby słownie w tekście - to usuwa większość błędów.
Czy można używać głosu AI komercyjnie?
Zależy od licencji: ElevenLabs na płatnym planie tak, OpenAI tak (z informacją, że głos jest syntetyczny), Chatterbox tak (MIT), XTTS v2 nie (licencja niekomercyjna), Edge TTS nie (to nie jest oficjalne API).
Ile kosztuje lektor AI za minutę nagrania?
Minuta mowy to ok. 700-900 znaków. W Eleven v4 po 12 października wychodzi ok. 0,06-0,07 USD za minutę, w GPT Audio Mini ułamek centa, lokalnie tylko prąd.
Jak zrobiłem ten test?
Wszystkie nagrania wygenerowałem 8 października 2026 tym samym tekstem i bez ręcznych poprawek. Chmurę wywoływałem przez API (ElevenLabs, OpenRouter, Edge TTS), modele lokalne na karcie RTX 4090 z 24 GB pamięci pod Windowsem 11.
Źródła i data sprawdzenia
- Ceny: ElevenLabs API, OpenRouter: GPT Audio, Azure Speech - 8.10.2026.
- Licencje: Chatterbox (MIT), XTTS v2 (Coqui Public Model License), Piper (GPL-3.0).
- Pomiary: mój komputer (RTX 4090 24 GB, Windows 11), 8.10.2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.
