✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Porównanie lektorów AI: 8 głosów czyta ten sam polski tekst

Ten sam polski tekst z datą, kwotą i łamańcami przeczytało 8 lektorów AI. Ślepy test, ceny, licencje i błędy wymowy.

9 min czytania
porownanie-lektorow-ai

👁 114 przeczytań

// w skrócie
  • Spośród 8 testowanych lektorów AI tylko ElevenLabs Eleven v4 przeczytał polski tekst bez błędu, zdobywając 15 na 15 punktów kontrolnych.
  • Największy problem sprawiały liczby: kwotę 1249,99 zł poprawnie - ze złotymi i groszami - odczytał wyłącznie Eleven v4, a datę źle podało 6 z 8 lektorów.
  • Najtańszą opcją okazał się GPT Audio Mini (ok. 0,005 USD za 1000 znaków), ale pominął całe zdanie tekstu, co dyskwalifikuje go tam, gdzie kompletność jest wymagana.

Ten sam polski tekst - 62 słowa z datą, kwotą, numerem pociągu, telefonem, pytaniem, wykrzyknikiem, „Szczebrzeszynem” i „chrząszczem” - przeczytało 8 lektorów AI: z chmury, za darmo i całkiem lokalnie na moim RTX 4090. Najpierw posłuchaj w ciemno, potem odsłoń etykiety. Bez błędu przeszedł tylko jeden głos, a dwa darmowe modele lokalne poległy na liczbach.

Stan na 8 października 2026

  • 8 nagrań tego samego tekstu (401 znaków), wyrównana głośność (-16 LUFS), pliki mp3 bez nazw modeli w adresie.
  • Źródła: Edge TTS (2 głosy), ElevenLabs Eleven v4, OpenAI GPT Audio i GPT Audio Mini (przez OpenRouter), lokalnie Piper, XTTS v2 i Chatterbox Multilingual.
  • Wynik bez błędu (15 z 15 punktów kontrolnych): tylko Eleven v4.
  • Koszt całego testu: ok. 0,17 USD na OpenRouterze plus 401 znaków z mojego limitu ElevenLabs.
  • Gemini TTS nie wszedł do zestawienia - opisuję niżej dlaczego.

To jest uzupełnienie mojego rankingu 14 modeli TTS po polsku. Tam liczyłem błędy w trzech długich tekstach. Tutaj chodzi o coś innego: o ucho. Jeden krótki tekst, osiem głosów obok siebie, ślepy test i tabela, która mówi, ile to kosztuje i czy wolno tego użyć komercyjnie.

Tekst testowy

Każdy lektor dostał dokładnie to samo, w zwykłym zapisie, bez rozpisywania liczb słownie:

Szczebrzeszyn, 17 października 2026 roku, godzina 9:45. Chrząszcz brzmi w trzcinie, a doktor Agnieszka Brzęczyszczykiewicz kupuje bilet za 1249,99 zł na pociąg IC 5316 do Łodzi. Czy zdąży, skoro pociąg ma już 25 minut spóźnienia? Źdźbło, gżegżółka, pszczółka - spróbuj to powtórzyć bez zająknięcia! A teraz zapisz: 15% zniżki, numer 601 234 567. Dziękuję i do usłyszenia w przyszły czwartek w Gdańsku!

W tym tekście siedzi 15 punktów kontrolnych:

  • nazwy i łamańce: Szczebrzeszyn, chrząszcz, Brzęczyszczykiewicz, źdźbło, gżegżółka, pszczółka;
  • liczby w poprawnej formie: „siedemnastego października dwa tysiące dwudziestego szóstego roku”, „dziewiąta czterdzieści pięć”, „tysiąc dwieście czterdzieści dziewięć złotych dziewięćdziesiąt dziewięć groszy”, „dwadzieścia pięć minut”, „piętnaście procent”;
  • skrót IC i numer pociągu, numer telefonu czytany grupami;
  • intonacja pytania w zdaniu „Czy zdąży…?”;
  • kompletność - czy lektor czegoś nie pominął albo nie dodał.

Ślepy test: posłuchaj, zanim zobaczysz nazwy

Kolejność jest losowa, głośność wyrównana, a w adresach plików nie ma nazw modeli. Zapisz sobie literę swojego faworyta i dopiero potem kliknij „Pokaż, kto czyta”.

Głos A

Pokaż, kto czyta

OpenAI GPT Audio (głos cedar, przez OpenRouter). 13/15 - przeczytał kwotę jako „dwanaście czterdzieści dziewięć…” i dał „siedemnasty” zamiast „siedemnastego”.

Głos B

Pokaż, kto czyta

Piper, głos gosia (lokalnie, na procesorze). 6/15 - „Przedbrzeszyn”, „cząszcz”, „ździebło”, telefon jako „sześćset jeden milionów…”.

Głos C

Pokaż, kto czyta

ElevenLabs Eleven v4, głos Adam z biblioteki. 15/15 - jedyny bez błędu, z wyraźnym pytaniem i wykrzyknikiem.

Głos D

Pokaż, kto czyta

Edge TTS, głos Zofia (pl-PL-ZofiaNeural). 9/15 - „siedemnaście października roku dwa tysiące…”, „IC” jako jedno słowo, płaskie pytanie.

Głos E

Pokaż, kto czyta

XTTS v2 (Coqui), głos Damien Black, lokalnie na RTX 4090. 10/15 - łamańce dobrze, liczby w mianowniku („dziewięć czterdzieści pięć”, „przecinek”), mocny obcy akcent.

Głos F

Pokaż, kto czyta

Chatterbox Multilingual (Resemble AI), lokalnie na RTX 4090. 4/15 - na cyfrach zaczyna bełkotać, kilka słów wymyśla.

Głos G

Pokaż, kto czyta

Edge TTS, głos Marek (pl-PL-MarekNeural). 9/15 - „wsząszcz” zamiast „chrząszcz”, zła forma daty, „setnych złotego”.

Głos H

Pokaż, kto czyta

OpenAI GPT Audio Mini (głos cedar, przez OpenRouter). 10/15 - pominął całe zdanie „spróbuj to powtórzyć bez zająknięcia! A teraz zapisz:”.

Swój typ porównaj z wynikami poniżej - punktacja nie zawsze pokrywa się z tym, co brzmi najprzyjemniej. Pod tekstem możesz jednym kliknięciem ocenić, czy taki ślepy test jest przydatny - jeśli tak, w kolejnej edycji dołożę wspólną tablicę głosów czytelników.

Wyniki: wymowa w 15 punktach kontrolnych

Poprawnie przeczytane punkty kontrolne (z 15)
Eleven v415
GPT Audio13
GPT Audio Mini10
XTTS v2 (lokalnie)10
Edge TTS Marek9
Edge TTS Zofia9
Piper gosia (lokalnie)6
Chatterbox (lokalnie)4

Jak oceniałem: każde nagranie przepuściłem przez Whisper large-v3 (lokalnie) i przez Gemini 3.8 Flash z poleceniem, żeby zapisał słownie, jak co zabrzmiało, i ocenił każdy punkt. Błąd liczyłem, gdy widać go było w obu zapisach albo gdy Gemini podał konkretną złą formę (np. „siedemnasty”). Jedną ocenę sędziego poprawiłem ręcznie: Piper przeczytał „IC pięć tysięcy trzysta szesnaście” - to dopuszczalne, więc uznałem punkt.

Najczęstsze błędy w trudnych słowach

  • Data - 6 z 8 lektorów użyło złej formy: „siedemnasty” albo „siedemnaście października” zamiast „siedemnastego”. Oba głosy Edge dokleiły do tego nadmiarowe „roku” („października roku dwa tysiące…”).
  • Kwota 1249,99 zł - poprawnie (ze złotymi i groszami) tylko Eleven v4. Edge czyta „dziewięćdziesiąt dziewięć setnych złotego”, XTTS i Piper mówią „przecinek”, GPT Audio zgubił tysiąc.
  • Chrząszcz - Edge Marek powiedział „wsząszcz”, Piper „cząszcz”, Chatterbox „ksząszcz”.
  • Źdźbło - Edge Zofia „źbło”, GPT Audio Mini „żdźbło”, Piper „ździebło”.
  • Szczebrzeszyn i Brzęczyszczykiewicz - poradzili sobie prawie wszyscy, wyjątkiem jest Piper („Przedbrzeszyn”, „Brzęcz-szczykiewicz”).
  • Pytanie - wznoszącą intonację w „Czy zdąży…?” dały tylko Eleven v4, GPT Audio, GPT Audio Mini i Chatterbox. Edge, XTTS i Piper czytają pytanie jak zdanie oznajmujące.
  • Numer telefonu - Piper przeczytał go jako jedną liczbę („sześćset jeden milionów…”). Eleven v4 przeczytał cyfra po cyfrze - to akurat poprawne.

Tabela: cena, polskie głosy, licencja, opóźnienie

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Opóźnienie to czas od wysłania tekstu do pierwszego dźwięku (dla usług ze strumieniowaniem) albo do gotowego pliku (modele lokalne). Mierzyłem z Polski, 8 października 2026, jedno wywołanie na model, więc traktuj to jako orientację, a nie benchmark.

LektorCena (1000 znaków)Polskie głosyLicencja komercyjnaOpóźnienie w moim teście
Eleven v4 (ElevenLabs)0,022 USD do 12.10, potem 0,08 USDdziesiątki w bibliotece (np. Adam)tak, na płatnym planie2,7 s do pierwszego dźwięku
GPT Audio (OpenAI)ok. 0,14 USD (z mojego rachunku)brak dedykowanych, głosy wielojęzycznetak, wg zasad OpenAI (trzeba ujawnić głos AI)0,8 s
GPT Audio Mini (OpenAI)ok. 0,005 USD (z mojego rachunku)jak wyżejtak, jak wyżej1,0 s
Edge TTS Marek / Zofia0 (nieoficjalnie); te same głosy w Azure ok. 16 USD za 1 mln znaków2 w Edge (Marek, Zofia), 3 w Azure (+ Agnieszka)nie przez Edge TTS; tak przez płatne Azure Speech3,3-4,5 s
XTTS v2 (lokalnie)0 (prąd)wbudowane głosy wielojęzyczne + klonowanienie (Coqui Public Model License)17,6 s na 53 s nagrania, ładowanie 15 s
Chatterbox Multilingual (lokalnie)0 (prąd)polski w 23 językach + klonowanietak (MIT), nagrania mają znak wodny Perth26,4 s na 33 s nagrania, ładowanie 13 s
Piper gosia (lokalnie)0 (prąd)5 polskich głosówsilnik GPL-3.0, głos gosia na zbiorze CC0 - sprawdź kartę głosu5,8 s na procesorze

Ceny w dolarach z cenników producentów i z mojego rachunku na OpenRouterze. Za Azure podaję stawkę z zestawień cenowych - oficjalna strona nie pokazała mi liczb bez logowania, więc sprawdź ją przed zakupem.

Lokalnie na RTX 4090: pomiary

ModelŁadowanieGenerowanieDługość nagraniaZajęta pamięć karty
XTTS v215,1 s17,6 s53,5 sok. 3,0 GB
Chatterbox Multilingual13,2 s26,4 s33,3 sok. 5,3 GB
Piper gosia6,4 s5,8 s (procesor)36,2 s0 (bez karty)

XTTS czyta wolno (53 sekundy przy 35-43 s u reszty) i z wyraźnym obcym akcentem, ale nazwy własne wymawia zaskakująco dobrze. Chatterbox wymaga tekstu bez cyfr - w zapisie „17 października” albo „1249,99 zł” generuje bełkot, którego nie ma w żadnym słowniku. Piper działa nawet na słabym laptopie, ale brzmi jak nawigacja sprzed dekady. Więcej o samej instalacji i ładowaniu modeli opisuję w przewodniku po lokalnym AI.

Dlaczego nie ma Gemini TTS

Gemini 3.8 Flash TTS i 3.1 Flash TTS wypadły bardzo dobrze w moim poprzednim rankingu (3.1 Flash TTS bezbłędnie). Tym razem nie miałem do nich dostępu: OpenRouter nie ma modeli Gemini z wyjściem audio, a bramka, przez którą testowałem je we wrześniu, była zablokowana do doładowania konta. Nie zakładałem nowego konta tylko dla jednego nagrania. Dołożę Gemini do ślepego testu, gdy wróci dostęp.

Który lektor AI do czego

  • Lektor do filmów i reklam po polsku - Eleven v4. Jedyny bez błędu, z naturalną intonacją. Do 12 października jest wyjątkowo tani, potem kosztuje 0,08 USD za 1000 znaków. Szczegóły w przewodniku ElevenLabs.
  • Asystent głosowy, rozmowa na żywo - GPT Audio: najkrótsze opóźnienie (0,8 s), dobre pytania, ale sprawdzaj kwoty. Wersja Mini jest prawie 30 razy tańsza, ale potrafi pominąć zdanie.
  • Za darmo, do własnych notatek i audiobooków - Edge TTS. Rozsądna jakość, ale liczby i daty lepiej rozpisać słownie przed czytaniem. Komercyjnie - tylko przez płatne Azure.
  • Offline, bez wysyłania tekstu do chmury - XTTS v2, jeśli nie zarabiasz na nagraniach, albo Chatterbox (MIT), jeśli zarabiasz i rozpiszesz liczby słownie.
  • Bardzo słaby komputer - Piper. Brzmi sztucznie, ale działa wszędzie.

Najczęstsze pytania

Jaki jest najlepszy generator głosu AI po polsku?

W tym teście Eleven v4 od ElevenLabs - 15 na 15 punktów kontrolnych i najbardziej naturalne brzmienie. W szerszym rankingu 14 modeli remisuje z nim Gemini 3.1 Flash TTS.

Czy jest darmowy lektor AI po polsku?

Tak: Edge TTS (głosy Marek i Zofia) oraz modele lokalne Piper, XTTS v2 i Chatterbox. Edge TTS to nieoficjalny dostęp do głosów Microsoftu, więc do zastosowań komercyjnych się nie nadaje. Z lokalnych komercyjnie wolno używać Chatterboxa (MIT) i Pipera (zależnie od głosu).

Który lektor AI najlepiej czyta liczby i daty?

Eleven v4. Pozostali najczęściej mylą formę daty („siedemnasty października”) i kwoty („przecinek”, „setnych złotego”). Jeśli używasz tańszego modelu, rozpisz liczby słownie w tekście - to usuwa większość błędów.

Czy można używać głosu AI komercyjnie?

Zależy od licencji: ElevenLabs na płatnym planie tak, OpenAI tak (z informacją, że głos jest syntetyczny), Chatterbox tak (MIT), XTTS v2 nie (licencja niekomercyjna), Edge TTS nie (to nie jest oficjalne API).

Ile kosztuje lektor AI za minutę nagrania?

Minuta mowy to ok. 700-900 znaków. W Eleven v4 po 12 października wychodzi ok. 0,06-0,07 USD za minutę, w GPT Audio Mini ułamek centa, lokalnie tylko prąd.

Jak zrobiłem ten test?

Wszystkie nagrania wygenerowałem 8 października 2026 tym samym tekstem i bez ręcznych poprawek. Chmurę wywoływałem przez API (ElevenLabs, OpenRouter, Edge TTS), modele lokalne na karcie RTX 4090 z 24 GB pamięci pod Windowsem 11.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›