Najlepszy lektor AI po polsku: ranking 14 modeli TTS
Te same polskie zdania na 14 modelach: ElevenLabs, Gemini, OpenAI, xAI, MiniMax, Inworld i Qwen. Daty, kwoty, skróty, nagrania do odsłuchu i ceny.

👁 114 przeczytań
- Najlepszym lektorem AI po polsku okazał się Eleven v4 od ElevenLabs, który bezbłędnie przeczytał wszystkie 18 punktów kontrolnych w trzech różnych głosach.
- Eleven v4 kosztuje 80 USD za milion znaków, ale do 12 października promocja obniża cenę do 22 USD, czyli około 84,85 zł za milion znaków.
- Gemini 3.1 Flash TTS za 18,3 USD za milion znaków osiągnął ten sam wynik 18/18 co Eleven v4, choć generacja 353 znaków trwała od 19 do 50 sekund.
Najlepszy lektor AI po polsku to w moim teście Eleven v4 od ElevenLabs, ale na drugim biegunie cenowym zremisował z nim Gemini 3.1 Flash TTS od Google. Sprawdziłem 14 modeli zamiany tekstu na mowę na tych samych polskich zdaniach: łamańce językowe, nazwisko Brzęczyszczykiewicz, daty, kwoty w złotych, skróty „ul.”, „dr”, „tj.”, numer telefonu i adres e-mail. Każde nagranie przepuściłem przez trzy transkrypcje i osadziłem niżej do odsłuchu, obok rankingu Artificial Analysis z 28 września 2026.
W skrócie
Trzy modele przeczytały bezbłędnie wszystkie 18 punktów kontrolnych: Eleven v4, Eleven v4 Turbo i Gemini 3.1 Flash TTS. Eleven v3 i Gemini 3.8 Flash-Lite miały po 17. Najgorzej wypadły MiniMax Speech 2.8 HD (7), Eleven Flash v2.5 na ustawieniach domyślnych (7), Inworld TTS-1.5 Max (0) i Qwen Audio 3.0 TTS, który po polsku nie mówi. Jeśli liczy się jakość i ekspresja, bierz Eleven v4 (0,31 zł za 1000 znaków bez VAT, do 12 października 0,085 zł). Jeśli liczy się cena, Gemini 3.1 Flash TTS. To moja opinia.
Jak testowałem lektorów AI
Każdy model dostał te same trzy teksty w zwykłym zapisie, bez rozpisywania liczb słownie, bo tak wygląda większość scenariuszy. Pierwszy to cztery zdania (353 znaki) ze „Szczebrzeszynem”, „źdźbłem”, doktor Agnieszką Brzęczyszczykiewicz, datą 17.03.2027 r., godziną 9:45, adresem ul. Żeromskiego 12, kwotą 1249,99 zł i 15%. Drugi to tor przeszkód z 11 pułapkami: IC 5316, peron 3, 6:05, 29.02.2028 r., 14:30, nr 48/2026, 3450,50 zł, „tj.”, „ok. 2,8 tys. zł”, telefon 601 234 567 i [email protected]. Trzeci sprawdzał angielskie nazwy w polskim zdaniu: Google Chrome, YouTube, Subscribe, OneDrive, WhatsApp.
Do modeli ElevenLabs dostałem się przez ich API, do pozostałych przez fal.ai i OpenRouter. Przy ElevenLabs użyłem polskiego głosu Adam z biblioteki (najpopularniejszy polski głos w serwisie), przy innych dostawcach męskich głosów wbudowanych, a przy Inworld polskiego głosu Szymon. Wyniki sprawdzałem trzema transkrypcjami: Whisper large-v3 (lokalnie, na procesorze), ElevenLabs Scribe v2 i Gemini z poleceniem zapisu słownego „dokładnie tak, jak wymówiono”. Błąd liczyłem, gdy potwierdzały go co najmniej dwie z nich.
Nie testowałem modeli, do których nie ma publicznego API w tych serwisach: Cartesia Sonic 3.6, Speechify Simba 3.2, Inworld Realtime TTS-2 i Luna TTS. Qwen-Audio-3.0-TTS-Plus z rankingu też był poza zasięgiem, więc sprawdziłem tańszą wersję Qwen Audio 3.0 TTS (Flash).
Ranking: wyniki na polskich zdaniach
| # | Model | Zdania: liczby i skróty (7) | Tor przeszkód (11) | Błędy w słowach | Angielskie nazwy | Cena za 1 mln znaków |
|---|---|---|---|---|---|---|
| 1 | Eleven v4 | 7 | 11 | 0 | tak | 80 USD (308,56 zł) |
| 2 | Eleven v4 Turbo | 7 | 11 | 0 | tak | 40 USD (154,28 zł) |
| 3 | Gemini 3.1 Flash TTS | 7 | 11 | 0 | tak | 18,3 USD (70,58 zł)* |
| 4 | Eleven v3 | 7 | 10 | 0 | tak | 80 USD (308,56 zł) |
| 5 | Gemini 3.8 Flash-Lite TTS | 7 | 10 | 1 | tak | 11 USD (42,43 zł)* |
| 6 | GPT Audio (OpenAI) | 6 | 10 | 0 | odmówił | ok. 150 USD** |
| 7 | Gemini 3.8 Flash TTS | 5 | 10 | 1 | tak | 16,5 USD (63,64 zł)* |
| 8 | GPT Audio mini (OpenAI) | 5 | 10 | 0 | odmówił | ok. 5,3 USD** |
| 9 | xAI TTS | 5 | 10 | 1 | tak | 15 USD (fal.ai) |
| 10 | Eleven Multilingual v2 | 3 | 8 | 0 | - | 80 USD (308,56 zł) |
| 11 | Eleven Flash v2.5 | 3 | 4 | 0 | tak | 40 USD (154,28 zł) |
| 12 | MiniMax Speech 2.8 HD | 3 | 4 | 0 | tak | 100 USD (fal.ai) |
| 13 | Inworld TTS-1.5 Max | 0 | 0 | kilkanaście | tak | 10 USD (fal.ai) |
| 14 | Qwen Audio 3.0 TTS | 0 | 0 | 40 z 44 | nie | 50 USD (fal.ai) |
* Cena według Artificial Analysis. Przez fal.ai te same modele Google kosztowały mnie 30-50 USD za milion znaków, bo pośrednik dolicza marżę. ** GPT Audio rozlicza się za tokeny dźwięku, nie za znaki; przeliczyłem to z faktycznego kosztu moich 353 znaków (0,053 USD i 0,0019 USD). Ceny ElevenLabs pochodzą z cennika API i są podane bez VAT; do 12 października v4 kosztuje 22 USD, a v4 Turbo 11 USD za milion znaków. Kurs 3,857 zł/USD.
Podium: Eleven v4, v4 Turbo i Gemini 3.1 Flash TTS
Eleven v4 zrobił komplet na trzech różnych głosach (Adam, Magdalena, Alice) i w trzech kolejnych generacjach na Adamie, więc wynik nie jest przypadkiem jednego losowania. Datę 17.03.2027 r. przeczytał jako „siedemnastego marca dwa tysiące dwudziestego siódmego roku”, kwotę jako „tysiąc dwieście czterdzieści dziewięć złotych dziewięćdziesiąt dziewięć groszy”, a e-mail jako „biuro małpa przykład kropka pe el”. Obsługuje też tagi emocji, których nie ma żaden inny model w tym zestawieniu. Szczegóły w tekście o Eleven v4.
Eleven v4 Turbo wypadł na liczbach tak samo, a zaczyna mówić po 0,25 s (pełny v4 po 0,95 s) i zużywa połowę kredytów. Do asystenta głosowego to lepszy wybór niż pełny v4.
Gemini 3.1 Flash TTS to niespodzianka. W rankingu Artificial Analysis jest dopiero 11. (1203 punkty), a w moim teście przeczytał wszystkie liczby i skróty, w tym „łamane na” w numerze zamówienia. Datę przeczytał potocznie, „siedemnastego trzeciego”, co jest poprawne, ale mniej eleganckie niż pełna nazwa miesiąca. Słabość: przez fal.ai generacja trwała od 19 do 50 s na 353 znaki.
Środek stawki: v3, Gemini 3.8 i OpenAI
Eleven v3 (17/18) potknął się na „peronu trzeciej”. Na głosie Alice raz pominął też miesiąc w dacie. Skoro v4 kosztuje tyle samo, nie ma już powodu, żeby przy nim zostawać.
Gemini 3.8 Flash-Lite TTS (17/18) przy cenie 11 USD za milion znaków to najlepszy stosunek jakości do ceny w zestawieniu. Pomylił tylko kwotę 3450,50 zł („trzy tysiące czterysta pięćdziesiąt pięćdziesiąt złotych”) i przekręcił nazwisko na „Brzęczy-Szyszkiewicz”.
Gemini 3.8 Flash TTS, trzeci w rankingu Artificial Analysis, wypadł po polsku słabiej od swojej tańszej wersji: powiedział „z doktorem Agnieszką”, datę przeczytał „siedemnasty zero trzeci”, a w numerze telefonu zgubił cyfry. W pierwszej próbie, którą zrobiłem kilkanaście minut wcześniej, Whisper zapisał datę jako poprawne „siedemnastego marca”, więc ten model jest mniej powtarzalny.
GPT Audio i GPT Audio mini od OpenAI to modele czatu, które mówią, a nie klasyczne syntezatory. Dobrze czytają polski (GPT Audio w zdaniach dodał do daty „czerwca”, a w torze przeszkód powiedział „złotych i pięćdziesiąt złotych”), ale zdanie „Otwórz Google Chrome, wejdź na YouTube…” oba potraktowały jak polecenie i odpowiedziały „Przepraszam, nie mogę pomóc w takich operacjach”. Pomogło dopiero ujęcie tekstu w cudzysłów z poleceniem „przeczytaj słowo w słowo”. Przy pracy lektorskiej to ryzyko, więc każde nagranie trzeba odsłuchać.
xAI TTS nie ma polskiego na liście języków, ale przy automatycznym wykrywaniu języka mówi po polsku i w większości zdań transkrypcje nie wykazały błędów. Tyle że pierwsze słowo, „Szczebrzeszynie”, przeliterował, skrót „dr” zostawił bez rozwinięcia, a datę 17.03 przeczytał jak godzinę „siedemnasta trzydzieści”.
Dół rankingu: gdzie lektor się sypie
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Eleven Multilingual v2 i Flash v2.5 to starsze modele ElevenLabs, wciąż domyślne w wielu integracjach. Na tych samych polskich głosach czytały skróty literalnie („ul”, „godz”, „er” zamiast „roku”) i myliły kwoty: 1239,99 albo 149,99 zł zamiast 1249,99 zł. Flash na głosie Magdalena zamienił 17.03.2027 na „trzynastego października dwa tysiące dwudziestego trzeciego”. Po włączeniu normalizacji tekstu (apply_text_normalization: "on") Flash zaliczył 10 z 11 punktów toru przeszkód, więc da się go uratować jednym ustawieniem.
MiniMax Speech 2.8 HD ma opcję wzmocnienia języka polskiego, a mimo to czytał „przecinek zero trzy” w dacie, „godz” i „ul” literalnie, „at” zamiast „małpa” w adresie e-mail. Robił też długie przerwy między słowami: te same zdania trwały u niego 49,6 s, u Eleven v4 32,1 s.
Inworld TTS-1.5 Max z polskim głosem Szymon zaczął dobrze, ale od daty zamienił się w niezrozumiały ciąg sylab, który Whisper zapisał jako „następnym centem 0,3”. Qwen Audio 3.0 TTS nie obsługuje polskiego i czytał tekst z angielską wymową, a daty po angielsku, np. „the 29th of February 2028”.
Ranking Artificial Analysis a mój test
Artificial Analysis mierzy naturalność głosu po angielsku: słuchacze w ciemno wybierają lepsze z dwóch nagrań. Pierwsza ósemka z 28 września 2026: Eleven v4 (1319), Cartesia Sonic 3.6 (1276), Gemini 3.8 Flash TTS (1267), Qwen-Audio-3.0-TTS-Plus (1258), Inworld Realtime TTS-2 (1246), Gemini 3.8 Flash-Lite TTS (1241), Speechify Simba 3.2 (1240) i Luna TTS (1231). Pełną tabelę z cenami podałem w tekście o Eleven v4.
Zgodność z moim testem jest częściowa. Lider jest ten sam. Ale Gemini 3.8 Flash TTS, trzeci w angielskim rankingu, po polsku przegrał z Flash-Lite i z Gemini 3.1 Flash TTS. Modele Qwen i Inworld, wysoko po angielsku, po polsku odpadły. Wniosek praktyczny: angielski ranking mówi, kto ma najlepszą technologię, ale polski tekst z liczbami trzeba sprawdzić samemu. To moja opinia.
Brzmienie oceniał też Gemini 3.8 Flash, któremu dałem nagrania do odsłuchu. Eleven v4, v4 Turbo, Gemini 3.1 Flash i 3.8 dostały od niego 8/10 za naturalność, a Multilingual v2 i Flash v2.5 na polskich głosach 2-6/10 z uwagą o „wschodnim akcencie” w liczbach. To ocena modelu, nie moja, ale zgadza się z pomiarem melodii głosu: najbardziej płasko (najmniejsze wahania wysokości) brzmiały Flash v2.5, Multilingual v2, GPT Audio mini i xAI TTS.
Który lektor AI wybrać
- Lektor do filmów, kursów i reklam po polsku: Eleven v4 z polskim głosem z biblioteki. Jak wybrać głos, opisałem w tekście ElevenLabs po polsku.
- Asystent głosowy, rozmowa na żywo: Eleven v4 Turbo (0,25 s do pierwszego dźwięku w moim pomiarze).
- Duże ilości tekstu za małe pieniądze: Gemini 3.1 Flash TTS albo 3.8 Flash-Lite przez API Google.
- Za darmo i lokalnie: żaden z tych modeli, zobacz AI lektor i tekst na mowę, gdzie opisuję głosy systemowe i darmowe silniki.
Niezależnie od modelu przed nagraniem przygotuj tekst pod czytanie: krótkie zdania, przecinki tam, gdzie ma być oddech. Robię to według listy z tekstu AI do lektora.
Najczęstsze pytania
Jaki jest najlepszy lektor AI po polsku?
W moim teście 14 modeli z 28 września 2026 najlepiej wypadł Eleven v4 od ElevenLabs: bez błędu w 18 liczbach, datach i skrótach, na trzech głosach. Tak samo dobrze liczby przeczytały Eleven v4 Turbo i Gemini 3.1 Flash TTS.
Jaki jest najtańszy dobry lektor AI po polsku?
Gemini 3.8 Flash-Lite TTS od Google: 11 USD (42,43 zł) za milion znaków według Artificial Analysis i tylko jeden błąd w liczbach w moim teście. Gemini 3.1 Flash TTS kosztuje 18,3 USD i nie zrobił żadnego.
Czy lektor AI czyta poprawnie liczby i daty?
Najnowsze modele tak, starsze nie. Eleven v4 przeczytał wszystkie, a Eleven Flash v2.5 na ustawieniach domyślnych tylko 7 z 18. Przy starszych modelach włącz normalizację tekstu albo rozpisz liczby słownie.
Czy ChatGPT może być lektorem?
Model GPT Audio czyta po polsku dobrze, ale traktuje tekst jak polecenie. Zdanie „Otwórz Google Chrome…” skwitował odmową, więc tekst trzeba ująć w cudzysłów z instrukcją „przeczytaj słowo w słowo”.
Ile kosztuje minuta lektora AI?
Minuta mowy to około 660 znaków. W Eleven v4 przez API wychodzi około 0,20 zł bez VAT (w promocji do 12 października 0,06 zł), w Gemini 3.8 Flash-Lite TTS około 0,03 zł.
Źródła i data sprawdzenia
Ranking: Artificial Analysis, Provider Voice i metodologia. Ceny: ElevenLabs API, Gemini API, fal.ai, OpenRouter. Obsługa polskiego w Gemini TTS: dokumentacja Google. Mój test: API ElevenLabs (głosy Adam, Magdalena, Alice), fal.ai (Gemini 3.8 Flash TTS, 3.8 Flash-Lite TTS, 3.1 Flash TTS, Qwen Audio 3.0 TTS, Inworld TTS-1.5 Max, MiniMax Speech 2.8 HD, xAI TTS), OpenRouter (GPT Audio, GPT Audio mini); transkrypcja Whisper large-v3, ElevenLabs Scribe v2, Gemini 3.1 Pro i 3.8 Flash. Kurs NBP 3,857 zł/USD. Sprawdzone 28 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model TTS najlepiej czyta po polsku liczby, daty i skróty?
Najlepiej wypadły Eleven v4, Eleven v4 Turbo i Gemini 3.1 Flash TTS - każdy z nich poprawnie przeczytał wszystkie 18 punktów kontrolnych. Modele te prawidłowo rozwinęły skróty takie jak 'ul.' i 'dr', odczytały daty słownie oraz poprawnie wymówiły kwoty w złotych i adresy e-mail.
Ile kosztuje Eleven v4 od ElevenLabs za milion znaków?
Standardowa cena Eleven v4 wynosi 80 USD za milion znaków bez VAT, co przy kursie 3,857 zł/USD daje 308,56 zł. Do 12 października obowiązuje promocja: 22 USD za milion znaków, a wersja Turbo kosztuje wtedy 11 USD.
Czy modele GPT Audio od OpenAI dobrze czytają polskie teksty?
GPT Audio i GPT Audio mini czytają polski poprawnie, ale oba odmówiły przeczytania zdania z angielskimi nazwami jak Google Chrome czy YouTube, traktując je jak polecenie do wykonania. Problem rozwiązało ujęcie tekstu w cudzysłów z poleceniem 'przeczytaj słowo w słowo', jednak przy pracy lektorskiej każde nagranie trzeba odsłuchać.
Jak poprawić jakość Eleven Flash v2.5 przy czytaniu po polsku?
Wystarczy włączyć normalizację tekstu przez ustawienie parametru apply_text_normalization na wartość 'on'. Bez tego Flash v2.5 uzyskał tylko 7 z 18 punktów kontrolnych, a po włączeniu normalizacji zaliczył 10 z 11 punktów samego toru przeszkód.
Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.
