✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Najlepszy lektor AI po polsku: ranking 14 modeli TTS

Te same polskie zdania na 14 modelach: ElevenLabs, Gemini, OpenAI, xAI, MiniMax, Inworld i Qwen. Daty, kwoty, skróty, nagrania do odsłuchu i ceny.

9 min czytania
Najlepszy lektor AI po polsku: ranking 14 modeli TTS

👁 114 przeczytań

// w skrócie
  • Najlepszym lektorem AI po polsku okazał się Eleven v4 od ElevenLabs, który bezbłędnie przeczytał wszystkie 18 punktów kontrolnych w trzech różnych głosach.
  • Eleven v4 kosztuje 80 USD za milion znaków, ale do 12 października promocja obniża cenę do 22 USD, czyli około 84,85 zł za milion znaków.
  • Gemini 3.1 Flash TTS za 18,3 USD za milion znaków osiągnął ten sam wynik 18/18 co Eleven v4, choć generacja 353 znaków trwała od 19 do 50 sekund.

Najlepszy lektor AI po polsku to w moim teście Eleven v4 od ElevenLabs, ale na drugim biegunie cenowym zremisował z nim Gemini 3.1 Flash TTS od Google. Sprawdziłem 14 modeli zamiany tekstu na mowę na tych samych polskich zdaniach: łamańce językowe, nazwisko Brzęczyszczykiewicz, daty, kwoty w złotych, skróty „ul.”, „dr”, „tj.”, numer telefonu i adres e-mail. Każde nagranie przepuściłem przez trzy transkrypcje i osadziłem niżej do odsłuchu, obok rankingu Artificial Analysis z 28 września 2026.

W skrócie

Trzy modele przeczytały bezbłędnie wszystkie 18 punktów kontrolnych: Eleven v4, Eleven v4 Turbo i Gemini 3.1 Flash TTS. Eleven v3 i Gemini 3.8 Flash-Lite miały po 17. Najgorzej wypadły MiniMax Speech 2.8 HD (7), Eleven Flash v2.5 na ustawieniach domyślnych (7), Inworld TTS-1.5 Max (0) i Qwen Audio 3.0 TTS, który po polsku nie mówi. Jeśli liczy się jakość i ekspresja, bierz Eleven v4 (0,31 zł za 1000 znaków bez VAT, do 12 października 0,085 zł). Jeśli liczy się cena, Gemini 3.1 Flash TTS. To moja opinia.

14modeli TTS na tych samych polskich zdaniach
3modele bez żadnego błędu w liczbach i skrótach
1319punktów Elo lidera rankingu Artificial Analysis
0,56 USDkoszt 40 nagrań testowych przez fal.ai i OpenRouter

Jak testowałem lektorów AI

Każdy model dostał te same trzy teksty w zwykłym zapisie, bez rozpisywania liczb słownie, bo tak wygląda większość scenariuszy. Pierwszy to cztery zdania (353 znaki) ze „Szczebrzeszynem”, „źdźbłem”, doktor Agnieszką Brzęczyszczykiewicz, datą 17.03.2027 r., godziną 9:45, adresem ul. Żeromskiego 12, kwotą 1249,99 zł i 15%. Drugi to tor przeszkód z 11 pułapkami: IC 5316, peron 3, 6:05, 29.02.2028 r., 14:30, nr 48/2026, 3450,50 zł, „tj.”, „ok. 2,8 tys. zł”, telefon 601 234 567 i [email protected]. Trzeci sprawdzał angielskie nazwy w polskim zdaniu: Google Chrome, YouTube, Subscribe, OneDrive, WhatsApp.

Do modeli ElevenLabs dostałem się przez ich API, do pozostałych przez fal.ai i OpenRouter. Przy ElevenLabs użyłem polskiego głosu Adam z biblioteki (najpopularniejszy polski głos w serwisie), przy innych dostawcach męskich głosów wbudowanych, a przy Inworld polskiego głosu Szymon. Wyniki sprawdzałem trzema transkrypcjami: Whisper large-v3 (lokalnie, na procesorze), ElevenLabs Scribe v2 i Gemini z poleceniem zapisu słownego „dokładnie tak, jak wymówiono”. Błąd liczyłem, gdy potwierdzały go co najmniej dwie z nich.

Nie testowałem modeli, do których nie ma publicznego API w tych serwisach: Cartesia Sonic 3.6, Speechify Simba 3.2, Inworld Realtime TTS-2 i Luna TTS. Qwen-Audio-3.0-TTS-Plus z rankingu też był poza zasięgiem, więc sprawdziłem tańszą wersję Qwen Audio 3.0 TTS (Flash).

Ranking: wyniki na polskich zdaniach

#ModelZdania: liczby i skróty (7)Tor przeszkód (11)Błędy w słowachAngielskie nazwyCena za 1 mln znaków
1Eleven v47110tak80 USD (308,56 zł)
2Eleven v4 Turbo7110tak40 USD (154,28 zł)
3Gemini 3.1 Flash TTS7110tak18,3 USD (70,58 zł)*
4Eleven v37100tak80 USD (308,56 zł)
5Gemini 3.8 Flash-Lite TTS7101tak11 USD (42,43 zł)*
6GPT Audio (OpenAI)6100odmówiłok. 150 USD**
7Gemini 3.8 Flash TTS5101tak16,5 USD (63,64 zł)*
8GPT Audio mini (OpenAI)5100odmówiłok. 5,3 USD**
9xAI TTS5101tak15 USD (fal.ai)
10Eleven Multilingual v2380-80 USD (308,56 zł)
11Eleven Flash v2.5340tak40 USD (154,28 zł)
12MiniMax Speech 2.8 HD340tak100 USD (fal.ai)
13Inworld TTS-1.5 Max00kilkanaścietak10 USD (fal.ai)
14Qwen Audio 3.0 TTS0040 z 44nie50 USD (fal.ai)

* Cena według Artificial Analysis. Przez fal.ai te same modele Google kosztowały mnie 30-50 USD za milion znaków, bo pośrednik dolicza marżę. ** GPT Audio rozlicza się za tokeny dźwięku, nie za znaki; przeliczyłem to z faktycznego kosztu moich 353 znaków (0,053 USD i 0,0019 USD). Ceny ElevenLabs pochodzą z cennika API i są podane bez VAT; do 12 października v4 kosztuje 22 USD, a v4 Turbo 11 USD za milion znaków. Kurs 3,857 zł/USD.

Poprawnie przeczytane liczby, daty i skróty (z 18)
Eleven v418
Eleven v4 Turbo18
Gemini 3.1 Flash TTS18
Eleven v317
Gemini 3.8 Flash-Lite17
GPT Audio16
Gemini 3.8 Flash15
GPT Audio mini15
xAI TTS15
Multilingual v211
Flash v2.57
MiniMax 2.8 HD7
Inworld 1.5 Max0
Qwen Audio 3.00

Podium: Eleven v4, v4 Turbo i Gemini 3.1 Flash TTS

Eleven v4 zrobił komplet na trzech różnych głosach (Adam, Magdalena, Alice) i w trzech kolejnych generacjach na Adamie, więc wynik nie jest przypadkiem jednego losowania. Datę 17.03.2027 r. przeczytał jako „siedemnastego marca dwa tysiące dwudziestego siódmego roku”, kwotę jako „tysiąc dwieście czterdzieści dziewięć złotych dziewięćdziesiąt dziewięć groszy”, a e-mail jako „biuro małpa przykład kropka pe el”. Obsługuje też tagi emocji, których nie ma żaden inny model w tym zestawieniu. Szczegóły w tekście o Eleven v4.

1. Eleven v4, głos Adam: 7 z 7 w zdaniach testowych.

Eleven v4 Turbo wypadł na liczbach tak samo, a zaczyna mówić po 0,25 s (pełny v4 po 0,95 s) i zużywa połowę kredytów. Do asystenta głosowego to lepszy wybór niż pełny v4.

2. Eleven v4 Turbo, głos Adam.

Gemini 3.1 Flash TTS to niespodzianka. W rankingu Artificial Analysis jest dopiero 11. (1203 punkty), a w moim teście przeczytał wszystkie liczby i skróty, w tym „łamane na” w numerze zamówienia. Datę przeczytał potocznie, „siedemnastego trzeciego”, co jest poprawne, ale mniej eleganckie niż pełna nazwa miesiąca. Słabość: przez fal.ai generacja trwała od 19 do 50 s na 353 znaki.

3. Gemini 3.1 Flash TTS, głos Charon.

Środek stawki: v3, Gemini 3.8 i OpenAI

Eleven v3 (17/18) potknął się na „peronu trzeciej”. Na głosie Alice raz pominął też miesiąc w dacie. Skoro v4 kosztuje tyle samo, nie ma już powodu, żeby przy nim zostawać.

4. Eleven v3, głos Adam.

Gemini 3.8 Flash-Lite TTS (17/18) przy cenie 11 USD za milion znaków to najlepszy stosunek jakości do ceny w zestawieniu. Pomylił tylko kwotę 3450,50 zł („trzy tysiące czterysta pięćdziesiąt pięćdziesiąt złotych”) i przekręcił nazwisko na „Brzęczy-Szyszkiewicz”.

5. Gemini 3.8 Flash-Lite TTS, głos Charon.

Gemini 3.8 Flash TTS, trzeci w rankingu Artificial Analysis, wypadł po polsku słabiej od swojej tańszej wersji: powiedział „z doktorem Agnieszką”, datę przeczytał „siedemnasty zero trzeci”, a w numerze telefonu zgubił cyfry. W pierwszej próbie, którą zrobiłem kilkanaście minut wcześniej, Whisper zapisał datę jako poprawne „siedemnastego marca”, więc ten model jest mniej powtarzalny.

7. Gemini 3.8 Flash TTS, głos Charon: „z doktorem Agnieszką”.

GPT Audio i GPT Audio mini od OpenAI to modele czatu, które mówią, a nie klasyczne syntezatory. Dobrze czytają polski (GPT Audio w zdaniach dodał do daty „czerwca”, a w torze przeszkód powiedział „złotych i pięćdziesiąt złotych”), ale zdanie „Otwórz Google Chrome, wejdź na YouTube…” oba potraktowały jak polecenie i odpowiedziały „Przepraszam, nie mogę pomóc w takich operacjach”. Pomogło dopiero ujęcie tekstu w cudzysłów z poleceniem „przeczytaj słowo w słowo”. Przy pracy lektorskiej to ryzyko, więc każde nagranie trzeba odsłuchać.

6. GPT Audio (OpenAI), głos Cedar.
8. GPT Audio mini, głos Cedar.

xAI TTS nie ma polskiego na liście języków, ale przy automatycznym wykrywaniu języka mówi po polsku i w większości zdań transkrypcje nie wykazały błędów. Tyle że pierwsze słowo, „Szczebrzeszynie”, przeliterował, skrót „dr” zostawił bez rozwinięcia, a datę 17.03 przeczytał jak godzinę „siedemnasta trzydzieści”.

9. xAI TTS, głos Leo: przeliterowany „Szczebrzeszyn” na początku.

Dół rankingu: gdzie lektor się sypie

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Eleven Multilingual v2 i Flash v2.5 to starsze modele ElevenLabs, wciąż domyślne w wielu integracjach. Na tych samych polskich głosach czytały skróty literalnie („ul”, „godz”, „er” zamiast „roku”) i myliły kwoty: 1239,99 albo 149,99 zł zamiast 1249,99 zł. Flash na głosie Magdalena zamienił 17.03.2027 na „trzynastego października dwa tysiące dwudziestego trzeciego”. Po włączeniu normalizacji tekstu (apply_text_normalization: "on") Flash zaliczył 10 z 11 punktów toru przeszkód, więc da się go uratować jednym ustawieniem.

11. Eleven Flash v2.5, głos Adam, normalizacja „auto”: zła godzina i kwota.
Ten sam Flash v2.5 z normalizacją „on”: tor przeszkód 10 z 11.
10. Eleven Multilingual v2, głos Adam: „ul” i „godz” czytane literalnie.

MiniMax Speech 2.8 HD ma opcję wzmocnienia języka polskiego, a mimo to czytał „przecinek zero trzy” w dacie, „godz” i „ul” literalnie, „at” zamiast „małpa” w adresie e-mail. Robił też długie przerwy między słowami: te same zdania trwały u niego 49,6 s, u Eleven v4 32,1 s.

12. MiniMax Speech 2.8 HD, polski wzmocniony: 49,6 s zamiast 32 s.

Inworld TTS-1.5 Max z polskim głosem Szymon zaczął dobrze, ale od daty zamienił się w niezrozumiały ciąg sylab, który Whisper zapisał jako „następnym centem 0,3”. Qwen Audio 3.0 TTS nie obsługuje polskiego i czytał tekst z angielską wymową, a daty po angielsku, np. „the 29th of February 2028”.

13. Inworld TTS-1.5 Max, głos Szymon (pl): liczby niezrozumiałe.
14. Qwen Audio 3.0 TTS: bez obsługi polskiego.

Ranking Artificial Analysis a mój test

Artificial Analysis mierzy naturalność głosu po angielsku: słuchacze w ciemno wybierają lepsze z dwóch nagrań. Pierwsza ósemka z 28 września 2026: Eleven v4 (1319), Cartesia Sonic 3.6 (1276), Gemini 3.8 Flash TTS (1267), Qwen-Audio-3.0-TTS-Plus (1258), Inworld Realtime TTS-2 (1246), Gemini 3.8 Flash-Lite TTS (1241), Speechify Simba 3.2 (1240) i Luna TTS (1231). Pełną tabelę z cenami podałem w tekście o Eleven v4.

Zgodność z moim testem jest częściowa. Lider jest ten sam. Ale Gemini 3.8 Flash TTS, trzeci w angielskim rankingu, po polsku przegrał z Flash-Lite i z Gemini 3.1 Flash TTS. Modele Qwen i Inworld, wysoko po angielsku, po polsku odpadły. Wniosek praktyczny: angielski ranking mówi, kto ma najlepszą technologię, ale polski tekst z liczbami trzeba sprawdzić samemu. To moja opinia.

Brzmienie oceniał też Gemini 3.8 Flash, któremu dałem nagrania do odsłuchu. Eleven v4, v4 Turbo, Gemini 3.1 Flash i 3.8 dostały od niego 8/10 za naturalność, a Multilingual v2 i Flash v2.5 na polskich głosach 2-6/10 z uwagą o „wschodnim akcencie” w liczbach. To ocena modelu, nie moja, ale zgadza się z pomiarem melodii głosu: najbardziej płasko (najmniejsze wahania wysokości) brzmiały Flash v2.5, Multilingual v2, GPT Audio mini i xAI TTS.

Który lektor AI wybrać

  • Lektor do filmów, kursów i reklam po polsku: Eleven v4 z polskim głosem z biblioteki. Jak wybrać głos, opisałem w tekście ElevenLabs po polsku.
  • Asystent głosowy, rozmowa na żywo: Eleven v4 Turbo (0,25 s do pierwszego dźwięku w moim pomiarze).
  • Duże ilości tekstu za małe pieniądze: Gemini 3.1 Flash TTS albo 3.8 Flash-Lite przez API Google.
  • Za darmo i lokalnie: żaden z tych modeli, zobacz AI lektor i tekst na mowę, gdzie opisuję głosy systemowe i darmowe silniki.

Niezależnie od modelu przed nagraniem przygotuj tekst pod czytanie: krótkie zdania, przecinki tam, gdzie ma być oddech. Robię to według listy z tekstu AI do lektora.

Najczęstsze pytania

Jaki jest najlepszy lektor AI po polsku?

W moim teście 14 modeli z 28 września 2026 najlepiej wypadł Eleven v4 od ElevenLabs: bez błędu w 18 liczbach, datach i skrótach, na trzech głosach. Tak samo dobrze liczby przeczytały Eleven v4 Turbo i Gemini 3.1 Flash TTS.

Jaki jest najtańszy dobry lektor AI po polsku?

Gemini 3.8 Flash-Lite TTS od Google: 11 USD (42,43 zł) za milion znaków według Artificial Analysis i tylko jeden błąd w liczbach w moim teście. Gemini 3.1 Flash TTS kosztuje 18,3 USD i nie zrobił żadnego.

Czy lektor AI czyta poprawnie liczby i daty?

Najnowsze modele tak, starsze nie. Eleven v4 przeczytał wszystkie, a Eleven Flash v2.5 na ustawieniach domyślnych tylko 7 z 18. Przy starszych modelach włącz normalizację tekstu albo rozpisz liczby słownie.

Czy ChatGPT może być lektorem?

Model GPT Audio czyta po polsku dobrze, ale traktuje tekst jak polecenie. Zdanie „Otwórz Google Chrome…” skwitował odmową, więc tekst trzeba ująć w cudzysłów z instrukcją „przeczytaj słowo w słowo”.

Ile kosztuje minuta lektora AI?

Minuta mowy to około 660 znaków. W Eleven v4 przez API wychodzi około 0,20 zł bez VAT (w promocji do 12 października 0,06 zł), w Gemini 3.8 Flash-Lite TTS około 0,03 zł.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Ranking: Artificial Analysis, Provider Voice i metodologia. Ceny: ElevenLabs API, Gemini API, fal.ai, OpenRouter. Obsługa polskiego w Gemini TTS: dokumentacja Google. Mój test: API ElevenLabs (głosy Adam, Magdalena, Alice), fal.ai (Gemini 3.8 Flash TTS, 3.8 Flash-Lite TTS, 3.1 Flash TTS, Qwen Audio 3.0 TTS, Inworld TTS-1.5 Max, MiniMax Speech 2.8 HD, xAI TTS), OpenRouter (GPT Audio, GPT Audio mini); transkrypcja Whisper large-v3, ElevenLabs Scribe v2, Gemini 3.1 Pro i 3.8 Flash. Kurs NBP 3,857 zł/USD. Sprawdzone 28 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model TTS najlepiej czyta po polsku liczby, daty i skróty?

Najlepiej wypadły Eleven v4, Eleven v4 Turbo i Gemini 3.1 Flash TTS - każdy z nich poprawnie przeczytał wszystkie 18 punktów kontrolnych. Modele te prawidłowo rozwinęły skróty takie jak 'ul.' i 'dr', odczytały daty słownie oraz poprawnie wymówiły kwoty w złotych i adresy e-mail.

Ile kosztuje Eleven v4 od ElevenLabs za milion znaków?

Standardowa cena Eleven v4 wynosi 80 USD za milion znaków bez VAT, co przy kursie 3,857 zł/USD daje 308,56 zł. Do 12 października obowiązuje promocja: 22 USD za milion znaków, a wersja Turbo kosztuje wtedy 11 USD.

Czy modele GPT Audio od OpenAI dobrze czytają polskie teksty?

GPT Audio i GPT Audio mini czytają polski poprawnie, ale oba odmówiły przeczytania zdania z angielskimi nazwami jak Google Chrome czy YouTube, traktując je jak polecenie do wykonania. Problem rozwiązało ujęcie tekstu w cudzysłów z poleceniem 'przeczytaj słowo w słowo', jednak przy pracy lektorskiej każde nagranie trzeba odsłuchać.

Jak poprawić jakość Eleven Flash v2.5 przy czytaniu po polsku?

Wystarczy włączyć normalizację tekstu przez ustawienie parametru apply_text_normalization na wartość 'on'. Bez tego Flash v2.5 uzyskał tylko 7 z 18 punktów kontrolnych, a po włączeniu normalizacji zaliczył 10 z 11 punktów samego toru przeszkód.

Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›