Eleven v4: nowy model ElevenLabs, cena i mój test po polsku
Eleven v4 prowadzi w rankingu Artificial Analysis (1319 Elo). Sprawdziłem go na polskich datach, kwotach i skrótach: 18 z 18, a Flash v2.5 tylko 7.

👁 115 przeczytań
- Eleven v4 zadebiutował 28 września 2026 roku i od razu zajął 1. miejsce rankingu Artificial Analysis z wynikiem 1319 punktów Elo, o 43 punkty więcej niż drugi Sonic 3.6.
- W teście polskich liczb, dat i skrótów v4 uzyskał 18 z 18 poprawnych odczytów, podczas gdy Flash v2.5 z domyślnymi ustawieniami trafił tylko 7 z 18.
- Wersja v4 Turbo kosztuje regularnie 0,04 USD za 1000 znaków, generuje pierwszy dźwięk po 0,25 s i zużywa połowę kredytów względem pełnego v4.
Eleven v4 to nowy model zamiany tekstu na mowę od ElevenLabs, który 28 września 2026 roku wszedł na 1. miejsce rankingu głosów Artificial Analysis z wynikiem 1319 punktów Elo. W dniu premiery dostałem się do niego przez API i przepuściłem go przez te same polskie zdania co 13 innych modeli: łamańce językowe, daty, kwoty, skróty i angielskie nazwy. Poniżej liczby z rankingu, ceny w złotych, moje nagrania do odsłuchu i to, gdzie v4 naprawdę wygrywa, a gdzie tylko remisuje.
W skrócie
Eleven v4 przeczytał bezbłędnie wszystkie 18 liczb, dat i skrótów z mojego testu, na trzech różnych głosach i w trzech powtórzeniach. Flash v2.5 z tymi samymi ustawieniami domyślnymi trafił 7 z 18. V4 kosztuje w API 0,08 USD za 1000 znaków (0,31 zł bez VAT), a do 12 października 0,022 USD dzięki promocji. Wersja Turbo daje ten sam wynik w moim teście, zaczyna mówić po 0,25 s i zużywa połowę kredytów. Dla kogo: lektor po polsku do filmów, kursów i reklam, gdzie tekst jest pełen liczb. Dla kogo nie: jeśli liczy się tylko cena, Gemini 3.1 Flash TTS zremisował z v4 na liczbach przy czterokrotnie niższej stawce. To moja opinia.
Co ogłosiło ElevenLabs
28 września 2026 roku ElevenLabs opublikowało Eleven v4 w dwóch wersjach: pełnej (identyfikator w API eleven_v4) i szybkiej eleven_v4_turbo. Firma pisze o nowej architekturze, większej głębi emocji i lepszym dialogu wielu mówców. Obie wersje działają w aplikacji ElevenCreative, w ElevenAgents i przez API.

- Języki: producent podaje „ponad 90” (v3 miał „ponad 70”). Lista w API, którą pobrałem 28 września, ma 85 kodów języków dla v4 i 74 dla v3. Polski jest na obu.
- Długość jednej generacji: do 10 000 znaków (v3: 5000).
- Tagi dźwiękowe: wstawki w nawiasach, np.
[whispers],[laughs],[sighs], które model gra zamiast czytać. - v4 Turbo: według ElevenLabs około 100 ms opóźnienia modelu i około 150 ms do pierwszego słowa.
- Klonowanie: szybki klon głosu (Instant Voice Clone) z 10 sekund nagrania; profesjonalne klony (PVC) też działają na v4.
ElevenLabs podaje też, że v4 wygrał w około 75% porównań w ciemno z modelami konkurencji. To dane producenta, nie da się ich sprawdzić z zewnątrz. Ranking Artificial Analysis można sprawdzić samemu.
Eleven v4 w rankingu Artificial Analysis
Artificial Analysis prowadzi arenę głosów: słuchacze dostają dwa nagrania tego samego tekstu, nie wiedzą, który model je zrobił, i wybierają bardziej naturalne. Z tysięcy takich głosowań powstaje punktacja Elo. W zestawieniu „Provider Voice” każdy model mówi własnymi głosami producenta (po angielsku, akcent amerykański i brytyjski).
| Miejsce | Model | Elo (±95%) | Cena za 1 mln znaków |
|---|---|---|---|
| 1 | Eleven v4 (ElevenLabs) | 1319 (±19) | 80 USD (308,56 zł) |
| 2 | Sonic 3.6 (Cartesia) | 1276 (±16) | 49 USD (188,99 zł) |
| 3 | Gemini 3.8 Flash TTS (Google) | 1267 (±16) | 16,5 USD (63,64 zł) |
| 4 | Qwen-Audio-3.0-TTS-Plus (Alibaba) | 1258 (±16) | 19,3 USD (74,44 zł) |
| 5 | Realtime TTS-2 (Inworld) | 1246 (±17) | 20,8 USD (80,23 zł) |
| 6 | Gemini 3.8 Flash-Lite TTS (Google) | 1241 (±16) | 11 USD (42,43 zł) |
| 7 | Simba 3.2 (Speechify) | 1240 (±14) | 6,6 USD (25,46 zł) |
| 8 | Luna TTS (VUI Labs) | 1231 (±13) | 15 USD (57,86 zł) |
Przewaga 43 punktów nad Cartesią to więcej niż suma obu przedziałów niepewności, więc 1. miejsce nie jest przypadkiem. Poprzednik, Eleven v3, jest w tym samym rankingu na 18. miejscu z 1169 punktami. W osobnym zestawieniu „Controlled Voice”, gdzie wszystkie modele dostają te same sklonowane głosy, v4 jest drugi (1157) za Qwen-Audio-3.1-TTS-Plus (1178), a v3 ma 1073.
Artificial Analysis podało też dwie liczby, których nie widać w tabeli rankingu na stronie, tylko we wpisie z 28 września (cytuję je za AlphaSignal): 91,7% poprawnej wymowy w teście trudnych słów, skrótów i liczb (Gemini 3.8 Flash TTS 89,5%, Gemini 3.1 Flash TTS 88,2%, Eleven v3 85,6%) oraz 73,4 znaku generowanego na sekundę wobec 42,5 w v3. Te testy są po angielsku. Dlatego zrobiłem własny po polsku.
Mój test po polsku: zdania, liczby, daty
Wygenerowałem przez API ElevenLabs cztery zdania: „W Szczebrzeszynie chrząszcz…”, „źdźbło”, spotkanie z „dr Agnieszką Brzęczyszczykiewicz” 17.03.2027 r. o godz. 9:45 przy ul. Żeromskiego 12, cenę 1249,99 zł i 15% oraz zdanie o fizyce i matematyce. Drugi tekst był czystym torem przeszkód: pociąg IC 5316, 29.02.2028 r., 14:30, zamówienie nr 48/2026, 3450,50 zł, „tj.”, „ok. 2,8 tys. zł”, numer telefonu i adres e-mail. Tekst wysyłałem w takiej postaci jak wyżej, bez rozpisywania liczb słownie, z ustawieniem normalizacji na „auto”.
Każde nagranie przepuściłem przez trzy niezależne transkrypcje: Whisper large-v3 (lokalnie), ElevenLabs Scribe v2 i Gemini z poleceniem „zapisz słownie, dokładnie tak, jak wymówiono”. Błąd liczyłem wtedy, gdy co najmniej dwie transkrypcje pokazywały złą formę, np. „siedemnasty zero trzeci” zamiast „siedemnastego marca”. Sam Whisper bywa nadgorliwy: kilka razy zapisał „a źdźbło trawy” jako „aźdź błotrawy”, choć Scribe i Gemini słyszały poprawną wymowę, więc takich pojedynczych wpadek nie liczyłem.
| Model (głos Adam) | Błędy słów (z 44) | Zdania: liczby i skróty (7) | Tor przeszkód (11) | Pełna generacja 353 znaków |
|---|---|---|---|---|
| Eleven v4 | 0 | 7/7 | 11/11 | 10,2-25,0 s |
| Eleven v4 Turbo | 0 | 7/7 | 11/11 | 4,1-4,5 s |
| Eleven v3 | 0 | 7/7 | 10/11 | 11,4-15,8 s |
| Multilingual v2 | 0 | 3/7 | 8/11 | 3,8 s |
| Flash v2.5 | 0 | 3/7 | 4/11 | 1,2 s |
V4 przeczytał „dr” jako „doktor” (z żeńskim imieniem, więc bez odmiany, poprawnie), datę jako „siedemnastego marca dwa tysiące dwudziestego siódmego roku”, kwotę jako „tysiąc dwieście czterdzieści dziewięć złotych dziewięćdziesiąt dziewięć groszy”, a adres e-mail jako „biuro małpa przykład kropka pe el”. Ten sam wynik, 7 z 7, padł na głosach Magdalena i Alice oraz w dwóch kolejnych generacjach na Adamie. V3 potknął się na „peronu trzeciej” i raz, na głosie Alice, pominął miesiąc w dacie.
Flash v2.5 poprawia się po włączeniu normalizacji tekstu (apply_text_normalization: "on"): zaliczył wtedy 10 z 11 punktów toru przeszkód. Przy v4 przełącznik nic nie zmienił, bo v4 na „auto” i tak miał komplet.
Oceny brzmienia nie zostawiłem tylko transkrypcjom. Gemini 3.8 Flash, któremu dałem nagrania do odsłuchu, wystawił v4 8/10 za naturalność i 9-10/10 za polską wymowę, a jako jedyną słabość wskazał lekkie zwolnienie przy nazwisku Brzęczyszczykiewicz i przy liczbach. Multilingual v2 i Flash v2.5 na tych samych polskich głosach dostały od niego 2-6/10 i uwagę o „wschodnim akcencie” przy liczbach.
Tagi emocji po polsku
Trzeci tekst miał sześć tagów: szept, pauzę, nerwowy śmiech, ekscytację, westchnienie i sarkazm („[sarcastic] Oczywiście, poniedziałek to mój ulubiony dzień”). Żaden model ElevenLabs nie przeczytał tagów na głos, co wcześniej się zdarzało. To, czy tag został zagrany, oceniał Gemini 3.1 Pro, więc traktuj to jako ocenę modelu, a nie pomiar.
| Model i głos | Zagrane tagi (z 6) | Czego zabrakło |
|---|---|---|
| v4 Turbo, Adam | 6 | - |
| v4 Turbo, Magdalena | 6 | - |
| v4, Adam | 5 | wyraźnej pauzy |
| v4, Magdalena | 4 | śmiechu i westchnienia |
| v3, Adam | 4 + sarkazm częściowo | nerwowego śmiechu |
Obiektywny ślad widać w melodii głosu. Zmierzyłem, jak bardzo skacze wysokość tonu (odchylenie w półtonach): v4 na Adamie 8,3, v4 Turbo 7,6, v3 6,4. Na zwykłych zdaniach bez tagów Flash v2.5 miał 3,0, czyli brzmiał najbardziej płasko.
Szybkość: v4, Turbo i Flash
Artificial Analysis podaje dla v4 73,4 znaku na sekundę. W dniu premiery, łącząc się z Polski, uzyskałem mniej: pierwsze wywołanie 353 znaków trwało 25 s, kolejne około 10 s, czyli 14-35 znaków na sekundę, tyle co v3. Serwery pierwszego dnia pracowały pod obciążeniem, więc pomiar powtórzę za tydzień.
Ważniejsze przy asystentach głosowych jest to, po jakim czasie słychać pierwszy dźwięk. Zmierzyłem to w trybie strumieniowym, trzy razy na model (mediana):
V4 Turbo jest więc prawie tak szybki jak Flash, na polskich liczbach wypadł jak pełny v4, a tagi emocji zagrał nawet pełniej (6 z 6 na obu głosach). Do rozmowy na żywo wybrałbym Turbo bez wahania. Pełny v4 zostawiłbym do nagrań, w których liczy się każdy niuans, bo to on zajął 1. miejsce w rankingu naturalności, ale w moim teście nie znalazłem przewagi, która uzasadniałaby podwójne zużycie kredytów. To moja opinia.
Cena Eleven v4 i dostępność w planach
W API v4 kosztuje 0,08 USD za 1000 znaków, czyli 80 USD (308,56 zł) za milion, tyle samo co v3 i Multilingual v2 w obecnym cenniku. Do 12 października 2026 trwa promocja: 0,022 USD za 1000 znaków w v4 i 0,011 USD w v4 Turbo (regularnie 0,04 USD). Ceny są bez VAT, przeliczam po kursie 3,857 zł za dolar.
| Model | Kredyty za znak (API) | Cena za 1000 znaków | Minuta lektora* |
|---|---|---|---|
| Eleven v4 | 1 | 0,08 USD (0,31 zł), promocja 0,022 USD | ok. 0,20 zł (promocja 0,06 zł) |
| Eleven v4 Turbo | 0,5 | 0,04 USD (0,15 zł), promocja 0,011 USD | ok. 0,10 zł |
| Eleven v3 | 1 | 0,08 USD (0,31 zł) | ok. 0,20 zł |
| Flash v2.5 | 0,5 | 0,04 USD (0,15 zł) | ok. 0,10 zł |
* Minutę liczę z mojego nagrania: 353 znaki dały 32,1 s, czyli około 660 znaków na minutę mowy. Kredyty za znak odczytałem z nagłówka odpowiedzi API: 353 znaki kosztowały 353 kredyty w v4 i 176 w v4 Turbo.
W aplikacji v4 jest dostępny także na planie darmowym. Na 10 000 kredytów z planu Free wychodzi około 15 minut mowy w v4 albo 30 minut w v4 Turbo, na Creatorze (121 000 kredytów, 22 USD, czyli 84,85 zł miesięcznie) około 3 godzin w v4. Wszystkie plany w złotych rozpisałem w przewodniku po ElevenLabs, a szczegóły limitów w tekście ile kosztuje ElevenLabs.
Czy przesiadać się z v3 na v4
Jeśli robisz polskie nagrania z liczbami, datami i skrótami, tak. V3 był dobry, ale w moim teście zrobił dwa błędy w liczbach („peronu trzeciej”, data bez miesiąca), a v4 żadnego, przy tej samej cenie w API. Jeśli masz projekty na Multilingual v2 albo Flash v2.5, zmiana jest jeszcze bardziej odczuwalna: te modele czytały „ul.” jako „ul”, „r.” jako „er” i myliły kwoty (1239,99 zamiast 1249,99 zł). Kto zostaje przy Flashu ze względu na szybkość, powinien włączyć normalizację tekstu albo przejść na v4 Turbo.
Porównanie z modelami Google, OpenAI, xAI, MiniMax i Inworld na tych samych zdaniach jest w rankingu najlepszy lektor AI po polsku, a wybór polskiego głosu opisałem w tekście ElevenLabs po polsku.
Najczęstsze pytania
Czy Eleven v4 mówi po polsku?
Tak. Polski jest na liście 85 języków v4 w API. W moim teście v4 przeczytał polskie łamańce, daty, kwoty i skróty bez błędu na trzech głosach.
Ile kosztuje Eleven v4?
W API 0,08 USD za 1000 znaków (0,31 zł bez VAT), do 12 października 2026 w promocji 0,022 USD. W aplikacji zużywa 1 kredyt na znak i jest dostępny także na planie darmowym.
Czym różni się Eleven v4 od v4 Turbo?
Turbo zaczyna mówić szybciej (w moim pomiarze po 0,25 s zamiast 0,95 s) i zużywa połowę kredytów. Na polskich liczbach oba modele wypadły tak samo, a tagi emocji Turbo zagrał w moim teście nawet pełniej (6 z 6).
Które miejsce zajął Eleven v4 w rankingu Artificial Analysis?
Pierwsze w zestawieniu Provider Voice: 1319 punktów Elo, 43 punkty przed modelem Cartesia Sonic 3.6. W zestawieniu Controlled Voice jest drugi za Qwen-Audio-3.1-TTS-Plus.
Czy Eleven v4 czyta liczby bez rozpisywania ich słownie?
W moim teście tak: daty, godziny, kwoty w złotych, procenty, numery telefonów i adresy e-mail przy normalizacji „auto”. Przy nazwach własnych i rzadkich skrótach nadal warto odsłuchać wynik.
Źródła i data sprawdzenia
Ranking: Artificial Analysis, Provider Voice, Controlled Voice, metodologia. Wynik wymowy 91,7% i szybkość 73,4 znaku/s: AlphaSignal za wpisem Artificial Analysis z 28.09.2026. Premiera: blog ElevenLabs, dokumentacja modeli, TechCrunch. Ceny: cennik API ElevenLabs, plany ElevenLabs. Kurs NBP 3,857 zł/USD. Mój test: API ElevenLabs (głosy Adam, Magdalena, Alice), transkrypcja Whisper large-v3, ElevenLabs Scribe v2 i Gemini 3.1 Pro. Sprawdzone 28 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile kosztuje Eleven v4 w API ElevenLabs?
Eleven v4 kosztuje 0,08 USD za 1000 znaków (0,31 zł bez VAT), czyli 80 USD za milion znaków. Do 12 października 2026 obowiązuje promocja: 0,022 USD za 1000 znaków dla wersji pełnej i 0,011 USD dla v4 Turbo.
Jak Eleven v4 radzi sobie z polskimi liczbami i skrótami?
W teście 18 elementów - liczb, dat, skrótów i adresów - v4 nie popełnił ani jednego błędu. Dla porównania Flash v2.5 z domyślnymi ustawieniami poprawnie odczytał tylko 7 z 18 tych samych elementów.
Czym różni się Eleven v4 od Eleven v4 Turbo?
V4 Turbo generuje pierwszy dźwięk po 0,25 s (pełny v4 po 0,95 s) i zużywa połowę kredytów. W teście polskich liczb oba modele osiągnęły identyczny wynik, a wersja Turbo zagrała nawet więcej tagów emocji - 6 z 6 na obu głosach.
Gdzie Eleven v4 plasuje się w rankingu Artificial Analysis?
Eleven v4 zajmuje 1. miejsce w rankingu Provider Voice z wynikiem 1319 punktów Elo (±19). Poprzednia wersja, Eleven v3, jest w tym samym rankingu na 18. miejscu z 1169 punktami.
Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.
