ElevenLabs Scribe: transkrypcja po polsku, test błędów
Minutowy wywiad z nazwiskami typu Brzęczyszczykiewicz i 13 liczbami: Scribe v2 w trzech ustawieniach kontra Whisper, plus nagrania z szumem.

👁 114 przeczytań
ElevenLabs Scribe to model zamiany mowy na tekst, który przepisuje nagrania w ponad 90 językach, rozpoznaje mówców i oznacza odgłosy. Sprawdziłem, jak radzi sobie z polskim: przygotowałem minutowy wywiad naszpikowany nazwiskami typu Żółtowski-Brzęczyszczykiewicz, nazwami miejsc i trzynastoma liczbami, a potem policzyłem błędy w trzech ustawieniach Scribe i w lokalnym Whisperze. Do tego test na nagraniach z szumem kawiarni, ulicy i wentylatora.
W skrócie
Scribe v2 przepisał 112 słów trudnego polskiego wywiadu bez błędu w nazwach i liczbach, poprawnie rozdzielił dwóch mówców w 6 z 6 wypowiedzi i zrobił to w 4,6 s. Whisper large-v3 na moim komputerze przekręcił nazwisko Curie i nazwę Zamościa, a pracował 150 s. Scribe domyślnie zapisuje liczby słownie, ale jedna instrukcja w parametrze transcript_edit zamienia je na cyfry. Podpowiedzi słów (keyterms) w moim teście zaszkodziły odmianie nazwiska. Cena przez API to 0,22 USD (0,85 zł) za godzinę nagrania. Dla kogo: wywiady, podcasty, spotkania, napisy. Dla kogo nie: nagrania, które z zasady nie mogą opuścić twojego komputera.
01Voice Isolator: usuwanie szumów z nagrania w ElevenLabsCzyste nagranie zaszumiłem wentylatorem, ulicą i kawiarnią, a potem oczyściłem Voice Isolatorem. Szum spadł o 21-26 dB, ale transkrypcja wyszła gorzej.Czytaj →
02ElevenLabs Dubbing: film po polsku, mój test v1 i v2Zdubbingowałem fikcyjny klip 24 s z angielskiego na polski w v1 i v2: filmy przed i po, czasy, kredyty, podobieństwo głosu i jedna kosztowna wpadka.Czytaj →
03Voicebot na ElevenLabs Agents: test polskiej infoliniiZbudowałem fikcyjną recepcję gabinetu i przeprowadziłem z nią rozmowę głosową po polsku: czas reakcji, rozpoznawanie mowy, koszt minuty i jedna pułapka.Czytaj →
04Voice Changer ElevenLabs: zmiana głosu AI na nagraniuPolski monolog zmieniony na głos kobiecy i niski głos lektora: treść, długość i melodia zdań po konwersji oraz jedno ustawienie, które ratuje nagrania z szumem.Czytaj →
05Klonowanie głosu AI w ElevenLabs: klon z 10 s i 2 minutSklonowałem wyłącznie syntetyczny głos z Voice Design: klony z 10 s, 30 s i 2 min, pomiar podobieństwa, nagrania, koszty i zasady zgody.Czytaj →
06Ile kosztuje ElevenLabs? Plany, minuty i limity głosówGdy sprawdzam, ile kosztuje ElevenLabs, zaczynam od planów narzędzia do generowania głosu i innych materiałów audio. Dostęp jest rozliczany między innymi kredytami,…Czytaj →Co potrafi Scribe
- Modele: Scribe v2 do plików, Scribe v2 Realtime do mowy na żywo (opóźnienie ok. 150 ms według dokumentacji) i Scribe v2 Medical do nagrań klinicznych. Starszy Scribe v1 jest oznaczony jako przestarzały.
- Polski: dokumentacja umieszcza go w grupie „Excellent”, czyli z odsetkiem błędnych słów (WER) do 5%.
- Funkcje: rozpoznawanie mówców (do 32), znaczniki czasu dla słów, opis odgłosów w nawiasach, podpowiedzi słów do 1000 haseł, wykrywanie i maskowanie danych osobowych, eksport do napisów, edycja transkrypcji poleceniem w języku naturalnym.
- Limity: plik do 5 GB i 10 godzin. Zamiast pliku można podać link, także do filmu na YouTube czy TikToku.
Mój test: wywiad z pułapkami
Nagranie przygotowałem sam, bez udziału prawdziwych osób. Dwa głosy ElevenLabs (kobiecy głos Matilda i męski Brian) przeczytały modelem Eleven v4 fikcyjny wywiad o otwarciu Muzeum Chrząszcza w Szczebrzeszynie: 66 sekund, 112 słów, 13 liczb (kwoty, procenty, godzina, numer drogi) i nazwy, które lubią wykoleić transkrypcję: Grzędzińska, Żółtowski-Brzęczyszczykiewicz, Curie-Skłodowska, Wieprz, Zamość, ulica Źródlana.

28 września 2026 przepuściłem je przez Scribe v2 z językiem polskim i rozpoznawaniem mówców w trzech wariantach, a dla porównania przez Whisper large-v3 (faster-whisper, int8 na procesorze).
| Wariant | Błędy treści | Liczby | Mówcy | Czas | Kredyty |
|---|---|---|---|---|---|
| Scribe v2 | 0 | 11 z 13 słownie | 6/6 | 4,6 s | 34 |
| Scribe v2 + keyterms | 1 (odmiana nazwiska) | 11 z 13 słownie | 6/6 | 3,9 s | 41 |
| Scribe v2 + transcript_edit | 0 | 13 z 13 cyframi | 6/6 | 6,5 s | 44 |
| Whisper large-v3 lokalnie | 2 („Kiri Skłodowskiej”, „Zeza Mościa”) | głównie cyframi | brak | 150 s | 0 |
Jedno miejsce jest sporne: w tekście było „Z Zamościa”, a Scribe zapisał „Ze Zamościa”. Whisper usłyszał tam „Zeza Mościa”, więc głos najpewniej powiedział „ze”. Nie liczę tego jako błędu Scribe. Bezbłędnie zapisał nazwisko Żółtowskiego-Brzęczyszczykiewicza w narzędniku, a także Grzędzińską, Szczebrzeszyn i Curie-Skłodowską.
Liczby: słownie czy cyframi
Domyślnie Scribe zapisuje liczby tak, jak je słychać: „trzy miliony czterysta osiemdziesiąt tysięcy złotych”, „osiemnaście złotych pięćdziesiąt groszy”, „o dziewiątej trzydzieści”. Tylko datę na początku zapisał cyframi. Do notatek i napisów to niewygodne, więc dodałem parametr transcript_edit z poleceniem:
Zapisz wszystkie liczby, kwoty, daty, godziny i numery cyframi,
np. 18,50 zł, 9:30, 1250. Niczego poza tym nie zmieniaj.Dostałem „3 480 000 zł”, „62%”, „18,50 zł”, „22 km”, „drogą wojewódzką numer 858” i „o 9:30”, a reszta tekstu została nietknięta. Poprawiony tekst przychodzi w osobnym polu edited_transcript, obok oryginału. Kosztowało to 44 kredyty zamiast 34.
Keyterms potrafią zaszkodzić
Podpowiedzi słów mają pomagać przy nazwach własnych. Dałem Scribe siedem haseł w mianowniku, m.in. „Żółtowski-Brzęczyszczykiewicz”. Efekt: w zdaniu „z panem Krzysztofem Żółtowskim-Brzęczyszczykiewiczem” model wstawił „Żółtowski” bez końcówki. Bez podpowiedzi zapisał poprawnie. Wniosek dla polskiego: keyterms używaj do nazw, które się nie odmieniają (marki, skróty, nazwy produktów), a nie do nazwisk w zdaniach. Keyterms są też płatne osobno: 0,05 USD za godzinę.
Szum w tle
W teście Voice Isolatora przygotowałem 25-sekundowy syntetyczny monolog (66 słów) i dodałem do niego szum wentylatora, ulicy i kawiarni, każdy tak głośny jak mowa. Scribe przepisał wszystkie trzy wersje bez błędu. Dopiero gdy gwar kawiarni był o 5 dB głośniejszy od mowy, pomylił 9 z 66 słów (13,6%). Co ciekawe, nagrania oczyszczone wcześniej Voice Isolatorem dawały więcej błędów niż surowe, więc przed transkrypcją nie czyść dźwięku.
Scribe czy Whisper
To moja opinia: jeśli nagranie może trafić do chmury, Scribe wygrywa dokładnością nazw, rozpoznawaniem mówców i szybkością. Whisper ma sens, gdy materiał nie może opuścić komputera albo przepisujesz setki godzin i liczy się zerowy koszt. Porównanie lokalnych modeli jest w tekście Whisper AI, a przegląd innych narzędzi w poradniku o transkrypcji.
Jak przepisać nagranie w Scribe
W aplikacji: Speech to Text, wgraj plik albo wklej link, wybierz język polski (automatyczne wykrywanie też działa, ale ręczny wybór to jedno ryzyko mniej) i włącz rozpoznawanie mówców. Gotową transkrypcję pobierzesz m.in. jako napisy. Przez API (przetestowane 28.09.2026):
curl -X POST https://api.elevenlabs.io/v1/speech-to-text \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-F model_id=scribe_v2 -F language_code=pl -F diarize=true \
-F "transcript_edit=Zapisz wszystkie liczby, kwoty, daty i godziny cyframi." \
-F [email protected]Ile kosztuje Scribe
| Usługa (cennik API, 28.09.2026, bez VAT) | USD | zł |
|---|---|---|
| Scribe v2 i v2 Medical, godzina nagrania | 0,22 | 0,85 |
| Scribe v2 Realtime, godzina | 0,39 | 1,50 |
| Dopłata za keyterms, godzina | 0,05 | 0,19 |
| Dopłata za wykrywanie danych, godzina | 0,07 | 0,27 |
Nagłówki odpowiedzi API pokazywały mi koszt wprost: minutowy wywiad to 34 kredyty i 0,0041 USD, z edycją liczb 44 kredyty i 0,0053 USD. Transkrypcja jest dostępna także w darmowym planie. Plany opisuję w tekście ile kosztuje ElevenLabs, a pozostałe funkcje w przewodniku ElevenLabs.
Najczęstsze pytania
Czy ElevenLabs Scribe dobrze rozpoznaje polski?
W moim teście tak: 112 słów wywiadu z trudnymi nazwiskami i 13 liczbami bez błędu treści. Dokumentacja zalicza polski do języków z odsetkiem błędów do 5%.
Ile kosztuje transkrypcja w ElevenLabs?
Przez API 0,22 USD (0,85 zł) za godzinę nagrania w Scribe v2, bez VAT. Minutowe nagranie kosztowało mnie 34 kredyty.
Jak sprawić, żeby Scribe pisał liczby cyframi?
Dodaj parametr transcript_edit z poleceniem „Zapisz wszystkie liczby, kwoty, daty i godziny cyframi”. Poprawiona wersja przychodzi w polu edited_transcript, za niewielką dopłatą.
Czy Scribe rozpoznaje, kto mówi?
Tak, po włączeniu diarize rozdziela do 32 mówców. W moim wywiadzie przypisał wszystkie 6 wypowiedzi właściwym osobom.
Czy Scribe jest lepszy od Whispera?
Na moim nagraniu tak: Scribe nie pomylił żadnej nazwy, Whisper large-v3 dwie, a do tego był 30 razy wolniejszy na procesorze. Whisper działa za to lokalnie i bez opłat.
Źródła i data sprawdzenia
dokumentacja: Speech to Text, API: Create transcript, dokumentacja: modele, cennik API, faster-whisper. Test własny 28.09.2026: 3 transkrypcje wywiadu 66 s i 13 transkrypcji nagrań z szumem, łącznie kilkaset kredytów. Kurs 3,857 zł/USD. Sprawdzone 28 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.
