✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

ElevenLabs Scribe: transkrypcja po polsku, test błędów

Minutowy wywiad z nazwiskami typu Brzęczyszczykiewicz i 13 liczbami: Scribe v2 w trzech ustawieniach kontra Whisper, plus nagrania z szumem.

6 min czytania
ElevenLabs Scribe: transkrypcja po polsku, test błędów

👁 114 przeczytań

ElevenLabs Scribe to model zamiany mowy na tekst, który przepisuje nagrania w ponad 90 językach, rozpoznaje mówców i oznacza odgłosy. Sprawdziłem, jak radzi sobie z polskim: przygotowałem minutowy wywiad naszpikowany nazwiskami typu Żółtowski-Brzęczyszczykiewicz, nazwami miejsc i trzynastoma liczbami, a potem policzyłem błędy w trzech ustawieniach Scribe i w lokalnym Whisperze. Do tego test na nagraniach z szumem kawiarni, ulicy i wentylatora.

W skrócie

Scribe v2 przepisał 112 słów trudnego polskiego wywiadu bez błędu w nazwach i liczbach, poprawnie rozdzielił dwóch mówców w 6 z 6 wypowiedzi i zrobił to w 4,6 s. Whisper large-v3 na moim komputerze przekręcił nazwisko Curie i nazwę Zamościa, a pracował 150 s. Scribe domyślnie zapisuje liczby słownie, ale jedna instrukcja w parametrze transcript_edit zamienia je na cyfry. Podpowiedzi słów (keyterms) w moim teście zaszkodziły odmianie nazwiska. Cena przez API to 0,22 USD (0,85 zł) za godzinę nagrania. Dla kogo: wywiady, podcasty, spotkania, napisy. Dla kogo nie: nagrania, które z zasady nie mogą opuścić twojego komputera.

0błędów w nazwiskach i liczbach (112 słów)
6/6wypowiedzi przypisanych właściwemu mówcy
4,6 sczas transkrypcji minutowego nagrania
0,85 złcena godziny nagrania przez API

Co potrafi Scribe

  • Modele: Scribe v2 do plików, Scribe v2 Realtime do mowy na żywo (opóźnienie ok. 150 ms według dokumentacji) i Scribe v2 Medical do nagrań klinicznych. Starszy Scribe v1 jest oznaczony jako przestarzały.
  • Polski: dokumentacja umieszcza go w grupie „Excellent”, czyli z odsetkiem błędnych słów (WER) do 5%.
  • Funkcje: rozpoznawanie mówców (do 32), znaczniki czasu dla słów, opis odgłosów w nawiasach, podpowiedzi słów do 1000 haseł, wykrywanie i maskowanie danych osobowych, eksport do napisów, edycja transkrypcji poleceniem w języku naturalnym.
  • Limity: plik do 5 GB i 10 godzin. Zamiast pliku można podać link, także do filmu na YouTube czy TikToku.

Mój test: wywiad z pułapkami

Nagranie przygotowałem sam, bez udziału prawdziwych osób. Dwa głosy ElevenLabs (kobiecy głos Matilda i męski Brian) przeczytały modelem Eleven v4 fikcyjny wywiad o otwarciu Muzeum Chrząszcza w Szczebrzeszynie: 66 sekund, 112 słów, 13 liczb (kwoty, procenty, godzina, numer drogi) i nazwy, które lubią wykoleić transkrypcję: Grzędzińska, Żółtowski-Brzęczyszczykiewicz, Curie-Skłodowska, Wieprz, Zamość, ulica Źródlana.

// taniej niż u producentaw magazynie
ElevenLabs Creator - 12 miesięcy
ElevenLabs Creator - 12 miesięcyKupon, którym włączasz ElevenLabs Creator na 12 miesięcy na własnym koncie.kinetyka.pl - mój sklep z rocznymi dostępami do narzędzi AI
430 zł-59%zamiast 1 056 zł35,83 zł / mies.Kup w Kinetyce →
Nagranie testowe: fikcyjny wywiad, dwa syntetyczne głosy, 66 s.

28 września 2026 przepuściłem je przez Scribe v2 z językiem polskim i rozpoznawaniem mówców w trzech wariantach, a dla porównania przez Whisper large-v3 (faster-whisper, int8 na procesorze).

WariantBłędy treściLiczbyMówcyCzasKredyty
Scribe v2011 z 13 słownie6/64,6 s34
Scribe v2 + keyterms1 (odmiana nazwiska)11 z 13 słownie6/63,9 s41
Scribe v2 + transcript_edit013 z 13 cyframi6/66,5 s44
Whisper large-v3 lokalnie2 („Kiri Skłodowskiej”, „Zeza Mościa”)głównie cyframibrak150 s0

Jedno miejsce jest sporne: w tekście było „Z Zamościa”, a Scribe zapisał „Ze Zamościa”. Whisper usłyszał tam „Zeza Mościa”, więc głos najpewniej powiedział „ze”. Nie liczę tego jako błędu Scribe. Bezbłędnie zapisał nazwisko Żółtowskiego-Brzęczyszczykiewicza w narzędniku, a także Grzędzińską, Szczebrzeszyn i Curie-Skłodowską.

Liczby: słownie czy cyframi

Domyślnie Scribe zapisuje liczby tak, jak je słychać: „trzy miliony czterysta osiemdziesiąt tysięcy złotych”, „osiemnaście złotych pięćdziesiąt groszy”, „o dziewiątej trzydzieści”. Tylko datę na początku zapisał cyframi. Do notatek i napisów to niewygodne, więc dodałem parametr transcript_edit z poleceniem:

Zapisz wszystkie liczby, kwoty, daty, godziny i numery cyframi,
np. 18,50 zł, 9:30, 1250. Niczego poza tym nie zmieniaj.

Dostałem „3 480 000 zł”, „62%”, „18,50 zł”, „22 km”, „drogą wojewódzką numer 858” i „o 9:30”, a reszta tekstu została nietknięta. Poprawiony tekst przychodzi w osobnym polu edited_transcript, obok oryginału. Kosztowało to 44 kredyty zamiast 34.

Keyterms potrafią zaszkodzić

Podpowiedzi słów mają pomagać przy nazwach własnych. Dałem Scribe siedem haseł w mianowniku, m.in. „Żółtowski-Brzęczyszczykiewicz”. Efekt: w zdaniu „z panem Krzysztofem Żółtowskim-Brzęczyszczykiewiczem” model wstawił „Żółtowski” bez końcówki. Bez podpowiedzi zapisał poprawnie. Wniosek dla polskiego: keyterms używaj do nazw, które się nie odmieniają (marki, skróty, nazwy produktów), a nie do nazwisk w zdaniach. Keyterms są też płatne osobno: 0,05 USD za godzinę.

Szum w tle

W teście Voice Isolatora przygotowałem 25-sekundowy syntetyczny monolog (66 słów) i dodałem do niego szum wentylatora, ulicy i kawiarni, każdy tak głośny jak mowa. Scribe przepisał wszystkie trzy wersje bez błędu. Dopiero gdy gwar kawiarni był o 5 dB głośniejszy od mowy, pomylił 9 z 66 słów (13,6%). Co ciekawe, nagrania oczyszczone wcześniej Voice Isolatorem dawały więcej błędów niż surowe, więc przed transkrypcją nie czyść dźwięku.

Scribe czy Whisper

To moja opinia: jeśli nagranie może trafić do chmury, Scribe wygrywa dokładnością nazw, rozpoznawaniem mówców i szybkością. Whisper ma sens, gdy materiał nie może opuścić komputera albo przepisujesz setki godzin i liczy się zerowy koszt. Porównanie lokalnych modeli jest w tekście Whisper AI, a przegląd innych narzędzi w poradniku o transkrypcji.

Jak przepisać nagranie w Scribe

W aplikacji: Speech to Text, wgraj plik albo wklej link, wybierz język polski (automatyczne wykrywanie też działa, ale ręczny wybór to jedno ryzyko mniej) i włącz rozpoznawanie mówców. Gotową transkrypcję pobierzesz m.in. jako napisy. Przez API (przetestowane 28.09.2026):

curl -X POST https://api.elevenlabs.io/v1/speech-to-text \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F model_id=scribe_v2 -F language_code=pl -F diarize=true \
  -F "transcript_edit=Zapisz wszystkie liczby, kwoty, daty i godziny cyframi." \
  -F [email protected]

Ile kosztuje Scribe

Usługa (cennik API, 28.09.2026, bez VAT)USDzł
Scribe v2 i v2 Medical, godzina nagrania0,220,85
Scribe v2 Realtime, godzina0,391,50
Dopłata za keyterms, godzina0,050,19
Dopłata za wykrywanie danych, godzina0,070,27

Nagłówki odpowiedzi API pokazywały mi koszt wprost: minutowy wywiad to 34 kredyty i 0,0041 USD, z edycją liczb 44 kredyty i 0,0053 USD. Transkrypcja jest dostępna także w darmowym planie. Plany opisuję w tekście ile kosztuje ElevenLabs, a pozostałe funkcje w przewodniku ElevenLabs.

Najczęstsze pytania

Czy ElevenLabs Scribe dobrze rozpoznaje polski?

W moim teście tak: 112 słów wywiadu z trudnymi nazwiskami i 13 liczbami bez błędu treści. Dokumentacja zalicza polski do języków z odsetkiem błędów do 5%.

Ile kosztuje transkrypcja w ElevenLabs?

Przez API 0,22 USD (0,85 zł) za godzinę nagrania w Scribe v2, bez VAT. Minutowe nagranie kosztowało mnie 34 kredyty.

Jak sprawić, żeby Scribe pisał liczby cyframi?

Dodaj parametr transcript_edit z poleceniem „Zapisz wszystkie liczby, kwoty, daty i godziny cyframi”. Poprawiona wersja przychodzi w polu edited_transcript, za niewielką dopłatą.

Czy Scribe rozpoznaje, kto mówi?

Tak, po włączeniu diarize rozdziela do 32 mówców. W moim wywiadzie przypisał wszystkie 6 wypowiedzi właściwym osobom.

Czy Scribe jest lepszy od Whispera?

Na moim nagraniu tak: Scribe nie pomylił żadnej nazwy, Whisper large-v3 dwie, a do tego był 30 razy wolniejszy na procesorze. Whisper działa za to lokalnie i bez opłat.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

dokumentacja: Speech to Text, API: Create transcript, dokumentacja: modele, cennik API, faster-whisper. Test własny 28.09.2026: 3 transkrypcje wywiadu 66 s i 13 transkrypcji nagrań z szumem, łącznie kilkaset kredytów. Kurs 3,857 zł/USD. Sprawdzone 28 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›