✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Voice Isolator: usuwanie szumów z nagrania w ElevenLabs

Czyste nagranie zaszumiłem wentylatorem, ulicą i kawiarnią, a potem oczyściłem Voice Isolatorem. Szum spadł o 21-26 dB, ale transkrypcja wyszła gorzej.

6 min czytania
Voice Isolator: usuwanie szumów z nagrania w ElevenLabs

👁 114 przeczytań

Voice Isolator od ElevenLabs służy do usuwania szumów z nagrania: wycina tło, pogłos i muzykę, a zostawia sam głos. Sprawdziłem go na nagraniu, które zepsułem celowo: czysty monolog po polsku zmieszałem w ffmpeg z szumem wentylatora, ulicy w deszczu i gwarem kawiarni. Zmierzyłem, ile szumu zostaje, czy głos brzmi jak przed zaszumieniem i czy da się potem dobrze przepisać nagranie. Ostatni wynik mnie zaskoczył.

W skrócie

Voice Isolator obniżył poziom szumu w przerwach między słowami o 21-26 dB i przywrócił barwę głosu prawie do oryginału (podobieństwo 0,96-0,99). Na ucho i do publikacji to duża poprawa, a 25-sekundowe nagranie było gotowe w 3 s za 425 kredytów. Model jednak w zagłuszonych miejscach potrafi zmienić głoski: po oczyszczeniu transkrypcja miała więcej błędów niż z surowego, zaszumionego pliku, a przy gwarze głośniejszym od mowy zamiast 9 błędów było 23. Dla kogo: podcasty, wywiady z telefonu, dźwięk do filmów. Dla kogo nie: nagrania, które chcesz tylko przepisać, i dowody, w których liczy się każde słowo.

+21-26 dBmniej szumu w przerwach między słowami
0,96-0,99podobieństwo głosu do czystego oryginału
3 sczas czyszczenia 25 s nagrania
9 → 23błędy transkrypcji przy gwarze -5 dB przed i po

Co robi Voice Isolator

Narzędzie przyjmuje plik audio (AAC, AIFF, OGG, MP3, OPUS, WAV, FLAC, M4A) albo wideo (m.in. MP4, MOV, MKV, WEBM) do 500 MB i 1 godziny. Zwraca samą mowę. Dokumentacja zastrzega, że narzędzie nie jest zoptymalizowane do wyciągania wokalu z muzyki, choć czasem to działa. Ten sam model działa też jako przełącznik „usuń szum tła” przy klonowaniu głosu i w Voice Changerze.

// taniej niż u producentaw magazynie
ElevenLabs Creator - 12 miesięcy
ElevenLabs Creator - 12 miesięcyKupon, którym włączasz ElevenLabs Creator na 12 miesięcy na własnym koncie.kinetyka.pl - mój sklep z rocznymi dostępami do narzędzi AI
430 zł-59%zamiast 1 056 zł35,83 zł / mies.Kup w Kinetyce →

Mój test: czyste nagranie, cztery rodzaje brudu

Punkt wyjścia to 25,5-sekundowy monolog o szukaniu mieszkania (66 słów), wygenerowany syntetycznym głosem w modelu Eleven v4. Dzięki temu miałem wzorzec: wiem dokładnie, jak nagranie brzmiało bez szumu.

Wzorzec: czyste nagranie przed dodaniem szumu.

Szum dodałem w ffmpeg. „Wentylator” to różowy szum z przydźwiękiem 50 i 150 Hz, wygenerowany w samym ffmpeg. „Ulica” (deszcz i tramwaj) oraz „kawiarnia” (rozmowy, filiżanki, ekspres) to tła z generatora efektów dźwiękowych. Poziom dobrałem tak, żeby szum był równie głośny jak mowa (0 dB), a w najtrudniejszej wersji kawiarnia była o 5 dB głośniejsza od głosu. Przykład dla wentylatora, w uproszczeniu:

ffmpeg -f lavfi -i "anoisesrc=color=pink:amplitude=0.5:duration=25.5" \
  -f lavfi -i "sine=frequency=50:duration=25.5" \
  -f lavfi -i "sine=frequency=150:duration=25.5" \
  -filter_complex "[1:a]volume=0.6[h1];[2:a]volume=0.25[h2];[0:a][h1][h2]amix=inputs=3:normalize=0" \
  -ac 1 szum.wav
ffmpeg -i czyste.wav -i szum.wav \
  -filter_complex "[1:a]volume=0.675[n];[0:a][n]amix=inputs=2:normalize=0:duration=first" \
  zaszumione.wav

Wzmocnienie szumu (tu 0,675) liczyłem dla każdego tła osobno, z poziomu RMS mowy i szumu. Każdy zaszumiony plik wysłałem 28 września 2026 do Voice Isolatora przez API.

Kawiarnia, szum tak głośny jak mowa: przed.
Kawiarnia: po Voice Isolatorze.
Wentylator z przydźwiękiem: przed.
Wentylator: po Voice Isolatorze.

Wyniki pomiarów

Nie oceniałem jakości na ucho. Zmierzyłem trzy rzeczy względem czystego wzorca: stosunek głośności mowy do tego, co słychać w przerwach między słowami (im więcej dB, tym ciszej w przerwach), odległość widma od wzorca (im mniej, tym bliżej oryginału) oraz podobieństwo głosu modelem weryfikacji mówcy WavLM.

WarunkiMowa do przerw: przed / poOdległość widma: przed / poPodobieństwo głosu: przed / po
Wentylator, 0 dB3,8 / 30,0 dB18,2 / 5,70,900 / 0,984
Ulica, 0 dB5,6 / 26,5 dB14,2 / 5,10,975 / 0,989
Kawiarnia, 0 dB5,2 / 30,6 dB16,2 / 5,90,949 / 0,987
Kawiarnia, -5 dB3,0 / 25,1 dB20,1 / 7,60,753 / 0,959
O ile ciszej w przerwach między słowami po oczyszczeniu
Wentylator+26,2 dB
Kawiarnia 0 dB+25,4 dB
Kawiarnia -5 dB+22,1 dB
Ulica+20,9 dB

Pod względem brzmienia to bardzo dobry wynik: szum w przerwach spadł o ponad 20 dB, a odległość widma od wzorca zmalała mniej więcej trzykrotnie. W czystym wzorcu ten stosunek wynosi ok. 60 dB, więc do ciszy studyjnej trochę brakuje. Plik wyjściowy ma tę samą długość co wejściowy, więc da się go podłożyć pod obraz bez przesuwania.

Niespodzianka: czyste nie znaczy wierne

Każde nagranie przed i po oczyszczeniu przepisałem transkrypcją ElevenLabs Scribe i policzyłem błędne słowa na 66.

WarunkiBłędy: zaszumioneBłędy: po Voice IsolatorzePrzykład
Wentylator, 0 dB00-
Ulica, 0 dB02„czwarte piętro” → „otwarte wnętro”
Kawiarnia, 0 dB04„złotych” → „złoty”, dopisane „jutro”
Kawiarnia, -5 dB923„zaraz mam spotkanie” → „nazywa się Spook May”
Najtrudniejszy przypadek, gwar o 5 dB głośniejszy od mowy: przed.
Po Voice Isolatorze: czysto, ale część słów brzmi już inaczej.

Porównanie próbka po próbce z wzorcem wypadło bardzo słabo, choć widmo jest bliskie oryginałowi. Wygląda na to, że model nie tylko wycina szum, ale odtwarza mowę na nowo, a tam, gdzie głos był zagłuszony, zgaduje głoski. Ucho dostaje czysty dźwięk, a transkrypcja dostaje czasem inne słowa. Wniosek praktyczny: do przepisania nagrania wysyłaj surowy plik prosto do transkrypcji, a Voice Isolatora używaj do tego, czego ktoś będzie słuchał.

Jak użyć Voice Isolatora

  1. W aplikacji: Voice Isolator, wgraj plik audio albo wideo i pobierz wynik.
  2. Przez API (przetestowane 28.09.2026):
curl -X POST https://api.elevenlabs.io/v1/audio-isolation \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F [email protected] -o czyste.mp3

Przesłuchaj wynik w miejscach, gdzie szum był najgłośniejszy, i porównaj z oryginałem, zanim opublikujesz cytat. Jeśli nagranie ma posłużyć do zmiany głosu, nie musisz go czyścić osobno: w Voice Changerze jest ten sam filtr jako opcja, a w moim teście robił tam ogromną różnicę.

Ile kosztuje Voice Isolator

Dokumentacja podaje 1000 kredytów za minutę nagrania, co zgadza się z moim pomiarem: 425 kredytów za 25,5 s. Cennik API z 28 września 2026: 0,12 USD (0,46 zł) za minutę, bez VAT. Godzinny podcast to więc 7,20 USD (27,77 zł). W planie Creator za 22 USD (84,85 zł, 121 tys. kredytów) zmieścisz ok. 2 godziny czyszczenia miesięcznie, jeśli nie używasz kredytów na nic innego. Pozostałe plany porównuję w tekście ile kosztuje ElevenLabs, a wszystkie narzędzia w przewodniku ElevenLabs.

Najczęstsze pytania

Jak usunąć szumy z nagrania za pomocą AI?

Wgraj plik do Voice Isolatora w ElevenLabs, w aplikacji albo przez API. W moim teście szum w przerwach między słowami spadł o 21-26 dB, a 25-sekundowe nagranie było gotowe w ok. 3 sekundy.

Ile kosztuje Voice Isolator?

1000 kredytów za minutę nagrania, przez API 0,12 USD (0,46 zł) za minutę, bez VAT. Mnie 25,5 s kosztowało 425 kredytów.

Czy Voice Isolator poprawia transkrypcję?

W moim teście nie, pogarszał ją. Przy gwarze głośniejszym od mowy liczba błędnych słów wzrosła z 9 do 23 na 66, bo model w zagłuszonych miejscach odtwarza inne głoski.

Czy Voice Isolator działa z plikami wideo?

Tak. Przyjmuje m.in. MP4, MOV, MKV i WEBM do 500 MB i godziny długości i zwraca oczyszczoną ścieżkę dźwiękową.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

dokumentacja: Voice isolator, API: Audio isolation, cennik API, cennik planów, model microsoft/wavlm-base-plus-sv. Test własny 28.09.2026: 4 nagrania po 25,5 s (1700 kredytów) plus 6 s testu polecenia curl. Kurs 3,857 zł/USD. Sprawdzone 28 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›