Voice Isolator: usuwanie szumów z nagrania w ElevenLabs
Czyste nagranie zaszumiłem wentylatorem, ulicą i kawiarnią, a potem oczyściłem Voice Isolatorem. Szum spadł o 21-26 dB, ale transkrypcja wyszła gorzej.

👁 114 przeczytań
Voice Isolator od ElevenLabs służy do usuwania szumów z nagrania: wycina tło, pogłos i muzykę, a zostawia sam głos. Sprawdziłem go na nagraniu, które zepsułem celowo: czysty monolog po polsku zmieszałem w ffmpeg z szumem wentylatora, ulicy w deszczu i gwarem kawiarni. Zmierzyłem, ile szumu zostaje, czy głos brzmi jak przed zaszumieniem i czy da się potem dobrze przepisać nagranie. Ostatni wynik mnie zaskoczył.
W skrócie
Voice Isolator obniżył poziom szumu w przerwach między słowami o 21-26 dB i przywrócił barwę głosu prawie do oryginału (podobieństwo 0,96-0,99). Na ucho i do publikacji to duża poprawa, a 25-sekundowe nagranie było gotowe w 3 s za 425 kredytów. Model jednak w zagłuszonych miejscach potrafi zmienić głoski: po oczyszczeniu transkrypcja miała więcej błędów niż z surowego, zaszumionego pliku, a przy gwarze głośniejszym od mowy zamiast 9 błędów było 23. Dla kogo: podcasty, wywiady z telefonu, dźwięk do filmów. Dla kogo nie: nagrania, które chcesz tylko przepisać, i dowody, w których liczy się każde słowo.
01ElevenLabs Scribe: transkrypcja po polsku, test błędówMinutowy wywiad z nazwiskami typu Brzęczyszczykiewicz i 13 liczbami: Scribe v2 w trzech ustawieniach kontra Whisper, plus nagrania z szumem.Czytaj →
02Voice Changer ElevenLabs: zmiana głosu AI na nagraniuPolski monolog zmieniony na głos kobiecy i niski głos lektora: treść, długość i melodia zdań po konwersji oraz jedno ustawienie, które ratuje nagrania z szumem.Czytaj →
03Klonowanie głosu AI w ElevenLabs: klon z 10 s i 2 minutSklonowałem wyłącznie syntetyczny głos z Voice Design: klony z 10 s, 30 s i 2 min, pomiar podobieństwa, nagrania, koszty i zasady zgody.Czytaj →
04ElevenLabs Dubbing: film po polsku, mój test v1 i v2Zdubbingowałem fikcyjny klip 24 s z angielskiego na polski w v1 i v2: filmy przed i po, czasy, kredyty, podobieństwo głosu i jedna kosztowna wpadka.Czytaj →
05Efekty dźwiękowe AI w ElevenLabs: test poleceń PL i ENPięć par efektów z tym samym opisem po polsku i po angielsku, ocenionych przez dwa modele. Wynik zmienia sposób pisania poleceń.Czytaj →
06Ile kosztuje ElevenLabs? Plany, minuty i limity głosówGdy sprawdzam, ile kosztuje ElevenLabs, zaczynam od planów narzędzia do generowania głosu i innych materiałów audio. Dostęp jest rozliczany między innymi kredytami,…Czytaj →Co robi Voice Isolator
Narzędzie przyjmuje plik audio (AAC, AIFF, OGG, MP3, OPUS, WAV, FLAC, M4A) albo wideo (m.in. MP4, MOV, MKV, WEBM) do 500 MB i 1 godziny. Zwraca samą mowę. Dokumentacja zastrzega, że narzędzie nie jest zoptymalizowane do wyciągania wokalu z muzyki, choć czasem to działa. Ten sam model działa też jako przełącznik „usuń szum tła” przy klonowaniu głosu i w Voice Changerze.

Mój test: czyste nagranie, cztery rodzaje brudu
Punkt wyjścia to 25,5-sekundowy monolog o szukaniu mieszkania (66 słów), wygenerowany syntetycznym głosem w modelu Eleven v4. Dzięki temu miałem wzorzec: wiem dokładnie, jak nagranie brzmiało bez szumu.
Szum dodałem w ffmpeg. „Wentylator” to różowy szum z przydźwiękiem 50 i 150 Hz, wygenerowany w samym ffmpeg. „Ulica” (deszcz i tramwaj) oraz „kawiarnia” (rozmowy, filiżanki, ekspres) to tła z generatora efektów dźwiękowych. Poziom dobrałem tak, żeby szum był równie głośny jak mowa (0 dB), a w najtrudniejszej wersji kawiarnia była o 5 dB głośniejsza od głosu. Przykład dla wentylatora, w uproszczeniu:
ffmpeg -f lavfi -i "anoisesrc=color=pink:amplitude=0.5:duration=25.5" \
-f lavfi -i "sine=frequency=50:duration=25.5" \
-f lavfi -i "sine=frequency=150:duration=25.5" \
-filter_complex "[1:a]volume=0.6[h1];[2:a]volume=0.25[h2];[0:a][h1][h2]amix=inputs=3:normalize=0" \
-ac 1 szum.wav
ffmpeg -i czyste.wav -i szum.wav \
-filter_complex "[1:a]volume=0.675[n];[0:a][n]amix=inputs=2:normalize=0:duration=first" \
zaszumione.wavWzmocnienie szumu (tu 0,675) liczyłem dla każdego tła osobno, z poziomu RMS mowy i szumu. Każdy zaszumiony plik wysłałem 28 września 2026 do Voice Isolatora przez API.
Wyniki pomiarów
Nie oceniałem jakości na ucho. Zmierzyłem trzy rzeczy względem czystego wzorca: stosunek głośności mowy do tego, co słychać w przerwach między słowami (im więcej dB, tym ciszej w przerwach), odległość widma od wzorca (im mniej, tym bliżej oryginału) oraz podobieństwo głosu modelem weryfikacji mówcy WavLM.
| Warunki | Mowa do przerw: przed / po | Odległość widma: przed / po | Podobieństwo głosu: przed / po |
|---|---|---|---|
| Wentylator, 0 dB | 3,8 / 30,0 dB | 18,2 / 5,7 | 0,900 / 0,984 |
| Ulica, 0 dB | 5,6 / 26,5 dB | 14,2 / 5,1 | 0,975 / 0,989 |
| Kawiarnia, 0 dB | 5,2 / 30,6 dB | 16,2 / 5,9 | 0,949 / 0,987 |
| Kawiarnia, -5 dB | 3,0 / 25,1 dB | 20,1 / 7,6 | 0,753 / 0,959 |
Pod względem brzmienia to bardzo dobry wynik: szum w przerwach spadł o ponad 20 dB, a odległość widma od wzorca zmalała mniej więcej trzykrotnie. W czystym wzorcu ten stosunek wynosi ok. 60 dB, więc do ciszy studyjnej trochę brakuje. Plik wyjściowy ma tę samą długość co wejściowy, więc da się go podłożyć pod obraz bez przesuwania.
Niespodzianka: czyste nie znaczy wierne
Każde nagranie przed i po oczyszczeniu przepisałem transkrypcją ElevenLabs Scribe i policzyłem błędne słowa na 66.
| Warunki | Błędy: zaszumione | Błędy: po Voice Isolatorze | Przykład |
|---|---|---|---|
| Wentylator, 0 dB | 0 | 0 | - |
| Ulica, 0 dB | 0 | 2 | „czwarte piętro” → „otwarte wnętro” |
| Kawiarnia, 0 dB | 0 | 4 | „złotych” → „złoty”, dopisane „jutro” |
| Kawiarnia, -5 dB | 9 | 23 | „zaraz mam spotkanie” → „nazywa się Spook May” |
Porównanie próbka po próbce z wzorcem wypadło bardzo słabo, choć widmo jest bliskie oryginałowi. Wygląda na to, że model nie tylko wycina szum, ale odtwarza mowę na nowo, a tam, gdzie głos był zagłuszony, zgaduje głoski. Ucho dostaje czysty dźwięk, a transkrypcja dostaje czasem inne słowa. Wniosek praktyczny: do przepisania nagrania wysyłaj surowy plik prosto do transkrypcji, a Voice Isolatora używaj do tego, czego ktoś będzie słuchał.
Jak użyć Voice Isolatora
- W aplikacji: Voice Isolator, wgraj plik audio albo wideo i pobierz wynik.
- Przez API (przetestowane 28.09.2026):
curl -X POST https://api.elevenlabs.io/v1/audio-isolation \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-F [email protected] -o czyste.mp3Przesłuchaj wynik w miejscach, gdzie szum był najgłośniejszy, i porównaj z oryginałem, zanim opublikujesz cytat. Jeśli nagranie ma posłużyć do zmiany głosu, nie musisz go czyścić osobno: w Voice Changerze jest ten sam filtr jako opcja, a w moim teście robił tam ogromną różnicę.
Ile kosztuje Voice Isolator
Dokumentacja podaje 1000 kredytów za minutę nagrania, co zgadza się z moim pomiarem: 425 kredytów za 25,5 s. Cennik API z 28 września 2026: 0,12 USD (0,46 zł) za minutę, bez VAT. Godzinny podcast to więc 7,20 USD (27,77 zł). W planie Creator za 22 USD (84,85 zł, 121 tys. kredytów) zmieścisz ok. 2 godziny czyszczenia miesięcznie, jeśli nie używasz kredytów na nic innego. Pozostałe plany porównuję w tekście ile kosztuje ElevenLabs, a wszystkie narzędzia w przewodniku ElevenLabs.
Najczęstsze pytania
Jak usunąć szumy z nagrania za pomocą AI?
Wgraj plik do Voice Isolatora w ElevenLabs, w aplikacji albo przez API. W moim teście szum w przerwach między słowami spadł o 21-26 dB, a 25-sekundowe nagranie było gotowe w ok. 3 sekundy.
Ile kosztuje Voice Isolator?
1000 kredytów za minutę nagrania, przez API 0,12 USD (0,46 zł) za minutę, bez VAT. Mnie 25,5 s kosztowało 425 kredytów.
Czy Voice Isolator poprawia transkrypcję?
W moim teście nie, pogarszał ją. Przy gwarze głośniejszym od mowy liczba błędnych słów wzrosła z 9 do 23 na 66, bo model w zagłuszonych miejscach odtwarza inne głoski.
Czy Voice Isolator działa z plikami wideo?
Tak. Przyjmuje m.in. MP4, MOV, MKV i WEBM do 500 MB i godziny długości i zwraca oczyszczoną ścieżkę dźwiękową.
Źródła i data sprawdzenia
dokumentacja: Voice isolator, API: Audio isolation, cennik API, cennik planów, model microsoft/wavlm-base-plus-sv. Test własny 28.09.2026: 4 nagrania po 25,5 s (1700 kredytów) plus 6 s testu polecenia curl. Kurs 3,857 zł/USD. Sprawdzone 28 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.
