Voice Changer ElevenLabs: zmiana głosu AI na nagraniu
Polski monolog zmieniony na głos kobiecy i niski głos lektora: treść, długość i melodia zdań po konwersji oraz jedno ustawienie, które ratuje nagrania z szumem.

👁 114 przeczytań
Voice Changer w ElevenLabs zmienia głos na gotowym nagraniu: bierze twoją wypowiedź z jej tempem, pauzami i intonacją i podmienia barwę na inny głos. Wcześniej funkcja nazywała się Speech to Speech. Sprawdziłem ją na polskim monologu, który przerobiłem na kobiecy głos i na niski głos lektora, a potem na tym samym nagraniu zagłuszonym gwarem kawiarni, z filtrem szumu i bez niego. Poniżej nagrania, pomiary i jedno ustawienie, bez którego wynik bywa nieczytelny.
W skrócie
Na czystym nagraniu Voice Changer zachował każde słowo (0 błędów na 66), długość co do 0,02 s i melodię zdań (korelacja przebiegu tonu 0,92-0,96), a barwę zmienił na docelową (podobieństwo 0,96). Na nagraniu z gwarem kawiarni bez filtra szumu wyszedł bełkot: 24 błędne słowa na 66. Z włączoną opcją „usuń szum tła” liczba błędów spadła do 3. Minuta kosztuje 1000 kredytów, przez API 0,12 USD (0,46 zł). Dla kogo: lektorzy, twórcy postaci do gier i animacji, anonimizacja głosu w materiałach. Dla kogo nie: rozmowy na żywo na Discordzie i podszywanie się pod konkretne osoby.
01Klonowanie głosu AI w ElevenLabs: klon z 10 s i 2 minutSklonowałem wyłącznie syntetyczny głos z Voice Design: klony z 10 s, 30 s i 2 min, pomiar podobieństwa, nagrania, koszty i zasady zgody.Czytaj →
02Voice Isolator: usuwanie szumów z nagrania w ElevenLabsCzyste nagranie zaszumiłem wentylatorem, ulicą i kawiarnią, a potem oczyściłem Voice Isolatorem. Szum spadł o 21-26 dB, ale transkrypcja wyszła gorzej.Czytaj →
03ElevenLabs Dubbing: film po polsku, mój test v1 i v2Zdubbingowałem fikcyjny klip 24 s z angielskiego na polski w v1 i v2: filmy przed i po, czasy, kredyty, podobieństwo głosu i jedna kosztowna wpadka.Czytaj →
04ElevenLabs Scribe: transkrypcja po polsku, test błędówMinutowy wywiad z nazwiskami typu Brzęczyszczykiewicz i 13 liczbami: Scribe v2 w trzech ustawieniach kontra Whisper, plus nagrania z szumem.Czytaj →
05Voicebot na ElevenLabs Agents: test polskiej infoliniiZbudowałem fikcyjną recepcję gabinetu i przeprowadziłem z nią rozmowę głosową po polsku: czas reakcji, rozpoznawanie mowy, koszt minuty i jedna pułapka.Czytaj →
06Ile kosztuje ElevenLabs? Plany, minuty i limity głosówGdy sprawdzam, ile kosztuje ElevenLabs, zaczynam od planów narzędzia do generowania głosu i innych materiałów audio. Dostęp jest rozliczany między innymi kredytami,…Czytaj →Czym Voice Changer różni się od modulatora głosu
Klasyczny modulator głosu przesuwa wysokość i dodaje efekty w czasie rzeczywistym, np. w grze czy na Discordzie. Voice Changer ElevenLabs generuje mowę od nowa innym głosem, zachowując treść i sposób mówienia z oryginału. Jednorazowo przetwarza do 5 minut nagrania (dłuższe trzeba pociąć), a API ma też wersję strumieniową. Do wyboru są dwa modele: eleven_multilingual_sts_v2 dla 29 języków, w tym polskiego, i eleven_english_sts_v2 tylko dla angielskiego. Dokumentacja zaleca model wielojęzyczny nawet dla angielskiego. Głosem docelowym może być gotowy głos z biblioteki, zaprojektowany albo twój klon głosu.

Mój test
Źródło to 25,5-sekundowy monolog o szukaniu mieszkania (66 słów) wygenerowany męskim głosem Chris w modelu Eleven v4. Nie użyłem nagrania żadnej prawdziwej osoby. 28 września 2026 zmieniłem go przez API na dwa głosy: brytyjski kobiecy głos Lily z biblioteki i niskiego polskiego lektora, którego wcześniej zaprojektowałem w Voice Design.
Wyniki na czystym nagraniu
Zmierzyłem cztery rzeczy: czy treść przeżyła (transkrypcja Scribe), czy zgadza się długość, czy zachowana jest melodia zdań (korelacja przebiegu tonu podstawowego źródła i wyniku, 1 oznacza identyczną linię) oraz czyj głos słychać (podobieństwo WavLM do krótkiej próbki głosu docelowego i źródłowego).
| Wynik | Chris → Lily | Chris → lektor |
|---|---|---|
| Błędy treści | 0 / 66 | 0 / 66 |
| Długość (źródło 25,52 s) | 25,54 s | 25,54 s |
| Korelacja melodii zdań | 0,963 | 0,921 |
| Mediana tonu (źródło 131 Hz) | 204 Hz | 96 Hz |
| Podobieństwo do głosu docelowego | 0,963 | 0,962 |
| Podobieństwo do Chrisa (źródło: 0,958) | 0,592 | 0,845 |
| Czas przetwarzania | 5,5 s | 5,7 s |
Głos docelowy wyszedł w obu przypadkach wyraźnie (0,96). Przy lektorze podobieństwo do Chrisa zostało wysokie, ale to dlatego, że oba głosy są męskie i już przed konwersją miały podobieństwo 0,832. Ton przesunął się tam, gdzie powinien: w górę dla kobiecego głosu, w dół dla niskiego lektora. Pauzy i akcenty zdań zostały na swoich miejscach, co widać po korelacji melodii powyżej 0,9. To moja opinia: to właśnie jest przewaga nad zwykłym czytaniem tekstu, bo emocję i tempo nadajesz swoim nagraniem, a nie poleceniem.
Szum w tle: jedno ustawienie robi całą różnicę
To samo nagranie zmieszałem z gwarem kawiarni o głośności równej mowie (tak samo jak w teście Voice Isolatora) i zmieniłem na głos Lily dwa razy: z opcją remove_background_noise i bez niej.
Bez filtra wynik był w dużej części niezrozumiały, np. początek zdania wyszedł jako „Medywanten na sie poł, se nas moch spykac” zamiast „Nagrywam to na szybko, bo zaraz mam spotkanie”. Z filtrem zostały trzy drobne pomyłki, m.in. „znalazłem” zamieniło się w „znalazłam”. Jeśli nagrywasz poza studiem, włączaj tę opcję zawsze.
Do czego się przydaje
- Postacie w grach i animacjach - jedna osoba nagrywa kwestie kilku bohaterów, a Voice Changer nadaje każdemu inną barwę przy zachowaniu aktorskiej interpretacji.
- Anonimizacja - rozmówca w reportażu czy materiale szkoleniowym mówi swoimi słowami, ale innym głosem.
- Poprawki lektorskie - dogrywasz zdanie własnym głosem i zamieniasz je na głos, którym czytany jest cały materiał, np. na swój klon.
- Kontrola nad tekstem czytanym przez AI - gdy lektor AI źle akcentuje zdanie, nagrywasz je sam i konwertujesz.
Ustawienia do skopiowania
- Model: eleven_multilingual_sts_v2 (także dla angielskiego).
- Usuń szum tła: włączone, chyba że nagranie jest studyjne.
- Nagrywaj tak, jak ma zabrzmieć wynik: tempo, pauzy i emocje przechodzą z oryginału.
- Nagrania dłuższe niż 5 minut tnij na fragmenty w miejscach pauz.
Przez API (przetestowane 28.09.2026 na 6-sekundowym zaszumionym fragmencie):
curl -X POST "https://api.elevenlabs.io/v1/speech-to-speech/VOICE_ID?output_format=mp3_44100_128" \
-H "xi-api-key: $ELEVENLABS_API_KEY" \
-F model_id=eleven_multilingual_sts_v2 \
-F remove_background_noise=true \
-F [email protected] -o nowy-glos.mp3Ile kosztuje Voice Changer
Dokumentacja podaje 1000 kredytów za minutę przetworzonego nagrania i tyle mi naliczono: 425 kredytów za 25,5 s, niezależnie od filtra szumu. Cennik API z 28 września 2026: 0,12 USD (0,46 zł) za minutę, bez VAT. Plan Starter za 6 USD (23,14 zł, 30 tys. kredytów) wystarcza na ok. 30 minut zmiany głosu, Creator za 22 USD (84,85 zł, 121 tys.) na ok. 2 godziny. Pozostałe plany są w tekście ile kosztuje ElevenLabs, a reszta narzędzi w przewodniku ElevenLabs.
Granice
Voice Changer pozwala mówić cudzym głosem, więc zasady są takie same jak przy klonowaniu: głos konkretnej, rozpoznawalnej osoby tylko za jej zgodą. Do postaci w grze, anonimizacji rozmówcy czy lektora z własnego nagrania używaj głosów z biblioteki, zaprojektowanych albo własnego klonu.
Najczęstsze pytania
Jak zmienić głos na nagraniu za pomocą AI?
Wgraj nagranie do Voice Changera w ElevenLabs, wybierz głos docelowy i model wielojęzyczny. W moim teście 25 s po polsku było gotowe w ok. 6 s, bez żadnego błędu w treści.
Czy Voice Changer działa po polsku?
Tak, model eleven_multilingual_sts_v2 obsługuje 29 języków, w tym polski. W moim teście zachował wszystkie 66 słów polskiego monologu.
Ile kosztuje Voice Changer w ElevenLabs?
1000 kredytów za minutę nagrania, przez API 0,12 USD (0,46 zł) za minutę, bez VAT. Mnie 25,5 s kosztowało 425 kredytów.
Czy Voice Changer działa na żywo?
W aplikacji przetwarza nagrania do 5 minut. API ma wersję strumieniową dla programistów, ale to nie jest gotowy modulator głosu do Discorda czy gier.
Źródła i data sprawdzenia
dokumentacja: Voice changer, API: Voice changer, cennik API, cennik planów, model microsoft/wavlm-base-plus-sv. Test własny 28.09.2026: 4 konwersje po 25,5 s (1700 kredytów) plus 6 s testu polecenia curl. Ton podstawowy: librosa pyin. Kurs 3,857 zł/USD. Sprawdzone 28 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.
