✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Voice Changer ElevenLabs: zmiana głosu AI na nagraniu

Polski monolog zmieniony na głos kobiecy i niski głos lektora: treść, długość i melodia zdań po konwersji oraz jedno ustawienie, które ratuje nagrania z szumem.

6 min czytania
Voice Changer ElevenLabs: zmiana głosu AI na nagraniu

👁 114 przeczytań

Voice Changer w ElevenLabs zmienia głos na gotowym nagraniu: bierze twoją wypowiedź z jej tempem, pauzami i intonacją i podmienia barwę na inny głos. Wcześniej funkcja nazywała się Speech to Speech. Sprawdziłem ją na polskim monologu, który przerobiłem na kobiecy głos i na niski głos lektora, a potem na tym samym nagraniu zagłuszonym gwarem kawiarni, z filtrem szumu i bez niego. Poniżej nagrania, pomiary i jedno ustawienie, bez którego wynik bywa nieczytelny.

W skrócie

Na czystym nagraniu Voice Changer zachował każde słowo (0 błędów na 66), długość co do 0,02 s i melodię zdań (korelacja przebiegu tonu 0,92-0,96), a barwę zmienił na docelową (podobieństwo 0,96). Na nagraniu z gwarem kawiarni bez filtra szumu wyszedł bełkot: 24 błędne słowa na 66. Z włączoną opcją „usuń szum tła” liczba błędów spadła do 3. Minuta kosztuje 1000 kredytów, przez API 0,12 USD (0,46 zł). Dla kogo: lektorzy, twórcy postaci do gier i animacji, anonimizacja głosu w materiałach. Dla kogo nie: rozmowy na żywo na Discordzie i podszywanie się pod konkretne osoby.

0/66błędów treści po zmianie głosu
0,96podobieństwo do głosu docelowego
24 → 3błędy przy szumie: bez filtra i z filtrem
0,46 złcena minuty przez API

Czym Voice Changer różni się od modulatora głosu

Klasyczny modulator głosu przesuwa wysokość i dodaje efekty w czasie rzeczywistym, np. w grze czy na Discordzie. Voice Changer ElevenLabs generuje mowę od nowa innym głosem, zachowując treść i sposób mówienia z oryginału. Jednorazowo przetwarza do 5 minut nagrania (dłuższe trzeba pociąć), a API ma też wersję strumieniową. Do wyboru są dwa modele: eleven_multilingual_sts_v2 dla 29 języków, w tym polskiego, i eleven_english_sts_v2 tylko dla angielskiego. Dokumentacja zaleca model wielojęzyczny nawet dla angielskiego. Głosem docelowym może być gotowy głos z biblioteki, zaprojektowany albo twój klon głosu.

// taniej niż u producentaw magazynie
ElevenLabs Creator - 12 miesięcy
ElevenLabs Creator - 12 miesięcyKupon, którym włączasz ElevenLabs Creator na 12 miesięcy na własnym koncie.kinetyka.pl - mój sklep z rocznymi dostępami do narzędzi AI
430 zł-59%zamiast 1 056 zł35,83 zł / mies.Kup w Kinetyce →

Mój test

Źródło to 25,5-sekundowy monolog o szukaniu mieszkania (66 słów) wygenerowany męskim głosem Chris w modelu Eleven v4. Nie użyłem nagrania żadnej prawdziwej osoby. 28 września 2026 zmieniłem go przez API na dwa głosy: brytyjski kobiecy głos Lily z biblioteki i niskiego polskiego lektora, którego wcześniej zaprojektowałem w Voice Design.

Źródło: głos Chris, 25,5 s po polsku.
Po zmianie na głos Lily.
Po zmianie na zaprojektowany głos lektora.

Wyniki na czystym nagraniu

Zmierzyłem cztery rzeczy: czy treść przeżyła (transkrypcja Scribe), czy zgadza się długość, czy zachowana jest melodia zdań (korelacja przebiegu tonu podstawowego źródła i wyniku, 1 oznacza identyczną linię) oraz czyj głos słychać (podobieństwo WavLM do krótkiej próbki głosu docelowego i źródłowego).

WynikChris → LilyChris → lektor
Błędy treści0 / 660 / 66
Długość (źródło 25,52 s)25,54 s25,54 s
Korelacja melodii zdań0,9630,921
Mediana tonu (źródło 131 Hz)204 Hz96 Hz
Podobieństwo do głosu docelowego0,9630,962
Podobieństwo do Chrisa (źródło: 0,958)0,5920,845
Czas przetwarzania5,5 s5,7 s

Głos docelowy wyszedł w obu przypadkach wyraźnie (0,96). Przy lektorze podobieństwo do Chrisa zostało wysokie, ale to dlatego, że oba głosy są męskie i już przed konwersją miały podobieństwo 0,832. Ton przesunął się tam, gdzie powinien: w górę dla kobiecego głosu, w dół dla niskiego lektora. Pauzy i akcenty zdań zostały na swoich miejscach, co widać po korelacji melodii powyżej 0,9. To moja opinia: to właśnie jest przewaga nad zwykłym czytaniem tekstu, bo emocję i tempo nadajesz swoim nagraniem, a nie poleceniem.

Szum w tle: jedno ustawienie robi całą różnicę

To samo nagranie zmieszałem z gwarem kawiarni o głośności równej mowie (tak samo jak w teście Voice Isolatora) i zmieniłem na głos Lily dwa razy: z opcją remove_background_noise i bez niej.

Zaszumione źródło, bez filtra szumu: 24 błędne słowa na 66.
To samo źródło z filtrem szumu: 3 błędne słowa na 66.

Bez filtra wynik był w dużej części niezrozumiały, np. początek zdania wyszedł jako „Medywanten na sie poł, se nas moch spykac” zamiast „Nagrywam to na szybko, bo zaraz mam spotkanie”. Z filtrem zostały trzy drobne pomyłki, m.in. „znalazłem” zamieniło się w „znalazłam”. Jeśli nagrywasz poza studiem, włączaj tę opcję zawsze.

Do czego się przydaje

  • Postacie w grach i animacjach - jedna osoba nagrywa kwestie kilku bohaterów, a Voice Changer nadaje każdemu inną barwę przy zachowaniu aktorskiej interpretacji.
  • Anonimizacja - rozmówca w reportażu czy materiale szkoleniowym mówi swoimi słowami, ale innym głosem.
  • Poprawki lektorskie - dogrywasz zdanie własnym głosem i zamieniasz je na głos, którym czytany jest cały materiał, np. na swój klon.
  • Kontrola nad tekstem czytanym przez AI - gdy lektor AI źle akcentuje zdanie, nagrywasz je sam i konwertujesz.

Ustawienia do skopiowania

  • Model: eleven_multilingual_sts_v2 (także dla angielskiego).
  • Usuń szum tła: włączone, chyba że nagranie jest studyjne.
  • Nagrywaj tak, jak ma zabrzmieć wynik: tempo, pauzy i emocje przechodzą z oryginału.
  • Nagrania dłuższe niż 5 minut tnij na fragmenty w miejscach pauz.

Przez API (przetestowane 28.09.2026 na 6-sekundowym zaszumionym fragmencie):

curl -X POST "https://api.elevenlabs.io/v1/speech-to-speech/VOICE_ID?output_format=mp3_44100_128" \
  -H "xi-api-key: $ELEVENLABS_API_KEY" \
  -F model_id=eleven_multilingual_sts_v2 \
  -F remove_background_noise=true \
  -F [email protected] -o nowy-glos.mp3

Ile kosztuje Voice Changer

Dokumentacja podaje 1000 kredytów za minutę przetworzonego nagrania i tyle mi naliczono: 425 kredytów za 25,5 s, niezależnie od filtra szumu. Cennik API z 28 września 2026: 0,12 USD (0,46 zł) za minutę, bez VAT. Plan Starter za 6 USD (23,14 zł, 30 tys. kredytów) wystarcza na ok. 30 minut zmiany głosu, Creator za 22 USD (84,85 zł, 121 tys.) na ok. 2 godziny. Pozostałe plany są w tekście ile kosztuje ElevenLabs, a reszta narzędzi w przewodniku ElevenLabs.

Granice

Voice Changer pozwala mówić cudzym głosem, więc zasady są takie same jak przy klonowaniu: głos konkretnej, rozpoznawalnej osoby tylko za jej zgodą. Do postaci w grze, anonimizacji rozmówcy czy lektora z własnego nagrania używaj głosów z biblioteki, zaprojektowanych albo własnego klonu.

Najczęstsze pytania

Jak zmienić głos na nagraniu za pomocą AI?

Wgraj nagranie do Voice Changera w ElevenLabs, wybierz głos docelowy i model wielojęzyczny. W moim teście 25 s po polsku było gotowe w ok. 6 s, bez żadnego błędu w treści.

Czy Voice Changer działa po polsku?

Tak, model eleven_multilingual_sts_v2 obsługuje 29 języków, w tym polski. W moim teście zachował wszystkie 66 słów polskiego monologu.

Ile kosztuje Voice Changer w ElevenLabs?

1000 kredytów za minutę nagrania, przez API 0,12 USD (0,46 zł) za minutę, bez VAT. Mnie 25,5 s kosztowało 425 kredytów.

Czy Voice Changer działa na żywo?

W aplikacji przetwarza nagrania do 5 minut. API ma wersję strumieniową dla programistów, ale to nie jest gotowy modulator głosu do Discorda czy gier.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

dokumentacja: Voice changer, API: Voice changer, cennik API, cennik planów, model microsoft/wavlm-base-plus-sv. Test własny 28.09.2026: 4 konwersje po 25,5 s (1700 kredytów) plus 6 s testu polecenia curl. Ton podstawowy: librosa pyin. Kurs 3,857 zł/USD. Sprawdzone 28 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›