✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Voicebot na ElevenLabs Agents: test polskiej infolinii

Zbudowałem fikcyjną recepcję gabinetu i przeprowadziłem z nią rozmowę głosową po polsku: czas reakcji, rozpoznawanie mowy, koszt minuty i jedna pułapka.

6 min czytania
Voicebot na ElevenLabs Agents: test polskiej infolinii

👁 114 przeczytań

Voicebot, czyli agent głosowy, który odbiera telefon, rozumie mowę i odpowiada głosem, da się dziś zbudować w ElevenLabs Agents, w panelu nawet bez pisania kodu. Ja postawiłem przez API fikcyjną recepcję gabinetu stomatologicznego, przeprowadziłem z nią prawdziwą rozmowę głosową po polsku (dzwonił syntetyczny głos, nie człowiek) i zmierzyłem czas reakcji, trafność rozpoznawania mowy i koszt minuty. Dołożyłem dwie symulowane rozmowy z trudnymi pacjentami. Nagranie całej rozmowy jest niżej.

W skrócie

Agent odpowiadał po 0,9-2,3 s (mediana 1,16 s), bezbłędnie rozpoznał wszystkie 5 wypowiedzi rozmówcy razem z numerem telefonu i nie wymyślił ani jednego terminu czy ceny spoza instrukcji. Dwuminutowa rozmowa zużyła 654 kredyty, a według cennika minuta ponad pakiet kosztuje 0,08 USD (0,31 zł) plus model językowy. Słaby punkt: agent obiecywał przełączenie do rejestracji, choć nie dałem mu takiej możliwości. Dla kogo: umawianie wizyt, godziny otwarcia, proste zamówienia, pierwsza linia infolinii. Dla kogo nie: sprawy wymagające decyzji człowieka, jeśli nie skonfigurujesz przekierowania.

1,16 smediana czasu odpowiedzi agenta
5/5wypowiedzi rozpoznanych bez błędu
654kredyty za rozmowę 119 s
0,31 złminuta rozmowy ponad pakiet (bez LLM)

Z czego składa się voicebot w ElevenLabs

ElevenAgents (wcześniej Conversational AI) łączy trzy elementy: rozpoznawanie mowy (u mnie Scribe Realtime), model językowy, który decyduje, co powiedzieć, i syntezę mowy (u mnie Eleven v4 Turbo). Do tego wykrywanie końca wypowiedzi, obsługa wtrąceń, baza wiedzy, narzędzia (np. zapis do kalendarza, przełączenie na numer telefonu) i integracje telefoniczne. Agenta tworzysz w panelu albo przez API, a rozmawiać z nim można w przeglądarce, w aplikacji lub przez numer telefonu.

// taniej niż u producentaw magazynie
ElevenLabs Creator - 12 miesięcy
ElevenLabs Creator - 12 miesięcyKupon, którym włączasz ElevenLabs Creator na 12 miesięcy na własnym koncie.kinetyka.pl - mój sklep z rocznymi dostępami do narzędzi AI
430 zł-59%zamiast 1 056 zł35,83 zł / mies.Kup w Kinetyce →

Mój agent: recepcja gabinetu „Uśmiech”

28 września 2026 utworzyłem agenta przez API z językiem polskim, głosem Matilda i modelem Eleven v4 Turbo. Modelu językowego nie zmieniałem. Platforma przypisała domyślnie model qwen35-397b-a17b. Instrukcja do skopiowania:

Jesteś Olą, wirtualną recepcjonistką fikcyjnego Gabinetu Stomatologicznego
Uśmiech w Lublinie, ul. Narutowicza 12. Rozmawiasz przez telefon, po polsku,
krótko: jedno lub dwa zdania na odpowiedź.
Cennik: przegląd 150 zł, skaling z piaskowaniem 280 zł, wypełnienie od 250 zł.
Wolne terminy w przyszłym tygodniu: wtorek 15:30 i 17:00, czwartek 9:00.
Innych terminów nie ma.
Godziny otwarcia: poniedziałek-piątek 8:00-19:00.
Zasady: przy rezerwacji zbierz imię, nazwisko i numer telefonu, powtórz numer
do potwierdzenia. Nie udzielaj porad medycznych ani nie oceniaj, czy zabieg
będzie bolał - powiedz, że to omówi lekarz, i zaproponuj przekazanie rozmowy
do rejestracji. Nie wymyślaj terminów ani cen spoza tej listy.

Pierwsza wypowiedź: „Dzień dobry, Gabinet Stomatologiczny Uśmiech, mówi wirtualna asystentka Ola. W czym mogę pomóc?”. Od razu mówi, że to nie człowiek, co przy infolinii uważam za obowiązek. Więcej o tym w tekście o prawie do rozmowy z człowiekiem.

Test 1: prawdziwa rozmowa głosowa

Połączyłem się z agentem przez WebSocket, tak jak robi to przeglądarka. Rozmówcą był syntetyczny polski głos, który zaprojektowałem w teście klonowania głosu. Pięć jego wypowiedzi wysyłałem w czasie rzeczywistym, w paczkach po 100 ms, i mierzyłem czas od końca wypowiedzi do pierwszego pakietu odpowiedzi. Scenariusz: umówienie przeglądu, pytanie o cenę, podanie danych, pytanie o ból i pożegnanie.

Cała rozmowa, 2 minuty. Oba głosy są syntetyczne, pauzy odpowiadają zmierzonym czasom reakcji.
Wypowiedź rozmówcyCzas reakcjiCo zrobił agent
Chcę umówić przegląd i czyszczenie, macie coś w przyszłym tygodniu?0,87 spodał dokładnie trzy terminy z listy
Najlepiej wtorek po południu. Ile to będzie razem?0,99 s150 + 280 = 430 zł, policzone poprawnie
Wtorek 17:00, Tomasz Testowy, numer 502 134 9871,62 spowtórzył numer i potwierdził rezerwację
Czy czyszczenie będzie bolało? Mam wrażliwe zęby.1,16 sodmówił oceny, odesłał do lekarza
Dziękuję, do widzenia.2,29 spożegnał się

Rozpoznawanie mowy nie pomyliło żadnego słowa, także numeru telefonu podanego słownie w trzech grupach. Czas reakcji mierzyłem z Polski, bez sieci telefonicznej, która doda swoje opóźnienie. Średnia wyszła 1,39 s. To moja opinia: poniżej 1,2 s rozmowa brzmi naturalnie, przy 2,3 s pauza jest już wyraźna, ale jeszcze nie niezręczna.

Przy pierwszej próbie mój skrypt zaczął mówić, zanim agent skończył powitanie. Przerwał wypowiedź i zaczął słuchać. Wtrącanie się działa więc tak jak w rozmowie z człowiekiem.

Test 2: symulowani trudni pacjenci

ElevenLabs pozwala sprawdzić agenta rozmową z innym modelem, który gra klienta, i ocenić wynik własnymi kryteriami. Ustawiłem dwa: „bez zmyślonych terminów i cen” oraz „bez porad medycznych”.

  • Pacjent chce tylko sobotę i naciska. Agent trzy razy odmówił, trzymając się godzin otwarcia, i zaproponował terminy z listy. Oba kryteria: spełnione.
  • Pacjent twierdzi, że znajomy dostał 30% rabatu, i pyta o lek przeciwbólowy. Agent nie potwierdził rabatu, podał cenę z cennika i odesłał pytanie o lek do lekarza. Oba kryteria: spełnione.

W obu symulacjach i w rozmowie głosowej powtórzył się jednak ten sam problem: agent mówił „przekażę prośbę recepcjonistce” albo „połączę pana z rejestracją”, choć nie skonfigurowałem żadnego przekierowania. Sam go do tego skłoniłem instrukcją, ale w prawdziwej infolinii to obietnica bez pokrycia. Przed wdrożeniem dodaj narzędzie przełączenia na numer albo usuń takie zdanie z instrukcji.

Symulację uruchomisz jednym poleceniem (przetestowane 28.09.2026):

curl -X POST https://api.elevenlabs.io/v1/convai/agents/AGENT_ID/simulate-conversation \
  -H "xi-api-key: $ELEVENLABS_API_KEY" -H "Content-Type: application/json" \
  -d '{"simulation_specification":{"simulated_user_config":{"prompt":{"prompt":"Jestes pacjentem. Mowisz po polsku, krotko. Pytasz, czy gabinet przyjmuje w niedziele."},"language":"pl"}},"new_turns_limit":4}'

Ile kosztuje voicebot w ElevenLabs

Plan (28.09.2026, bez VAT)CenaMinuty rozmów w pakiecieRozmowy jednocześnie
Free0 zł154
Starter6 USD (23,14 zł)756
Creator22 USD (84,85 zł)27510
Pro99 USD (381,84 zł)123820
Scale299 USD (1153,24 zł)373830
Business990 USD (3818,43 zł)12 37540

Minuta ponad pakiet kosztuje 0,08 USD (0,31 zł), w trybie burst przy przekroczeniu limitu rozmów jednoczesnych 0,16 USD (0,62 zł), a wiadomość tekstowa 0,003 USD. Model językowy jest rozliczany osobno. Moja 119-sekundowa rozmowa zużyła 548 kredytów za głos i 106 za model językowy, który kosztował 0,0127 USD (0,05 zł). Opłaty operatora telefonii dochodzą osobno. Pozostałe koszty ElevenLabs są w tekście ile kosztuje ElevenLabs.

Czego nie sprawdziłem

Nie podłączałem numeru telefonu (Twilio, SIP), więc nie mierzyłem jakości przez sieć komórkową. Nie sprawdzałem też bazy wiedzy ani narzędzi zapisujących wizytę w kalendarzu. Rozmówca był syntetyczny i mówił wyraźnie. Prawdziwy pacjent z szumem ulicy w tle będzie trudniejszy dla rozpoznawania mowy, co widać w moim teście Scribe na nagraniach z szumem. Pełny przegląd narzędzi jest w przewodniku ElevenLabs.

Najczęstsze pytania

Czy voicebot ElevenLabs mówi po polsku?

Tak. Mój agent rozumiał i mówił po polsku, a rozpoznawanie mowy przepisało bez błędu wszystkie 5 wypowiedzi rozmówcy, łącznie z numerem telefonu.

Ile kosztuje minuta rozmowy z agentem ElevenLabs?

Ponad pakiet w planie 0,08 USD (0,31 zł) za minutę plus koszt modelu językowego, bez VAT. Plany mają od 15 do 12 375 minut w cenie.

Jak szybko odpowiada agent głosowy ElevenLabs?

W moim teście od 0,87 do 2,29 s po zakończeniu wypowiedzi, mediana 1,16 s. Pomiar nie obejmuje opóźnienia sieci telefonicznej.

Czy agent ElevenLabs może odebrać telefon?

Tak, przez integracje telefoniczne, np. Twilio albo SIP. Tego wariantu nie sprawdzałem, rozmawiałem z agentem przez WebSocket.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

cennik ElevenAgents, pomoc: ile kosztuje ElevenAgents, dokumentacja: WebSocket, dokumentacja: symulacja rozmów, API: Create agent. Test własny 28.09.2026: 2 rozmowy głosowe po 119 s (1323 kredyty), 3 symulacje tekstowe. Kurs 3,857 zł/USD. Sprawdzone 28 września 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Link do ElevenLabs jest partnerski: jeśli kupisz przez niego, serwis dostaje prowizję, a Ty płacisz tyle samo. Nie wpływa to na treść, także tam, gdzie piszę krytycznie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›