🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

DuplexSpeechBench-IFEval: jak testować głosowych asystentów AI w czasie rzeczywistym

Badacze stworzyli benchmark do oceny, czy głosowe agenty AI potrafią wnioskować odpowiednie zachowanie z przypisanej im roli - bez dosłownych instrukcji. Testy na sześciu systemach pokazują wyraźne różnice architekturalne i jeden wspólny problem: konflikty bezpieczeństwa.

3 min czytania
Orange outline of a simple document with lines representing text, centered on a dark blue background

👁 124 przeczytań

Puneet Mathur i Dinesh Manocha opublikowali na arXiv (wrzesień 2026) pracę opisującą nowy benchmark o nazwie DuplexSpeechBench-IFEval, w skrócie DSB-IFEval. Dotyczy on tzw. agentów full-duplex - czyli systemów głosowych, które prowadzą rozmowę w czasie rzeczywistym i muszą na bieżąco decydować, kiedy słuchać, kiedy przerywać rozmówcy, kiedy oddawać głos i jak reagować na nakładające się wypowiedzi.

Na czym polega problem

Dotychczasowe benchmarki testowały takie zachowania głównie przez podawanie agentowi wprost napisanych instrukcji: „przerywaj rzadziej”, „oddawaj głos po dwóch sekundach” i podobne. W praktyce jednak wdrożone systemy otrzymują zazwyczaj opis roli lub persony - na przykład „jesteś formalnym asystentem korporacyjnym” - i mają samodzielnie wywnioskować, jak powinny się zachowywać w rozmowie. Autorzy nazywają to „implicit instruction following”, czyli podążaniem za instrukcjami niejawnymi.

Co zawiera benchmark

DSB-IFEval składa się z 1 038 przypadków testowych obejmujących osiem różnych ról asystenta. Każdy przypadek jest oceniany w pięciu wariantach konfiguracji instrukcji: domyślne zachowanie, jawne instrukcje behawioralne, zachowanie wynikające z persony, połączenie persony z regułami oraz konflikty między instrukcjami. Do pomiaru używane są dwa wskaźniki: deterministyczny IAS (Instruction Adherence Score), mierzący zarządzanie głosem w czasie rzeczywistym, oraz LLM-judged PAS (Persona Adherence Score), oceniający spójność treści z przypisaną personą.

Wyniki na sześciu systemach

Autorzy przetestowali sześć systemów czasu rzeczywistego. Modele full-duplex - F-Actor i PersonaPlex - okazały się wrażliwe na to, czy instrukcje są podane jawnie czy wynikają tylko z persony: adherencja spadła odpowiednio o 9,7% i 4,5% przy kondycjonowaniu wyłącznie personą. Z kolei GPT-Realtime, MiniCPM-o i Fun-Audio-Chat dobrze trzymają się treści spójnej z personą, ale ich zachowanie w zakresie zarządzania głosem nie adaptuje się między trybem jawnych instrukcji a trybem persony i pozostaje ograniczone w kilku proaktywnych działaniach.

Konflikty i bezpieczeństwo

Osobnym wątkiem jest sytuacja, gdy instrukcje są ze sobą sprzeczne. Autorzy zauważają, że nawet jeśli systemy niezawodnie wykonują sprzeczne dyrektywy zgodne z przypisaną personą, nadal mają trudności z ich nadpisaniem w przypadku konfliktu bezpieczeństwa. Innymi słowy: agent może być podatny na polecenia łamiące wytyczne bezpieczeństwa, jeśli te polecenia wpisują się w jego zdefiniowaną rolę.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Wnioski autorów

Praca jest według informacji na arXiv w trakcie recenzji („Under Submission”). Autorzy podsumowują, że wnioskowanie zachowania implikowanego przez rolę, wykonanie go w odpowiednim momencie rozmowy oraz rozwiązywanie konkurujących instrukcji to trzy odrębne wyzwania - i żaden z testowanych systemów nie radzi sobie z nimi jednakowo dobrze. Szczegółowe dane dotyczące poszczególnych systemów, poza wymienionymi wartościami procentowymi, nie są dostępne w abstrakcie.

Co z tego wynika. Moim zdaniem ta praca wskazuje na lukę, która w dotychczasowych testach była łatwa do przeoczenia: liczy się nie tylko to, czy agent rozumie rozkazy, ale czy potrafi wywnioskować zachowanie z kontekstu roli - tak jak robi to człowiek. Niepokojący jest przy tym wynik dotyczący bezpieczeństwa: jeśli systemy nie potrafią nadpisać instrukcji sprzecznych z zasadami bezpieczeństwa, gdy te instrukcje „pasują do persony”, to projektowanie ról dla agentów głosowych staje się problemem nie tylko technicznym, ale i bezpieczeństwa wdrożenia. Benchmark jest jednak opisany tylko w abstrakcie, więc na pełną ocenę metodologii trzeba poczekać na publikację.

Źródło: arXiv cs.AI: DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents (dokument z 2026-09-04). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie