PROMPTOWY_
Newsy

DuplexSpeechBench-IFEval: jak testować głosowych asystentów AI w czasie rzeczywistym

promptowy@ai:~$ cat news_1

Puneet Mathur i Dinesh Manocha opublikowali na arXiv (wrzesień 2026) pracę opisującą nowy benchmark o nazwie DuplexSpeechBench-IFEval, w skrócie DSB-IFEval.

promptowy@ai:~$ cat news_2

agentów full-duplex - czyli systemów głosowych, które prowadzą rozmowę w czasie rzeczywistym i muszą na bieżąco decydować, kiedy słuchać, kiedy przerywać rozmówcy, kiedy oddawać głos i jak reagować na nakładające się wypowiedzi.Na czym polega problemDotychczasowe benchmarki testowały takie zachowania głównie przez podawanie agentowi wprost napisanych instrukcji: "przerywaj rzadziej", "oddawaj głos po dwóch sekundach" i podobne.

promptowy@ai:~$ cat news_3

W praktyce jednak wdrożone systemy otrzymują zazwyczaj opis roli lub persony - na przykład "jesteś formalnym asystentem korporacyjnym" - i mają samodzielnie wywnioskować, jak powinny się zachowywać w rozmowie.

promptowy@ai:~$ cat news_4

Autorzy nazywają to "implicit instruction following", czyli podążaniem za instrukcjami niejawnymi.Co zawiera benchmarkDSB-IFEval składa się z 1 038 przypadków testowych obejmujących osiem różnych ról asystenta.

promptowy@ai:~$ open --full
Czytaj całość

DuplexSpeechBench-IFEval: jak testować głosowych asystentów AI w czasie rzeczywistym

Otwórz artykuł na promptowy.com