› Puneet Mathur i Dinesh Manocha opublikowali na arXiv (wrzesień 2026) pracę opisującą nowy benchmark o nazwie DuplexSpeechBench-IFEval, w skrócie DSB-IFEval.
› agentów full-duplex - czyli systemów głosowych, które prowadzą rozmowę w czasie rzeczywistym i muszą na bieżąco decydować, kiedy słuchać, kiedy przerywać rozmówcy, kiedy oddawać głos i jak reagować na nakładające się wypowiedzi.Na czym polega problemDotychczasowe benchmarki testowały takie zachowania głównie przez podawanie agentowi wprost napisanych instrukcji: "przerywaj rzadziej", "oddawaj głos po dwóch sekundach" i podobne.
› W praktyce jednak wdrożone systemy otrzymują zazwyczaj opis roli lub persony - na przykład "jesteś formalnym asystentem korporacyjnym" - i mają samodzielnie wywnioskować, jak powinny się zachowywać w rozmowie.
› Autorzy nazywają to "implicit instruction following", czyli podążaniem za instrukcjami niejawnymi.Co zawiera benchmarkDSB-IFEval składa się z 1 038 przypadków testowych obejmujących osiem różnych ról asystenta.