OSReward: czy modele VLM potrafią oceniać agentów komputerowych?
Badacze stworzyli benchmark OSReward, który sprawdza, czy modele wizualno-językowe są wiarygodnymi sędziami agentów sterujących komputerem. Okazuje się, że nawet najlepsze modele mają systematyczną tendencję do zaliczania zadań, które agent wykonał błędnie.
👁 127 przeczytań
Artykuł pochodzi z arXiv (cs.AI), został złożony 30 lipca 2026 roku, a poprawiona wersja ukazała się 6 sierpnia 2026. Autorów jest 23, na czele z Qiushi Sun. Praca jest oznaczona jako „work in progress”.
O co chodzi z agentami komputerowymi
Agenty komputerowe (computer-using agents, CUA) to systemy, które samodzielnie obsługują komputer - klikają, wpisują tekst, poruszają się po interfejsach graficznych. Każda sesja pracy agenta zapisywana jest jako trajektoria: sekwencja działań, stanów ekranu i rozumowania. Żeby ocenić, czy agent wykonał zadanie poprawnie, trzeba tę trajektorię zweryfikować. Ani ręczne pisanie weryfikatorów, ani ludzcy anotatorzy nie skalują się wystarczająco, więc do oceny coraz częściej używa się modeli wizualno-językowych (VLM) jako automatycznych sędziów.
Problem, który dotąd ignorowano
Autorzy stawiają jedno centralne pytanie: czy te modele-sędziowie są wystarczająco wiarygodne? Jak piszą, to pytanie przez długi czas pozostawało bez systematycznej odpowiedzi. Żeby je zbadać, stworzyli benchmark OSReward - zbiór trajektorii z różnych platform, wykonanych przez różne modele agentów działające według instrukcji zweryfikowanych przez ludzi. Trajektorie zostały następnie ręcznie opatrzone etykietami poprawności w wieloetapowym procesie anotacji.
Co zawiera OSReward
Na bazie głównego benchmarku powstały dwa dodatkowe zbiory: OSReward-Hard, koncentrujący się na przypadkach genuinely trudnych (autorzy używają tego słowa wprost), oraz OSReward-Multi służący do oceny efektywności i stopnia dopasowania w bardziej szczegółowym ujęciu. Dokument nie precyzuje dokładnych liczb przykładów w tych zbiorach - te informacje nie pojawiają się w abstrakcie.
Wyniki ewaluacji
Autorzy przeprowadzili - jak sami określają - najbardziej kompleksową do tej pory ewaluację modeli-sędziów VLM. Wnioski są krytyczne: nawet modele z kategorii state-of-the-art nie spełniają wymagań idealnego sędziego. Wszystkie badane modele dzielą jeden systematyczny błąd: leniency bias, czyli tendencję do zbyt łagodnej oceny. W praktyce oznacza to, że modele błędnie klasyfikują nieudane przebiegi jako sukcesy. Modele wystarczająco wiarygodne, żeby im zaufać, są zbyt drogie do stosowania na dużą skalę. Tańsze modele open-source znacząco odstają od tej grupy.
Proponowane rozwiązanie
Żeby wypełnić tę lukę, autorzy zbudowali i udostępniają publicznie zbiór OS-Shepherd-100K - korpus 100 000 ocen trajektorii wzbogaconych o adnotacje rozumowania. Na jego podstawie wytrenowali dwa modele nagród: OS-Shepherd w wersji 9B i 35B parametrów. Według autorów modele te dostarczają stabilnych i wiarygodnych sygnałów nagród przy koszcie 30-60 razy niższym niż modele frontierowe przy porównywalnej jakości oceny. Kod, benchmark, zbiór danych i checkpointy modeli są publicznie dostępne.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem ten artykuł dotyka realnego problemu infrastrukturalnego w budowaniu agentów AI - bez wiarygodnego systemu oceny trudno trenować modele przez reinforcement learning i trudno zbierać dane dobrej jakości. Wynik o systematycznym leniency bias to konkretna, niepokojąca obserwacja: modele, które powszechnie stosuje się do ewaluacji agentów, mogą masowo zawyżać ich skuteczność. Fakt, że autorzy oferują alternatywę 30-60 razy tańszą od modeli frontierowych, brzmi obiecująco - ale artykuł jest pracą w toku i nie ma tu jeszcze niezależnej weryfikacji tych twierdzeń. Warto śledzić, czy te wyniki potwierdzą się w kolejnych wersjach.
Źródło: arXiv cs.AI: OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models (dokument z 2026-08-07). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


