Agent zaliczy zadanie raz. Czy zrobi to samo przy kolejnym podejściu?
IBM Research opublikował analizę pokazującą, że agent AI oparty na GPT-4.1 osiąga 77,4% skuteczności średnio, ale tylko w 53% zadań radzi sobie poprawnie przy każdym z pięciu powtórzeń.

👁 115 przeczytań
Zespół IBM Research opublikował na Hugging Face analizę problemu powtarzalności agentów AI, która wskazuje na zasadnicze pęknięcie między tym, co pokazują benchmarki, a tym, czego rzeczywiście potrzebują użytkownicy produkcyjni.
Agent ReAct oparty na GPT-4.1, testowany na zbiorze AppWorld test_normal, uzyska poprawną odpowiedź średnio w 77,4% przypadków. To liczba, którą widać na liderboardach. Ale jeśli to samo zadanie powtórzyć pięć razy i wymagać, żeby agent zdał wszystkie pięć prób - odsetek spada do 53,0%. Luka wynosi 24,4 punktu procentowego. Na najtrudniejszych zadaniach sięga 30 punktów.
Różnica między tymi dwoma metrykami nie jest techniczną ciekawostką. W kontekście produkcyjnym - weryfikacja zobowiązań w umowie, uzgadnianie transakcji finansowej - workflow, który raz się powiódł, a raz zawiódł przy identycznym żądaniu, jest problemem, nie statystyką.
Dwie metryki, dwa pytania
Badacze zwracają uwagę na istotną różnicę terminologiczną. Mean@k - odpowiada na pytanie: jak dobry jest agent średnio? Pass^k (nie mylić z popularnym Pass@k) odpowiada na pytanie, które zadaje sobie rzeczywisty użytkownik: czy agent za każdym razem wykona to samo zadanie poprawnie? Pass@k jest optymistyczne - wystarczy jeden sukces z k prób. Pass^k jest pesymistyczne - każda próba musi się udać. Większość benchmarków raportuje wyłącznie tę pierwszą liczbę.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Diagnoza i leczenie
IBM Research zbudował Consistency Analyzer - narzędzie, które analizuje zapisaną trajektorię agenta i szuka punktów decyzyjnych, w których model był o jeden token od wybrania innej ścieżki. Co ważne, narzędzie działa na jednej zapisanej trajektorii i nie wymaga ground truth ani ponownego uruchamiania całego zadania. W każdym punkcie decyzyjnym pobiera k=5 uzupełnień jednym dodatkowym wywołaniem modelu.
Na podstawie tej diagnozy system ALTK-Evolve generuje tzw. consistency guidelines - wytyczne spójności wstrzykiwane agentowi w czasie inferencji. Efekt: luka Pass^5 spada z 24,4 do 12,0 pp. W zadaniach tego samego typu wynik Pass^5 rośnie o 16,0 pp, w zadaniach podobnych - o 13,0 pp. Średnia dokładność nie spada.
Pełna metodologia i wyniki są dostępne w raporcie technicznym na arXiv.
To ciekawe przypomnienie, że poprawa średniej dokładności o kilka punktów może być mniej wartościowa niż sprawienie, żeby agent przestał losować odpowiedź przy tym samym pytaniu.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
