🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 9 szt. albo Gemini Pro na 18 miesięcy 170 zł Kup teraz →
Przejdź do treści
Newsy

Agent zaliczy zadanie raz. Czy zrobi to samo przy kolejnym podejściu?

IBM Research opublikował analizę pokazującą, że agent AI oparty na GPT-4.1 osiąga 77,4% skuteczności średnio, ale tylko w 53% zadań radzi sobie poprawnie przy każdym z pięciu powtórzeń.

2 min czytania
Agent zaliczy zadanie raz. Czy zrobi to samo przy kolejnym podejściu?

👁 115 przeczytań

Zespół IBM Research opublikował na Hugging Face analizę problemu powtarzalności agentów AI, która wskazuje na zasadnicze pęknięcie między tym, co pokazują benchmarki, a tym, czego rzeczywiście potrzebują użytkownicy produkcyjni.

Agent ReAct oparty na GPT-4.1, testowany na zbiorze AppWorld test_normal, uzyska poprawną odpowiedź średnio w 77,4% przypadków. To liczba, którą widać na liderboardach. Ale jeśli to samo zadanie powtórzyć pięć razy i wymagać, żeby agent zdał wszystkie pięć prób - odsetek spada do 53,0%. Luka wynosi 24,4 punktu procentowego. Na najtrudniejszych zadaniach sięga 30 punktów.

materiał wideo ze źródła

Różnica między tymi dwoma metrykami nie jest techniczną ciekawostką. W kontekście produkcyjnym - weryfikacja zobowiązań w umowie, uzgadnianie transakcji finansowej - workflow, który raz się powiódł, a raz zawiódł przy identycznym żądaniu, jest problemem, nie statystyką.

Dwie metryki, dwa pytania

Badacze zwracają uwagę na istotną różnicę terminologiczną. Mean@k - odpowiada na pytanie: jak dobry jest agent średnio? Pass^k (nie mylić z popularnym Pass@k) odpowiada na pytanie, które zadaje sobie rzeczywisty użytkownik: czy agent za każdym razem wykona to samo zadanie poprawnie? Pass@k jest optymistyczne - wystarczy jeden sukces z k prób. Pass^k jest pesymistyczne - każda próba musi się udać. Większość benchmarków raportuje wyłącznie tę pierwszą liczbę.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Diagnoza i leczenie

IBM Research zbudował Consistency Analyzer - narzędzie, które analizuje zapisaną trajektorię agenta i szuka punktów decyzyjnych, w których model był o jeden token od wybrania innej ścieżki. Co ważne, narzędzie działa na jednej zapisanej trajektorii i nie wymaga ground truth ani ponownego uruchamiania całego zadania. W każdym punkcie decyzyjnym pobiera k=5 uzupełnień jednym dodatkowym wywołaniem modelu.

Na podstawie tej diagnozy system ALTK-Evolve generuje tzw. consistency guidelines - wytyczne spójności wstrzykiwane agentowi w czasie inferencji. Efekt: luka Pass^5 spada z 24,4 do 12,0 pp. W zadaniach tego samego typu wynik Pass^5 rośnie o 16,0 pp, w zadaniach podobnych - o 13,0 pp. Średnia dokładność nie spada.

Pełna metodologia i wyniki są dostępne w raporcie technicznym na arXiv.

To ciekawe przypomnienie, że poprawa średniej dokładności o kilka punktów może być mniej wartościowa niż sprawienie, żeby agent przestał losować odpowiedź przy tym samym pytaniu.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie