🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

SWE-Gate: agenty AI zdają testy funkcjonalne, ale nie spełniają wymagań code review

Badacze pokazują, że popularne benchmarki dla agentów programistycznych mierzą tylko to, czy kod działa - a pomijają wymagania wynikające z recenzji kodu. Spośród 644 napraw, które przeszły testy funkcjonalne, aż 221 nie spełniało dodatkowych ograniczeń z code review.

3 min czytania
Orange document icon with several horizontal lines representing text on a dark blue background.

👁 122 przeczytań

Artykuł „SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents” autorstwa Xin He, Yanlin Wang, Mingwei Liu, Jiachi Chen, Hongyu Zhang i Guanbin Li trafił na arXiv 3 września 2026 roku. Liczy 11 stron, zawiera 2 rysunki i 5 tabel.

Na czym polega problem

Istniejące benchmarki oceniające agenty AI do pisania kodu mierzą głównie jedno: czy wygenerowana łatka (patch) przechodzi testy funkcjonalne. Autorzy wskazują, że w prawdziwym procesie wytwarzania oprogramowania kod musi spełniać jeszcze inne wymagania - takie, które wynikają z komentarzy recenzentów podczas przeglądu kodu (code review). Autorzy nazywają je „review-derived acceptance constraints” albo krótko „review constraints”. Dotychczasowe benchmarki te ograniczenia pomijają.

Czym jest SWE-Gate

SWE-Gate to nowy benchmark działający na poziomie całego repozytorium, który ocenia agenty programistyczne pod kątem obu wymiarów jednocześnie: poprawności funkcjonalnej oraz zgodności z ograniczeniami z recenzji kodu. Benchmark zbudowano na bazie prawdziwych komentarzy z pull requestów - stamtąd pochodzi definicja ograniczeń. Na ich podstawie stworzono instancje zadań naprawczych.

Każda instancja zawiera osobne testy funkcjonalne i testy sprawdzające ograniczenia z recenzji, a także dwa warianty łatek: niezgodną z wymaganiami oraz wzorcową (gold patch). Taka struktura pozwala wyraźnie rozdzielić zdolność do rozwiązania zgłoszonego problemu od zdolności do spełnienia pełnej specyfikacji naprawy.

Dane liczbowe

Benchmark składa się z 303 instancji zadań naprawczych na poziomie repozytorium, obejmujących 75 otwarto-źródłowych repozytoriów Pythona z różnych dziedzin oprogramowania. W eksperymentach użyto czterech różnych modeli językowych o zróżnicowanych możliwościach, uruchomionych w ramach wspólnego szkieletu agenta programistycznego.

Kluczowy wynik: spośród 644 napraw, które przeszły testy funkcjonalne, 221 nie spełniało dostarczonych ograniczeń z recenzji kodu. Oznacza to, że ocenianie wyłącznie na podstawie testów funkcjonalnych zawyża szacowaną skuteczność agentów przy pełnej specyfikacji zadania naprawczego.

Wniosek autorów

Autorzy stwierdzają wprost, że „functional-only evaluation overestimates agents’ ability to satisfy the full requirements of repository-level repair tasks”. Innymi słowy, benchmark, który patrzy tylko na to, czy kod działa, daje zbyt optymistyczny obraz tego, jak dobrze agent poradziłby sobie w realnym projekcie - gdzie recenzenci mają konkretne oczekiwania co do stylu, struktury czy podejścia do rozwiązania problemu.

Kod, dane i wyniki eksperymentów są dostępne w repozytorium wskazanym w artykule. Artykuł nie podaje natomiast szczegółów dotyczących tego, jakie konkretnie rodzaje ograniczeń z recenzji najczęściej sprawiają problem agentom, ani nie wymienia z nazwy żadnego z czterech testowanych modeli językowych.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem to badanie wskazuje na realną lukę w tym, jak środowisko AI mierzy postęp agentów do programowania. Liczba 221 niepowodzeń na 644 pozornych sukcesów to ponad jedna trzecia - trudno to zbagatelizować. Praktyczny wniosek jest taki, że firmy i zespoły, które wybierają narzędzia do automatycznego łatania kodu wyłącznie na podstawie wyników w popularnych benchmarkach funkcjonalnych, mogą być niemile zaskoczone, gdy agent zacznie pracować z prawdziwym repozytorium, gdzie obowiązują wewnętrzne konwencje i standardy recenzji. SWE-Gate daje konkretne narzędzie do bardziej realistycznej oceny - choć benchmark obejmuje tylko Pythona i 75 repozytoriów, więc jego zakres jest ograniczony.

Źródło: arXiv cs.AI: SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents (dokument z 2026-09-04). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie