PROMPTOWY_
Newsy

SWE-Gate: agenty AI zdają testy funkcjonalne, ale nie spełniają wymagań code review

promptowy@ai:~$ cat news_1

Artykuł "SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents" autorstwa Xin He, Yanlin Wang, Mingwei Liu, Jiachi Chen, Hongyu Zhang i Guanbin Li trafił na arXiv 3 września 2026 roku.

promptowy@ai:~$ cat news_2

Liczy 11 stron, zawiera 2 rysunki i 5 tabel.Na czym polega problemIstniejące benchmarki oceniające agenty AI do pisania kodu mierzą głównie jedno: czy wygenerowana łatka (patch) przechodzi testy funkcjonalne.

promptowy@ai:~$ cat news_3

Autorzy wskazują, że w prawdziwym procesie wytwarzania oprogramowania kod musi spełniać jeszcze inne wymagania - takie, które wynikają z komentarzy recenzentów podczas przeglądu kodu (code review).

promptowy@ai:~$ cat news_4

Autorzy nazywają je "review-derived acceptance constraints" albo krótko "review constraints".

promptowy@ai:~$ open --full
Czytaj całość

SWE-Gate: agenty AI zdają testy funkcjonalne, ale nie spełniają wymagań code review

Otwórz artykuł na promptowy.com