› Artykuł "SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents" autorstwa Xin He, Yanlin Wang, Mingwei Liu, Jiachi Chen, Hongyu Zhang i Guanbin Li trafił na arXiv 3 września 2026 roku.
› Liczy 11 stron, zawiera 2 rysunki i 5 tabel.Na czym polega problemIstniejące benchmarki oceniające agenty AI do pisania kodu mierzą głównie jedno: czy wygenerowana łatka (patch) przechodzi testy funkcjonalne.
› Autorzy wskazują, że w prawdziwym procesie wytwarzania oprogramowania kod musi spełniać jeszcze inne wymagania - takie, które wynikają z komentarzy recenzentów podczas przeglądu kodu (code review).
› Autorzy nazywają je "review-derived acceptance constraints" albo krótko "review constraints".