› Praca pochodzi z arXiv (cs.AI), złożona 22 września 2026 roku.
› Autorzy to Mattie Terzolo, Mikolaj Sacha, Ayan Sinha i Andrew Rabinovich.Problem: jedna liczba gubi zbyt wiele informacjiPopularna metoda trenowania agentów językowych - Group Relative Policy Optimization (GRPO) i pokrewne algorytmy gradientu polityki - działa tak: agent wykonuje całą wieloetapową sekwencję działań, a na końcu dostaje jedną skalarną nagrodę za cały epizod.
› Autorzy nazywają to "collapsing" (zwijaniem) i twierdzą, że jest to stratne.
› Optymalizator musi sam domyślić się, które konkretne działanie w długiej sekwencji zadecydowało o wyniku i jak zmienić przyszłe zachowanie.