PROMPTOWY_
Newsy

RLDS: rozkład zadań na podzadania poprawia uczenie przez wzmacnianie agentów LLM

promptowy@ai:~$ cat news_1

› Praca pochodzi z arXiv (cs.AI), złożona 22 września 2026 roku.

promptowy@ai:~$ cat news_2

› Autorzy to Mattie Terzolo, Mikolaj Sacha, Ayan Sinha i Andrew Rabinovich.Problem: jedna liczba gubi zbyt wiele informacjiPopularna metoda trenowania agentów językowych - Group Relative Policy Optimization (GRPO) i pokrewne algorytmy gradientu polityki - działa tak: agent wykonuje całą wieloetapową sekwencję działań, a na końcu dostaje jedną skalarną nagrodę za cały epizod.

promptowy@ai:~$ cat news_3

› Autorzy nazywają to "collapsing" (zwijaniem) i twierdzą, że jest to stratne.

promptowy@ai:~$ cat news_4

› Optymalizator musi sam domyślić się, które konkretne działanie w długiej sekwencji zadecydowało o wyniku i jak zmienić przyszłe zachowanie.

promptowy@ai:~$ open --full
Czytaj całość

RLDS: rozkład zadań na podzadania poprawia uczenie przez wzmacnianie agentów LLM

Otwórz artykuł na promptowy.com