RLDS: rozkład zadań na podzadania poprawia uczenie przez wzmacnianie agentów LLM
Badacze proponują metodę RLDS, która zamiast jednej skalarnej nagrody za całą trajektorię przypisuje agentowi osobne nagrody za każde podzadanie. Na czterech testach wyniki rosną nawet o ponad 11 punktów - ale tylko tam, gdzie zadania są wystarczająco zróżnicowane.

👁 120 przeczytań
Praca pochodzi z arXiv (cs.AI), złożona 22 września 2026 roku. Autorzy to Mattie Terzolo, Mikolaj Sacha, Ayan Sinha i Andrew Rabinovich.
Problem: jedna liczba gubi zbyt wiele informacji
Popularna metoda trenowania agentów językowych - Group Relative Policy Optimization (GRPO) i pokrewne algorytmy gradientu polityki - działa tak: agent wykonuje całą wieloetapową sekwencję działań, a na końcu dostaje jedną skalarną nagrodę za cały epizod. Autorzy nazywają to „collapsing” (zwijaniem) i twierdzą, że jest to stratne. Optymalizator musi sam domyślić się, które konkretne działanie w długiej sekwencji zadecydowało o wyniku i jak zmienić przyszłe zachowanie. Gdy zadanie składa się z kilku różnych umiejętności, a informacja zwrotna z otoczenia jest rzadka i opóźniona, ta rekonstrukcja bywa zawodna.
Rozwiązanie: RLDS i mechanizm SDAE
Autorzy proponują podejście o nazwie Reinforcement Learning with Decomposed Subtasks (RLDS). Jego sercem jest Subtask-Decomposed Advantage Estimation (SDAE) - zamiennik dla skalarnej przewagi (advantage) z GRPO. Mechanizm działa następująco: nagroda za całą trajektorię jest dzielona na udziały przypisane poszczególnym podzadaniom zgodnie z ustaloną taksonomią. Dla każdego podzadania liczona jest osobna przewaga relatywna w grupie. Następnie kredyt na poziomie tokenu jest przypisywany przez ważenie przewagi każdego podzadania jego ważnością - i koncentrowany wokół kroku, w którym „refleksja” (reflection) oznacza wykonanie danego podzadania jako istotne dla wyniku. Dokument nie wyjaśnia szczegółowo, jak ta refleksja jest implementowana technicznie - tego w abstrakcie po prostu nie ma.
Testy na czterech benchmarkach
Autorzy oceniają RLDS na czterech zadaniach agentowych:
FrozenLake - rzadka nawigacja po siatce. Wynik: +9,8 punktu, przedział ufności 95% metodą paired-bootstrap: [+7,0; +12,8].
HotpotQA - wieloetapowe pytania i odpowiedzi z jednym narzędziem do wyszukiwania. Wynik: w granicach szumu pomiarowego, bez istotnej poprawy.
ScienceWorld - długohoryzontowe zadania ucieleśnionej nauki. Wynik: +11,5 punktu, przedział ufności [+9,8; +13,3]. Dodatkowo RLDS okazał się tu bardziej efektywny obliczeniowo niż skalarny GRPO: -10,9% czasu zegarowego na krok. Autorzy tłumaczą to tym, że długie przebiegi amortyzują stały koszt operacji „reflect-and-grade”.
DeepResearch - długa synteza badawcza, cztery narzędzia, złożona nagroda rubric. Wynik: w granicach szumu, bez istotnej poprawy.
Skąd wiadomo, kiedy metoda się opłaca?
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Kluczowym elementem systemu są diagnostyki heterogeniczności podzadań emitowane w trakcie treningu. Autorzy twierdzą, że zyski z dekompozycji rosną wraz z heterogenicznością podzadań. ScienceWorld i FrozenLake mają wysoką heterogeniczność - stąd duże zyski. HotpotQA i DeepResearch mają niską heterogeniczność według tych diagnostyk - i tam metoda nie przynosi poprawy. Autorzy podkreślają, że diagnostyki z góry przewidziały, gdzie nie ma czego odzyskiwać. Szczegółowej definicji miary heterogeniczności w samym abstrakcie nie ma.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem najciekawszy element tej pracy to nie sama poprawa wyników, lecz wbudowany mechanizm diagnostyczny - czyli narzędzie, które podczas treningu mówi, czy dekompozycja w ogóle ma sens dla danego zadania. Jeśli to działa wiarygodnie, eliminuje jeden z typowych problemów w badaniach nad RL dla LLM: stosowanie metody wszędzie i raportowanie średnich wyników bez rozróżnienia, gdzie naprawdę pomaga. Wyniki na HotpotQA i DeepResearch - zadaniach, gdzie metoda nie zadziałała - są tu równie ważne jak sukcesy na ScienceWorld. Zastrzegam jednak, że widzę tylko abstrakt; szczegóły implementacji SDAE, taksonomii podzadań i samej refleksji wymagają lektury pełnego tekstu.
Źródło: arXiv cs.AI: Reinforcement Learning with Decomposed Subtasks (dokument z 2026-09-24). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
