› Praca pochodzi z arXiv (numer 2608.17941) i została złożona 18 sierpnia 2026 roku przez siedmioro autorów: Zhizhao Liu, Zhiliang Tian, Xi Wang, Zhihua Wen, Yihang Xiong, Zhiquan Lai i Dongsheng Li.Problem: model traci czas na łatwe zadaniaUczenie przez wzmacnianie z weryfikowalnymi nagrodami - w skrócie RLVR - to podejście, które poprawia zdolności rozumowania dużych modeli językowych.
› Działa ono przez tak zwane rollout, czyli wielokrotne generowanie odpowiedzi na to samo pytanie, żeby sprawdzić, co działa.
› Problem polega na tym, że standardowe podejście przydziela tyle samo prób każdej próbce, niezależnie od tego, czy jest ona łatwa, czy trudna.
› Autorzy wskazują wprost: łatwe próbki dostają zbędne rollout, a trudne, ale możliwe do nauczenia, dostają ich za mało.