› Uczenie przez wzmacnianie z weryfikowalnymi nagrodami (RLVR) to podejście, które w ostatnich latach mocno pchnęło do przodu modele językowe nastawione na rozumowanie.
› Problem polega na tym, że RLVR działa dobrze tylko tam, gdzie można jednoznacznie sprawdzić poprawność odpowiedzi - przede wszystkim w matematyce i programowaniu.
› Dla zadań otwartych, takich jak streszczanie tekstów czy pisanie kreatywne, trzeba polegać na ludzkich ocenach, dodatkowych modelach nagrody albo innych modelach językowych pełniących rolę sędziów.
› Każde z tych rozwiązań wprowadza własne problemy: stronniczość oceny, ograniczenia wynikające z możliwości modelu-sędziego i dodatkowe koszty obliczeniowe.Pomysł: przekształć zadanie, zamiast zmieniać ocenęAutorzy - zespół jedenastu badaczy z różnych instytucji - proponują inne wyjście.