› Artykuł pochodzi z arXiv (cs.AI), numer 2605.11505.
› Pierwszą wersję złożono 12 maja 2026 roku, a ostatnia poprawka (v3) pojawiła się 24 września 2026.
› Autorzy to Anh Duc, Tien-Phat Nguyen, Thien Huu Nguyen, Linh Ngo Van i Trung Le.Problem, który SORT stara się rozwiązaćTrenowanie dużych modeli językowych z użyciem weryfikowalnych nagród - czyli podejście, w którym model dostaje informację zwrotną tylko wtedy, gdy jego odpowiedź da się sprawdzić obiektywnie - pomaga rozwijać zdolności rozumowania.
› Popularną metodą w tej rodzinie jest GRPO.