SORT: jak nauczyć model uczyć się nawet wtedy, gdy wszystko idzie źle
Metody treningu przez wzmacnianie zawodzą, gdy model nie potrafi rozwiązać żadnego z testowanych zadań - nie ma wtedy sygnału uczącego. SORT proponuje obejście tego problemu bez zmiany sposobu generowania odpowiedzi.

👁 115 przeczytań
Artykuł pochodzi z arXiv (cs.AI), numer 2605.11505. Pierwszą wersję złożono 12 maja 2026 roku, a ostatnia poprawka (v3) pojawiła się 24 września 2026. Autorzy to Anh Duc, Tien-Phat Nguyen, Thien Huu Nguyen, Linh Ngo Van i Trung Le.
Problem, który SORT stara się rozwiązać
Trenowanie dużych modeli językowych z użyciem weryfikowalnych nagród - czyli podejście, w którym model dostaje informację zwrotną tylko wtedy, gdy jego odpowiedź da się sprawdzić obiektywnie - pomaga rozwijać zdolności rozumowania. Popularną metodą w tej rodzinie jest GRPO. Jej słabość jest jednak konkretna: gdy model dostaje trudne zadanie i wszystkie jego próby odpowiedzi są błędne, metoda GRPO staje w miejscu. Nie ma żadnej poprawnej próbki, na której można by się oprzeć, więc nie ma sygnału uczącego. Trudne zadania po prostu wypadają z procesu treningu.
Co robi SORT inaczej
SORT (Selective Off-Policy Reference Tuning) dodaje do tego procesu osobną ścieżkę naprawczą dla właśnie tych trudnych przypadków - tych, w których wszystkie wygenerowane próbki są błędne. Robi to bez zmiany sposobu generowania odpowiedzi (rollout generation pozostaje niezmieniony).
Mechanizm działa tak: dla zadania, którego model nie potrafi rozwiązać, SORT sięga po rozwiązanie referencyjne - czyli gotową, poprawną odpowiedź. Wyprowadza z niej plan, a następnie porównuje prawdopodobieństwo wystąpienia poszczególnych tokenów w dwóch wariantach: bez tego planu i z nim. Tokeny, które stają się bardziej przewidywalne, gdy model zna plan, dostają wyższe wagi w sygnale uczącym. Tokeny, na których plan nie robi większej różnicy, dostają niższe wagi.
Efektem jest to, że zamiast kazać modelowi po prostu naśladować całe rozwiązanie referencyjne (uniform imitation - równomierne naśladowanie), SORT tworzy selektywny, uwzględniający strukturę sygnał uczący. Model uczy się przede wszystkim tych fragmentów rozwiązania, które wynikają ze struktury planu, a nie przypadkowych detali.
Wyniki
Autorzy testowali SORT na trzech różnych modelach bazowych (backbone) i ośmiu benchmarkach mierzących zdolności rozumowania. Według abstraktu SORT poprawia wyniki względem GRPO oraz względem innych metod opartych na wskazówkach (guidance baselines). Największe zyski autorzy odnotowują na słabszych modelach. Szczegółowe liczby z poszczególnych benchmarków nie są podane w abstrakcie - dokument nie zawiera tabel ani wykresów w tej skróconej wersji.
Czego w dokumencie nie ma
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Dostępna mi wersja to wyłącznie abstrakt z arXiv. Nie ma tu informacji o tym, jakie konkretnie modele posłużyły jako trzy backbony, jakie dokładnie benchmarki wchodziły w skład ośmiu testów, ani jakie były liczbowe wyniki porównań. Nie ma też opisu kosztów obliczeniowych ani żadnych informacji o publicznym udostępnieniu kodu lub danych.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
To moim zdaniem interesujące podejście do realnego problemu praktycznego - martwego punktu w treningu przez wzmacnianie, gdy model jest po prostu za słaby na dane zadanie. Selektywne ważenie tokenów według tego, jak bardzo plan zmienia ich przewidywalność, brzmi sensownie koncepcyjnie i różni się od prostego kopiowania rozwiązań wzorcowych. Jednocześnie abstrakt jest bardzo skrótowy i bez dostępu do pełnego tekstu trudno ocenić, czy zyski są duże w sensie praktycznym, czy jedynie statystycznie istotne. Wzmianka o tym, że największe zyski pojawiają się na słabszych modelach, jest ciekawa - sugeruje, że SORT może być szczególnie użyteczny właśnie tam, gdzie zasoby obliczeniowe są ograniczone i nie stać nas na największe modele. Warto śledzić, czy pojawi się kod i pełne wyniki.
Źródło: arXiv cs.AI: Selective Off-Policy Reference Tuning with Plan Guidance (dokument z 2026-09-28). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
