✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

SORT: jak nauczyć model uczyć się nawet wtedy, gdy wszystko idzie źle

Metody treningu przez wzmacnianie zawodzą, gdy model nie potrafi rozwiązać żadnego z testowanych zadań - nie ma wtedy sygnału uczącego. SORT proponuje obejście tego problemu bez zmiany sposobu generowania odpowiedzi.

3 min czytania
SORT: jak nauczyć model uczyć się nawet wtedy, gdy wszystko idzie źle

👁 115 przeczytań

Artykuł pochodzi z arXiv (cs.AI), numer 2605.11505. Pierwszą wersję złożono 12 maja 2026 roku, a ostatnia poprawka (v3) pojawiła się 24 września 2026. Autorzy to Anh Duc, Tien-Phat Nguyen, Thien Huu Nguyen, Linh Ngo Van i Trung Le.

Problem, który SORT stara się rozwiązać

Trenowanie dużych modeli językowych z użyciem weryfikowalnych nagród - czyli podejście, w którym model dostaje informację zwrotną tylko wtedy, gdy jego odpowiedź da się sprawdzić obiektywnie - pomaga rozwijać zdolności rozumowania. Popularną metodą w tej rodzinie jest GRPO. Jej słabość jest jednak konkretna: gdy model dostaje trudne zadanie i wszystkie jego próby odpowiedzi są błędne, metoda GRPO staje w miejscu. Nie ma żadnej poprawnej próbki, na której można by się oprzeć, więc nie ma sygnału uczącego. Trudne zadania po prostu wypadają z procesu treningu.

Co robi SORT inaczej

SORT (Selective Off-Policy Reference Tuning) dodaje do tego procesu osobną ścieżkę naprawczą dla właśnie tych trudnych przypadków - tych, w których wszystkie wygenerowane próbki są błędne. Robi to bez zmiany sposobu generowania odpowiedzi (rollout generation pozostaje niezmieniony).

Mechanizm działa tak: dla zadania, którego model nie potrafi rozwiązać, SORT sięga po rozwiązanie referencyjne - czyli gotową, poprawną odpowiedź. Wyprowadza z niej plan, a następnie porównuje prawdopodobieństwo wystąpienia poszczególnych tokenów w dwóch wariantach: bez tego planu i z nim. Tokeny, które stają się bardziej przewidywalne, gdy model zna plan, dostają wyższe wagi w sygnale uczącym. Tokeny, na których plan nie robi większej różnicy, dostają niższe wagi.

Efektem jest to, że zamiast kazać modelowi po prostu naśladować całe rozwiązanie referencyjne (uniform imitation - równomierne naśladowanie), SORT tworzy selektywny, uwzględniający strukturę sygnał uczący. Model uczy się przede wszystkim tych fragmentów rozwiązania, które wynikają ze struktury planu, a nie przypadkowych detali.

Wyniki

Autorzy testowali SORT na trzech różnych modelach bazowych (backbone) i ośmiu benchmarkach mierzących zdolności rozumowania. Według abstraktu SORT poprawia wyniki względem GRPO oraz względem innych metod opartych na wskazówkach (guidance baselines). Największe zyski autorzy odnotowują na słabszych modelach. Szczegółowe liczby z poszczególnych benchmarków nie są podane w abstrakcie - dokument nie zawiera tabel ani wykresów w tej skróconej wersji.

Czego w dokumencie nie ma

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Dostępna mi wersja to wyłącznie abstrakt z arXiv. Nie ma tu informacji o tym, jakie konkretnie modele posłużyły jako trzy backbony, jakie dokładnie benchmarki wchodziły w skład ośmiu testów, ani jakie były liczbowe wyniki porównań. Nie ma też opisu kosztów obliczeniowych ani żadnych informacji o publicznym udostępnieniu kodu lub danych.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co z tego wynika

To moim zdaniem interesujące podejście do realnego problemu praktycznego - martwego punktu w treningu przez wzmacnianie, gdy model jest po prostu za słaby na dane zadanie. Selektywne ważenie tokenów według tego, jak bardzo plan zmienia ich przewidywalność, brzmi sensownie koncepcyjnie i różni się od prostego kopiowania rozwiązań wzorcowych. Jednocześnie abstrakt jest bardzo skrótowy i bez dostępu do pełnego tekstu trudno ocenić, czy zyski są duże w sensie praktycznym, czy jedynie statystycznie istotne. Wzmianka o tym, że największe zyski pojawiają się na słabszych modelach, jest ciekawa - sugeruje, że SORT może być szczególnie użyteczny właśnie tam, gdzie zasoby obliczeniowe są ograniczone i nie stać nas na największe modele. Warto śledzić, czy pojawi się kod i pełne wyniki.

Źródło: arXiv cs.AI: Selective Off-Policy Reference Tuning with Plan Guidance (dokument z 2026-09-28). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 500 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›