🔥 Gemini Pro 170 zł -43% CapCut Pro 460 zł -23% do niedzieli Zobacz →
Przejdź do treści
Newsy

RCI: jak przypisać koszty naruszeń bezpieczeństwa w RL bez etykiet krok po kroku

Uczenie ze wzmocnieniem w trybie offline zakłada zwykle, że każdy krok trajektorii ma przypisaną ocenę bezpieczeństwa - w praktyce ludzie podają tylko sygnał stopu na końcu. Autorzy z Uniwersytetu Witwatersrand proponują metodę RCI, która przekształca ten rzadki sygnał w gęste adnotacje per krok.

3 min czytania
Yellow outlined document icon with multiple orange text lines on a dark blue background.

👁 131 przeczytań

Praca pochodzi z Uniwersytetu Witwatersrand (RPA) i została przyjęta na warsztat SPAI 2026 (1st IJCAI Workshop on Safe Physical AI), afiliowany przy konferencji IJCAI/ECAI 2026. Autorzy to Ebenezer Gelo, Geraud Nangue Tasse, Steven James i Benjamin Rosman. Preprint trafił na arXiv 12 sierpnia 2026 roku.

Problem: skąd wziąć gęste etykiety bezpieczeństwa?

Standardowe metody bezpiecznego uczenia ze wzmocnieniem w trybie offline (safe offline RL) zakładają, że każdy pojedynczy krok w zbiorze danych ma przypisaną wartość kosztu - czyli informację o tym, czy dana akcja była niebezpieczna. W praktyce jest inaczej: osoba nadzorująca (supervisor) widzi całą trajektorię i podaje jedynie binarny sygnał stopu przy pierwszym niebezpiecznym przejściu. Nie wskazuje, który konkretnie krok był winny. Autorzy nazywają to problemem czasowego przypisania zasług (temporal credit assignment problem) - i to właśnie jego rozwiązaniu poświęcona jest cała praca.

Propozycja: framework RCI

Odpowiedzią jest Redistribution-based Cost Inference (RCI) - framework, który działa w dwóch etapach. Po pierwsze, konwertuje rzadki sygnał stopu w gęste koszty per krok, korzystając z techniki zwanej return decomposition (rozkładem zwrotu). Po drugie, na tak wzbogaconym zbiorze danych trenowana jest polityka z ograniczeniami (constrained offline policy).

Autorzy dowodzą, że redistybucja równoważna pod względem zwrotu (return-equivalent redistribution) zachowuje dwie właściwości: zbiór wykonalnych polityk (feasible policy set) oraz optymalny mnożnik Lagrange’a w formułowaniu CMDP (Constrained Markov Decision Process). Oznacza to - zgodnie z twierdzeniem autorów - że transformacja jest bezstratna teoretycznie, a jednocześnie w praktyce poprawia warunkowanie uczenia krytyka kosztów (cost critic learning).

Eksperymenty i wyniki

Metodę testowano na dwóch scenariuszach: prowadzeniu pojazdu na autostradzie (highway driving) oraz manipulacji robotycznej (robotic manipulation). Wyniki pokazują - według autorów - istotnie niższe współczynniki naruszeń w porównaniu z dwiema klasami bazowymi: podejściem ze rzadkimi etykietami (sparse baseline) oraz podejściem opartym na klasyfikatorze (classifier-based baseline). Dokument nie podaje konkretnych wartości liczbowych w abstrakcie - są one zapewne w pełnym tekście pracy, do którego w dostarczonej mi wersji nie mam dostępu.

Autorzy zaznaczają ponadto, że RCI jest odporny na dwa trudne warunki praktyczne: heterogeniczne składy zbiorów danych (heterogeneous dataset compositions) oraz szum w etykietach (label noise). To istotna uwaga, bo dane zbierane w rzeczywistych warunkach rzadko są jednorodne i bezbłędne.

Czego w dokumencie nie ma

W udostępnionym mi abstrakcie i metadanych nie ma: szczegółowych tabel z wynikami, opisu architektury sieci, hiperparametrów, kodu ani informacji o dostępności danych. Nie podano też, jak duże były zbiory danych użyte w eksperymentach ani ile czasu zajmowało trenowanie. Praca nie była (według dostępnych informacji) recenzowana w trybie pełnej konferencji - trafia na warsztat, co jest niższym progiem akceptacji niż główny tor IJCAI.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem to solidnie postawiony problem - w realnych zastosowaniach bezpiecznego RL etykiety per krok są rzeczywiście luksusem, a sygnał stopu od człowieka jest tym, co faktycznie można zebrać. Fakt, że autorzy pokazują teoretyczną bezstratność przekształcenia (a nie tylko empiryczną poprawę), jest wartościowy - daje podstawy do zaufania metodzie poza wąskim zestawem testowym. Jednocześnie traktuję te wyniki ostrożnie: to akceptacja warsztatowa, pełne dane liczbowe są niedostępne w tym fragmencie, a eksperymenty dotyczą symulacji. Czy metoda zadziała tak samo w bardziej złożonych środowiskach z długimi horyzontami czasowymi - tego z dostarczonego tekstu nie da się ocenić.

Źródło: arXiv cs.AI: Redistribution-based Cost Inference Improves Sparse Safe Offline RL (dokument z 2026-08-13). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie