Przejdź do treści
Newsy

SCOPE: jak nauczyć agenta AI obsługującego komputer odmawiać niebezpiecznych zadań

Badacze opublikowali metodę trenowania agentów AI sterujących komputerem tak, by jednocześnie skutecznie wykonywały zadania i odmawiały wykonania tych szkodliwych. Wyniki pokazują, że można to osiągnąć bez rezygnowania z użyteczności.

3 min czytania
SCOPE: jak nauczyć agenta AI obsługującego komputer odmawiać niebezpiecznych zadań

👁 112 przeczytań

Praca pochodzi z sierpnia 2026 roku, autorstwa zespołu ośmiorga badaczy: Zeyu Kang, Zhenyun Yin, Yang Zhang, Shan He, Shanzhe Lei, Yanjiu Zhong, Xinquan Chen i Xuhong Wang. Dotyczy tzw. agentów używających komputera (computer-use agents, w skrócie CUA) - czyli systemów AI, które sterują graficznym interfejsem użytkownika, klikają, wpisują tekst i wykonują złożone zadania na prawdziwym komputerze.

Problem: samo ukończenie zadania nie wystarcza

Autorzy wskazują na konkretny problem: dotychczasowe trenowanie takich agentów skupiało się wyłącznie na tym, czy zadanie zostało wykonane. To nie wystarcza, bo agent musi też umieć oceniać ryzyko. Według autorów niezawodny CUA powinien spełniać trzy warunki: wykonywać zwykłe, bezpieczne zadania; unikać zagrożeń w środowisku i kontynuować działanie, gdy istnieje bezpieczna ścieżka do celu; oraz odmawiać, gdy cel jest szkodliwy albo nie istnieje bezpieczna ścieżka do jego osiągnięcia. Innymi słowy - agent powinien uzależniać swoje działanie od oceny ryzyka, nie tylko od możliwości wykonania polecenia.

SCOPE: wspólny trening zdolności i bezpieczeństwa

Odpowiedzią na ten problem jest metoda nazwana SCOPE (Safety and Capability Optimization for Policy Execution). Jej idea polega na jednoczesnym trenowaniu agenta pod kątem dwóch celów: skuteczności w wykonywaniu zadań oraz podejmowania decyzji uwzględniających bezpieczeństwo. Żeby dostarczyć dopasowane dane treningowe, autorzy opracowali dodatkowe narzędzie - SCOPE-Gen. Jest to zautomatyzowany pipeline, który tworzy weryfikowalne zadania testujące zdolności agenta, a następnie przekształca je w pary wariantów: z ryzykiem środowiskowym i bez, zachowując przy tym oryginalny cel zadania.

Dane treningowe: trzy typy trajektorii

Na bazie zadań wygenerowanych przez SCOPE-Gen powstał zbiór danych SATraj-OS. Zawiera on trajektorie trzech rodzajów: demonstracje skutecznego wykonania zadań, przykłady bezpiecznego kontynuowania mimo napotkanych zagrożeń, oraz wyraźne odmowy. Agent SCOPE jest najpierw trenowany na wszystkich trzech typach trajektorii metodą nadzorowanego dostrajania (supervised fine-tuning), a następnie dalej poprawiany w zakresie ukończania zadań za pomocą uczenia przez wzmacnianie online (online reinforcement learning).

Wyniki: liczby

Punktem startowym był model Qwen3.5-9B. Po zastosowaniu SCOPE-RL (wariant z uczeniem przez wzmacnianie) agent osiągnął 54,17% skuteczności na benchmarku OSWorld oraz 64,30% skuteczności w unikaniu ataków na benchmarku OS-BLIND. Łączny wynik agregujący zdolności i bezpieczeństwo wyniósł 58,80% - autorzy wskazują, że jest to najlepszy wynik wśród ocenianych agentów. Jakie inne agenty były oceniane i jakie osiągnęły wyniki - dokument tego nie precyzuje w dostępnym abstrakcie.

Co robi odmowa, a co obsługa ryzyka

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Autorzy przeprowadzili też analizę ablacyjną, czyli sprawdzili, co się dzieje, gdy usuwa się poszczególne elementy metody. Wyniki pokazują asymetrię: trajektorie odmowy odpowiadają za większość zysku w unikaniu ataków, natomiast trajektorie obsługi ryzyka (czyli bezpiecznego kontynuowania) lepiej zachowują użyteczność agenta przy porównywalnym poziomie unikania ataków. Obie formy nadzoru bezpieczeństwa są więc komplementarne, ale pełnią różne role.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem ta praca wskazuje na istotną lukę w dotychczasowym podejściu do trenowania agentów AI sterujących komputerem - optymalizacja wyłącznie pod kątem skuteczności zadań to za mało, gdy agent ma realny dostęp do systemu operacyjnego. Wyniki liczbowe są obiecujące, ale dokument - przynajmniej w tej formie - nie ujawnia szczegółów benchmarków ani porównywanych agentów, co utrudnia pełną ocenę. Kluczowy wniosek praktyczny to rozróżnienie między odmową a obsługą ryzyka: agent, który tylko odmawia, jest bezpieczniejszy, ale mniej użyteczny - agent, który umie też bezpiecznie kontynuować, zachowuje większą wartość praktyczną.

Źródło: arXiv cs.AI: Beyond Task Completion: Training Capable and Safe Computer-Use Agents (dokument z 2026-09-23). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie