🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Modele AI nie radzą sobie z konfliktami poleceń - nowy benchmark to potwierdza

Badacze z Johns Hopkins stworzyli test sprawdzający, czy agenty AI poprawnie ustalają priorytety sprzecznych instrukcji od wielu źródeł. Nawet najlepsze modele osiągają około 40% skuteczności, gdy liczba konfliktujących poleceń rośnie.

3 min czytania
Orange document icon with lines of text on a dark navy background

👁 113 przeczytań

Kiedy agent AI dostaje sprzeczne polecenia - powiedzmy, jedno z komunikatu systemowego, drugie od użytkownika, trzecie z narzędzia, a czwarte od innego agenta - które z nich powinien wykonać? To pytanie brzmi prosto, ale w praktyce okazuje się poważnym problemem.

Na czym polega problem

Obecne podejście do hierarchii poleceń w modelach językowych zakłada niewielką, sztywną liczbę poziomów uprzywilejowania - zazwyczaj mniej niż pięć - definiowanych przez stałe etykiety ról, na przykład: system ma pierwszeństwo przed użytkownikiem. Autorzy artykułu - Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van Durme i Daniel Khashabi - twierdzą, że taki model jest niewystarczający dla rzeczywistych zastosowań agentowych. W prawdziwych systemach konflikty mogą pojawiać się w znacznie większej liczbie źródeł i kontekstów.

W odpowiedzi na ten problem proponują nowy paradygmat nazwany Many-Tier Instruction Hierarchy, w skrócie ManyIH. Chodzi o metodę rozwiązywania konfliktów między poleceniami, które mogą mieć dowolnie wiele poziomów uprzywilejowania - nie tylko kilka z góry narzuconych.

Benchmark ManyIH-Bench

Razem z propozycją paradygmatu autorzy wprowadzają ManyIH-Bench - pierwszy benchmark zaprojektowany specjalnie pod kątem tego problemu. Test wymaga od modeli nawigowania przez konflikty obejmujące nawet 12 poziomów sprzecznych poleceń o różnych poziomach uprzywilejowania.

Benchmark składa się z 853 zadań agentowych: 427 dotyczących programowania i 426 dotyczących przestrzegania instrukcji. Zadania obejmują 46 rzeczywistych agentów. Ograniczenia i scenariusze konfliktów były generowane przez modele językowe, a następnie weryfikowane przez ludzi - autorzy podkreślają, że miało to na celu uzyskanie realistycznych i trudnych przypadków testowych.

Wyniki eksperymentów

Eksperymenty pokazują, że nawet obecne modele czołowe osiągają słabe wyniki - około 40% skuteczności - gdy skala konfliktów instrukcji rośnie. Artykuł nie podaje szczegółowego zestawienia wyników dla poszczególnych modeli (przynajmniej nie w abstrakcie dostępnym w źródle), ale ten jeden wskaźnik mówi dużo: przy rosnącej liczbie poziomów konfliktu modele zawodzą w ponad połowie przypadków.

Autorzy oceniają, że wyniki te wskazują na pilną potrzebę opracowania metod, które wprost celują w szczegółowe i skalowalne rozwiązywanie konfliktów poleceń w środowiskach agentowych.

Gdzie i kiedy praca została opublikowana

Artykuł został zgłoszony na arXiv 10 kwietnia 2026 roku, a jego czwarta wersja pochodzi z 4 września 2026 roku. Praca została przyjęta do EMNLP 2026 Findings - jest to jedna z głównych konferencji poświęconych przetwarzaniu języka naturalnego.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem to badanie trafia w konkretny i często pomijany problem praktyczny. Gdy buduje się systemy wieloagentowe - a takich systemów przybywa - zakładanie, że wystarczą trzy czy cztery poziomy hierarchii poleceń, jest myśleniem życzeniowym. Wynik rzędu 40% skuteczności przy 12 poziomach konfliktu to nie jest coś, co można zbyć wzruszeniem ramion. Brakuje mi w dostępnym tekście szczegółów dotyczących tego, jak konkretnie ManyIH rozwiązuje te konflikty - abstrakt opisuje problem i benchmark, ale nie wdaje się w mechanizm proponowanego rozwiązania. Jeśli jednak benchmark zostanie przyjęty przez społeczność badawczą jako standard, może realnie przyspieszyć prace nad bezpieczniejszymi agentami AI.

Źródło: arXiv cs.AI: Many-Tier Instruction Hierarchy in LLM Agents (dokument z 2026-09-09). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 440 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie