Modele AI nie radzą sobie z konfliktami poleceń - nowy benchmark to potwierdza
Badacze z Johns Hopkins stworzyli test sprawdzający, czy agenty AI poprawnie ustalają priorytety sprzecznych instrukcji od wielu źródeł. Nawet najlepsze modele osiągają około 40% skuteczności, gdy liczba konfliktujących poleceń rośnie.
👁 115 przeczytań
Kiedy agent AI dostaje sprzeczne polecenia - powiedzmy, jedno z komunikatu systemowego, drugie od użytkownika, trzecie z narzędzia, a czwarte od innego agenta - które z nich powinien wykonać? To pytanie brzmi prosto, ale w praktyce okazuje się poważnym problemem.
Na czym polega problem
Obecne podejście do hierarchii poleceń w modelach językowych zakłada niewielką, sztywną liczbę poziomów uprzywilejowania - zazwyczaj mniej niż pięć - definiowanych przez stałe etykiety ról, na przykład: system ma pierwszeństwo przed użytkownikiem. Autorzy artykułu - Jingyu Zhang, Tianjian Li, William Jurayj, Hongyuan Zhan, Benjamin Van Durme i Daniel Khashabi - twierdzą, że taki model jest niewystarczający dla rzeczywistych zastosowań agentowych. W prawdziwych systemach konflikty mogą pojawiać się w znacznie większej liczbie źródeł i kontekstów.
W odpowiedzi na ten problem proponują nowy paradygmat nazwany Many-Tier Instruction Hierarchy, w skrócie ManyIH. Chodzi o metodę rozwiązywania konfliktów między poleceniami, które mogą mieć dowolnie wiele poziomów uprzywilejowania - nie tylko kilka z góry narzuconych.
Benchmark ManyIH-Bench
Razem z propozycją paradygmatu autorzy wprowadzają ManyIH-Bench - pierwszy benchmark zaprojektowany specjalnie pod kątem tego problemu. Test wymaga od modeli nawigowania przez konflikty obejmujące nawet 12 poziomów sprzecznych poleceń o różnych poziomach uprzywilejowania.
Benchmark składa się z 853 zadań agentowych: 427 dotyczących programowania i 426 dotyczących przestrzegania instrukcji. Zadania obejmują 46 rzeczywistych agentów. Ograniczenia i scenariusze konfliktów były generowane przez modele językowe, a następnie weryfikowane przez ludzi - autorzy podkreślają, że miało to na celu uzyskanie realistycznych i trudnych przypadków testowych.
Wyniki eksperymentów
Eksperymenty pokazują, że nawet obecne modele czołowe osiągają słabe wyniki - około 40% skuteczności - gdy skala konfliktów instrukcji rośnie. Artykuł nie podaje szczegółowego zestawienia wyników dla poszczególnych modeli (przynajmniej nie w abstrakcie dostępnym w źródle), ale ten jeden wskaźnik mówi dużo: przy rosnącej liczbie poziomów konfliktu modele zawodzą w ponad połowie przypadków.
Autorzy oceniają, że wyniki te wskazują na pilną potrzebę opracowania metod, które wprost celują w szczegółowe i skalowalne rozwiązywanie konfliktów poleceń w środowiskach agentowych.
Gdzie i kiedy praca została opublikowana
Artykuł został zgłoszony na arXiv 10 kwietnia 2026 roku, a jego czwarta wersja pochodzi z 4 września 2026 roku. Praca została przyjęta do EMNLP 2026 Findings - jest to jedna z głównych konferencji poświęconych przetwarzaniu języka naturalnego.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem to badanie trafia w konkretny i często pomijany problem praktyczny. Gdy buduje się systemy wieloagentowe - a takich systemów przybywa - zakładanie, że wystarczą trzy czy cztery poziomy hierarchii poleceń, jest myśleniem życzeniowym. Wynik rzędu 40% skuteczności przy 12 poziomach konfliktu to nie jest coś, co można zbyć wzruszeniem ramion. Brakuje mi w dostępnym tekście szczegółów dotyczących tego, jak konkretnie ManyIH rozwiązuje te konflikty - abstrakt opisuje problem i benchmark, ale nie wdaje się w mechanizm proponowanego rozwiązania. Jeśli jednak benchmark zostanie przyjęty przez społeczność badawczą jako standard, może realnie przyspieszyć prace nad bezpieczniejszymi agentami AI.
Źródło: arXiv cs.AI: Many-Tier Instruction Hierarchy in LLM Agents (dokument z 2026-09-09). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
