Ukryta komunikacja między agentami AI otwiera nowe furtki dla szkodliwych odpowiedzi
Naukowcy pokazują, że gdy modele językowe rozmawiają ze sobą w przestrzeni wewnętrznych reprezentacji zamiast tekstem, ich zabezpieczenia mogą przestać działać. Atak oparty na uczeniu przez wzmacnianie podniósł wskaźnik szkodliwej zgodności z 27,9 do 76,9.

👁 115 przeczytań
Muhammad Huzaifa, Sina Mavali i Thorsten Eisenhofer opublikowali 30 września 2026 roku na arXiv pracę zatytułowaną „Safety of Latent Communication in Multi-Agent Systems”. Opisują w niej problem, który pojawia się, gdy wiele modeli AI komunikuje się ze sobą nie przez tekst, lecz bezpośrednio przez wewnętrzne reprezentacje - czyli tak zwana komunikacja latentna.
Na czym polega komunikacja latentna
Standardowo agenty AI wymieniają informacje przez tekst, co generuje koszty: zużywane są tokeny, czas obliczeń i rośnie opóźnienie. Komunikacja latentna omija ten etap - jeden model przekazuje drugiemu swoje wewnętrzne stany bezpośrednio do przestrzeni wejściowej odbiorcy. Żeby to działało, między agentami wprowadza się lekkie, trenowalne „łącza” (links), które mapują reprezentacje nadawcy na format zrozumiały dla odbiorcy.
Problem: nawet zwykłe trenowanie łączy psuje zabezpieczenia
Autorzy pokazują, że już samo nieszkodliwe trenowanie takich łączy - bez żadnego złośliwego zamiaru - zwiększa tzw. harmful compliance, czyli skłonność systemu do spełniania szkodliwych próśb. Co istotne, same modele bazowe pozostają niezmienione i nadal mają wbudowane zabezpieczenia (safety alignment). Problem leży w łączu, nie w agencie.
Atakujący może wzmocnić ten efekt na dwa sposoby opisane w pracy: po pierwsze, optymalizując łącza na parach pytanie szkodliwe - odpowiedź szkodliwa; po drugie, zatruwając (poisoning) z pozoru nieszkodliwe dane treningowe.
Atak przez uczenie przez wzmacnianie
Autorzy opracowali osobny rodzaj ataku oparty na reinforcement learning. Jego cechą wyróżniającą jest to, że nie wymaga posiadania szkodliwych odpowiedzi docelowych - nagradza samą szkodliwą zgodność przy jednoczesnym zachowaniu użyteczności na zwykłych zadaniach.
Wyniki są konkretne: na trzech topologiach komunikacyjnych i czterech benchmarkach bezpieczeństwa ten atak podniósł średni wskaźnik harmful compliance z 27,9 (przy nieszkodliwie wytrenowanych łączach) do 76,9. W porównaniu z bezpośrednią optymalizacją nadzorowaną atak RL osiągnął też wyższą średnią dokładność na dwóch benchmarkach użyteczności - czyli szkodliwy system jednocześnie lepiej wykonuje normalne zadania.
Możliwa naprawa bez modyfikowania agentów
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Autorzy sprawdzili też, czy tę samą mechanikę można wykorzystać w odwrotnym kierunku. Okazuje się, że dostosowanie nagród w stronę bezpiecznego zachowania pozwala naprawić skompromitowane łącza. Zgodnie z opisem w abstrakcie, takie podejście istotnie redukuje harmful compliance we wszystkich ocenianych atakach - i co ważne, robi to bez aktualizowania samych agentów.
Główny wniosek autorów
Autorzy piszą wprost: „safety alignment requires considering the multi-agent system as a whole” - zabezpieczanie modelu w izolacji nie wystarcza, jeśli ten model będzie działał jako część większego systemu wieloagentowego. Łącza komunikacyjne między agentami stają się osobną powierzchnią ataku, która dotychczas nie była brana pod uwagę przy ocenie bezpieczeństwa.
Kod do pracy jest publicznie dostępny pod adresem wskazanym przez autorów w abstrakcie. Artykuł jest klasyfikowany w kategoriach Artificial Intelligence, Machine Learning i Multiagent Systems.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
To badanie jest dla mnie sygnałem, że systemy wieloagentowe wchodzą w fazę, w której bezpieczeństwo pojedynczego modelu przestaje być wystarczającą miarą. Liczba 76,9 jako wskaźnik szkodliwej zgodności wobec 27,9 w punkcie wyjścia to różnica, której nie można zbagatelizować. Niepokoi mnie szczególnie to, że atak RL nie potrzebuje gotowych szkodliwych odpowiedzi - obniża to próg wejścia dla potencjalnych nadużyć. Jednocześnie fakt, że te same mechanizmy można wykorzystać do naprawy łączy bez dotykania modeli bazowych, sugeruje praktyczne ścieżki obrony - o ile ktoś faktycznie zacznie je wdrażać w projektowaniu systemów produkcyjnych.
Źródło: arXiv cs.AI: Safety of Latent Communication in Multi-Agent Systems (dokument z 2026-10-02). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
