Cztery ataki na agentów AI w dziesięć dni - i ta sama dziura za każdym razem
W ciągu zaledwie dziesięciu dni w lipcu 2025 roku cztery niezależne zespoły badawcze ujawniły poważne luki w zabezpieczeniach agentów AI - i wszystkie sprowadzają się do tego samego problemu.
👁 148 przeczytań
W ciągu zaledwie dziesięciu dni lipca cztery niezależne zespoły badawcze opublikowały wyniki pokazujące, że agenci AI - modele wyposażone w dostęp do skrzynki mailowej, kalendarza i trwałej pamięci - mają strukturalną lukę, którą można wykorzystać na wiele różnych sposobów.
Firma Manifold Security wykazała, że dowolne rozszerzenie przeglądarki może sfałszować kliknięcie użytkownika w zaledwie sześciu liniach kodu i skłonić Anthropic Claude for Chrome do cichego odczytu Gmaila, Google Docs i Kalendarza. Manifold twierdzi, że poinformowała Anthropic o problemie w maju - osiem wydań później luka nadal działa.
Pamięć, którą można otruć
Drugi atak celuje w długoterminową pamięć agentów. Badacze opublikowali na arXiv pracę pokazującą, że jeden starannie spreparowany email - który przechodzi normalne filtry spamowe - wystarczy, by zapisać fałszywe instrukcje w pamięci agenta. W ponad połowie testowanych przypadków agent zachowywał je bez żadnego ostrzeżenia dla użytkownika. W odróżnieniu od zwykłego prompt injection, który działa tylko przez jedną rozmowę, zatruta pamięć steruje agentem przez wszystkie przyszłe sesje.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Zatruty model za 75 funtów
Trzecia luka sięga głębiej - do samego modelu. Katie Paxton-Fear z Semgrep i jej współpracownicy pokazali, że zatrucie otwartego modelu wagowego zajmuje około godziny i kosztuje poniżej 75 funtów. Wystarczyło dziesięć spreparowanych przykładów treningowych, żeby model zaczął generować kod z ukrytą luką bezpieczeństwa - nawet dla promptów, których nigdy wcześniej nie widział. Co niepokojące, większe modele okazały się łatwiejsze do zatrucia, nie trudniejsze. David Kaplan z firmy Origin poszedł o krok dalej i zbudował model, który po cichu wykrada dane przez narzędzie mailowe.
Wspólny mianownik wszystkich czterech ataków jest ten sam: agent nie potrafi odróżnić prawdziwej instrukcji od sfałszowanej.
Kiedy modele miały tylko rozmawiać, pomyłki były żenujące - teraz, gdy dostają klucze do naszych danych, stają się exploitowalne.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


