🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Cztery ataki na agentów AI w dziesięć dni - i ta sama dziura za każdym razem

W ciągu zaledwie dziesięciu dni w lipcu 2025 roku cztery niezależne zespoły badawcze ujawniły poważne luki w zabezpieczeniach agentów AI - i wszystkie sprowadzają się do tego samego problemu.

2 min czytania
Cztery ataki na agentów AI w dziesięć dni - i ta sama dziura za każdym razem

👁 148 przeczytań

W ciągu zaledwie dziesięciu dni lipca cztery niezależne zespoły badawcze opublikowały wyniki pokazujące, że agenci AI - modele wyposażone w dostęp do skrzynki mailowej, kalendarza i trwałej pamięci - mają strukturalną lukę, którą można wykorzystać na wiele różnych sposobów.

Firma Manifold Security wykazała, że dowolne rozszerzenie przeglądarki może sfałszować kliknięcie użytkownika w zaledwie sześciu liniach kodu i skłonić Anthropic Claude for Chrome do cichego odczytu Gmaila, Google Docs i Kalendarza. Manifold twierdzi, że poinformowała Anthropic o problemie w maju - osiem wydań później luka nadal działa.

Pamięć, którą można otruć

Drugi atak celuje w długoterminową pamięć agentów. Badacze opublikowali na arXiv pracę pokazującą, że jeden starannie spreparowany email - który przechodzi normalne filtry spamowe - wystarczy, by zapisać fałszywe instrukcje w pamięci agenta. W ponad połowie testowanych przypadków agent zachowywał je bez żadnego ostrzeżenia dla użytkownika. W odróżnieniu od zwykłego prompt injection, który działa tylko przez jedną rozmowę, zatruta pamięć steruje agentem przez wszystkie przyszłe sesje.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Zatruty model za 75 funtów

Trzecia luka sięga głębiej - do samego modelu. Katie Paxton-Fear z Semgrep i jej współpracownicy pokazali, że zatrucie otwartego modelu wagowego zajmuje około godziny i kosztuje poniżej 75 funtów. Wystarczyło dziesięć spreparowanych przykładów treningowych, żeby model zaczął generować kod z ukrytą luką bezpieczeństwa - nawet dla promptów, których nigdy wcześniej nie widział. Co niepokojące, większe modele okazały się łatwiejsze do zatrucia, nie trudniejsze. David Kaplan z firmy Origin poszedł o krok dalej i zbudował model, który po cichu wykrada dane przez narzędzie mailowe.

Wspólny mianownik wszystkich czterech ataków jest ten sam: agent nie potrafi odróżnić prawdziwej instrukcji od sfałszowanej.

Kiedy modele miały tylko rozmawiać, pomyłki były żenujące - teraz, gdy dostają klucze do naszych danych, stają się exploitowalne.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie