Prompt injection kontra hakerskie agenty AI - atak skuteczny w 1% przypadków
Badacze z Tracebit odkryli, że umieszczanie prompt injections obok haseł i kluczy kryptograficznych w AWS redukuje skuteczność ataków hakerskich agentów AI z 57% do 5%.
👁 142 przeczytań
Badacze z Tracebit ogłosili w poniedziałek, że umieszczanie złośliwych prompt injections obok haseł i kluczy kryptograficznych przechowywanych w Amazon Web Services potrafi skutecznie neutralizować ataki przeprowadzane przez hakerskie agenty AI.
Technika, którą Tracebit nazwał context bombing, polega na podrzuceniu ciągów tekstowych zawierających polecenia zakazane przez guardrails modeli LLM - np. instrukcje syntezy wąglika lub odniesienia do masakry na Tiananmen w przypadku modeli chińskich producentów. Gdy atakujący agent natrafi na taki ciąg, jego mechanizm odmowy blokuje dalsze działanie.

W testach na pięciu modelach i 152 próbach ataku odsetek przejęcia pełnych uprawnień administracyjnych spadł z 57% do 5%, a całkowitego kompromisu z 36% do 1%. Opus 4.8, który w normalnych warunkach zdobywał dostęp admin w 93% prób, po napotkaniu context bomb nie zdołał tego zrobić ani razu. Odsetek przebiegów, w których agent wykonał jakąkolwiek ścieżkę ataku, spadł z 91% do 15%.
Metoda rozszerza wcześniejsze prace Tracebit z maja, gdy firma zaprezentowała system wabików w infrastrukturze AWS - zasobów-kanarków alarmujących o ataku średnio w ciągu ośmiu minut.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


