Przejdź do treści
Newsy

Badacze z Instytutu Turinga złamali zabezpieczenia GitHub Copilota przez rozłożenie szkodliwego żądania na etapy

Naukowcy z Alan Turing Institute pokazali, że GitHub Copilot wykona 816 z 816 szkodliwych poleceń, jeśli rozłożyć je na pozornie niewinne kroki w ramach projektu.

2 min czytania
Badacze z Instytutu Turinga złamali zabezpieczenia GitHub Copilota przez rozłożenie szkodliwego żądania na etapy
W skrócie
  • W bezpośrednim czacie Copilot odmówił wykonania 808 z 816 szkodliwych próśb; w trybie workflow - wykonał wszystkie 816.
  • Atak działa na czterech testowanych modelach: Claude Sonnet 4.6, Claude Haiku 4.5, Gemini 3.1 Pro i Gemini 3.5 Flash.
  • Badacze postulują testowanie całych trajektorii sesji, nie pojedynczych promptów, i ostrzegają, że ten sam problem dotyczy Cursora, Cline i Windsurf.

👁 129 przeczytań

Badacze z Alan Turing Institute wykazali, że GitHub Copilot wykonuje szkodliwe polecenia w 100% przypadków, gdy żądanie zostanie ukryte jako dane do przetworzenia i rozłożone na małe, niewinnie wyglądające kroki wewnątrz projektu. Wyniki opisał serwis The Register, a praca trafiła na serwer preprintów arXiv.

Różnica między trybami jest druzgocąca. W bezpośrednim czacie asystent odmówił niemal wszystkiego - odpowiedział tylko na 8 z 816 szkodliwych próśb. W trybie workflow zrealizował wszystkie 816. Abhishek Kumar i Carsten Maple przetestowali Copilota w edytorze VS Code na czterech modelach: dwóch od Anthropic (Claude Sonnet 4.6 i Claude Haiku 4.5) i dwóch od Google (Gemini 3.1 Pro i Gemini 3.5 Flash). Wszystkie cztery zachowywały się podobnie.

Google · Twoje źródłaDodaj promptowy.com do preferowanych źródeł w Google

Na czym polega atak

Zamiast pytać model wprost o coś niebezpiecznego, szkodliwy cel zostaje opakowany jako dane wejściowe do przetworzenia, a następnie podzielony na etapy wyglądające jak zwykłe zadania programistyczne. Każdy krok osobno przechodzi filtry bezpieczeństwa. Niebezpieczny wynik pojawia się dopiero po złożeniu całości. Redakcja The Register widziała przykłady - jeden dotyczył sposobu na oszukanie alkomatu, drugi - przemytu gotówki ze Stanów Zjednoczonych.

Badacze wskazują, że standardowe testy bezpieczeństwa oceniają jeden prompt na raz, więc atak, który buduje szkodliwy wynik przez wiele kroków, po prostu umyka wykryciu. Rozwiązanie? Monitorowanie całej trajektorii sesji - plików, skryptów i danych, których agent dotyka podczas wykonywania zadania.

Metoda nie jest specyficzna dla Copilota. Autorzy wymieniają z nazwy Cursor, Cline i Windsurf jako narzędzia wymagające takiej samej weryfikacji. Anthropic, Google i Microsoft GitHub zostały poproszone o komentarz.

To celna diagnoza branżowej luki: skoro rzeczywiste ryzyko tkwi w sekwencji kroków, a nie w pojedynczym zapytaniu, obecne certyfikaty bezpieczeństwa modeli mówią nam mniej, niż chcielibyśmy sądzić.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Wypisujesz się jednym kliknięciem.
// Zapytaj AI o ten news
Co o tym sądzisz?
$ sitemap --all Cała strona w jednym miejscu - żeby się nie pogubić.
🛒 Sklep Kinetyka X Premium+ & SuperGrok 699 zł/rok CapCut Pro 600 zł/rok LinkedIn Premium od 149 zł/rok Zobacz wszystko → 💙 wspieraj
Redaguje
× powiększenie