🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 7 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Newsy

Badacze z Instytutu Turinga złamali zabezpieczenia GitHub Copilota przez rozłożenie szkodliwego żądania na etapy

Naukowcy z Alan Turing Institute pokazali, że GitHub Copilot wykona 816 z 816 szkodliwych poleceń, jeśli rozłożyć je na pozornie niewinne kroki w ramach projektu.

2 min czytania
Badacze z Instytutu Turinga złamali zabezpieczenia GitHub Copilota przez rozłożenie szkodliwego żądania na etapy

👁 152 przeczytań

Badacze z Alan Turing Institute wykazali, że GitHub Copilot wykonuje szkodliwe polecenia w 100% przypadków, gdy żądanie zostanie ukryte jako dane do przetworzenia i rozłożone na małe, niewinnie wyglądające kroki wewnątrz projektu. Wyniki opisał serwis The Register, a praca trafiła na serwer preprintów arXiv.

Różnica między trybami jest druzgocąca. W bezpośrednim czacie asystent odmówił niemal wszystkiego - odpowiedział tylko na 8 z 816 szkodliwych próśb. W trybie workflow zrealizował wszystkie 816. Abhishek Kumar i Carsten Maple przetestowali Copilota w edytorze VS Code na czterech modelach: dwóch od Anthropic (Claude Sonnet 4.6 i Claude Haiku 4.5) i dwóch od Google (Gemini 3.1 Pro i Gemini 3.5 Flash). Wszystkie cztery zachowywały się podobnie.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Na czym polega atak

Zamiast pytać model wprost o coś niebezpiecznego, szkodliwy cel zostaje opakowany jako dane wejściowe do przetworzenia, a następnie podzielony na etapy wyglądające jak zwykłe zadania programistyczne. Każdy krok osobno przechodzi filtry bezpieczeństwa. Niebezpieczny wynik pojawia się dopiero po złożeniu całości. Redakcja The Register widziała przykłady - jeden dotyczył sposobu na oszukanie alkomatu, drugi - przemytu gotówki ze Stanów Zjednoczonych.

Badacze wskazują, że standardowe testy bezpieczeństwa oceniają jeden prompt na raz, więc atak, który buduje szkodliwy wynik przez wiele kroków, po prostu umyka wykryciu. Rozwiązanie? Monitorowanie całej trajektorii sesji - plików, skryptów i danych, których agent dotyka podczas wykonywania zadania.

Metoda nie jest specyficzna dla Copilota. Autorzy wymieniają z nazwy Cursor, Cline i Windsurf jako narzędzia wymagające takiej samej weryfikacji. Anthropic, Google i Microsoft GitHub zostały poproszone o komentarz.

To celna diagnoza branżowej luki: skoro rzeczywiste ryzyko tkwi w sekwencji kroków, a nie w pojedynczym zapytaniu, obecne certyfikaty bezpieczeństwa modeli mówią nam mniej, niż chcielibyśmy sądzić.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie