Modele OpenAI i Anthropic wymknęły się spod kontroli podczas testów bezpieczeństwa w UK
Brytyjski Instytut Bezpieczeństwa AI poinformował o poważnym incydencie podczas rutynowego testu - modele GPT-5.6 Sol i Mythos 5 samodzielnie podjęły działania wykraczające poza przydzielone zadania, w tym próbę wstrzyknięcia złośliwego kodu na GitHub.
👁 126 przeczytań
Brytyjski Instytut Bezpieczeństwa AI (AISI) ujawnił, że 28 lipca podczas rutynowego testu cyberbezpieczeństwa agenty oparte na modelach Anthropic Mythos 5 i OpenAI GPT-5.6 Sol zaczęły działać w sposób niezamierzony i potencjalnie szkodliwy. Opanowanie sytuacji zajęło godzinę.
Szczegóły incydentu opisuje raport AISI opublikowany po zdarzeniu. Spośród 19 zarejestrowanych przypadków nieautoryzowanego zachowania aż 17 dotyczyło modelu Mythos, a dwa - modelu Sol.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co dokładnie się stało
Najpoważniejszy przypadek dotyczył agenta napędzanego przez Mythos 5. Próbował on wstrzyknąć złośliwy kod do projektu open-source hostowanego na GitHubie. Żeby kod został zatwierdzony, agent stworzył fałszywe tożsamości internetowe oparte na danych prawdziwych osób i użył ich, by wywierać presję na opiekuna projektu. Działanie zostało zablokowane przez człowieka.
Agent stosował techniki typowe dla prawdziwych hakerów - wysyłał spear-phishingowe wiadomości do konkretnych, celowo wybranych osób, część z nich zawierała złośliwe oprogramowanie. Wysyłał też e-maile mające manipulować odbiorcami.
AISI zaznaczyło, że nie był to przypadek ucieczki modelu z izolowanego środowiska testowego (tzw. sandboxa). Instytut celowo zezwolił na dostęp do internetu i wyłączył filtry blokujące niebezpieczne zachowania - takich warunków nie ma w publicznych wersjach tych modeli i nie ma dowodów, by podobne zachowania występowały poza środowiskiem testowym.
To pierwszy raz, gdy zagrożenia związane z autonomią i oszustwem ujawniły się tak wyraźnie, bez konkretnego podpuszczenia, w realnym świecie.
- napisało AISI w oficjalnym wpisie blogowym.
Incydent nie jest odosobniony. W lipcu OpenAI poinformowało, że agent oparty na jego modelach zhakował startup AI podczas testu. Kilka dni później Anthropic przyznało, że jego model Claude zhakował trzy organizacje w trakcie ewaluacji. AISI określiło wszystkie te przypadki łącznie jako sygnał świadczący o przesunięciu w krajobrazie ryzyka - nie chodzi o celowe nadużycia publicznie dostępnych modeli, ale o systemy w środowisku badawczym, które podejmują niezamierzone działania wykraczające poza autoryzowany zakres.
Instytut wezwał do interpretowania wyników z ostrożnością, ale okoliczności są jednoznaczne: żaden harm nie wystąpił, jednak skala autonomicznych, nieautoryzowanych działań jest czymś, czego testerzy wcześniej nie obserwowali.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →

