🔥 Gemini Pro 18 miesięcy (voucher) 170 zł -43% do piątku Kup teraz →
Przejdź do treści
Newsy

Modele OpenAI i Anthropic wymknęły się spod kontroli podczas testów bezpieczeństwa w UK

Brytyjski Instytut Bezpieczeństwa AI poinformował o poważnym incydencie podczas rutynowego testu - modele GPT-5.6 Sol i Mythos 5 samodzielnie podjęły działania wykraczające poza przydzielone zadania, w tym próbę wstrzyknięcia złośliwego kodu na GitHub.

2 min czytania
Scientist with a clipboard watches two small orange-lit robots entering a glowing doorway in a dark lab setting

👁 126 przeczytań

Brytyjski Instytut Bezpieczeństwa AI (AISI) ujawnił, że 28 lipca podczas rutynowego testu cyberbezpieczeństwa agenty oparte na modelach Anthropic Mythos 5 i OpenAI GPT-5.6 Sol zaczęły działać w sposób niezamierzony i potencjalnie szkodliwy. Opanowanie sytuacji zajęło godzinę.

Szczegóły incydentu opisuje raport AISI opublikowany po zdarzeniu. Spośród 19 zarejestrowanych przypadków nieautoryzowanego zachowania aż 17 dotyczyło modelu Mythos, a dwa - modelu Sol.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co dokładnie się stało

Najpoważniejszy przypadek dotyczył agenta napędzanego przez Mythos 5. Próbował on wstrzyknąć złośliwy kod do projektu open-source hostowanego na GitHubie. Żeby kod został zatwierdzony, agent stworzył fałszywe tożsamości internetowe oparte na danych prawdziwych osób i użył ich, by wywierać presję na opiekuna projektu. Działanie zostało zablokowane przez człowieka.

Agent stosował techniki typowe dla prawdziwych hakerów - wysyłał spear-phishingowe wiadomości do konkretnych, celowo wybranych osób, część z nich zawierała złośliwe oprogramowanie. Wysyłał też e-maile mające manipulować odbiorcami.

AISI zaznaczyło, że nie był to przypadek ucieczki modelu z izolowanego środowiska testowego (tzw. sandboxa). Instytut celowo zezwolił na dostęp do internetu i wyłączył filtry blokujące niebezpieczne zachowania - takich warunków nie ma w publicznych wersjach tych modeli i nie ma dowodów, by podobne zachowania występowały poza środowiskiem testowym.

To pierwszy raz, gdy zagrożenia związane z autonomią i oszustwem ujawniły się tak wyraźnie, bez konkretnego podpuszczenia, w realnym świecie.

- napisało AISI w oficjalnym wpisie blogowym.

Incydent nie jest odosobniony. W lipcu OpenAI poinformowało, że agent oparty na jego modelach zhakował startup AI podczas testu. Kilka dni później Anthropic przyznało, że jego model Claude zhakował trzy organizacje w trakcie ewaluacji. AISI określiło wszystkie te przypadki łącznie jako sygnał świadczący o przesunięciu w krajobrazie ryzyka - nie chodzi o celowe nadużycia publicznie dostępnych modeli, ale o systemy w środowisku badawczym, które podejmują niezamierzone działania wykraczające poza autoryzowany zakres.

Instytut wezwał do interpretowania wyników z ostrożnością, ale okoliczności są jednoznaczne: żaden harm nie wystąpił, jednak skala autonomicznych, nieautoryzowanych działań jest czymś, czego testerzy wcześniej nie obserwowali.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 600 zł/rok Cursor Pro 320 zł/rok Zobacz wszystko →
× powiększenie