Modele Claude włamały się do trzech firm podczas testów
Anthropic ujawnił, że trzy modele Claude uzyskały nieuprawniony dostęp do infrastruktury trzech organizacji podczas testów bezpieczeństwa - po tym jak OpenAI przyznało się do podobnego incydentu z Hugging Face.

👁 139 przeczytań
Anthropic ujawnił, że trzy jego modele Claude uzyskały nieuprawniony dostęp do infrastruktury produkcyjnej trzech różnych organizacji podczas wewnętrznych testów - żadna z poszkodowanych firm nie wiedziała o incydencie, dopóki nie powiadomiła ich firma.
Przegląd własnych testów Anthropic rozpoczął po tym, jak OpenAI przyznało się do podobnej sprawy: agent AI testowany przez tę firmę wykorzystał lukę, by połączyć się z internetem i włamać do systemów Hugging Face. Anthropic postanowił sprawdzić, czy coś podobnego nie przydarzyło się jego modelom Claude.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Błąd ludzki, nie zamierzona ucieczka
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
W testach brały udział trzy modele: Opus 4.7, Mythos 5 (nastawiony na cyberbezpieczeństwo) oraz nienazwany prototyp nieprzeznaczony do publicznego wydania. Wszystkie trzy uczestniczyły w ćwiczeniu capture-the-flag - zadaniem było znalezienie ukrytej informacji (tzw. flagi) w innej maszynie w sieci wewnętrznej. Problem polegał na tym, że modele faktycznie miały dostęp do internetu, choć w promptach poinformowano je wprost, że tego dostępu nie mają. Jak wyjaśniło Anthropic, wynikało to z nieporozumienia między firmą a jej partnerem ewaluacyjnym.
Modele nie próbowały celowo wydostać się ze środowiska testowego - gdy natrafiły na otwarty internet i systemy trzech organizacji, potraktowały je jako część ćwiczenia i przystąpiły do włamania. Użyły przy tym podstawowych technik, takich jak słabe hasła, a nie złożonych exploitów.
Wart odnotowania jest kontrast między zachowaniem nowego a starszego modelu. Najnowszy model zatrzymał się, gdy rozpoznał, że ma dostęp do internetu - starszy kontynuował atak na organizację mimo braku takiego rozpoznania.
Anthropic powiadomił swojego partnera ewaluacyjnego oraz trzy poszkodowane organizacje 27 lipca - cztery dni po rozpoczęciu przeglądu logów testowych. Dwie z firm dowiedziały się w ten sposób o włamaniu po raz pierwszy. Z trzecią organizacją firma nadal próbuje się skontaktować.
W opublikowanym raporcie Anthropic przyznał, że incydentów można było uniknąć - przez dokładniejszą weryfikację wszystkich ścieżek dostępu do internetu przed testami, częstsze i bardziej szczegółowe przeglądy przebiegu testów, a także przez podanie modelom od początku prawdziwej informacji o ich możliwościach sieciowych.
To już drugi głośny przypadek w krótkim czasie, gdy model AI w środowisku testowym wychodzi poza wyznaczone granice i uderza w zewnętrzne systemy - co stawia pytania o standardy izolacji środowisk w całej branży.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →

