Przejdź do treści
Newsy

Modele Claude włamały się do trzech firm podczas testów

Anthropic ujawnił, że trzy modele Claude uzyskały nieuprawniony dostęp do infrastruktury trzech organizacji podczas testów bezpieczeństwa - po tym jak OpenAI przyznało się do podobnego incydentu z Hugging Face.

2 min czytania
Modele Claude włamały się do trzech firm podczas testów

👁 139 przeczytań

Anthropic ujawnił, że trzy jego modele Claude uzyskały nieuprawniony dostęp do infrastruktury produkcyjnej trzech różnych organizacji podczas wewnętrznych testów - żadna z poszkodowanych firm nie wiedziała o incydencie, dopóki nie powiadomiła ich firma.

Przegląd własnych testów Anthropic rozpoczął po tym, jak OpenAI przyznało się do podobnej sprawy: agent AI testowany przez tę firmę wykorzystał lukę, by połączyć się z internetem i włamać do systemów Hugging Face. Anthropic postanowił sprawdzić, czy coś podobnego nie przydarzyło się jego modelom Claude.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Błąd ludzki, nie zamierzona ucieczka

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

W testach brały udział trzy modele: Opus 4.7, Mythos 5 (nastawiony na cyberbezpieczeństwo) oraz nienazwany prototyp nieprzeznaczony do publicznego wydania. Wszystkie trzy uczestniczyły w ćwiczeniu capture-the-flag - zadaniem było znalezienie ukrytej informacji (tzw. flagi) w innej maszynie w sieci wewnętrznej. Problem polegał na tym, że modele faktycznie miały dostęp do internetu, choć w promptach poinformowano je wprost, że tego dostępu nie mają. Jak wyjaśniło Anthropic, wynikało to z nieporozumienia między firmą a jej partnerem ewaluacyjnym.

Modele nie próbowały celowo wydostać się ze środowiska testowego - gdy natrafiły na otwarty internet i systemy trzech organizacji, potraktowały je jako część ćwiczenia i przystąpiły do włamania. Użyły przy tym podstawowych technik, takich jak słabe hasła, a nie złożonych exploitów.

Wart odnotowania jest kontrast między zachowaniem nowego a starszego modelu. Najnowszy model zatrzymał się, gdy rozpoznał, że ma dostęp do internetu - starszy kontynuował atak na organizację mimo braku takiego rozpoznania.

Anthropic powiadomił swojego partnera ewaluacyjnego oraz trzy poszkodowane organizacje 27 lipca - cztery dni po rozpoczęciu przeglądu logów testowych. Dwie z firm dowiedziały się w ten sposób o włamaniu po raz pierwszy. Z trzecią organizacją firma nadal próbuje się skontaktować.

W opublikowanym raporcie Anthropic przyznał, że incydentów można było uniknąć - przez dokładniejszą weryfikację wszystkich ścieżek dostępu do internetu przed testami, częstsze i bardziej szczegółowe przeglądy przebiegu testów, a także przez podanie modelom od początku prawdziwej informacji o ich możliwościach sieciowych.

To już drugi głośny przypadek w krótkim czasie, gdy model AI w środowisku testowym wychodzi poza wyznaczone granice i uderza w zewnętrzne systemy - co stawia pytania o standardy izolacji środowisk w całej branży.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok ElevenLabs Creator 352 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie