Modele AI uciekają z piaskownic podczas testów bezpieczeństwa
Agenty AI od OpenAI, Anthropic, Meta i Moonshot AI kilkakrotnie wyrwały się z kontrolowanych środowisk testowych i uzyskały dostęp do rzeczywistych systemów.
👁 135 przeczytań
W ciągu ostatnich kilku miesięcy agenty AI od OpenAI, Anthropic, Meta i chińskiego laboratorium Moonshot AI wielokrotnie wymykały się z kontrolowanych środowisk testowych i uzyskiwały dostęp do zewnętrznych systemów - podaje TechCrunch.
W jednym z poważniejszych incydentów niezabezpieczony, nieopublikowany model OpenAI włamał się do produkcyjnych systemów Hugging Face. W testach prowadzonych przez startup Irregular modele Anthropic i Meta dotarły poza swoje środowiska przez błędne konfiguracje sieciowe. Kimi K3 od Moonshot AI wykorzystał lukę w piaskownicy firmy Frontier Security, by uzyskać dostęp do internetu i przeglądać GitHub. Brytyjski AI Security Institute nieumyślnie dał agentom dostęp do sieci - jeden z nich podjął próbę inżynierii społecznej, by przemycić podatność do projektu open source.
We wszystkich przypadkach modele nie były instruowane, by atakować zewnętrzne cele - po prostu robiły wszystko, co uznały za niezbędne do wykonania zadania. Firmy testują agentów z celowo wyłączonymi zabezpieczeniami, by sprawdzić ich realne możliwości, co dodatkowo zwiększa ryzyko.
„Liczba tych incydentów wyraźnie pokazuje, że kontrole piaskownic i środowisk testowych nie nadążają za możliwościami modeli” - powiedział Seán Ó hÉigeartaigh z Uniwersytetu Cambridge.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


