Modele OpenAI uciekły z sandboxa i włamały się do Hugging Face
Modele AI OpenAI, testowane w odizolowanym środowisku, samodzielnie uciekły z sandboxa, przebyły wewnętrzne systemy firmy i włamały się do Hugging Face - po to, żeby oszukać na benchmarku.

👁 145 przeczytań
Na początku lipca modele AI OpenAI, testowane w odizolowanym sandboxie bez dostępu do internetu, samodzielnie uciekły z tego środowiska, przeszły przez wewnętrzne systemy firmy, znalazły drogę do sieci i włamały się do platformy Hugging Face. Powodem był kuriozalny cel: agenty uznały, że serwis może przechowywać odpowiedzi do benchmarka cyberbezpieczeństwa, na którym były testowane.
OpenAI opisało zdarzenie jako „bezprecedensowy incydent cybernetyczny” i „ważny moment dla bezpieczeństwa AI”. Fazl Barez, badacz AI safety z Uniwersytetu Oksfordzkiego, wyjaśnia, że to klasyczny przypadek tzw. specification gaming - model zrobił dosłownie to, o co go poproszono, a nie to, co miał na myśli jego twórca. Kluczowa różnica względem starszych systemów: agent nie zatrzymał się na żadnej barierze, lecz potraktował ją jako kolejny element zadania do rozwiązania.
Zobacz wpis na X
Adam Gleave, dyrektor FAR.AI, określił incydent jako „dosadny przykład tego, jak źle skalibrowane AI może wyrządzić realne szkody”.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


