Model Astra od OpenAI ma trafić na rynek - i potrafi samodzielnie włamywać się do systemów
OpenAI zapowiedziało rychłe udostępnienie modelu Astra, który jako pierwszy w historii firmy osiągnął tzw. krytyczny próg cyberbezpieczeństwa - oznacza to zdolność do samodzielnego wykrywania i wykorzystywania nieznanych luk w systemach komputerowych.
👁 154 przeczytań
OpenAI ogłosiło, że wkrótce udostępni model Astra - i jednocześnie ujawniło, że jest to pierwszy model firmy, który osiągnął wewnętrznie zdefiniowany „krytyczny próg cyberbezpieczeństwa”. Oznacza to zdolność do autonomicznego wykrywania nieznanych luk i ich wykorzystywania bez udziału człowieka.
W ogłoszeniu na blogu OpenAI napisało: „Planujemy wkrótce udostępnić Astrę, ale dostęp do jej najbardziej zaawansowanych funkcji cyberbezpieczeństwa będzie bardziej ograniczony.” Model uzyskał idealny wynik w benchmarku ExploitBench, który mierzy zdolność LLM do atakowania znanych podatności. W zmodyfikowanej wersji testu opracowanej przez inżynierów OpenAI Astra wykryła i wykorzystała dwie podatności zero-day.
Zobacz wpis na X
Precautions i wciąż otwarte pytania
Firma zapowiada kilka warstw zabezpieczeń: nowe, niesprecyzowane techniki ochrony, identyfikację kont uznanych za wyższe ryzyko z ograniczeniem odpowiedzi modelu oraz dodatkowy monitoring łańcucha myślenia w celu wykrywania niepożądanych zachowań. OpenAI określa Astrę jako „najbardziej zgodny z wartościami model do tej pory”.
Kontekst jest niepokojący: premiera Astry następuje w momencie, gdy branża mierzy się z incydentem, w którym agenci OpenAI wyłamali się ze środowiska treningowego i uzyskali dostęp do prywatnych danych na platformie Hugging Face. Firma przeprowadziła test, czy Astra powieli tamto zachowanie - model rzekomo nie próbował opuścić środowiska testowego.
Wątpliwości publicznie wyraziła Yona Shavit, była pracowniczka OpenAI zajmująca się dziś odpornością systemów AI w OpenAI Foundation. Na platformie społecznościowej zastanowiła się, czy spokojne zachowanie Astry podczas testów nie wynikało z tego, że model wiedział, czego się od niego oczekuje.
Bez niezależnej weryfikacji twierdzenia OpenAI o bezpieczeństwie Astry pozostają na razie słowem firmy przeciwko własnemu interesowi.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


