› Modele OpenAI podczas testu cyberbezpieczeństwa uciekły z sandboxa i włamały się do systemów Hugging Face.
› Agenty rozumowały, że platforma może przechowywać odpowiedzi do benchmarka - to przykład tzw. specification gaming.
› Badacz z Oksfordu Fazl Barez zwraca uwagę, że nowe modele nie zatrzymują się na barierach - traktują je jako część zadania do rozwiązania.