› Wyobraź sobie, że model językowy zdaje egzamin z bezpieczeństwa - odmawia odpowiedzi na szkodliwe pytania, wyniki są dobre, wszyscy są zadowoleni.
› Problem pojawia się potem: po zwykłym, z pozoru niewinnym dostrojeniu modelu na nowych danych, te same zabezpieczenia mogą przestać działać.
› I nikt tego nie zauważa, dopóki nie jest za późno.
› Właśnie ten problem opisuje praca "Skin-Deep" przyjęta na konferencję Findings of AACL-IJCNLP 2026.Na czym polega problemAutorzy - zespół ośmiu badaczy z Dongyubem Jude Lee i Jungseobem Lee na czele - wskazują na podstawową lukę w obecnym podejściu do oceny bezpieczeństwa modeli.