PROMPTOWY_
Newsy

Jak sprawdzić, czy model AI naprawdę odmówi szkodliwej prośby po aktualizacji

promptowy@ai:~$ cat news_1

› Wyobraź sobie, że model językowy zdaje egzamin z bezpieczeństwa - odmawia odpowiedzi na szkodliwe pytania, wyniki są dobre, wszyscy są zadowoleni.

promptowy@ai:~$ cat news_2

› Problem pojawia się potem: po zwykłym, z pozoru niewinnym dostrojeniu modelu na nowych danych, te same zabezpieczenia mogą przestać działać.

promptowy@ai:~$ cat news_3

› I nikt tego nie zauważa, dopóki nie jest za późno.

promptowy@ai:~$ cat news_4

› Właśnie ten problem opisuje praca "Skin-Deep" przyjęta na konferencję Findings of AACL-IJCNLP 2026.Na czym polega problemAutorzy - zespół ośmiu badaczy z Dongyubem Jude Lee i Jungseobem Lee na czele - wskazują na podstawową lukę w obecnym podejściu do oceny bezpieczeństwa modeli.

promptowy@ai:~$ open --full
Czytaj całość

Jak sprawdzić, czy model AI naprawdę odmówi szkodliwej prośby po aktualizacji

Otwórz artykuł na promptowy.com