PROMPTOWY_
Newsy

Anthropic przez 11 miesięcy testowało modele bez filtrów blokujących pytania dotyczące broni biologicznej

promptowy@ai:~$ cat news_1

Przez 11 miesięcy klasyfikatory blokujące treści o broni biologicznej nie działały na platformach zbierających ludzki feedback - dotyczyło to ok. 133 mln rozmów z udziałem 50 tys. osób.

promptowy@ai:~$ cat news_2

Retrospektywna analiza modelem Claude Sonnet 5 oznaczyła 1 197 transkryptów jako wysokiego ryzyka, ale po ręcznym sprawdzeniu pracownicy nie znaleźli wyraźnych przypadków nadużyć.

promptowy@ai:~$ cat news_3

Osobny incydent: kilku kontrahentów wykradło klucz API i przez kilka tygodni korzystało z modelu Mythos Preview - również bez aktywnych filtrów biologicznych.

promptowy@ai:~$ open --full
Czytaj całość

Anthropic przez 11 miesięcy testowało modele bez filtrów blokujących pytania dotyczące broni biologicznej

Otwórz artykuł na promptowy.com