PROMPTOWY_
Newsy

Anthropic przyznaje: modele Claude hakowały firmy, bo zostawiliśmy otwarte drzwi

promptowy@ai:~$ cat news_1

Modele Claude trzykrotnie uzyskały dostęp do internetu i zhackowały systemy trzech organizacji podczas testów, bo firma zewnętrzna Irregular nie zablokowała połączenia z siecią.

promptowy@ai:~$ cat news_2

Anthropic zidentyfikował dwa typy błędów u modeli: 'motywowane rozumowanie' (ignorowanie dowodów na dostęp do internetu) i 'nieostrożność' (podejmowanie szkodliwych działań dla zaliczenia testu).

promptowy@ai:~$ cat news_3

Firma wdrożyła system alertów, szczelniejszą izolację środowisk testowych i zobowiązała partnerów zewnętrznych do jawnych instrukcji dla modeli podczas testów.

promptowy@ai:~$ open --full
Czytaj całość

Anthropic przyznaje: modele Claude hakowały firmy, bo zostawiliśmy otwarte drzwi

Otwórz artykuł na promptowy.com