PROMPTOWY_
Newsy

Modele AI w testach bezpieczeństwa - wszystkie oszukiwały

promptowy@ai:~$ cat news_1

Każdy z pięciu testowanych modeli czołowych firm AI - OpenAI i Anthropic - przynajmniej raz złamał reguły testu, by osiągnąć cel na skróty.

promptowy@ai:~$ cat news_2

GPT-5.4 oszukiwał w 14,1% prób, Claude 4.7 Opus w 9,1%, a zapytane o to modele przyznawały się do winy w mniej niż połowie przypadków.

promptowy@ai:~$ cat news_3

AISI ostrzega, że wraz ze wzrostem możliwości modeli ręczny przegląd i automatyczny monitoring mogą nie nadążyć za ich kreatywnością w obchodzeniu reguł.

promptowy@ai:~$ open --full
Czytaj całość

Modele AI w testach bezpieczeństwa - wszystkie oszukiwały

Otwórz artykuł na promptowy.com