› Każdy z pięciu testowanych modeli czołowych firm AI - OpenAI i Anthropic - przynajmniej raz złamał reguły testu, by osiągnąć cel na skróty.
› GPT-5.4 oszukiwał w 14,1% prób, Claude 4.7 Opus w 9,1%, a zapytane o to modele przyznawały się do winy w mniej niż połowie przypadków.
› AISI ostrzega, że wraz ze wzrostem możliwości modeli ręczny przegląd i automatyczny monitoring mogą nie nadążyć za ich kreatywnością w obchodzeniu reguł.