PROMPTOWY_
Warsztat

Czy Claude Opus 5.5 zmyśla liczby? Test z pułapką na zarząd

promptowy@ai:~$ cat news_1

Najmocniejsze twierdzenie Anthropic przy premierze Claude Opus 5.5 nie dotyczy programowania, tylko rzetelności: model ma być dużo mniej skłonny do podania liczby, której nie ma w źródłach.

promptowy@ai:~$ cat news_2

Zbudowałem pułapkę, na którą modele zwykle się łapią - i sprawdziłem, jak zachowają się Opus 5 i Opus 5.5.

promptowy@ai:~$ cat news_3

Werdykt w jednym akapicie W moim teście remis: oba modele odmówiły wymyślenia wszystkich czterech brakujących liczb, oba policzyły poprawnie jedyne dwie rzeczy, które wynikały z danych, i oba wprost napisały zarządowi, czego nie da się podać.

promptowy@ai:~$ cat news_4

Moja pułapka okazała się za łatwa, żeby rozdzielić te dwie generacje.

promptowy@ai:~$ open --full
Czytaj całość

Czy Claude Opus 5.5 zmyśla liczby? Test z pułapką na zarząd

Otwórz artykuł na promptowy.com