PROMPTOWY_
Warsztat

Claude Opus 5.5 benchmarki: pełna tabela 9 testów i przypisy, których nikt nie tłumaczy

promptowy@ai:~$ cat news_1

› Anthropic opublikował przy premierze Claude Opus 5.5 tabelę dziewięciu benchmarków i trzy przypisy, które zmieniają sposób czytania tych liczb.

promptowy@ai:~$ cat news_2

› Zebrałem wszystko po polsku, z komentarzem do każdego testu - bo same procenty bez przypisów wprowadzają w błąd.

promptowy@ai:~$ cat news_3

› Werdykt w jednym akapicie Opus 5.5 wygrywa z Fable 5.1 i z Opus 5 we wszystkich dziewięciu testach, a z GPT-6 Astra w czterech z sześciu, w których OpenAI podał wynik.

promptowy@ai:~$ cat news_4

› Największy skok jest w programowaniu w terminalu: 66,4% wobec 52,3% u poprzednika.

promptowy@ai:~$ open --full
Czytaj całość

Claude Opus 5.5 benchmarki: pełna tabela 9 testów i przypisy, których nikt nie tłumaczy

Otwórz artykuł na promptowy.com