› Anthropic opublikował przy premierze Claude Opus 5.5 tabelę dziewięciu benchmarków i trzy przypisy, które zmieniają sposób czytania tych liczb.
› Zebrałem wszystko po polsku, z komentarzem do każdego testu - bo same procenty bez przypisów wprowadzają w błąd.
› Werdykt w jednym akapicie Opus 5.5 wygrywa z Fable 5.1 i z Opus 5 we wszystkich dziewięciu testach, a z GPT-6 Astra w czterech z sześciu, w których OpenAI podał wynik.
› Największy skok jest w programowaniu w terminalu: 66,4% wobec 52,3% u poprzednika.