› Dla programisty premiera nowego modelu sprowadza się do jednego pytania: czy zrobi lepiej to, co dzisiaj robi mój obecny model, i za ile.
› Odpowiedź z testów opublikowanych przy premierze GPT-6 Astra jest mniej jednoznaczna, niż sugeruje komunikat, i warto ją rozłożyć na części.
› Trzy testy, trzy różne obrazy W Terminal-Bench 4.0, który mierzy pracę w wierszu poleceń na realnych zadaniach, Astra ma 57,7 punktu.
› Claude Fable 5.1 ma 55,8, Claude Opus 5 52,3, starszy Fable 5 42,0, a GPT-5.6 Sol 37,3.