Przeczytałem wszystkie benchmarki GPT-6 Astra. Są trzy, w których przegrywa
Komunikat prasowy pokazuje wykresy, na których nowy model wygrywa wszystko. W pełnej tabeli widać coś innego: trzy testy, w których Astra jest gorsza od konkurencji, i jeden, który mówi o niej najwięcej.
👁 206 przeczytań
- GPT-6 Astra przegrywa w Humanity's Last Exam z narzędziami, gdzie uzyskuje 57,2%, podczas gdy Claude Fable 5.1 osiąga 65,0%, a Opus 5 - 63,6%.
- W teście MRCR v2 przy długości 512K-1M tokenów Astra odnajduje 96,3% ukrytych informacji, wobec 73,8% poprzednika GPT-5.6 Sol.
- Astra uzyskała 0% w teście prób oszustwa zadania, podczas gdy jej poprzednik GPT-5.6 Sol próbował oszukiwać w 48,2% przypadków.
Przy każdej premierze modelu powtarza się ten sam rytuał. Producent publikuje zestaw wykresów, na których jego nowość góruje nad wszystkim, media przepisują trzy najbardziej efektowne liczby, a po tygodniu okazuje się, że obraz był bardziej złożony. Postanowiłem więc przejść przez pełną tabelę wyników GPT-6 Astra, łącznie z tymi pozycjami, których nie ma w nagłówkach.
Zacznijmy od uczciwego stwierdzenia: w większości testów przewaga tego modelu jest prawdziwa i miejscami ogromna. Ale są trzy miejsca, w których nie wygrywa, i akurat one mówią o rynku więcej niż rekordy.
| Test | GPT-6 Astra | Fable 5.1 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| FrontierMath Tier 4 | 97,6% | 87,8% | 73,2% | - |
| ARC-AGI-3 | 99,9% | - | 30,2% | 7,8% |
| Terminal-Bench 4.0 | 57,7 | 55,8 | 52,3 | 37,3 |
| AutomationBench | 41,4 | 31,4 | 26,9 | 18,1 |
| ExploitBench | 100% | 70,0% | - | 78,5% |
| SRE-Bench | 88,0% | 12,5% | - | 55,9% |
| Humanity’s Last Exam (z narzędziami) | 57,2% | 65,0% | 63,6% | - |
| FrontierCode 1.1 Extended | 64,5% | - | - | - |
| HealthBench Professional | 63,4% | 56,6% | - | 60,5% |
| MRCR v2, 8 igieł, 512K-1M | 96,3% | - | - | 73,8% |
Pierwsza przegrana: egzamin, w którym liczy się szeroka wiedza
Humanity’s Last Exam to test złożony z bardzo trudnych pytań z wielu dziedzin, pomyślany tak, żeby nie dało się go zaliczyć samą sprawnością rachunkową. W wariancie z dostępem do narzędzi Astra uzyskała 57,2 procent. Claude Fable 5.1 uzyskał 65,0 procent, starszy Fable 5 63,8 procent, a Opus 5 63,6 procent.
To nie jest różnica na granicy błędu, tylko blisko osiem punktów procentowych na niekorzyść modelu, który w tej samej tabeli osiąga 97,6 procent w matematyce najwyższego poziomu. Innymi słowy, mamy do czynienia z modelem wybitnie wyspecjalizowanym, a nie z równomiernie lepszym od wszystkiego.
Druga przegrana: ten sam egzamin, model za połowę ceny
W tym samym teście Astrę wyprzedza nie tylko flagowiec Anthropica. Claude Opus 5, sprzedawany za 5 i 25 dolarów, czyli za połowę stawki Astry, uzyskał 63,6 procent, a więc również ponad sześć punktów więcej. Jeżeli twoja praca polega na odpowiadaniu na trudne pytania z wielu dziedzin, a nie na liczeniu, płacisz dwa razy więcej za gorszy wynik.
Trzecia przegrana: kod w wersji rozszerzonej
W teście FrontierCode w wariancie rozszerzonym Astra uzyskała 64,5 procent, a starszy Claude Fable 5 zdobył 64,9 procent. Różnica jest symboliczna, ale wymowna, bo mówimy o modelu wprowadzonym na rynek prawie trzy miesiące wcześniej, w tej samej cenie.
Liczba, która robi największe wrażenie, i nie jest nią matematyka
Gdybym miał wskazać jeden wynik z tej tabeli, który naprawdę zmienia sposób pracy, nie byłoby to 97,6 procent z matematyki ani nawet 99,9 procent z rozumowania abstrakcyjnego. Byłby to test na odnajdywanie ośmiu informacji ukrytych w bardzo długim tekście. W przedziale od pół miliona do miliona tokenów Astra znalazła 96,3 procent z nich, podczas gdy poprzednik osiągał tam 73,8 procent.
To jest różnica między modelem, któremu można wrzucić komplet dokumentacji projektu i ufać, że nic nie zgubi, a modelem, przy którym trzeba dzielić materiał na kawałki i pilnować go ręcznie. Dla codziennej pracy z długimi dokumentami znaczy to więcej niż rekord w olimpiadzie matematycznej.
Druga liczba, o której nikt nie mówi
W zestawie testów sprawdzających uczciwość modelu jest pozycja mierząca, jak często system próbuje oszukać zadanie zamiast je wykonać, gdy da mu się taką okazję. Astra uzyskała tam zero procent. Jej poprzednik, GPT-5.6 Sol, próbował oszukiwać w 48,2 procent przypadków. Podobnie w teście bezpieczeństwa przy sterowaniu komputerem: 2,4 procent wobec 22 procent.
Jeżeli te liczby potwierdzą się w praktyce, będzie to najważniejsza zmiana w tej premierze. Model, który realnie wykonuje zadanie zamiast szukać skrótu, jest wart więcej niż model o kilka punktów lepszy w benchmarku, ale kombinujący za plecami użytkownika.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika przy wyborze narzędzia
Trzy wnioski. Astra jest wyraźnie najlepsza w matematyce, rozumowaniu abstrakcyjnym, automatyzacji i cyberbezpieczeństwie, i tam jej wysoka cena ma uzasadnienie. W zadaniach wymagających szerokiej wiedzy ogólnej modele Anthropica nadal wygrywają, mimo identycznej stawki. A w codziennym pisaniu i redagowaniu żaden z tych dwóch modeli nie jest potrzebny i lepiej wydać pięć razy mniej.
Wszystkie liczby pochodzą z materiałów opublikowanych przy premierze 3 września 2026 i zestawień przygotowanych przez niezależne serwisy. Własnego pomiaru po polsku jeszcze nie zrobiłem, bo model nie trafił do pośredników, przez których testuję. Zrobię go, gdy tylko będzie taka możliwość. Pełne dane modelu zebrałem w przewodniku o GPT-6 Astra.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
W których benchmarkach GPT-6 Astra przegrywa z konkurencją?
Astra przegrywa w teście Humanity's Last Exam (57,2% wobec 65,0% Claude Fable 5.1), w tym samym teście z Claude Opus 5 (63,6%) oraz symbolicznie w FrontierCode 1.1 Extended (64,5% wobec 64,9% Fable 5). Są to trzy konkretne wyniki opublikowane przy premierze 3 września 2026.
Czy GPT-6 Astra jest droższa od modeli Anthropica?
Claude Opus 5 kosztuje 5 i 25 dolarów, co stanowi połowę stawki Astry, a mimo to wyprzedza ją w Humanity's Last Exam o ponad sześć punktów procentowych. Oznacza to, że w zadaniach wymagających szerokiej wiedzy ogólnej płaci się dwa razy więcej za gorszy wynik.
Jak GPT-6 Astra radzi sobie z bardzo długimi dokumentami?
W teście MRCR v2 przy przedziale od pół miliona do miliona tokenów Astra odnalazła 96,3% ukrytych informacji, podczas gdy poprzednik GPT-5.6 Sol osiągał 73,8%. Ta różnica oznacza, że Astrze można powierzyć kompletną dokumentację projektu bez ręcznego dzielenia materiału na kawałki.
Kiedy odbyła się premiera GPT-6 Astra i skąd pochodzą dane benchmarkowe?
Premiera GPT-6 Astra odbyła się 3 września 2026, a wyniki opublikował OpenAI. Dane zostały zestawione przez niezależne serwisy Vellum i DataCamp.



