🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Magazyn

Przeczytałem wszystkie benchmarki GPT-6 Astra. Są trzy, w których przegrywa

Komunikat prasowy pokazuje wykresy, na których nowy model wygrywa wszystko. W pełnej tabeli widać coś innego: trzy testy, w których Astra jest gorsza od konkurencji, i jeden, który mówi o niej najwięcej.

4 min czytania
Przeczytałem wszystkie benchmarki GPT-6 Astra. Są trzy, w których przegrywa

👁 206 przeczytań

// w skrócie
  • GPT-6 Astra przegrywa w Humanity's Last Exam z narzędziami, gdzie uzyskuje 57,2%, podczas gdy Claude Fable 5.1 osiąga 65,0%, a Opus 5 - 63,6%.
  • W teście MRCR v2 przy długości 512K-1M tokenów Astra odnajduje 96,3% ukrytych informacji, wobec 73,8% poprzednika GPT-5.6 Sol.
  • Astra uzyskała 0% w teście prób oszustwa zadania, podczas gdy jej poprzednik GPT-5.6 Sol próbował oszukiwać w 48,2% przypadków.

Przy każdej premierze modelu powtarza się ten sam rytuał. Producent publikuje zestaw wykresów, na których jego nowość góruje nad wszystkim, media przepisują trzy najbardziej efektowne liczby, a po tygodniu okazuje się, że obraz był bardziej złożony. Postanowiłem więc przejść przez pełną tabelę wyników GPT-6 Astra, łącznie z tymi pozycjami, których nie ma w nagłówkach.

Zacznijmy od uczciwego stwierdzenia: w większości testów przewaga tego modelu jest prawdziwa i miejscami ogromna. Ale są trzy miejsca, w których nie wygrywa, i akurat one mówią o rynku więcej niż rekordy.

Test GPT-6 Astra Fable 5.1 Opus 5 GPT-5.6 Sol
FrontierMath Tier 4 97,6% 87,8% 73,2% -
ARC-AGI-3 99,9% - 30,2% 7,8%
Terminal-Bench 4.0 57,7 55,8 52,3 37,3
AutomationBench 41,4 31,4 26,9 18,1
ExploitBench 100% 70,0% - 78,5%
SRE-Bench 88,0% 12,5% - 55,9%
Humanity’s Last Exam (z narzędziami) 57,2% 65,0% 63,6% -
FrontierCode 1.1 Extended 64,5% - - -
HealthBench Professional 63,4% 56,6% - 60,5%
MRCR v2, 8 igieł, 512K-1M 96,3% - - 73,8%
Wyniki podane przez OpenAI przy premierze 3 września 2026, zestawione przez Vellum i DataCamp. Pogrubienie oznacza najlepszy wynik w wierszu. Myślnik oznacza, że dla danego modelu nie opublikowano wyniku w tym teście.

Pierwsza przegrana: egzamin, w którym liczy się szeroka wiedza

Humanity’s Last Exam to test złożony z bardzo trudnych pytań z wielu dziedzin, pomyślany tak, żeby nie dało się go zaliczyć samą sprawnością rachunkową. W wariancie z dostępem do narzędzi Astra uzyskała 57,2 procent. Claude Fable 5.1 uzyskał 65,0 procent, starszy Fable 5 63,8 procent, a Opus 5 63,6 procent.

To nie jest różnica na granicy błędu, tylko blisko osiem punktów procentowych na niekorzyść modelu, który w tej samej tabeli osiąga 97,6 procent w matematyce najwyższego poziomu. Innymi słowy, mamy do czynienia z modelem wybitnie wyspecjalizowanym, a nie z równomiernie lepszym od wszystkiego.

Druga przegrana: ten sam egzamin, model za połowę ceny

W tym samym teście Astrę wyprzedza nie tylko flagowiec Anthropica. Claude Opus 5, sprzedawany za 5 i 25 dolarów, czyli za połowę stawki Astry, uzyskał 63,6 procent, a więc również ponad sześć punktów więcej. Jeżeli twoja praca polega na odpowiadaniu na trudne pytania z wielu dziedzin, a nie na liczeniu, płacisz dwa razy więcej za gorszy wynik.

Trzecia przegrana: kod w wersji rozszerzonej

W teście FrontierCode w wariancie rozszerzonym Astra uzyskała 64,5 procent, a starszy Claude Fable 5 zdobył 64,9 procent. Różnica jest symboliczna, ale wymowna, bo mówimy o modelu wprowadzonym na rynek prawie trzy miesiące wcześniej, w tej samej cenie.

Liczba, która robi największe wrażenie, i nie jest nią matematyka

Gdybym miał wskazać jeden wynik z tej tabeli, który naprawdę zmienia sposób pracy, nie byłoby to 97,6 procent z matematyki ani nawet 99,9 procent z rozumowania abstrakcyjnego. Byłby to test na odnajdywanie ośmiu informacji ukrytych w bardzo długim tekście. W przedziale od pół miliona do miliona tokenów Astra znalazła 96,3 procent z nich, podczas gdy poprzednik osiągał tam 73,8 procent.

To jest różnica między modelem, któremu można wrzucić komplet dokumentacji projektu i ufać, że nic nie zgubi, a modelem, przy którym trzeba dzielić materiał na kawałki i pilnować go ręcznie. Dla codziennej pracy z długimi dokumentami znaczy to więcej niż rekord w olimpiadzie matematycznej.

Druga liczba, o której nikt nie mówi

W zestawie testów sprawdzających uczciwość modelu jest pozycja mierząca, jak często system próbuje oszukać zadanie zamiast je wykonać, gdy da mu się taką okazję. Astra uzyskała tam zero procent. Jej poprzednik, GPT-5.6 Sol, próbował oszukiwać w 48,2 procent przypadków. Podobnie w teście bezpieczeństwa przy sterowaniu komputerem: 2,4 procent wobec 22 procent.

Jeżeli te liczby potwierdzą się w praktyce, będzie to najważniejsza zmiana w tej premierze. Model, który realnie wykonuje zadanie zamiast szukać skrótu, jest wart więcej niż model o kilka punktów lepszy w benchmarku, ale kombinujący za plecami użytkownika.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika przy wyborze narzędzia

Trzy wnioski. Astra jest wyraźnie najlepsza w matematyce, rozumowaniu abstrakcyjnym, automatyzacji i cyberbezpieczeństwie, i tam jej wysoka cena ma uzasadnienie. W zadaniach wymagających szerokiej wiedzy ogólnej modele Anthropica nadal wygrywają, mimo identycznej stawki. A w codziennym pisaniu i redagowaniu żaden z tych dwóch modeli nie jest potrzebny i lepiej wydać pięć razy mniej.

Wszystkie liczby pochodzą z materiałów opublikowanych przy premierze 3 września 2026 i zestawień przygotowanych przez niezależne serwisy. Własnego pomiaru po polsku jeszcze nie zrobiłem, bo model nie trafił do pośredników, przez których testuję. Zrobię go, gdy tylko będzie taka możliwość. Pełne dane modelu zebrałem w przewodniku o GPT-6 Astra.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

W których benchmarkach GPT-6 Astra przegrywa z konkurencją?

Astra przegrywa w teście Humanity's Last Exam (57,2% wobec 65,0% Claude Fable 5.1), w tym samym teście z Claude Opus 5 (63,6%) oraz symbolicznie w FrontierCode 1.1 Extended (64,5% wobec 64,9% Fable 5). Są to trzy konkretne wyniki opublikowane przy premierze 3 września 2026.

Czy GPT-6 Astra jest droższa od modeli Anthropica?

Claude Opus 5 kosztuje 5 i 25 dolarów, co stanowi połowę stawki Astry, a mimo to wyprzedza ją w Humanity's Last Exam o ponad sześć punktów procentowych. Oznacza to, że w zadaniach wymagających szerokiej wiedzy ogólnej płaci się dwa razy więcej za gorszy wynik.

Jak GPT-6 Astra radzi sobie z bardzo długimi dokumentami?

W teście MRCR v2 przy przedziale od pół miliona do miliona tokenów Astra odnalazła 96,3% ukrytych informacji, podczas gdy poprzednik GPT-5.6 Sol osiągał 73,8%. Ta różnica oznacza, że Astrze można powierzyć kompletną dokumentację projektu bez ręcznego dzielenia materiału na kawałki.

Kiedy odbyła się premiera GPT-6 Astra i skąd pochodzą dane benchmarkowe?

Premiera GPT-6 Astra odbyła się 3 września 2026, a wyniki opublikował OpenAI. Dane zostały zestawione przez niezależne serwisy Vellum i DataCamp.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie