Astra w niezależnym rankingu: 61 punktów i miejsce za dwoma modelami Claude
Dzień po premierze przyszedł pierwszy wynik spoza OpenAI. W zbiorczym indeksie inteligencji nowy model nie zajął pierwszego miejsca, i to mówi o nim więcej niż wszystkie rekordy z komunikatu.
👁 142 przeczytań
Komunikaty premierowe mają jedną wspólną cechę: wszystkie wykresy w nich zaczynają się od zera i kończą na nowym modelu. Dlatego przy każdej premierze czekam na pierwszy wynik zmierzony przez kogoś, kto modelu nie sprzedaje. Przy GPT-6 Astra przyszedł wyjątkowo szybko, dzień po premierze, i jest ciekawszy niż komunikat.
W indeksie inteligencji Artificial Analysis, który agreguje wyniki z kilkunastu testów i z którego korzystam w rankingu modeli, GPT-6 Astra dostała 61 punktów w najwyższym ustawieniu rozumowania. W ustawieniu wysokim 60, w średnim 59. Claude Opus 5 ma w tym samym indeksie 63 punkty, a Claude Fable 5, model sprzed prawie trzech miesięcy, 62.
Jak model z rekordami może nie być pierwszy
Odpowiedź leży w konstrukcji indeksu. Zbiorczy wynik nie jest średnią z najgłośniejszych testów, tylko z szerokiego zestawu, w którym matematyka najwyższego poziomu jest jedną pozycją z wielu. Astra osiąga w niej 97,6 procent, o dziesięć punktów więcej niż najmocniejszy model Anthropica, ale w teście szerokiej wiedzy ogólnej dostaje 57,2 procent wobec 65,0 procent u konkurenta. Jedno z drugim się znosi, a reszta rozstrzyga o kolejności.
To nie jest zarzut wobec modelu. To jest informacja o jego profilu: Astra jest wyspecjalizowanym narzędziem o ekstremalnych osiągach w kilku dziedzinach, a nie równomiernie najlepszym modelem do wszystkiego. Kto potrzebuje matematyki, automatyzacji albo cyberbezpieczeństwa, dostaje coś, czego wcześniej nie było. Kto potrzebuje szerokiej wiedzy i języka, ma tańsze i lepsze opcje.
Trzy ustawienia, trzy różne modele
Warto zwrócić uwagę na rozrzut między ustawieniami: 61, 60 i 59 punktów. Różnica dwóch punktów między najwyższym a średnim trybem rozumowania oznacza, że w praktyce dostajesz różny model w zależności od tego, ile pozwolisz mu myśleć. Przy cenie 10 i 50 dolarów za milion tokenów tryb najwyższy potrafi kosztować kilkukrotnie więcej niż średni, bo model generuje znacznie więcej tokenów rozumowania przed odpowiedzią.
Praktyczna rada: zanim ustawisz najwyższy tryb jako domyślny, sprawdź na swoich zadaniach, czy te dwa punkty w indeksie są warte różnicy w rachunku. W wielu przypadkach nie są.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co dalej z rankingiem
Indeks będzie się zmieniał, gdy pojawią się kolejne pomiary, a ustawienia modelu zostaną doprecyzowane. Nie zdziwię się, jeśli Astra zyska punkt lub dwa. Nie zdziwię się też, jeśli nie zyska, bo jej słabsze pozycje nie wynikają z niedopracowania, tylko z wyboru priorytetów przy trenowaniu.
Aktualną kolejność, razem ze stawkami i szybkością, sprawdzisz w rankingu modeli AI, który odświeża się dwa razy dziennie. Pełną tabelę benchmarków z porównaniem do Claude rozpisałem w tekście o testach, w których Astra przegrywa, a wszystkie dane modelu zebrałem w przewodniku.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


