🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Magazyn

Astra w niezależnym rankingu: 61 punktów i miejsce za dwoma modelami Claude

Dzień po premierze przyszedł pierwszy wynik spoza OpenAI. W zbiorczym indeksie inteligencji nowy model nie zajął pierwszego miejsca, i to mówi o nim więcej niż wszystkie rekordy z komunikatu.

3 min czytania
Astra w niezależnym rankingu: 61 punktów i miejsce za dwoma modelami Claude

👁 142 przeczytań

Komunikaty premierowe mają jedną wspólną cechę: wszystkie wykresy w nich zaczynają się od zera i kończą na nowym modelu. Dlatego przy każdej premierze czekam na pierwszy wynik zmierzony przez kogoś, kto modelu nie sprzedaje. Przy GPT-6 Astra przyszedł wyjątkowo szybko, dzień po premierze, i jest ciekawszy niż komunikat.

W indeksie inteligencji Artificial Analysis, który agreguje wyniki z kilkunastu testów i z którego korzystam w rankingu modeli, GPT-6 Astra dostała 61 punktów w najwyższym ustawieniu rozumowania. W ustawieniu wysokim 60, w średnim 59. Claude Opus 5 ma w tym samym indeksie 63 punkty, a Claude Fable 5, model sprzed prawie trzech miesięcy, 62.

Jak model z rekordami może nie być pierwszy

Odpowiedź leży w konstrukcji indeksu. Zbiorczy wynik nie jest średnią z najgłośniejszych testów, tylko z szerokiego zestawu, w którym matematyka najwyższego poziomu jest jedną pozycją z wielu. Astra osiąga w niej 97,6 procent, o dziesięć punktów więcej niż najmocniejszy model Anthropica, ale w teście szerokiej wiedzy ogólnej dostaje 57,2 procent wobec 65,0 procent u konkurenta. Jedno z drugim się znosi, a reszta rozstrzyga o kolejności.

To nie jest zarzut wobec modelu. To jest informacja o jego profilu: Astra jest wyspecjalizowanym narzędziem o ekstremalnych osiągach w kilku dziedzinach, a nie równomiernie najlepszym modelem do wszystkiego. Kto potrzebuje matematyki, automatyzacji albo cyberbezpieczeństwa, dostaje coś, czego wcześniej nie było. Kto potrzebuje szerokiej wiedzy i języka, ma tańsze i lepsze opcje.

Trzy ustawienia, trzy różne modele

Warto zwrócić uwagę na rozrzut między ustawieniami: 61, 60 i 59 punktów. Różnica dwóch punktów między najwyższym a średnim trybem rozumowania oznacza, że w praktyce dostajesz różny model w zależności od tego, ile pozwolisz mu myśleć. Przy cenie 10 i 50 dolarów za milion tokenów tryb najwyższy potrafi kosztować kilkukrotnie więcej niż średni, bo model generuje znacznie więcej tokenów rozumowania przed odpowiedzią.

Praktyczna rada: zanim ustawisz najwyższy tryb jako domyślny, sprawdź na swoich zadaniach, czy te dwa punkty w indeksie są warte różnicy w rachunku. W wielu przypadkach nie są.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co dalej z rankingiem

Indeks będzie się zmieniał, gdy pojawią się kolejne pomiary, a ustawienia modelu zostaną doprecyzowane. Nie zdziwię się, jeśli Astra zyska punkt lub dwa. Nie zdziwię się też, jeśli nie zyska, bo jej słabsze pozycje nie wynikają z niedopracowania, tylko z wyboru priorytetów przy trenowaniu.

Aktualną kolejność, razem ze stawkami i szybkością, sprawdzisz w rankingu modeli AI, który odświeża się dwa razy dziennie. Pełną tabelę benchmarków z porównaniem do Claude rozpisałem w tekście o testach, w których Astra przegrywa, a wszystkie dane modelu zebrałem w przewodniku.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie