🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Magazyn

GPT-6 Astra dla programistów: co mówią testy kodu, a czego nie mówią

W teście terminalowym Astra prowadzi, w teście napraw kodu wygrywa o półtora punktu, a w rozszerzonym teście programowania przegrywa z modelem sprzed trzech miesięcy. Rozkładam wyniki na to, co znaczą przy codziennej pracy z kodem.

2 min czytania
GPT-6 Astra dla programistów: co mówią testy kodu, a czego nie mówią

👁 154 przeczytań

Dla programisty premiera nowego modelu sprowadza się do jednego pytania: czy zrobi lepiej to, co dzisiaj robi mój obecny model, i za ile. Odpowiedź z testów opublikowanych przy premierze GPT-6 Astra jest mniej jednoznaczna, niż sugeruje komunikat, i warto ją rozłożyć na części.

Trzy testy, trzy różne obrazy

W Terminal-Bench 4.0, który mierzy pracę w wierszu poleceń na realnych zadaniach, Astra ma 57,7 punktu. Claude Fable 5.1 ma 55,8, Claude Opus 5 52,3, starszy Fable 5 42,0, a GPT-5.6 Sol 37,3. Przewaga nad bezpośrednim konkurentem wynosi niecałe dwa punkty, ale skok względem własnego poprzednika jest ogromny: z 37,3 na 57,7.

W DeepSWE v1.1, teście naprawiania błędów w prawdziwych repozytoriach, Astra uzyskała 74,1 procent wobec 72,7 procent u Sola. Poprawa jest, ale nieduża. Na tym poziomie trudności różnica półtora punktu oznacza kilka zadań na sto.

I wreszcie FrontierCode 1.1 w wariancie rozszerzonym: Astra 64,5 procent, Claude Fable 5 64,9 procent. Model sprzed prawie trzech miesięcy, w tej samej cenie, wypada o włos lepiej.

Czego te liczby nie mówią

Testy mierzą zadania zamknięte: jest błąd do naprawienia, jest polecenie do wykonania, jest wynik do sprawdzenia. Codzienna praca z kodem to w większości coś innego: czytanie cudzego kodu, decyzje architektoniczne, rozmowa o tym, czego w ogóle nie robić. Tego żaden z tych testów nie mierzy i różnice między modelami bywają tam inne niż w tabeli.

Druga rzecz: ceny. Astra kosztuje 10 i 50 dolarów za milion tokenów, Sol 2 i 10. Przewaga półtora punktu w naprawie błędów przy pięciokrotnej różnicy w cenie jest argumentem tylko wtedy, gdy te kilka procent zadań, których Sol nie zrobi, kosztuje więcej niż dopłata za wszystkie pozostałe.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Gdzie Astra naprawdę zmienia grę dla programisty

Dwa miejsca. Pierwsze to długi kontekst: w teście odnajdywania informacji w tekście o długości od pół miliona do miliona tokenów Astra ma 96,3 procent wobec 73,8 u poprzednika. To jest różnica między wrzuceniem całego repozytorium do kontekstu i ufaniem, że model nic nie zgubi, a dzieleniem go na kawałki. Drugie to praca agentowa: w teście automatyzacji zadań zawodowych Astra ma 41,4 punktu wobec 31,4 u Fable 5.1 i 18,1 u Sola, a w OSWorld, teście sterowania komputerem, 72,6 procent wobec 65,7.

Jeżeli twoja praca to długie sesje agenta na dużym kodzie, Astra jest pierwszym modelem, który robi to wyraźnie lepiej od reszty. Jeżeli to pojedyncze pytania i szybkie poprawki, tańszy model zrobi to samo, a rachunek będzie pięć razy niższy.

Pełna tabela testów z porównaniem do konkurencji jest w tekście o benchmarkach Astry, a wszystkie dane modelu w przewodniku.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie