Przetestowałem GPT-6 Astra po polsku, na kodzie i na 150 tysiącach znaków. Wygrał ktoś inny
Astra była najszybsza i nie zawiesiła się ani razu, ale w polszczyźnie zrobiła ten sam błąd co Fable 5.1, a bezbłędny komplet zaliczył model dwadzieścia razy tańszy. Do tego okazało się, że ten sam polski tekst kosztuje u Claude 60 procent więcej tokenów.
👁 194 przeczytań
- GPT-6 Astra przegrał test polszczyzny z Gemini 3.8 Flash, który kosztuje dwadzieścia razy mniej i jako jedyny poprawnie zastosował wielkie litery we wszystkich sześciu zadaniach.
- Tokenizer Claude dzieli polski tekst na około 60 procent więcej kawałków niż GPT-6 Astra, przez co za to samo zadanie Fable 5.1 kosztował 0,73 dolara wobec 0,58 dolara u Astry.
- Wszystkie cztery modele rozwiązały bezbłędnie 19 na 19 asercji w zadaniach PHP, co autor ocenia jako porażkę testu, a nie sukces modeli - zadania były za łatwe.
Czwartego września GPT-6 Astra trafił do OpenRoutera, czyli do miejsca, przez które mierzę modele od miesięcy. Tego samego wieczoru puściłem go przez trzy zestawy zadań, każdy z odpowiedzią sprawdzalną bez uznaniowości, i postawiłem obok trzech konkurentów: Claude Fable 5.1 w tej samej cenie, Claude Opus 5 za połowę stawki i Gemini 3.8 Flash, który wszedł do oferty dwa dni wcześniej i kosztuje ułamek tego, co pozostałe.
Trzy zestawy to: polszczyzna (sześć zadań z odmiany, liczebników, wielkich liter, imiesłowów, przecinków i prostego języka, te same, którymi mierzę modele od sierpnia), kod (trzy funkcje PHP uruchamiane na ukrytych testach) i igła w stogu (pięć faktów ukrytych w 150 tysiącach znaków polskiego tekstu). Wszystko przy temperaturze 0,2, jeden przebieg, koszt liczony z rachunku API. Zastrzeżenie na wstępie: jeden przebieg to nie benchmark z setkami powtórzeń, ale pokazuje, jak modele zachowały się na moim biurku pierwszego dnia.
Polszczyzna: Gemini za ułamek ceny zrobił komplet
| Model | Poprawne z 6 | Średni czas | Koszt zestawu | Uwagi |
|---|---|---|---|---|
| GPT-6 Astra | 5 | 6,5 s | 0,078 $ | zostawił „Urzędzie Miasta” wielkimi |
| Claude Fable 5.1 | 5 | 9,0 s | 0,108 $ | ten sam błąd co Astra |
| Claude Opus 5 | 4 | 7,8 s | 0,055 $ | „Urzędzie Miasta”, „Pana Dyrektora” i brak odpowiedzi na jedno zadanie po 240 s |
| Gemini 3.8 Flash | 6 | 10,7 s | 0,036 $ | jedyny bez błędu |
Największa niespodzianka nie dotyczy Astry. Gemini 3.8 Flash, model z niższej półki, jako jedyny poprawił wielkie litery w pełni zgodnie z normą: prezydent Warszawy, urząd miasta jako nazwa nieoficjalna i pan dyrektor małymi literami, Ministerstwo Cyfryzacji i Święta Bożego Narodzenia wielkimi. Astra i Fable 5.1 zostawiły „Urzędzie Miasta”, Opus 5 dodatkowo „Pana Dyrektora”. To dokładnie te błędy, które w polskich pismach urzędowych są najczęstsze, więc trudno się dziwić, że modele je powielają.
Astra rozwiązała wszystkie sześć zadań i była najszybsza z całej czwórki, średnio 6,5 sekundy na odpowiedź. Dla porównania, przy premierze Fable 5.1 trzy dni wcześniej to właśnie model Anthropica zawiesił się na liczebnikach; tym razem zawiesił się Opus 5, na zadaniu z urzędniczą polszczyzną, i wisiał do przerwania połączenia po czterech minutach. Zacinanie się na krótkich zadaniach językowych wygląda na cechę rodziny Claude, a nie jednorazowy wypadek.
Przy tej samej temperaturze modele nie są powtarzalne. Przy pierwszym pomiarze Fable 5.1 zapisał „urzędzie miasta” małą literą, tym razem wielką. Ocena z jednego przebiegu jest więc oceną tego przebiegu, nie modelu w ogóle.
Kod: wszyscy 19 na 19, czyli zadania były za łatwe
Trzy funkcje PHP: slug z polskiego tekstu (z transliteracją ogonków), poprawna forma rzeczownika po liczebniku (plik, pliki, plików, z pułapkami typu 12, 22, 101, 124) oraz scalanie nachodzących na siebie przedziałów. Każdą odpowiedź uruchamiałem na ukrytych testach: 19 asercji łącznie.
Wynik: cztery modele, 19 na 19 u każdego. Uczciwie mówiąc, to porażka testu, nie sukces modeli. Zadania, które jeszcze rok temu potrafiły zaskoczyć (liczebniki polskie są klasyczną pułapką), dziś rozwiązuje bez pomyłki także najtańszy model w zestawieniu. Różnice zostały tylko w rachunku: Gemini 3.8 Flash 0,014 dolara za trzy zadania, Opus 5 0,039, Astra 0,040, Fable 5.1 0,048. Następny test kodu będzie musiał być znacząco trudniejszy, żeby cokolwiek zmierzyć.
Igła w stogu: wszyscy trafili, ale rachunki różnią się dwudziestokrotnie
Do 150 tysięcy znaków polskiego tekstu wstawiłem pięć zmyślonych faktów (kod rezerwacji, częstotliwość, numer alejki, hasło z ogonkami, czas przesyłki) w różnych miejscach, od trzeciego do dziewięćdziesiątego szóstego procenta długości, i zadałem pięć pytań.
| Model | Trafione | Tokeny wejścia | Czas | Koszt jednego pytania |
|---|---|---|---|---|
| GPT-6 Astra | 5/5 | 45 882 | 2,8 s | 0,576 $ |
| Claude Fable 5.1 | 5/5 | 73 063 | 4,8 s | 0,733 $ |
| Claude Opus 5 | 5/5 | 73 061 | 8,8 s | 0,370 $ |
| Gemini 3.8 Flash | 5/5 | 43 350 | 3,2 s | 0,033 $ |
Wszyscy znaleźli wszystko, więc jakościowo remis. Ciekawa jest kolumna z tokenami: ten sam polski tekst to 45 882 tokeny u Astry i 43 350 u Gemini, ale 73 063 u obu modeli Claude. Tokenizer Anthropica dzieli polszczyznę na blisko 60 procent więcej kawałków. Przy identycznej stawce za milion tokenów oznacza to, że za tę samą pracę po polsku Fable 5.1 kosztuje realnie więcej niż Astra, mimo że cennik obu wygląda tak samo. Ten „podatek tokenowy” liczę od dawna w kalkulatorze kosztów, a tu widać go na jednym zadaniu: 0,58 dolara u Astry, 0,73 u Fable, 0,03 u Gemini.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Po pierwsze, Astra jest w tych zadaniach najszybsza i nie zawiesiła się ani razu, co po doświadczeniach z rodziną Claude ma dla mnie wagę praktyczną. Po drugie, w polszczyźnie nie jest lepsza od tańszych modeli: zrobiła ten sam błąd co Fable 5.1, a przegrała z Gemini 3.8 Flash, który kosztował dwadzieścia razy mniej. Po trzecie, przewagi Astry z oficjalnych benchmarków, czyli matematyka, rozumowanie abstrakcyjne i cyberbezpieczeństwo, w ogóle nie pojawiają się w codziennej pracy redakcyjnej po polsku, więc ten test ich nie mierzy i nie udaje, że mierzy.
Wniosek dla kogoś, kto pisze i redaguje po polsku, jest ten sam, który wyszedł mi przy teście Fable 5.1: najdroższa półka nie daje przewagi w tej pracy, a wśród tanich modeli pojawił się kandydat, który robi ją bez błędu. Dla kogoś, kto potrzebuje matematyki, agentów i długich zadań badawczych, ten test nic nie mówi i trzeba czekać na niezależne pomiary. Pełne dane modelu zebrałem w przewodniku o GPT-6 Astra.
Metoda i surowe odpowiedzi wszystkich modeli są zapisane; jeśli chcesz je zobaczyć albo zaproponować trudniejsze zadania do następnej rundy, napisz.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czy GPT-6 Astra radzi sobie lepiej z polszczyzną niż Claude Fable 5.1?
Nie - oba modele popełniły ten sam błąd, zostawiając 'Urzędzie Miasta' wielką literą. Żaden z nich nie dorównał Gemini 3.8 Flash, który jako jedyny w zestawieniu rozwiązał wszystkie sześć zadań językowych bez błędu.
Ile kosztuje test igły w stogu na 150 tysiącach znaków dla GPT-6 Astra i Gemini 3.8 Flash?
Koszt jednego pytania wyniósł 0,576 dolara dla Astry i zaledwie 0,033 dolara dla Gemini 3.8 Flash. Oba modele znalazły wszystkie pięć ukrytych faktów, więc jakościowo był remis.
Dlaczego Claude Fable 5.1 kosztuje więcej niż GPT-6 Astra przy takim samym cenniku za milion tokenów?
Tokenizer Anthropica dzieli polski tekst na blisko 60 procent więcej kawałków niż tokenizer OpenAI - ten sam tekst to 73 063 tokeny u Claude wobec 45 882 tokenów u Astry. W praktyce oznacza to wyższy rachunek za identyczną pracę po polsku.
Czy GPT-6 Astra zawiesza się na zadaniach językowych tak jak modele Claude?
Nie - Astra ukończyła wszystkie sześć zadań z polszczyzny bez zawieszenia, ze średnim czasem 6,5 sekundy na odpowiedź. Claude Opus 5 wisiał na jednym zadaniu przez cztery minuty i połączenie trzeba było przerwać, a Fable 5.1 zawieszał się wcześniej na liczebnikach.



