Zbudowałem test dla jedenastu modeli AI. Na jednym zadaniu test się pomylił, a modele miały rację
👁 115 przeczytań
- GPT-6 Astra zdobył 9 na 9 punktów przy koszcie 0,04955 USD i czasie 35,3 sekundy, wygrywając test jedenastu modeli.
- Na zadaniu z PHP błąd dotyczył luźnego porównania == zamiast modyfikacji tablicy w trakcie iteracji - co potwierdziły testy na PHP 8.4.25.
- Ministral 14B uzyskał tyle samo punktów co Claude Haiku 4.5, kosztując 17 razy mniej - 0,00019 USD zamiast 0,00334 USD.
Zbudowałem test dla jedenastu modeli: dziewięć zadań z kodu, tłumaczenia i trzymania się instrukcji, każde sprawdzane automatycznie, żeby nie oceniać gustem. Po przejrzeniu odpowiedzi okazało się, że na jednym zadaniu mój automat punktował odwrotnie. Modele, którym postawił zero, odpowiedziały poprawnie, a te z punktem się myliły.
To jest ciekawsze od samego rankingu, więc zacznę od tego.
Zadanie, w którym pomylił się test, a nie modele
Dałem modelom taki kod w PHP i poprosiłem o wskazanie błędu jednym zdaniem:
foreach ($lista as $i => $el) {
if ($el == null) unset($lista[$i]);
}
echo count($lista);
Odpowiedzi rozłożyły się na dwa obozy.
Obóz pierwszy: błędem jest usuwanie elementów z tablicy w trakcie iterowania po niej, bo to psuje pętlę i pomija elementy.
Obóz drugi: błędem jest luźne porównanie ==, które oprócz null łapie także zero, pusty ciąg, fałsz i pustą tablicę, więc usuwa więcej, niż powinno.
Mój automat szukał w odpowiedzi słów o modyfikowaniu w trakcie iteracji, więc nagradzał obóz pierwszy. Uruchomiłem ten kod na serwerze, na PHP 8.4.25, i wynik jest jednoznaczny.
1) same nulle: zostało 4 z 7, wartości: a,b,c,d
iteracja pominęła elementy? NIE, usunęło dokładnie 3 nulle
2) z zerami i pustymi: zostało 5 z 10, wartości: 'a','b','c','d','0'
Usuwanie w pętli niczego nie popsuło. W PHP pętla po wartości pracuje na kopii tablicy, więc kasowanie w środku jest bezpieczne. Za to luźne porównanie wycięło zero, pusty ciąg, fałsz i pustą tablicę, czyli dokładnie to, o czym mówił obóz drugi.
Obóz pierwszy powtórzył regułę prawdziwą w innych językach. Obóz drugi znał PHP.
Kto rozpoznał prawdziwy błąd
Poprawnie odpowiedziało pięć modeli z jedenastu: GPT-6 Astra, Claude promptowy.com/claude-fable-5-1/">Fable 5.1, Gemini 3.8 Flash, GLM 5.3 Flash i Kimi K3. Pozostałe sześć podało regułę o iteracji albo, w przypadku Ministrala, coś jeszcze innego i również nieprawdziwego.
To jest podział, który akurat pokrywa się z ceną: rozpoznały go modele z górnej półki. Nie zawsze tak jest i za chwilę pokażę zadanie, gdzie było odwrotnie.
Wyniki po korekcie
Poniżej punktacja po poprawieniu tego zadania. Podaję też koszt całego zestawu i czas, bo przy wyborze modelu do pracy jedno bez drugiego nic nie znaczy.
| Model | Punkty | Koszt | Czas | Puste odpowiedzi |
|---|---|---|---|---|
| GPT-6 Astra | 9 / 9 | 0,04955 USD | 35,3 s | 0 |
| Claude Fable 5.1 | 8 / 9 | 0,11503 USD | 81,0 s | 0 |
| Gemini 3.8 Flash | 8 / 9 | 0,03957 USD | 72,2 s | 0 |
| Kimi K3 | 7 / 9 | 0,09539 USD | 92,5 s | 0 |
| DeepSeek V4 Flash | 6 / 9 | 0,00075 USD | 73,4 s | 0 |
| DeepSeek V4 Pro | 6 / 9 | 0,01478 USD | 96,6 s | 0 |
| Qwen3.8 27B | 6 / 9 | 0,01365 USD | 282,7 s | 2 |
| GLM 5.3 Flash | 6 / 9 | 0,00500 USD | 353,1 s | 3 |
| Claude Haiku 4.5 | 5 / 9 | 0,00334 USD | 12,9 s | 0 |
| Ministral 14B | 5 / 9 | 0,00019 USD | 6,2 s | 0 |
| Llama 4 Maverick | 4 / 9 | 0,00037 USD | 47,1 s | 0 |
Najdroższy nie wygrał
Claude Fable 5.1 kosztował 0,11503 dolara, czyli ponad dwa razy więcej niż zwycięzca, i skończył o punkt niżej. Gemini 3.8 Flash zdobył tyle samo co Fable przy koszcie niższym o dwie trzecie.
Na drugim końcu stawki Ministral 14B zdobył pięć punktów za 0,00019 dolara, czyli tyle samo co Claude Haiku 4.5, który kosztował siedemnaście razy więcej. Zrobił to w 6,2 sekundy, najszybciej z całej jedenastki.
Kod wypadł zaskakująco równo
W grupie zadań programistycznych, po korekcie, różnice są mniejsze, niż zakładałem. Funkcję sprawdzającą numer NIP z sumą kontrolną napisali wszyscy. Zapytanie z sumowaniem, grupowaniem i ograniczeniem do dziesięciu wyników też przeszło u wszystkich.
Cała różnica zrobiła się na zadaniu z błędem, czyli tam, gdzie trzeba było nie tyle napisać kod, co go zrozumieć. To jest chyba najbardziej praktyczna obserwacja z całego testu: pisanie kodu jest dziś rozwiązane nawet w tanich modelach, czytanie cudzego kodu nie.
Instrukcje to najsłabszy punkt wszystkich
Najgorzej wypadła grupa zadań, w których liczyło się trzymanie twardych ograniczeń. Tylko GPT-6 Astra zaliczył wszystkie trzy.
Zadanie brzmiało: napisz dwa zdania o kawie po polsku, ale nie użyj litery „a” ani razu. Poradziły sobie trzy modele z jedenastu.
Najciekawsze są sposoby przegrywania. Dwa modele napisały poprawne zdania, ale poprzedziły je wstępem w rodzaju „Oto dwa zdania bez litery a”, czyli same się wyłożyły na własnej zapowiedzi. Jeden zaczął wymyślać nieistniejące wyrazy: „Kow jest gorący, czarny napój”. Inny dopisał na końcu uwagę, że samo słowo „kawa” zawiera zakazaną literę, jakby chciał się usprawiedliwić.
Poprawne odpowiedzi wyglądały tak: „Espresso pobudzi umysł. Jego woń koi zmysły” oraz „Ciemny, gorzki płyn w kubku budzi o świcie uśpione zmysły”.
Praktyczny wniosek: jeśli budujesz coś, co ma się trzymać sztywnego formatu, sprawdź to osobno. Model, który pięknie pisze, potrafi jednocześnie nie umieć policzyć zdań.
Kalki z angielskiego
Poprosiłem o polski odpowiednik zwrotu „it’s not rocket science”. Osiem modeli podało coś naturalnego, najczęściej „to żadna filozofia”. Trzy poszły w kalkę: „to nie jest żadna rakietowa nauka”, „to nie jest fizyka jądrowa”, „to nie jest rakieta, to jest prostsze niż myślisz”.
To jest różnica, której nie widać w testach robionych po angielsku, a która decyduje o tym, czy tekst brzmi jak napisany przez Polaka.
Przy okazji mój automat pokazał tu drugą słabość. Za błędne uznał odpowiedzi „to nie jest wyższa matematyka” oraz „to nie jest zajęcie dla głupich”, bo nie było ich na mojej liście dopuszczalnych sformułowań. Oba zwroty są w polszczyźnie zupełnie naturalne. Punktacji nie zmieniałem, żeby nie naginać jej do własnych wrażeń, ale odnotowuję: przy tym zadaniu dwa modele dostały zero za odpowiedź, którą człowiek uznałby za dobrą.
GLM 5.3 Flash: wygrał jeden test, przegrał drugi
Muszę tu dopisać rzecz, która komplikuje mój wcześniejszy wniosek. W teście polskiej gramatyki GLM 5.3 Flash zdobył komplet punktów przy najniższym rachunku i nazwałem go domyślnym wyborem do polskiego tekstu.
W tym teście ten sam model potrzebował 353 sekund na dziewięć zadań, czyli od czterech do siedmiu razy dłużej niż reszta stawki, i trzy razy zwrócił pustą odpowiedź. Skończył w środku tabeli.
Oba wyniki są prawdziwe i nie ma w tym sprzeczności: GLM jest bardzo dobry w polszczyźnie i bardzo powolny przy zadaniach, które wymagają dłuższego rozumowania. Powód opisałem osobno: w tym modelu nie da się wyłączyć rozumowania, więc przy trudnym poleceniu przepala budżet tokenów i czasem nie zostawia sobie miejsca na odpowiedź.
To jest dokładnie ten rodzaj wniosku, którego nie da się wyciągnąć z jednego testu, i powód, dla którego opisuję metodę, a nie tylko wynik.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Jak to mierzyłem i czego ten test nie mówi
Dziewięć zadań, jedenaście modeli, po jednym podejściu na zadanie, limit 1 600 tokenów na odpowiedź w części pierwszej i 3 000 w tej. Koszty odczytane z pola rozliczeniowego zwracanego przez interfejs, a nie z cennika, bo cena z karty modelu potrafi rozminąć się z rachunkiem nawet czternastokrotnie. Cały test kosztował 0,34 dolara.
Czego nie mówi: nie sprawdzałem pisania długich tekstów, wiedzy faktograficznej ani pracy na dużym kontekście. Dziewięć zadań to za mało na ranking absolutny i tego nie twierdzę.
I najważniejsze, bo to jest morał z całego tego tekstu: automatyczny test jest tylko tak dobry, jak kryterium, które w nim zapisałeś. Mój był błędny na jednym zadaniu z dziewięciu i wyszło to dopiero przy czytaniu odpowiedzi. Jeśli oceniasz modele automatem i nie czytasz wyników, możesz publikować ranking, który mierzy zgodność z Twoją pomyłką.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model AI wypadł najlepiej w teście dziewięciu zadań z kodu, tłumaczenia i instrukcji?
Najlepiej wypadł GPT-6 Astra z wynikiem 9 na 9 punktów. Kosztował 0,04955 USD i ukończył całe zadanie w 35,3 sekundy, bez żadnych pustych odpowiedzi.
Czy droższy model AI daje lepsze wyniki w testach programistycznych?
Nie, najdroższy model w teście - Claude Fable 5.1 za 0,11503 USD - skończył o punkt niżej niż zwycięzca i kosztował ponad dwa razy więcej. Gemini 3.8 Flash zdobył tyle samo punktów co Fable przy koszcie niższym o dwie trzecie.
Dlaczego GLM 5.3 Flash raz wypadł świetnie, a raz słabo w testach AI?
GLM 5.3 Flash jest bardzo dobry w polszczyźnie, ale bardzo powolny przy zadaniach wymagających dłuższego rozumowania - w tym teście potrzebował 353 sekund i trzy razy zwrócił pustą odpowiedź. Powodem jest brak możliwości wyłączenia trybu rozumowania, który przepala budżet tokenów przy trudnych poleceniach.
Jakie zadania sprawiają modelom AI największe problemy?
Największe problemy sprawiało trzymanie się twardych ograniczeń formalnych - zadanie z napisaniem dwóch zdań bez litery 'a' zaliczyły tylko trzy modele z jedenastu. Dwa modele napisały poprawne zdania, ale same się wykluczyły, używając zakazanej litery we wstępie poprzedzającym odpowiedź.
Podobne tematy na Promptowym
Copilot i Gemini kosztują dokładnie tyle samo: 97,99 zł. Sprawdziłem, co dostajesz za tę samą kwotę
Który model AI pisze najlepiej po polsku? Zmierzyłem dziesięć. Zwycięzca kosztuje 32 razy mniej niż drugi zwycięzca
Cena na OpenRouter to nie cena, którą płacisz. Sprawdziłem 15 modeli i różnica sięga czternastu razy
