🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 8 szt. albo Pro na rok 464 zł Kup teraz →
Przejdź do treści
Artykuły

Zbudowałem test dla jedenastu modeli AI. Na jednym zadaniu test się pomylił, a modele miały rację

6 min czytania
Punkty po korekcie kontra koszt: jedenascie modeli AI na dziewieciu zadaniach

👁 116 przeczytań

// w skrócie
  • GPT-6 Astra zdobył 9 na 9 punktów przy koszcie 0,04955 USD i czasie 35,3 sekundy, wygrywając test jedenastu modeli.
  • Na zadaniu z PHP błąd dotyczył luźnego porównania == zamiast modyfikacji tablicy w trakcie iteracji - co potwierdziły testy na PHP 8.4.25.
  • Ministral 14B uzyskał tyle samo punktów co Claude Haiku 4.5, kosztując 17 razy mniej - 0,00019 USD zamiast 0,00334 USD.

Zbudowałem test dla jedenastu modeli: dziewięć zadań z kodu, tłumaczenia i trzymania się instrukcji, każde sprawdzane automatycznie, żeby nie oceniać gustem. Po przejrzeniu odpowiedzi okazało się, że na jednym zadaniu mój automat punktował odwrotnie. Modele, którym postawił zero, odpowiedziały poprawnie, a te z punktem się myliły.

To jest ciekawsze od samego rankingu, więc zacznę od tego.

Zadanie, w którym pomylił się test, a nie modele

Dałem modelom taki kod w PHP i poprosiłem o wskazanie błędu jednym zdaniem:

foreach ($lista as $i => $el) {
    if ($el == null) unset($lista[$i]);
}
echo count($lista);

Odpowiedzi rozłożyły się na dwa obozy.

Obóz pierwszy: błędem jest usuwanie elementów z tablicy w trakcie iterowania po niej, bo to psuje pętlę i pomija elementy.

Obóz drugi: błędem jest luźne porównanie ==, które oprócz null łapie także zero, pusty ciąg, fałsz i pustą tablicę, więc usuwa więcej, niż powinno.

Mój automat szukał w odpowiedzi słów o modyfikowaniu w trakcie iteracji, więc nagradzał obóz pierwszy. Uruchomiłem ten kod na serwerze, na PHP 8.4.25, i wynik jest jednoznaczny.

1) same nulle: zostało 4 z 7, wartości: a,b,c,d
   iteracja pominęła elementy? NIE, usunęło dokładnie 3 nulle
2) z zerami i pustymi: zostało 5 z 10, wartości: 'a','b','c','d','0'

Usuwanie w pętli niczego nie popsuło. W PHP pętla po wartości pracuje na kopii tablicy, więc kasowanie w środku jest bezpieczne. Za to luźne porównanie wycięło zero, pusty ciąg, fałsz i pustą tablicę, czyli dokładnie to, o czym mówił obóz drugi.

Obóz pierwszy powtórzył regułę prawdziwą w innych językach. Obóz drugi znał PHP.

Kto rozpoznał prawdziwy błąd

Poprawnie odpowiedziało pięć modeli z jedenastu: GPT-6 Astra, Claude promptowy.com/claude-fable-5-1/">Fable 5.1, Gemini 3.8 Flash, GLM 5.3 Flash i Kimi K3. Pozostałe sześć podało regułę o iteracji albo, w przypadku Ministrala, coś jeszcze innego i również nieprawdziwego.

To jest podział, który akurat pokrywa się z ceną: rozpoznały go modele z górnej półki. Nie zawsze tak jest i za chwilę pokażę zadanie, gdzie było odwrotnie.

Wyniki po korekcie

Poniżej punktacja po poprawieniu tego zadania. Podaję też koszt całego zestawu i czas, bo przy wyborze modelu do pracy jedno bez drugiego nic nie znaczy.

Model Punkty Koszt Czas Puste odpowiedzi
GPT-6 Astra 9 / 9 0,04955 USD 35,3 s 0
Claude Fable 5.1 8 / 9 0,11503 USD 81,0 s 0
Gemini 3.8 Flash 8 / 9 0,03957 USD 72,2 s 0
Kimi K3 7 / 9 0,09539 USD 92,5 s 0
DeepSeek V4 Flash 6 / 9 0,00075 USD 73,4 s 0
DeepSeek V4 Pro 6 / 9 0,01478 USD 96,6 s 0
Qwen3.8 27B 6 / 9 0,01365 USD 282,7 s 2
GLM 5.3 Flash 6 / 9 0,00500 USD 353,1 s 3
Claude Haiku 4.5 5 / 9 0,00334 USD 12,9 s 0
Ministral 14B 5 / 9 0,00019 USD 6,2 s 0
Llama 4 Maverick 4 / 9 0,00037 USD 47,1 s 0

Najdroższy nie wygrał

Claude Fable 5.1 kosztował 0,11503 dolara, czyli ponad dwa razy więcej niż zwycięzca, i skończył o punkt niżej. Gemini 3.8 Flash zdobył tyle samo co Fable przy koszcie niższym o dwie trzecie.

Na drugim końcu stawki Ministral 14B zdobył pięć punktów za 0,00019 dolara, czyli tyle samo co Claude Haiku 4.5, który kosztował siedemnaście razy więcej. Zrobił to w 6,2 sekundy, najszybciej z całej jedenastki.

Kod wypadł zaskakująco równo

W grupie zadań programistycznych, po korekcie, różnice są mniejsze, niż zakładałem. Funkcję sprawdzającą numer NIP z sumą kontrolną napisali wszyscy. Zapytanie z sumowaniem, grupowaniem i ograniczeniem do dziesięciu wyników też przeszło u wszystkich.

Cała różnica zrobiła się na zadaniu z błędem, czyli tam, gdzie trzeba było nie tyle napisać kod, co go zrozumieć. To jest chyba najbardziej praktyczna obserwacja z całego testu: pisanie kodu jest dziś rozwiązane nawet w tanich modelach, czytanie cudzego kodu nie.

Instrukcje to najsłabszy punkt wszystkich

Najgorzej wypadła grupa zadań, w których liczyło się trzymanie twardych ograniczeń. Tylko GPT-6 Astra zaliczył wszystkie trzy.

Zadanie brzmiało: napisz dwa zdania o kawie po polsku, ale nie użyj litery „a” ani razu. Poradziły sobie trzy modele z jedenastu.

Najciekawsze są sposoby przegrywania. Dwa modele napisały poprawne zdania, ale poprzedziły je wstępem w rodzaju „Oto dwa zdania bez litery a”, czyli same się wyłożyły na własnej zapowiedzi. Jeden zaczął wymyślać nieistniejące wyrazy: „Kow jest gorący, czarny napój”. Inny dopisał na końcu uwagę, że samo słowo „kawa” zawiera zakazaną literę, jakby chciał się usprawiedliwić.

Poprawne odpowiedzi wyglądały tak: „Espresso pobudzi umysł. Jego woń koi zmysły” oraz „Ciemny, gorzki płyn w kubku budzi o świcie uśpione zmysły”.

Praktyczny wniosek: jeśli budujesz coś, co ma się trzymać sztywnego formatu, sprawdź to osobno. Model, który pięknie pisze, potrafi jednocześnie nie umieć policzyć zdań.

Kalki z angielskiego

Poprosiłem o polski odpowiednik zwrotu „it’s not rocket science”. Osiem modeli podało coś naturalnego, najczęściej „to żadna filozofia”. Trzy poszły w kalkę: „to nie jest żadna rakietowa nauka”, „to nie jest fizyka jądrowa”, „to nie jest rakieta, to jest prostsze niż myślisz”.

To jest różnica, której nie widać w testach robionych po angielsku, a która decyduje o tym, czy tekst brzmi jak napisany przez Polaka.

Przy okazji mój automat pokazał tu drugą słabość. Za błędne uznał odpowiedzi „to nie jest wyższa matematyka” oraz „to nie jest zajęcie dla głupich”, bo nie było ich na mojej liście dopuszczalnych sformułowań. Oba zwroty są w polszczyźnie zupełnie naturalne. Punktacji nie zmieniałem, żeby nie naginać jej do własnych wrażeń, ale odnotowuję: przy tym zadaniu dwa modele dostały zero za odpowiedź, którą człowiek uznałby za dobrą.

GLM 5.3 Flash: wygrał jeden test, przegrał drugi

Muszę tu dopisać rzecz, która komplikuje mój wcześniejszy wniosek. W teście polskiej gramatyki GLM 5.3 Flash zdobył komplet punktów przy najniższym rachunku i nazwałem go domyślnym wyborem do polskiego tekstu.

W tym teście ten sam model potrzebował 353 sekund na dziewięć zadań, czyli od czterech do siedmiu razy dłużej niż reszta stawki, i trzy razy zwrócił pustą odpowiedź. Skończył w środku tabeli.

Oba wyniki są prawdziwe i nie ma w tym sprzeczności: GLM jest bardzo dobry w polszczyźnie i bardzo powolny przy zadaniach, które wymagają dłuższego rozumowania. Powód opisałem osobno: w tym modelu nie da się wyłączyć rozumowania, więc przy trudnym poleceniu przepala budżet tokenów i czasem nie zostawia sobie miejsca na odpowiedź.

To jest dokładnie ten rodzaj wniosku, którego nie da się wyciągnąć z jednego testu, i powód, dla którego opisuję metodę, a nie tylko wynik.

Jak to mierzyłem i czego ten test nie mówi

Dziewięć zadań, jedenaście modeli, po jednym podejściu na zadanie, limit 1 600 tokenów na odpowiedź w części pierwszej i 3 000 w tej. Koszty odczytane z pola rozliczeniowego zwracanego przez interfejs, a nie z cennika, bo cena z karty modelu potrafi rozminąć się z rachunkiem nawet czternastokrotnie. Cały test kosztował 0,34 dolara.

Czego nie mówi: nie sprawdzałem pisania długich tekstów, wiedzy faktograficznej ani pracy na dużym kontekście. Dziewięć zadań to za mało na ranking absolutny i tego nie twierdzę.

I najważniejsze, bo to jest morał z całego tego tekstu: automatyczny test jest tylko tak dobry, jak kryterium, które w nim zapisałeś. Mój był błędny na jednym zadaniu z dziewięciu i wyszło to dopiero przy czytaniu odpowiedzi. Jeśli oceniasz modele automatem i nie czytasz wyników, możesz publikować ranking, który mierzy zgodność z Twoją pomyłką.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Ten sam test, ale od strony rachunku

Powyżej liczę punkty. Jeśli interesuje Cię, ile kosztuje sama praca, zmierzyłem to osobno na dłuższym zadaniu: ile kosztuje artykuł napisany przez AI. Wyszło od czterech setnych centa do dziewiętnastu centów za ten sam tekst.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model AI wypadł najlepiej w teście dziewięciu zadań z kodu, tłumaczenia i instrukcji?

Najlepiej wypadł GPT-6 Astra z wynikiem 9 na 9 punktów. Kosztował 0,04955 USD i ukończył całe zadanie w 35,3 sekundy, bez żadnych pustych odpowiedzi.

Czy droższy model AI daje lepsze wyniki w testach programistycznych?

Nie, najdroższy model w teście - Claude Fable 5.1 za 0,11503 USD - skończył o punkt niżej niż zwycięzca i kosztował ponad dwa razy więcej. Gemini 3.8 Flash zdobył tyle samo punktów co Fable przy koszcie niższym o dwie trzecie.

Dlaczego GLM 5.3 Flash raz wypadł świetnie, a raz słabo w testach AI?

GLM 5.3 Flash jest bardzo dobry w polszczyźnie, ale bardzo powolny przy zadaniach wymagających dłuższego rozumowania - w tym teście potrzebował 353 sekund i trzy razy zwrócił pustą odpowiedź. Powodem jest brak możliwości wyłączenia trybu rozumowania, który przepala budżet tokenów przy trudnych poleceniach.

Jakie zadania sprawiają modelom AI największe problemy?

Największe problemy sprawiało trzymanie się twardych ograniczeń formalnych - zadanie z napisaniem dwóch zdań bez litery 'a' zaliczyły tylko trzy modele z jedenastu. Dwa modele napisały poprawne zdania, ale same się wykluczyły, używając zakazanej litery we wstępie poprzedzającym odpowiedź.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro 440 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie