Przejdź do treści
Warsztat

Grok 4.7 vs Fable 5.1 vs GPT-5.6 Sol: policzyłem, ile kosztuje punkt przewagi

Cztery wygrane benchmarki kontra pięciokrotnie niższa cena. Liczę koszt jednego punktu przewagi i mówię, kiedy dopłata ma sens.

5 min czytania
Grok 4.7 vs Fable 5.1 vs GPT-5.6 Sol: policzyłem, ile kosztuje punkt przewagi

👁 114 przeczytań

// w skrócie
  • Fable 5.1 wygrywa 4 benchmarki z 7, ale kosztuje 10 USD za milion tokenów wejściowych wobec 2 USD za Groka 4.7, który wygrywa 3 testy.
  • W prawie Grok 4.7 osiąga 19,6% w Harvey Legal Agent Benchmark wobec 6,7% Fable 5.1 i 2,5% GPT-5.6 Sol, będąc jednocześnie najtańszy.
  • Jeden punkt procentowy przewagi w kodowaniu kosztuje około 3,05 USD na zadanie, co przy 100 zadaniach miesięcznie daje około 1 150 zł za 5,5 punktu.

Producent Groka 4.7 zrobił przy premierze rzecz nietypową: opublikował własne wyniki obok wyników konkurencji i obok cen. Wziąłem tę tabelę i policzyłem to, czego w niej nie ma - ile realnie kosztuje jeden punkt procentowy przewagi. Wynik jest dla części zastosowań brutalny.

Rozstrzygnięcie w jednym akapicie

Fable 5.1 wygrywa cztery benchmarki z siedmiu, ale kosztuje pięć razy więcej na wejściu i ponad osiem razy więcej na wyjściu. Grok 4.7 wygrywa trzy - elektronikę, pracę prawniczą i cenę. GPT-5.6 Sol nie wygrywa żadnego poza jednym testem programistycznym, przy cenie pośrodku. Jeśli Twoje zadania przypominają CursorBench albo Terminal-Bench, dopłata ma uzasadnienie. Jeśli nie - trudno je obronić.

Pełna tabela, ceny i wyniki razem

Grok 4.7 xHighGPT-5.6 Sol MaxFable 5.1 Max
Wejście (mln tokenów)2 USD4 USD10 USD
Wyjście (mln tokenów)6 USD20 USD50 USD
CursorBench 4.046,3%41,7%51,8%
DeepSWE v1.171,0%*72,7%70,0%
EEBench - elektronika64,0%39,4%56,4%
AA Briefcase - biuro1 6571 4871 678
Terminal-Bench 4.038,0%37,3%57,9%
Harvey - prawo19,6%2,5%6,7%
HealthBench Professional56,7%60,5%62,1%
Wygranych benchmarków214

Gwiazdka to wynik w trybie wysokiego wysiłku. Wszystkie liczby pochodzą z materiału producenta Groka.

Ile kosztuje punkt przewagi

To jest wyliczenie, którego nie ma w żadnym ogłoszeniu, a decyduje o rachunku. Weźmy CursorBench, czyli kodowanie - test, w którym Fable 5.1 wygrywa najwyraźniej.

Przewaga wynosi 5,5 punktu procentowego (51,8% wobec 46,3%). Koszt zadania przy milionie tokenów wejściowych i 200 tysiącach wyjściowych:

ModelKoszt zadaniaWynik CursorBenchDopłata wobec Groka
Grok 4.73,20 USD46,3%-
GPT-5.6 Sol8,00 USD41,7%+4,80 USD za wynik gorszy
Fable 5.120,00 USD51,8%+16,80 USD za +5,5 pkt

Jeden punkt procentowy przewagi w kodowaniu kosztuje około 3,05 USD na zadanie. Przy stu zadaniach miesięcznie to 305 dolarów, czyli około 1 150 zł, za pięć i pół punktu.

To jest wyliczenie redakcji na podstawie cen i wyników producenta, przy kursie 3,78 zł za dolara. Czy to się opłaca, zależy wyłącznie od tego, ile kosztuje Cię błąd. Przy kodzie idącym na produkcję pięć punktów może być warte każdej złotówki. Przy generowaniu treści roboczych - raczej nie.

Gdzie różnice są największe

Prawo: przewaga trzykrotna i ośmiokrotna

Harvey Legal Agent Benchmark: 19,6% wobec 6,7% i 2,5%. To nie jest różnica stopnia, tylko rzędu wielkości. Przy pracy z dokumentami prawnymi ten jeden wiersz tabeli przeważa wszystko inne - i przy okazji model jest tu najtańszy.

Elektronika: 25 punktów różnicy

EEBench: 64,0% wobec 39,4%. Grok 4.7 wygrywa też z droższym konkurentem (56,4%).

Terminal: przewaga po drugiej stronie

Terminal-Bench 4.0: 57,9% wobec 38,0%. Prawie 20 punktów na korzyść droższego modelu. Przy długich zadaniach w terminalu ta różnica jest zbyt duża, żeby ją zignorować dla oszczędności.

Medycyna: najdroższy wygrywa

HealthBench Professional: 62,1%, 60,5% i 56,7%. Różnice są niewielkie, ale kolejność odwrotna do ceny - tu płacisz i dostajesz.

Osobna miara: praca zawodowa

Producent podał też wyniki w skali Elo dla zadań wykonywanych przez zawodowców - prawników, pielęgniarki, analityków finansowych:

ModelElo
Fable 5.1 (max)1 735
Grok 4.7 (xhigh)1 695
Grok 4.6 (high)1 605
GPT-6 Astra (max)1 542

Różnica między czołówką a Grokiem 4.7 to 40 punktów Elo. Dla porównania: skok z Groka 4.6 na 4.7 to 90 punktów, czyli ponad dwa razy więcej niż dystans, jaki został do lidera.

Który model do czego - tabela decyzyjna

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Twoje zadanieWybórDlaczego
Dokumenty prawne, analiza umówGrok 4.719,6% wobec 6,7% - i taniej
Inżynieria elektrycznaGrok 4.764,0%, najlepszy wynik w zestawieniu
Duży wolumen, budżet się liczyGrok 4.73,20 USD wobec 20,00 USD na zadanie
Długie zadania w terminaluFable 5.157,9% wobec 38,0% - różnica zbyt duża
Najtrudniejsze kodowanieFable 5.151,8% wobec 46,3%, jeśli błąd kosztuje
Zastosowania medyczneFable 5.162,1%, najwyżej w HealthBench
Praca biurowa, prezentacjeremis1 678 wobec 1 657 - różnica w granicach szumu

Czego ta tabela nie mówi

To jest opinia i uważam ją za najważniejszą rzecz w całym tekście. Wszystkie te liczby pochodzą od jednego producenta, który przy okazji publikuje wyniki swojej konkurencji. Nie ma powodu zakładać, że są nieuczciwe - podanie własnych przegranych w czterech testach z siedmiu przemawia za rzetelnością. Ale to nadal nie jest niezależny benchmark.

Druga rzecz: benchmark mierzy to, co mierzy. Jeśli Twoja praca nie przypomina żadnego z tych siedmiu testów, tabela mówi Ci o niej niewiele. Jedyny wiarygodny test to dziesięć Twoich własnych zadań puszczonych przez oba modele i porównanych ręcznie. Kosztuje to kilkadziesiąt złotych i godzinę czasu, a odpowiada na pytanie, na które żaden ranking nie odpowie.

Najczęstsze pytania

Który model jest najlepszy?

Fable 5.1 wygrywa cztery benchmarki z siedmiu, więc w kategorii czystej jakości - on. W kategorii wyniku na złotówkę - Grok 4.7, i to z dużym zapasem.

Czy warto dopłacać za droższy model?

W kodowaniu jeden punkt przewagi kosztuje około 3 USD na zadanie. Opłaca się, jeśli błąd w kodzie kosztuje Cię więcej. Przy pracy roboczej trudno to obronić.

Dlaczego GPT-5.6 Sol wypada słabo?

W tym zestawieniu wygrywa tylko jeden benchmark, przy cenie dwa razy wyższej od najtańszego. Warto pamiętać, że to wyniki opublikowane przez konkurenta - do weryfikacji u źródła.

Co z GPT-6 Astra?

Pojawia się tylko w zestawieniu Elo dla pracy zawodowej, gdzie ma 1 542 punkty - najniżej z czterech porównywanych.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Ceny i wyniki benchmarków pochodzą z oficjalnego ogłoszenia Groka 4.7 z 21 września 2026, odczytanego tego samego dnia: x.ai/news/grok-4-7. Wyliczenia kosztu zadania i kosztu punktu przewagi to obliczenia redakcji na podstawie tych cen, przy założeniu miliona tokenów wejściowych i 200 tysięcy wyjściowych oraz kursie 3,78 zł za dolara. Nie przeprowadziłem własnych testów żadnego z tych modeli - to jest analiza cudzych liczb, nie pomiar.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Który model - Grok 4.7, Fable 5.1 czy GPT-5.6 Sol - jest najlepszy pod względem wyników benchmarków?

Fable 5.1 wygrywa cztery benchmarki z siedmiu, więc w kategorii czystej jakości zajmuje pierwsze miejsce. Grok 4.7 wygrywa trzy testy, w tym prawo i elektronikę, przy najniższej cenie 2 USD za milion tokenów wejściowych. GPT-5.6 Sol nie wygrywa żadnego poza jednym testem programistycznym, przy cenie 4 USD.

Ile kosztuje zadanie na milion tokenów wejściowych i 200 tysiącach wyjściowych dla każdego z modeli?

Grok 4.7 kosztuje 3,20 USD za takie zadanie, GPT-5.6 Sol 8,00 USD, a Fable 5.1 20,00 USD. Różnica między najtańszym a najdroższym modelem wynosi 16,80 USD na jedno zadanie.

Do jakich zastosowań najlepiej nadaje się Fable 5.1 mimo wysokiej ceny?

Fable 5.1 jest najlepszym wyborem do długich zadań w terminalu, gdzie osiąga 57,9% wobec 38,0% Groka 4.7, oraz do zastosowań medycznych z wynikiem 62,1% w HealthBench Professional. Uzasadniony jest też przy najtrudniejszym kodowaniu, gdzie wyprzedza konkurentów wynikiem 51,8% w CursorBench 4.0.

Skąd pochodzą wyniki benchmarków porównujące modele konkurencji i czy można im ufać?

Wszystkie liczby pochodzą z oficjalnego ogłoszenia producenta Groka 4.7 opublikowanego 21 września 2026 na stronie x.ai/news/grok-4-7 - nie są to niezależne badania. Autor zaznacza, że publikowanie własnych przegranych w czterech testach z siedmiu przemawia za rzetelnością danych, jednak zaleca weryfikację u źródła.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie