Grok 4.7 vs Fable 5.1 vs GPT-5.6 Sol: policzyłem, ile kosztuje punkt przewagi
Cztery wygrane benchmarki kontra pięciokrotnie niższa cena. Liczę koszt jednego punktu przewagi i mówię, kiedy dopłata ma sens.

👁 113 przeczytań
- Fable 5.1 wygrywa 4 benchmarki z 7, ale kosztuje 10 USD za milion tokenów wejściowych wobec 2 USD za Groka 4.7, który wygrywa 3 testy.
- W prawie Grok 4.7 osiąga 19,6% w Harvey Legal Agent Benchmark wobec 6,7% Fable 5.1 i 2,5% GPT-5.6 Sol, będąc jednocześnie najtańszy.
- Jeden punkt procentowy przewagi w kodowaniu kosztuje około 3,05 USD na zadanie, co przy 100 zadaniach miesięcznie daje około 1 150 zł za 5,5 punktu.
Producent Groka 4.7 zrobił przy premierze rzecz nietypową: opublikował własne wyniki obok wyników konkurencji i obok cen. Wziąłem tę tabelę i policzyłem to, czego w niej nie ma - ile realnie kosztuje jeden punkt procentowy przewagi. Wynik jest dla części zastosowań brutalny.
Rozstrzygnięcie w jednym akapicie
Fable 5.1 wygrywa cztery benchmarki z siedmiu, ale kosztuje pięć razy więcej na wejściu i ponad osiem razy więcej na wyjściu. Grok 4.7 wygrywa trzy - elektronikę, pracę prawniczą i cenę. GPT-5.6 Sol nie wygrywa żadnego poza jednym testem programistycznym, przy cenie pośrodku. Jeśli Twoje zadania przypominają CursorBench albo Terminal-Bench, dopłata ma uzasadnienie. Jeśli nie - trudno je obronić.
Pełna tabela, ceny i wyniki razem
| Grok 4.7 xHigh | GPT-5.6 Sol Max | Fable 5.1 Max | |
|---|---|---|---|
| Wejście (mln tokenów) | 2 USD | 4 USD | 10 USD |
| Wyjście (mln tokenów) | 6 USD | 20 USD | 50 USD |
| CursorBench 4.0 | 46,3% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0%* | 72,7% | 70,0% |
| EEBench - elektronika | 64,0% | 39,4% | 56,4% |
| AA Briefcase - biuro | 1 657 | 1 487 | 1 678 |
| Terminal-Bench 4.0 | 38,0% | 37,3% | 57,9% |
| Harvey - prawo | 19,6% | 2,5% | 6,7% |
| HealthBench Professional | 56,7% | 60,5% | 62,1% |
| Wygranych benchmarków | 2 | 1 | 4 |
Gwiazdka to wynik w trybie wysokiego wysiłku. Wszystkie liczby pochodzą z materiału producenta Groka.
Ile kosztuje punkt przewagi
To jest wyliczenie, którego nie ma w żadnym ogłoszeniu, a decyduje o rachunku. Weźmy CursorBench, czyli kodowanie - test, w którym Fable 5.1 wygrywa najwyraźniej.
Przewaga wynosi 5,5 punktu procentowego (51,8% wobec 46,3%). Koszt zadania przy milionie tokenów wejściowych i 200 tysiącach wyjściowych:
| Model | Koszt zadania | Wynik CursorBench | Dopłata wobec Groka |
|---|---|---|---|
| Grok 4.7 | 3,20 USD | 46,3% | - |
| GPT-5.6 Sol | 8,00 USD | 41,7% | +4,80 USD za wynik gorszy |
| Fable 5.1 | 20,00 USD | 51,8% | +16,80 USD za +5,5 pkt |
Jeden punkt procentowy przewagi w kodowaniu kosztuje około 3,05 USD na zadanie. Przy stu zadaniach miesięcznie to 305 dolarów, czyli około 1 150 zł, za pięć i pół punktu.
To jest wyliczenie redakcji na podstawie cen i wyników producenta, przy kursie 3,78 zł za dolara. Czy to się opłaca, zależy wyłącznie od tego, ile kosztuje Cię błąd. Przy kodzie idącym na produkcję pięć punktów może być warte każdej złotówki. Przy generowaniu treści roboczych - raczej nie.
Gdzie różnice są największe
Prawo: przewaga trzykrotna i ośmiokrotna
Harvey Legal Agent Benchmark: 19,6% wobec 6,7% i 2,5%. To nie jest różnica stopnia, tylko rzędu wielkości. Przy pracy z dokumentami prawnymi ten jeden wiersz tabeli przeważa wszystko inne - i przy okazji model jest tu najtańszy.
Elektronika: 25 punktów różnicy
EEBench: 64,0% wobec 39,4%. Grok 4.7 wygrywa też z droższym konkurentem (56,4%).
Terminal: przewaga po drugiej stronie
Terminal-Bench 4.0: 57,9% wobec 38,0%. Prawie 20 punktów na korzyść droższego modelu. Przy długich zadaniach w terminalu ta różnica jest zbyt duża, żeby ją zignorować dla oszczędności.
Medycyna: najdroższy wygrywa
HealthBench Professional: 62,1%, 60,5% i 56,7%. Różnice są niewielkie, ale kolejność odwrotna do ceny - tu płacisz i dostajesz.
Osobna miara: praca zawodowa
Producent podał też wyniki w skali Elo dla zadań wykonywanych przez zawodowców - prawników, pielęgniarki, analityków finansowych:
| Model | Elo |
|---|---|
| Fable 5.1 (max) | 1 735 |
| Grok 4.7 (xhigh) | 1 695 |
| Grok 4.6 (high) | 1 605 |
| GPT-6 Astra (max) | 1 542 |
Różnica między czołówką a Grokiem 4.7 to 40 punktów Elo. Dla porównania: skok z Groka 4.6 na 4.7 to 90 punktów, czyli ponad dwa razy więcej niż dystans, jaki został do lidera.
Który model do czego - tabela decyzyjna
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
| Twoje zadanie | Wybór | Dlaczego |
|---|---|---|
| Dokumenty prawne, analiza umów | Grok 4.7 | 19,6% wobec 6,7% - i taniej |
| Inżynieria elektryczna | Grok 4.7 | 64,0%, najlepszy wynik w zestawieniu |
| Duży wolumen, budżet się liczy | Grok 4.7 | 3,20 USD wobec 20,00 USD na zadanie |
| Długie zadania w terminalu | Fable 5.1 | 57,9% wobec 38,0% - różnica zbyt duża |
| Najtrudniejsze kodowanie | Fable 5.1 | 51,8% wobec 46,3%, jeśli błąd kosztuje |
| Zastosowania medyczne | Fable 5.1 | 62,1%, najwyżej w HealthBench |
| Praca biurowa, prezentacje | remis | 1 678 wobec 1 657 - różnica w granicach szumu |
Czego ta tabela nie mówi
To jest opinia i uważam ją za najważniejszą rzecz w całym tekście. Wszystkie te liczby pochodzą od jednego producenta, który przy okazji publikuje wyniki swojej konkurencji. Nie ma powodu zakładać, że są nieuczciwe - podanie własnych przegranych w czterech testach z siedmiu przemawia za rzetelnością. Ale to nadal nie jest niezależny benchmark.
Druga rzecz: benchmark mierzy to, co mierzy. Jeśli Twoja praca nie przypomina żadnego z tych siedmiu testów, tabela mówi Ci o niej niewiele. Jedyny wiarygodny test to dziesięć Twoich własnych zadań puszczonych przez oba modele i porównanych ręcznie. Kosztuje to kilkadziesiąt złotych i godzinę czasu, a odpowiada na pytanie, na które żaden ranking nie odpowie.
Najczęstsze pytania
Który model jest najlepszy?
Fable 5.1 wygrywa cztery benchmarki z siedmiu, więc w kategorii czystej jakości - on. W kategorii wyniku na złotówkę - Grok 4.7, i to z dużym zapasem.
Czy warto dopłacać za droższy model?
W kodowaniu jeden punkt przewagi kosztuje około 3 USD na zadanie. Opłaca się, jeśli błąd w kodzie kosztuje Cię więcej. Przy pracy roboczej trudno to obronić.
Dlaczego GPT-5.6 Sol wypada słabo?
W tym zestawieniu wygrywa tylko jeden benchmark, przy cenie dwa razy wyższej od najtańszego. Warto pamiętać, że to wyniki opublikowane przez konkurenta - do weryfikacji u źródła.
Co z GPT-6 Astra?
Pojawia się tylko w zestawieniu Elo dla pracy zawodowej, gdzie ma 1 542 punkty - najniżej z czterech porównywanych.
Źródła i data sprawdzenia
Ceny i wyniki benchmarków pochodzą z oficjalnego ogłoszenia Groka 4.7 z 21 września 2026, odczytanego tego samego dnia: x.ai/news/grok-4-7. Wyliczenia kosztu zadania i kosztu punktu przewagi to obliczenia redakcji na podstawie tych cen, przy założeniu miliona tokenów wejściowych i 200 tysięcy wyjściowych oraz kursie 3,78 zł za dolara. Nie przeprowadziłem własnych testów żadnego z tych modeli - to jest analiza cudzych liczb, nie pomiar.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Który model - Grok 4.7, Fable 5.1 czy GPT-5.6 Sol - jest najlepszy pod względem wyników benchmarków?
Fable 5.1 wygrywa cztery benchmarki z siedmiu, więc w kategorii czystej jakości zajmuje pierwsze miejsce. Grok 4.7 wygrywa trzy testy, w tym prawo i elektronikę, przy najniższej cenie 2 USD za milion tokenów wejściowych. GPT-5.6 Sol nie wygrywa żadnego poza jednym testem programistycznym, przy cenie 4 USD.
Ile kosztuje zadanie na milion tokenów wejściowych i 200 tysiącach wyjściowych dla każdego z modeli?
Grok 4.7 kosztuje 3,20 USD za takie zadanie, GPT-5.6 Sol 8,00 USD, a Fable 5.1 20,00 USD. Różnica między najtańszym a najdroższym modelem wynosi 16,80 USD na jedno zadanie.
Do jakich zastosowań najlepiej nadaje się Fable 5.1 mimo wysokiej ceny?
Fable 5.1 jest najlepszym wyborem do długich zadań w terminalu, gdzie osiąga 57,9% wobec 38,0% Groka 4.7, oraz do zastosowań medycznych z wynikiem 62,1% w HealthBench Professional. Uzasadniony jest też przy najtrudniejszym kodowaniu, gdzie wyprzedza konkurentów wynikiem 51,8% w CursorBench 4.0.
Skąd pochodzą wyniki benchmarków porównujące modele konkurencji i czy można im ufać?
Wszystkie liczby pochodzą z oficjalnego ogłoszenia producenta Groka 4.7 opublikowanego 21 września 2026 na stronie x.ai/news/grok-4-7 - nie są to niezależne badania. Autor zaznacza, że publikowanie własnych przegranych w czterech testach z siedmiu przemawia za rzetelnością danych, jednak zaleca weryfikację u źródła.
