Grok 4.7: pełna tabela benchmarków i cen z dnia premiery
Nowy, większy model bazowy w tej samej cenie co poprzednik. Rozbieram pełną tabelę wyników i liczę, ile to realnie kosztuje w złotych.

👁 113 przeczytań
- Grok 4.7 kosztuje 2 USD za milion tokenów wejściowych i 6 USD za wyjściowe - tyle samo co Grok 4.6, choć konkurencja z najwyższej półki bierze 10 i 50 USD.
- Na Terminal-Bench 4.0 Grok 4.7 skoczył z 20,3% (wynik Groka 4.6) do 38,0%, co oznacza niemal dwukrotną poprawę w jednej generacji.
Grok 4.7 wyszedł 21 września 2026 i najciekawsza liczba nie jest w żadnym benchmarku. Model dostał nowy, większy model bazowy i dłuższy trening, a mimo to jest serwowany w tej samej cenie co Grok 4.6: 2 dolary za milion tokenów wejściowych i 6 za milion wyjściowych. Dla porównania konkurencja z najwyższej półki bierze 10 i 50.
Werdykt w jednym akapicie
To nie jest model, który wygrywa wszystkie benchmarki - to model, który wygrywa stosunek wyniku do ceny. W kodowaniu ustępuje najmocniejszej konkurencji, ale kosztuje pięć razy mniej na wejściu i ponad osiem razy mniej na wyjściu. Są jednak trzy obszary, w których Grok 4.7 wygrywa wprost: elektronika, praca prawnicza i bezpieczeństwo. W teście prawniczym różnica jest trzykrotna na jego korzyść.
Cena obok wyników - cała tabela
Producent zrobił rzecz, której zwykle się nie robi: wrzucił ceny do tej samej tabeli co benchmarki. Poniżej komplet, stan na dzień premiery.
| Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max | |
|---|---|---|---|---|
| Wejście (za mln tokenów) | 2 USD | 2 USD | 4 USD | 10 USD |
| Wyjście (za mln tokenów) | 6 USD | 6 USD | 20 USD | 50 USD |
| CursorBench 4.0 - kodowanie | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0%* | 65,2% | 72,7% | 70,0% |
| EEBench - elektronika | 64,0% | 53,0% | 39,4% | 56,4% |
| AA Briefcase - praca biurowa | 1 657 | 1 546 | 1 487 | 1 678 |
| Terminal-Bench 4.0 | 38,0% | 20,3% | 37,3% | 57,9% |
| Harvey - praca prawnicza | 19,6% | 15,8% | 2,5% | 6,7% |
| HealthBench Professional | 56,7% | 48,5% | 60,5% | 62,1% |
Gwiazdka przy DeepSWE oznacza wynik w trybie wysokiego wysiłku.
Trzy rzeczy, które ta tabela mówi
1. W kodowaniu nie jest najlepszy i nikt tego nie ukrywa
Na CursorBench 4.0 Grok 4.7 ma 46,3%, a konkurent 51,8%. Na Terminal-Bench różnica jest znacznie większa: 38,0% wobec 57,9%. To nie są wyniki, które da się przemilczeć - i producent ich nie przemilcza, bo sam je opublikował obok swoich.
Co jednak robi różnicę: ten sam Grok 4.7 przeskoczył Groka 4.6 na Terminal-Bench z 20,3% na 38,0%, czyli prawie dwukrotnie, w obrębie jednej generacji.
2. Praca prawnicza to anomalia w skali całej tabeli
Harvey Legal Agent Benchmark: 19,6% dla Groka 4.7, 6,7% dla najmocniejszego konkurenta i 2,5% dla kolejnego. To jest różnica trzykrotna i ośmiokrotna, a nie kilka punktów procentowych.
To jest opinia: gdy jeden model bije resztę o rząd wielkości w wąskim benchmarku, zwykle oznacza to, że trenowano go celowo pod ten typ zadań. Nie umniejsza to wyniku - ale przed decyzją zakupową warto sprawdzić, czy Twoja praca przypomina to, co mierzy ten konkretny test.
3. Elektronika bez konkurencji
EEBench: 64,0% wobec 56,4% i 39,4%. Przy zadaniach z inżynierii elektrycznej przewaga jest wyraźna, a różnica wobec jednego z konkurentów wynosi 25 punktów procentowych.
Co się zmieniło pod maską
Producent podaje cztery rzeczy i wszystkie są spójne z tym, co widać w wynikach:
- Nowy, większy model bazowy niż w Groku 4.6
- Dłuższy trening ze wzmocnieniem na trudniejszym zestawie zadań, ważonym w stronę problemów zajmujących wiele godzin
- Lepsze sprawdzanie własnej pracy i obsługa długiego kontekstu
- Natywne rozumienie własnego środowiska agentowego - stąd poprawa w zadaniach konwersacyjnych i biurowych
Ważenie treningu w stronę zadań wielogodzinnych tłumaczy skok na Terminal-Bench i w pracy biurowej. To są dokładnie te testy, gdzie liczy się wytrwałość, a nie błyskotliwość w jednym kroku.
Bezpieczeństwo - i tu są konkretne liczby
To zwykle najbardziej mglista część ogłoszeń o premierze, ale tutaj padły dwie liczby:
- 62,4% na biologicznym teście bezpieczeństwa prowadzonym przez zewnętrzny podmiot - najwyższy wynik w zestawieniu
- 3,3% ryzykownych zapytań podwójnego zastosowania przepuszczonych na HackerBench, przy jednoczesnym rzadkim blokowaniu legalnej pracy z bezpieczeństwem
Ta druga liczba jest ciekawsza, niż wygląda. Łatwo zbudować model, który odmawia wszystkiego - trudniej taki, który odmawia niebezpiecznych rzeczy, a nie przeszkadza specjaliście od bezpieczeństwa w normalnej pracy. Tu deklarowane są oba naraz.
Ile to realnie kosztuje
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Przeliczmy na coś namacalnego. Przyjmijmy zadanie zużywające milion tokenów wejściowych i 200 tysięcy wyjściowych - to mniej więcej dłuższa sesja pracy z dużym kontekstem.
| Model | Wejście | Wyjście | Razem | W złotych |
|---|---|---|---|---|
| Grok 4.7 | 2,00 USD | 1,20 USD | 3,20 USD | ~12,10 zł |
| GPT-5.6 Sol | 4,00 USD | 4,00 USD | 8,00 USD | ~30,20 zł |
| Fable 5.1 | 10,00 USD | 10,00 USD | 20,00 USD | ~75,60 zł |
Przeliczenie redakcji po kursie 3,78 zł za dolara. Różnica na jednym zadaniu to 63 złote - przy stu takich zadaniach miesięcznie robi się z tego 6 300 zł.
Dostępny jest też wariant szybki: podwójna prędkość wyjścia za podwójną cenę.
Gdzie go użyjesz od dziś
Model jest dostępny w Cursorze i w środowisku budowania producenta, przez API, w zewnętrznych narzędziach do kodowania oraz przez routery modeli i platformy chmurowe.
Dla kogo to jest, a dla kogo nie
| Sytuacja | Werdykt |
|---|---|
| Dużo zapytań, budżet ma znaczenie | Tak. Tu przewaga cenowa jest decydująca |
| Praca prawnicza, analiza dokumentów | Tak. Trzykrotna przewaga w benchmarku |
| Inżynieria elektryczna | Tak. Najlepszy wynik w zestawieniu |
| Długie zadania agentowe | Warto sprawdzić. Duży skok wobec poprzednika |
| Najtrudniejsze zadania programistyczne | Nie. Konkurencja wyraźnie wyżej, choć drożej |
| Zastosowania medyczne | Nie. HealthBench na korzyść konkurencji |
Najczęstsze pytania
Ile kosztuje Grok 4.7?
Od 2 USD za milion tokenów wejściowych i 6 USD za milion wyjściowych - tyle samo co Grok 4.6. Wariant szybki kosztuje dwa razy więcej i ma dwa razy szybsze wyjście.
Czy Grok 4.7 jest lepszy od Groka 4.6?
We wszystkich siedmiu opublikowanych benchmarkach tak. Największy skok to Terminal-Bench: z 20,3% na 38,0%. A cena się nie zmieniła.
Czy Grok 4.7 jest najlepszym modelem do kodowania?
Nie. Na CursorBench 4.0 ma 46,3% wobec 51,8% u najmocniejszego konkurenta. Jest za to znacznie tańszy, więc pytanie brzmi raczej: ile jesteś gotów dopłacić za te pięć punktów.
Gdzie mogę go używać?
W Cursorze, w środowisku budowania producenta, przez API, w zewnętrznych narzędziach do kodowania oraz na platformach chmurowych i routerach modeli.
Czy jest darmowa wersja?
Producent udostępnia da[…] (zdanie urwane)rmowe wejście przez swoje środowisko budowania - szczegóły na stronie projektu.
Źródła i data sprawdzenia
Wszystkie ceny, wyniki benchmarków i opis zmian pochodzą z oficjalnego ogłoszenia producenta z 21 września 2026, odczytanego tego samego dnia: x.ai/news/grok-4-7. Nie przeprowadziłem własnych testów tego modelu - podane liczby są deklaracjami producenta, w tym wyniki jego konkurentów, które sam opublikował. Przeliczenia na złote to wyliczenia redakcji po kursie 3,78 zł za dolara.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Ile kosztuje Grok 4.7 w porównaniu do konkurencji?
Grok 4.7 kosztuje 2 USD za milion tokenów wejściowych i 6 USD za milion wyjściowych. Dla porównania GPT-5.6 Sol Max pobiera 4 USD za wejście i 20 USD za wyjście, a Fable 5.1 Max odpowiednio 10 USD i 50 USD.
Czy Grok 4.7 jest najlepszym modelem do kodowania?
Nie - na CursorBench 4.0 Grok 4.7 uzyskał 46,3%, podczas gdy najmocniejszy konkurent osiągnął 51,8%. Model jest za to znacznie tańszy, a na Terminal-Bench 4.0 poprawił wynik z 20,3% do 38,0% względem poprzednika.
W czym Grok 4.7 wypada najlepiej spośród testowanych modeli?
Grok 4.7 osiąga najwyższe wyniki w pracy prawniczej (19,6% wobec 6,7% u najbliższego konkurenta) oraz w elektronice na EEBench (64,0% wobec 56,4% i 39,4%). Bezpieczeństwo biologiczne to również najwyższy wynik w zestawieniu - 62,4%.
Gdzie mogę korzystać z Groka 4.7?
Model jest dostępny w Cursorze, w środowisku budowania producenta, przez API oraz w zewnętrznych narzędziach do kodowania. Można z niego korzystać też przez routery modeli i platformy chmurowe.
