Przejdź do treści
Warsztat

Grok 4.7: pełna tabela benchmarków i cen z dnia premiery

Nowy, większy model bazowy w tej samej cenie co poprzednik. Rozbieram pełną tabelę wyników i liczę, ile to realnie kosztuje w złotych.

5 min czytania
Grok 4.7: pełna tabela benchmarków i cen z dnia premiery

👁 113 przeczytań

// w skrócie
  • Grok 4.7 kosztuje 2 USD za milion tokenów wejściowych i 6 USD za wyjściowe - tyle samo co Grok 4.6, choć konkurencja z najwyższej półki bierze 10 i 50 USD.
  • Na Terminal-Bench 4.0 Grok 4.7 skoczył z 20,3% (wynik Groka 4.6) do 38,0%, co oznacza niemal dwukrotną poprawę w jednej generacji.

Grok 4.7 wyszedł 21 września 2026 i najciekawsza liczba nie jest w żadnym benchmarku. Model dostał nowy, większy model bazowy i dłuższy trening, a mimo to jest serwowany w tej samej cenie co Grok 4.6: 2 dolary za milion tokenów wejściowych i 6 za milion wyjściowych. Dla porównania konkurencja z najwyższej półki bierze 10 i 50.

Werdykt w jednym akapicie

To nie jest model, który wygrywa wszystkie benchmarki - to model, który wygrywa stosunek wyniku do ceny. W kodowaniu ustępuje najmocniejszej konkurencji, ale kosztuje pięć razy mniej na wejściu i ponad osiem razy mniej na wyjściu. Są jednak trzy obszary, w których Grok 4.7 wygrywa wprost: elektronika, praca prawnicza i bezpieczeństwo. W teście prawniczym różnica jest trzykrotna na jego korzyść.

Cena obok wyników - cała tabela

Producent zrobił rzecz, której zwykle się nie robi: wrzucił ceny do tej samej tabeli co benchmarki. Poniżej komplet, stan na dzień premiery.

Grok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
Wejście (za mln tokenów)2 USD2 USD4 USD10 USD
Wyjście (za mln tokenów)6 USD6 USD20 USD50 USD
CursorBench 4.0 - kodowanie46,3%40,4%41,7%51,8%
DeepSWE v1.171,0%*65,2%72,7%70,0%
EEBench - elektronika64,0%53,0%39,4%56,4%
AA Briefcase - praca biurowa1 6571 5461 4871 678
Terminal-Bench 4.038,0%20,3%37,3%57,9%
Harvey - praca prawnicza19,6%15,8%2,5%6,7%
HealthBench Professional56,7%48,5%60,5%62,1%

Gwiazdka przy DeepSWE oznacza wynik w trybie wysokiego wysiłku.

Trzy rzeczy, które ta tabela mówi

1. W kodowaniu nie jest najlepszy i nikt tego nie ukrywa

Na CursorBench 4.0 Grok 4.7 ma 46,3%, a konkurent 51,8%. Na Terminal-Bench różnica jest znacznie większa: 38,0% wobec 57,9%. To nie są wyniki, które da się przemilczeć - i producent ich nie przemilcza, bo sam je opublikował obok swoich.

Co jednak robi różnicę: ten sam Grok 4.7 przeskoczył Groka 4.6 na Terminal-Bench z 20,3% na 38,0%, czyli prawie dwukrotnie, w obrębie jednej generacji.

2. Praca prawnicza to anomalia w skali całej tabeli

Harvey Legal Agent Benchmark: 19,6% dla Groka 4.7, 6,7% dla najmocniejszego konkurenta i 2,5% dla kolejnego. To jest różnica trzykrotna i ośmiokrotna, a nie kilka punktów procentowych.

To jest opinia: gdy jeden model bije resztę o rząd wielkości w wąskim benchmarku, zwykle oznacza to, że trenowano go celowo pod ten typ zadań. Nie umniejsza to wyniku - ale przed decyzją zakupową warto sprawdzić, czy Twoja praca przypomina to, co mierzy ten konkretny test.

3. Elektronika bez konkurencji

EEBench: 64,0% wobec 56,4% i 39,4%. Przy zadaniach z inżynierii elektrycznej przewaga jest wyraźna, a różnica wobec jednego z konkurentów wynosi 25 punktów procentowych.

Co się zmieniło pod maską

Producent podaje cztery rzeczy i wszystkie są spójne z tym, co widać w wynikach:

  • Nowy, większy model bazowy niż w Groku 4.6
  • Dłuższy trening ze wzmocnieniem na trudniejszym zestawie zadań, ważonym w stronę problemów zajmujących wiele godzin
  • Lepsze sprawdzanie własnej pracy i obsługa długiego kontekstu
  • Natywne rozumienie własnego środowiska agentowego - stąd poprawa w zadaniach konwersacyjnych i biurowych

Ważenie treningu w stronę zadań wielogodzinnych tłumaczy skok na Terminal-Bench i w pracy biurowej. To są dokładnie te testy, gdzie liczy się wytrwałość, a nie błyskotliwość w jednym kroku.

Bezpieczeństwo - i tu są konkretne liczby

To zwykle najbardziej mglista część ogłoszeń o premierze, ale tutaj padły dwie liczby:

  • 62,4% na biologicznym teście bezpieczeństwa prowadzonym przez zewnętrzny podmiot - najwyższy wynik w zestawieniu
  • 3,3% ryzykownych zapytań podwójnego zastosowania przepuszczonych na HackerBench, przy jednoczesnym rzadkim blokowaniu legalnej pracy z bezpieczeństwem

Ta druga liczba jest ciekawsza, niż wygląda. Łatwo zbudować model, który odmawia wszystkiego - trudniej taki, który odmawia niebezpiecznych rzeczy, a nie przeszkadza specjaliście od bezpieczeństwa w normalnej pracy. Tu deklarowane są oba naraz.

Ile to realnie kosztuje

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Przeliczmy na coś namacalnego. Przyjmijmy zadanie zużywające milion tokenów wejściowych i 200 tysięcy wyjściowych - to mniej więcej dłuższa sesja pracy z dużym kontekstem.

ModelWejścieWyjścieRazemW złotych
Grok 4.72,00 USD1,20 USD3,20 USD~12,10 zł
GPT-5.6 Sol4,00 USD4,00 USD8,00 USD~30,20 zł
Fable 5.110,00 USD10,00 USD20,00 USD~75,60 zł

Przeliczenie redakcji po kursie 3,78 zł za dolara. Różnica na jednym zadaniu to 63 złote - przy stu takich zadaniach miesięcznie robi się z tego 6 300 zł.

Dostępny jest też wariant szybki: podwójna prędkość wyjścia za podwójną cenę.

Gdzie go użyjesz od dziś

Model jest dostępny w Cursorze i w środowisku budowania producenta, przez API, w zewnętrznych narzędziach do kodowania oraz przez routery modeli i platformy chmurowe.

Dla kogo to jest, a dla kogo nie

SytuacjaWerdykt
Dużo zapytań, budżet ma znaczenieTak. Tu przewaga cenowa jest decydująca
Praca prawnicza, analiza dokumentówTak. Trzykrotna przewaga w benchmarku
Inżynieria elektrycznaTak. Najlepszy wynik w zestawieniu
Długie zadania agentoweWarto sprawdzić. Duży skok wobec poprzednika
Najtrudniejsze zadania programistyczneNie. Konkurencja wyraźnie wyżej, choć drożej
Zastosowania medyczneNie. HealthBench na korzyść konkurencji

Najczęstsze pytania

Ile kosztuje Grok 4.7?

Od 2 USD za milion tokenów wejściowych i 6 USD za milion wyjściowych - tyle samo co Grok 4.6. Wariant szybki kosztuje dwa razy więcej i ma dwa razy szybsze wyjście.

Czy Grok 4.7 jest lepszy od Groka 4.6?

We wszystkich siedmiu opublikowanych benchmarkach tak. Największy skok to Terminal-Bench: z 20,3% na 38,0%. A cena się nie zmieniła.

Czy Grok 4.7 jest najlepszym modelem do kodowania?

Nie. Na CursorBench 4.0 ma 46,3% wobec 51,8% u najmocniejszego konkurenta. Jest za to znacznie tańszy, więc pytanie brzmi raczej: ile jesteś gotów dopłacić za te pięć punktów.

Gdzie mogę go używać?

W Cursorze, w środowisku budowania producenta, przez API, w zewnętrznych narzędziach do kodowania oraz na platformach chmurowych i routerach modeli.

Czy jest darmowa wersja?

Producent udostępnia da[…] (zdanie urwane)rmowe wejście przez swoje środowisko budowania - szczegóły na stronie projektu.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Wszystkie ceny, wyniki benchmarków i opis zmian pochodzą z oficjalnego ogłoszenia producenta z 21 września 2026, odczytanego tego samego dnia: x.ai/news/grok-4-7. Nie przeprowadziłem własnych testów tego modelu - podane liczby są deklaracjami producenta, w tym wyniki jego konkurentów, które sam opublikował. Przeliczenia na złote to wyliczenia redakcji po kursie 3,78 zł za dolara.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile kosztuje Grok 4.7 w porównaniu do konkurencji?

Grok 4.7 kosztuje 2 USD za milion tokenów wejściowych i 6 USD za milion wyjściowych. Dla porównania GPT-5.6 Sol Max pobiera 4 USD za wejście i 20 USD za wyjście, a Fable 5.1 Max odpowiednio 10 USD i 50 USD.

Czy Grok 4.7 jest najlepszym modelem do kodowania?

Nie - na CursorBench 4.0 Grok 4.7 uzyskał 46,3%, podczas gdy najmocniejszy konkurent osiągnął 51,8%. Model jest za to znacznie tańszy, a na Terminal-Bench 4.0 poprawił wynik z 20,3% do 38,0% względem poprzednika.

W czym Grok 4.7 wypada najlepiej spośród testowanych modeli?

Grok 4.7 osiąga najwyższe wyniki w pracy prawniczej (19,6% wobec 6,7% u najbliższego konkurenta) oraz w elektronice na EEBench (64,0% wobec 56,4% i 39,4%). Bezpieczeństwo biologiczne to również najwyższy wynik w zestawieniu - 62,4%.

Gdzie mogę korzystać z Groka 4.7?

Model jest dostępny w Cursorze, w środowisku budowania producenta, przez API oraz w zewnętrznych narzędziach do kodowania. Można z niego korzystać też przez routery modeli i platformy chmurowe.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie