Grok 4.7 po polsku: nie ma benchmarków, jest test na kwadrans
Polszczyzna kosztuje więcej tokenów, a model pisze bez ogonków, gdy Twoja instrukcja jest bez nich. Test, który da odpowiedź w kwadrans.

👁 112 przeczytań
- Grok 4.7 nie ma ani jednego benchmarku po polsku - wszystkie siedem opublikowanych testów to zadania anglojęzyczne i nikt ich nie uzupełni.
- Polszczyzna zużywa więcej tokenów niż angielski, więc przy cenie 2 USD za milion tokenów wejścia i 6 USD za wyjście ten sam tekst kosztuje po polsku wyraźnie więcej.
- W teście pracy prawniczej Grok 4.7 osiągnął 19,6% wobec 6,7% u najlepszego konkurenta, co sugeruje dobre radzenie sobie ze złożoną składnią - ale wynik dotyczy angielskiego.
Grok 4.7 nie ma ani jednego benchmarku po polsku - ani w ogłoszeniu premiery, ani w dokumentacji. Żaden producent ich nie publikuje. Zebrałem więc to, co da się o polszczyźnie powiedzieć z twardych danych, i opisałem test, którym sprawdzisz to sam w kwadrans.
Werdykt w jednym akapicie
Nie ma danych o jakości Groka 4.7 po polsku i nikt ich nie ma - wszystkie siedem opublikowanych benchmarków to testy anglojęzyczne. To, co wiemy na pewno: polszczyzna zużywa więcej tokenów niż angielski przy tej samej treści, więc ten sam tekst kosztuje po polsku wyraźnie więcej. Jedyna wiarygodna odpowiedź to własny test na własnych zadaniach - opisuję go niżej, zajmuje kwadrans.
Dlaczego polski kosztuje więcej
To nie jest opinia, tylko konsekwencja sposobu, w jaki modele dzielą tekst na tokeny. Tokenizery trenowane są głównie na angielszczyźnie, więc częste angielskie słowa mają własne tokeny, a polskie są sklejane z kawałków.
Praktyczna konsekwencja: ten sam materiał po polsku zajmuje więcej tokenów niż po angielsku. Płacisz za tokeny, więc płacisz więcej za to samo. Przy cenie 2 USD za milion tokenów wejścia i 6 za wyjście różnica staje się widoczna dopiero przy dużym wolumenie - ale staje się.
Co z tym zrobić, gdy wolumen jest duży: materiał wejściowy zostaw po polsku, ale instrukcję systemową pisz po angielsku. Instrukcja powtarza się przy każdym zapytaniu, więc to ona najbardziej zyskuje na skróceniu.
Pułapka, która psuje polskie teksty w każdym modelu
Trafiłem na to przy budowie automatu redakcyjnego i kosztowało mnie trzy nieudane przebiegi z rzędu. Jeśli instrukcja dla modelu jest napisana bez polskich znaków, model pisze cały tekst bez ogonków.
Powód: model kopiuje styl instrukcji. Napisałem prompt w pliku PHP, gdzie wygodniej było użyć samego ASCII - i dostawałem „Uzywaj wylacznie liczb podanych w sekcji” zamiast „Używaj wyłącznie”. Model potraktował to jako wzorzec.
Poprawka jest banalna: pisz instrukcje z pełną polszczyzną. Po tej zmianie ten sam automat przeszedł za pierwszym podejściem. Opisałem to szerzej w tekście o pułapkach przy generowaniu ustrukturyzowanych odpowiedzi.
Test polszczyzny w kwadrans
To jest jedyna wiarygodna odpowiedź na pytanie „jak radzi sobie po polsku”, bo mierzy to, co Ty z nim robisz, a nie cudze zadania.
Prompt testowy - skopiuj i wklej
Napisz tekst po polsku na 900 słów o tym, jak zmienia się polski rynek pracy w IT. Zasady bezwzględne: polskie znaki diakrytyczne obowiązkowo, ani jednego słowa bez ogonków. Tylko dywiz "-", nigdy długa pauza. Zero waty typu "w dzisiejszych czasach", "warto pamiętać", "podsumowując". Każdą tezę popierasz liczbą albo piszesz wprost, że to opinia. Jeśli czegoś nie wiesz, piszesz "nie wiem" - nie zmyślasz danych ani nazw firm. Zwróć sam tekst, bez komentarza.
Czego szukać w odpowiedzi
| Co sprawdzasz | Jak | Czerwona flaga |
|---|---|---|
| Ogonki do końca | Przeczytaj ostatni akapit | Większość modeli gubi je po 600 słowach |
| Długie pauzy | Szukaj znaku „-” | To najczęstsza sygnatura tekstu z modelu |
| Odmiana przez przypadki | Zdania z liczebnikami | „2 modeli” zamiast „2 modele” |
| Zmyślone dane | Sprawdź każdą liczbę | Konkretne statystyki bez źródła |
| Kalki z angielskiego | Czytaj na głos | „Dedykowany”, „adresować problem” |
Punkt czwarty jest najważniejszy. Model, który pisze piękną polszczyzną i zmyśla liczby, jest gorszy od takiego, który pisze sucho i przyznaje się do niewiedzy.
Co wiadomo o Groku 4.7 z twardych danych
Benchmarków po polsku nie ma, ale dwa opublikowane wyniki mają pośredni związek z pracą z tekstem:
| Test | Grok 4.7 | Najlepszy konkurent |
|---|---|---|
| Praca prawnicza | 19,6% | 6,7% |
| Wielogodzinna praca biurowa | 1 657 | 1 678 |
Pierwszy wynik jest interesujący, bo praca z dokumentami prawnymi to w dużej mierze praca z językiem: rozumienie odesłań, warunków i zastrzeżeń. Trzykrotna przewaga w tym teście sugeruje dobre radzenie sobie ze złożoną składnią - ale to jest mój wniosek, nie pomiar, i dotyczy angielskiego.
Pięć zasad przy pracy po polsku - niezależnie od modelu
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
- Instrukcje pisz z pełną polszczyzną. Model kopiuje styl - bez ogonków w instrukcji dostaniesz tekst bez ogonków.
- Zakaż długiej pauzy wprost. „Tylko dywiz, nigdy długa pauza” w każdej instrukcji.
- Wypisz wyrazy do zakazania. „W dzisiejszych czasach”, „warto pamiętać”, „podsumowując” - bez tego wracają.
- Żądaj przyznania się do niewiedzy. „Jeśli czegoś nie wiesz, napisz nie wiem” zmniejsza liczbę zmyślonych danych.
- Sprawdzaj końcówkę tekstu, nie początek. Jakość spada na końcu długich odpowiedzi i tam wychodzą ogonki oraz kalki.
Najczęstsze pytania
Czy Grok 4.7 dobrze radzi sobie po polsku?
Nie wiadomo i nikt tego nie zmierzył - wszystkie opublikowane benchmarki są anglojęzyczne. Sprawdź to testem opisanym wyżej na własnych zadaniach.
Czy pisanie po polsku kosztuje więcej?
Tak. Polszczyzna zużywa więcej tokenów niż angielski przy tej samej treści, a płacisz za tokeny.
Dlaczego model pisze bez polskich znaków?
Najczęściej dlatego, że Twoja instrukcja jest napisana bez nich. Model kopiuje styl instrukcji. Napisz prompt z pełną polszczyzną.
Jak pozbyć się długich pauz?
Zakaż ich wprost w instrukcji: „tylko dywiz, nigdy długa pauza”. Bez tego wracają niezależnie od modelu.
Czy da się obniżyć koszt pracy po polsku?
Materiał zostaw po polsku, a instrukcję systemową napisz po angielsku - to ona powtarza się przy każdym zapytaniu.
Źródła i data sprawdzenia
Ceny i wyniki benchmarków pochodzą z oficjalnego ogłoszenia z 21 września 2026: x.ai/news/grok-4-7. Brak benchmarków polskojęzycznych to stan faktyczny na dzień premiery, nie zaniedbanie tego producenta - nikt ich nie publikuje. Obserwacje o instrukcjach bez ogonków i o zużyciu tokenów pochodzą z mojej pracy nad automatem redakcyjnym na tym serwisie, nie z materiałów producenta.
Więcej o Groku 4.7
Przewodnik: pełna tabela benchmarków i cen · Grok 4.7 vs Fable 5.1 vs GPT-5.6 Sol: policzyłem, ile kosztuje punkt przewagi · Ile kosztuje Grok 4.7? Pełny cennik: tekst, głos, obraz i wideo w złotych · 500 tysięcy tokenów kontekstu w Groku 4.7: co się w to mieści naprawdę
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czy Grok 4.7 dobrze radzi sobie z językiem polskim?
Nie wiadomo - wszystkie opublikowane benchmarki Groka 4.7 są anglojęzyczne i żaden producent nie publikuje testów polskojęzycznych. Jedyną wiarygodną odpowiedzią jest własny test na własnych zadaniach, który według artykułu zajmuje kwadrans.
Dlaczego model pisze polskie teksty bez ogonków?
Najczęstszą przyczyną jest instrukcja napisana bez polskich znaków diakrytycznych - model kopiuje styl promptu. Wystarczy pisać instrukcje z pełną polszczyzną, żeby problem zniknął.
Jak obniżyć koszt korzystania z Groka 4.7 po polsku?
Materiał wejściowy należy zostawić po polsku, a instrukcję systemową napisać po angielsku. Instrukcja powtarza się przy każdym zapytaniu, więc jej skrócenie daje największą oszczędność tokenów.
Jak sprawdzić jakość Groka 4.7 w języku polskim?
Należy wkleić gotowy prompt testowy z artykułu i poprosić model o tekst 900 słów o polskim rynku pracy w IT z bezwzględnym wymogiem ogonków i zakazem długich pauz. W odpowiedzi trzeba sprawdzić cztery rzeczy: ogonki w ostatnim akapicie, brak długiej pauzy, poprawną odmianę liczebników oraz czy podane liczby są weryfikowalne.
