7 lokalnych modeli AI po polsku: test na RTX 4090 kontra chmura
Gemma 4 12B, Qwen 3.8, Bielik, GPT-OSS i inne w tym samym teście co Opus 5.5. Najlepsze lokalne pobiły Claude Haiku 4.5.

👁 115 przeczytań
Lokalne modele AI po polsku sprawdziłem 26 września 2026 roku tym samym testem co Claude Opus 5.5 i GPT-6 w Laboratorium Promptowego. Siedem darmowych modeli uruchomionych na karcie RTX 4090 dostało 13 zadań: dziewięć pisarskich, korektę dwóch tekstów i 94 pytania o Polskę. Najlepsze, Gemma 4 12B i Qwen 3.8 27B, wyprzedziły płatnego Claude Haiku 4.5 z chmury. Do Opusa 5.5 brakuje im jednak ponad 20 punktów.
W skrócie
Najlepszy lokalny model do pisania po polsku to Gemma 4 12B: 72,3 pkt przy 104 tokenach na sekundę i 8 GB pamięci karty. Qwen 3.8 27B ma prawie ten sam wynik (72,2), ale jest dwa razy wolniejszy i zajmuje 17 GB. Bielik 11B pisze najpoprawniej po polsku i najlepiej zna Polskę (42 z 48 trudnych pytań), ale najsłabiej wykonuje polecenia. GPT-OSS 20B jest najszybszy (218 tok/s), a po polsku najsłabszy. W tej samej rundzie Claude Opus 5.5 z chmury dostał 94,2 pkt, GPT-6 Luna 86,4, a Claude Haiku 4.5 62,7.
Jak wyglądał test
Wszystkie modele działały w llama.cpp (wersja CUDA b11194) na karcie RTX 4090 z 24 GB pamięci, pod Windowsem 11, z kontekstem 32 768 tokenów. Instalację i pułapki opisałem w poradniku llama.cpp na Windowsie. Polecenia były identyczne jak w teście chmurowym. Tryb myślenia wyłączyłem w Gemmie i Qwenie, a w GPT-OSS ustawiłem wysiłek na niski. To odpowiednik ustawienia effort=low, z którym testowałem modele w chmurze.
Odpowiedzi ocenili ci sami trzej ślepi sędziowie z trzech firm: Claude Opus 5.5, GPT-6 Sol i Gemini 3.1 Pro. Nie wiedzieli, który tekst jest czyj. Sędzia nie oceniał modelu własnej firmy, więc Gemini nie oceniało Gemmy, a GPT-6 Sol nie oceniał GPT-OSS. Do puli dołożyłem trzy „kotwice” z chmury (Opus 5.5, GPT-6 Luna, Haiku 4.5). Dzięki nim widać, jak wypadają modele lokalne na tle znanych wyników. Wynik łączny liczę tym samym wzorem co w rankingu chmurowym: 70% ocena sędziów, 20% reguły sprawdzane automatycznie, 10% higiena tekstu.
Wyniki: ranking
Sędziowie w tej rundzie byli nieco łagodniejsi niż w pierwszej. Wszystkie trzy kotwice dostały o 3,5-3,6 pkt więcej niż w rankingu chmurowym (Opus 94,2 wobec 90,1, Luna 86,4 wobec 82,8, Haiku 62,7 wobec 59,2). Żeby porównać model lokalny z rankiem 16 modeli chmurowych, odejmij więc około 3,5 pkt. Gemma 4 12B ma wtedy około 69 pkt: mniej niż Claude Sonnet 5 (71,9), ale więcej niż Mistral Medium 3.5 (68,0) i GLM-5.3 (64,4) z chmury.
| Model | Wynik | Poprawność / naturalność / wykonanie (1-10) | Korekta trudna | Quiz o Polsce: łatwy / trudny | Szybkość | Pamięć karty |
|---|---|---|---|---|---|---|
| Gemma 4 12B (Q4_0, 7,0 GB) | 72,3 | 7,4 / 6,0 / 6,5 | 25/30 | 40/46, 30/48 | 104 tok/s | 8,0 GB |
| Qwen 3.8 27B (Q4_K_M, 16,5 GB) | 72,2 | 7,6 / 5,7 / 6,2 | 24/30 | 42/46, 37/48 | 50 tok/s | 17,0 GB |
| Bielik 11B v3 (Q8_0, 11,9 GB) | 64,4 | 8,5 / 5,5 / 4,2 | 22/30 | 45/46, 42/48 | 72 tok/s | 16,7 GB |
| Gemma 4 E4B (Q8_0, 8,0 GB) | 60,1 | 6,7 / 5,0 / 4,8 | 15/30 | 36/46, 26/48 | 110 tok/s | 5,9 GB |
| Mistral Small 3.2 24B (Q4_K_M, 14,3 GB) | 53,9 | 6,1 / 5,1 / 4,7 | 16/30 | 43/46, 38/48 | 61 tok/s | 18,6 GB |
| Qwen 3.6 35B-A3B (IQ4_XS, 17,7 GB) | 53,8 | 4,6 / 4,0 / 3,9 | 19/30 | 43/46, 34/48 | 174 tok/s | 17,5 GB |
| GPT-OSS 20B (MXFP4, 12,1 GB) | 52,4 | 5,4 / 4,3 / 4,5 | 9/30 | 29/46, 15/48 | 218 tok/s | 12,2 GB |
Szybkość to wynik llama-bench (generowanie 128 tokenów). Pamięć karty to szczyt podczas testu z kontekstem 32 768 tokenów, po odjęciu tego, co zajmował system i przeglądarka. Z krótszym kontekstem modele zajmą mniej. Dla porównania: Opus 5.5 i Luna dostały w korekcie 30/30 i 29/30, a w quizach komplet punktów.
Co wyszło z poszczególnych modeli
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Gemma 4 12B to najlepszy stosunek jakości do sprzętu. Mail do klienta z opóźnioną paczką był najlepszy spośród modeli lokalnych: GPT-6 Sol dał mu 9/8/8, a Opus 7/7/8 (Gemini nie oceniał modelu Google’a). W opowiadaniu obaj sędziowie wytknęli jej jednak „czwarty piętro”, a w tekście dla dziecka „Za rok temu kosztowała”. Polszczyzna jest dobra na co dzień, ale nie do publikacji bez korekty.
Qwen 3.8 27B najlepiej wytłumaczył inflację dwunastolatkowi (sędziowie: 9/9/10 i 10/8/9) i jako jedyny spełnił wszystkie 26 reguł automatycznych. Ma skłonność do dopowiadania: w mailu wymyślił dzień tygodnia dostawy i „ustalenia z partnerem logistycznym”. W opowiadaniu napisał „złoty serce” i „pulsuując”.
Bielik 11B ma najczystszą polszczyznę w teście (poprawność 8,5) i zna Polskę lepiej niż Claude Haiku 4.5: 45/46 w łatwym quizie i 42/48 w trudnym. Najsłabiej trzyma się jednak poleceń. W mailu dopisał 30-dniową ważność kodu rabatowego, choć polecenie zakazywało obiecywania czegokolwiek ponad treść. Tekst dla dziecka był za krótki, a opowiadanie miało zamknięty morał zamiast otwartego zakończenia. Szerzej o nim piszę w poradniku Bielik lokalnie.
Gemma 4 E4B to model na laptopa: 5,9 GB pamięci karty i 110 tokenów na sekundę. Wyprzedził dwa dużo większe modele, ale zostawiał w podpisie niewypełnione „[Nazwa Sklepu]” i pisał „To i jest właśnie inflacja”.
Mistral Small 3.2, Qwen 3.6 35B-A3B i GPT-OSS 20B są szybkie, ale po polsku słabe. Mistral napisał „Zrozumiemy, że to niepokojące” i „ceny rośnie”. Qwen 3.6 „liczył Państwo” i wstawił niemiecki „Titel:” do opowiadania. GPT-OSS miał najgorszą korektę (9/30) i najsłabszą wiedzę o Polsce (15/48). Do polskich tekstów bym ich nie wybierał, a do kodu czy streszczeń po angielsku mogą się sprawdzić. To opinia redakcji.
Pułapka: myślenie, które zjada wszystko
W pierwszym podejściu uruchomiłem Gemmę 4 12B z domyślnym trybem myślenia. Te same 13 zadań zajęło 570 sekund i 54 093 tokeny zamiast 53 sekund i 4710 tokenów. W trzech zadaniach model nie oddał odpowiedzi wcale, bo w myślach liczył słowa w szkicu, aż wyczerpał limit. To ten sam problem, który opisałem u chińskich modeli w chmurze w tekście AI myśli za długo po polsku. Wniosek praktyczny: do zwykłego pisania wyłącz myślenie. Jak to zrobić w llama.cpp, pokazuję w poradniku.
Ile to kosztuje
Cały test 13 zadań na Gemmie 4 12B zużył 0,004 kWh prądu na samą kartę, czyli 0,4 grosza przy cenie 1,05 zł za kWh. Ta sama seria w chmurze kosztowała 1,6 grosza w GPT-6 Luna, 26,5 grosza w Claude Haiku 4.5 i 1,43 zł w Claude Opus 5.5. Nie liczę tu zakupu karty. Pełny rachunek z progiem opłacalności jest w tekście lokalny model czy API.
Który model wybrać
- Karta z 8 GB (RTX 4060, 3070): Gemma 4 E4B albo Gemma 4 12B z krótszym kontekstem.
- Karta z 12-16 GB (RTX 4070, 5070 Ti): Gemma 4 12B z pełnym kontekstem. To najlepszy wybór do pisania po polsku.
- Karta z 24 GB (RTX 4090, 3090): Qwen 3.8 27B, jeśli liczy się wykonanie poleceń, albo Bielik 11B w Q8, jeśli ważna jest poprawność języka i wiedza o Polsce.
- Tekst ma wyjść bez poprawek: żaden model lokalny. Opus 5.5 i Luna są w innej lidze, a Luna kosztuje grosze.
Najczęstsze pytania
Jaki jest najlepszy lokalny model AI po polsku?
W moim teście 26.09.2026 wygrała Gemma 4 12B z wynikiem 72,3 pkt, tuż przed Qwen 3.8 27B (72,2). Gemma działa na karcie z 8 GB pamięci i generuje 104 tokeny na sekundę na RTX 4090.
Czy lokalny model jest lepszy od ChatGPT albo Claude?
Od najlepszych nie. Claude Opus 5.5 dostał w tej samej rundzie 94,2 pkt, a GPT-6 Luna 86,4. Najlepsze modele lokalne wyprzedziły natomiast płatnego Claude Haiku 4.5 (62,7 pkt).
Czy Bielik jest dobry?
Bielik 11B v3 ma najlepszą polszczyznę spośród modeli lokalnych (poprawność 8,5 na 10) i najlepiej zna polskie realia (42 z 48 trudnych pytań). Słabo trzyma się jednak szczegółowych poleceń, dlatego w wyniku łącznym jest trzeci.
Ile pamięci karty potrzebuje lokalny model?
W teście od 5,9 GB (Gemma 4 E4B) do 18,6 GB (Mistral Small 3.2) przy kontekście 32 768 tokenów. Z krótszym kontekstem zajmują mniej.
Źródła i data sprawdzenia
Test własny 26.09.2026: RTX 4090 24 GB, llama.cpp b11194 CUDA 12.4, pliki GGUF z Hugging Face (Google, SpeakLeash, Unsloth, ggml-org). Polecenia, klucze odpowiedzi i sędziowie jak w rankingu AI do pisania po polsku. Licencje modeli (Apache 2.0) według kart modeli na Hugging Face. Sprawdzone 26 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
