Lokalne AI: modele tekstowe, obrazy i wideo na własnym komputerze
Przewodnik po lokalnym AI z własnymi testami na RTX 4090: 7 modeli tekstowych po polsku, generatory obrazów i wideo, instalacja i koszty.

👁 116 przeczytań
- Na kartach z 8 GB najlepszym lokalnym modelem tekstowym po polsku jest Gemma 4 12B, która w teście z 26.09.2026 uzyskała 72,3 pkt - więcej niż płatny Claude Haiku 4.5.
- Generator obrazów Z-Image Turbo tworzy jeden obraz w 4,2 s na RTX 4090, wymaga do 18 GB VRAM i jest objęty licencją Apache 2.0 dopuszczającą użytek komercyjny.
- Koszt prądu za 13 zadań na lokalnej Gemmie 4 12B wyniósł 0,4 grosza, wobec 1,6 grosza za te same zadania przez API GPT-6 Luna.
Lokalne AI to modele językowe, graficzne i wideo, które działają na twoim komputerze: bez konta, bez abonamentu i bez wysyłania danych do chmury. W tym przewodniku zebrałem wszystko, co przetestowałem na promptowy.com. Są tu wyniki 7 modeli tekstowych po polsku, 2 generatorów obrazów i modelu wideo, zmierzone 26 września 2026 roku na karcie RTX 4090, a do tego instalacja krok po kroku i rachunek, kiedy to się opłaca.
W skrócie
Na start: Gemma 4 12B do tekstu, Z-Image Turbo do obrazów, Wan 2.2 5B do krótkich klipów. Gemma dostała 72,3 pkt w moim teście pisania po polsku, więcej niż płatny Claude Haiku 4.5, i działa na karcie z 8 GB. Z-Image robi obraz w 4,2 s i wolno go używać komercyjnie. Wan 2.2 to około 4 minuty na 5 sekund wideo 720p. Do tekstów, które mają wyjść bez poprawek, chmura (Claude Opus 5.5, GPT-6 Luna) jest nadal wyraźnie lepsza.
Moje testy i poradniki
017 lokalnych modeli AI po polsku: test na RTX 4090 kontra chmuraGemma 4 12B, Qwen 3.8, Bielik, GPT-OSS i inne w tym samym teście co Opus 5.5. Najlepsze lokalne pobiły Claude Haiku 4.5.Czytaj →
02Z-Image Turbo lokalnie: test na 8 promptach i porównanie z Qwen-Image16 obrazów z tych samych poleceń: Z-Image Turbo robi obraz w 4,2 s i wolno go używać komercyjnie. Oba modele pomyliły polskie litery.Czytaj →
03Wan 2.2 lokalnie: wideo z AI na własnej karcie - czas, VRAM, próbkiCztery klipy 5 s w 720p z Wan 2.2 5B na RTX 4090: ok. 4 minuty na klip, 2 grosze prądu. Co wychodzi dobrze, a gdzie model gubi fizykę.Czytaj →
04llama.cpp na Windowsie: instalacja, czat w przeglądarce i test CUDAJedna komenda instaluje llama.cpp, ale wersja z winget była u nas 2-2,6 raza wolniejsza. Jak pobrać wersję CUDA, uruchomić serwer i wyłączyć zapętlone myślenie.Czytaj →
05ComfyUI: instalacja na Windowsie, pierwszy obraz i wymaganiaDarmowy program do obrazów i wideo AI na własnym komputerze. Trzy sposoby instalacji, szablony zamiast pustej tablicy i ile naprawdę potrzeba VRAM.Czytaj →
06Lokalny model czy API: ile naprawdę kosztuje AI z własnej kartyPomiar prądu na RTX 4090 kontra rachunki z API za te same zadania. Gemma lokalnie: 0,4 gr, GPT-6 Luna: 1,6 gr. Kiedy karta się zwraca.Czytaj →Co wybrać: tekst, obraz, wideo
| Do czego | Model | Pamięć karty | Szybkość (RTX 4090) | Licencja |
|---|---|---|---|---|
| Tekst po polsku, karta 8-16 GB | Gemma 4 12B | 8 GB | 104 tok/s | Apache 2.0 |
| Tekst, karta 24 GB | Qwen 3.8 27B | 17 GB | 50 tok/s | Apache 2.0 |
| Poprawna polszczyzna i wiedza o Polsce | Bielik 11B v3 | 17 GB (Q8) | 72 tok/s | Apache 2.0 |
| Laptop, słabsza karta | Gemma 4 E4B | 6 GB | 110 tok/s | Apache 2.0 |
| Obrazy do użytku komercyjnego | Z-Image Turbo | do 18 GB | 4,2 s / obraz | Apache 2.0 |
| Obrazy, projekty prywatne | Qwen-Image 2.1 | do 16 GB | 6,5 s / obraz | tylko niekomercyjnie |
| Wideo | Wan 2.2 TI2V 5B | ok. 20 GB | ok. 4 min / 5 s | Apache 2.0 |
Programy do uruchamiania
- LM Studio - okienkowy program z wyszukiwarką modeli. Najprostszy start z modelami tekstowymi.
- Ollama - modele tekstowe z terminala i prosty serwer API. Popularna w automatyzacjach.
- llama.cpp - silnik pod spodem obu powyższych. Daje pełną kontrolę i czat w przeglądarce. Na karcie Nvidii bierz wersję CUDA, bo Vulkan był u mnie 2-2,6 raza wolniejszy.
- ComfyUI - obrazy i wideo. Tablica z blokami, szablony dla nowych modeli i sterowanie ze skryptu.
Sprzęt: ile czego potrzeba
Najważniejsza jest pamięć karty graficznej (VRAM). Modele tekstowe do 12 mld parametrów w wersji skompresowanej (Q4) mieszczą się w 8 GB. Większe, jak Qwen 3.8 27B, wymagają 16-24 GB. Generatory obrazów i wideo w pełnej jakości zajmowały w moich testach 16-20 GB. Szczegóły i konkretne zestawy są w poradniku jaki komputer do lokalnego AI. Jak LM Studio współpracuje z narzędziami MCP i ile wtedy potrzeba pamięci, opisuje tekst LM Studio, MCP i lokalne modele.
Gotowe skrypty do pobrania
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Do każdego poradnika przygotowałem skrypt, który sprawdziłem 26.09.2026 na Windows 11 z kartą RTX 4090. Pełny kod z komentarzami jest w tekstach. Licencja MIT. Całość możesz też pobrać jako wszystkie 5 skryptów w jednym pliku ZIP (15 KB).
- instaluj-llama-cpp.ps1 (5 KB) - llama.cpp w wersji CUDA albo Vulkan, Gemma 4 12B i plik startowy. Opis.
- instaluj-comfyui.ps1 (6 KB) - ComfyUI z PyTorchem dla karty i modelami Z-Image Turbo oraz Wan 2.2. Opis.
- generuj-obrazy.py (6 KB) - serie obrazów z listy poleceń, z dziennikiem czasu. Opis.
- generuj-wideo.py (6 KB) - klip z Wan 2.2 prosto do MP4. Opis.
- zmierz-model.py (6 KB) - szybkość, pamięć karty i koszt prądu twojego modelu. Opis.
Czy to się opłaca
Prąd za 13 zadań na Gemmie 4 12B kosztował 0,4 grosza, a te same zadania w GPT-6 Luna przez API 1,6 grosza. Obraz z Z-Image to 0,04 grosza prądu. Zakup karty zwraca się jednak dopiero po setkach godzin pracy, a najtańsze API pisze lepiej. Lokalne AI wygrywa przede wszystkim prywatnością: nic nie wychodzi z komputera. Pełny rachunek jest w tekście lokalny model czy API.
Więcej o modelach lokalnych
01Jak uruchomić Bielika lokalnie na własnym komputerzePobierz i uruchom Bielika na własnym komputerze przez LM Studio, Ollamę lub llama.cpp. Dobór wersji, wymagania sprzętowe i gotowe komendy.Czytaj →
02GPT-OSS-20B lokalnie: wymagania, pliki i start w OllamieGPT-OSS-20B: jak uruchomić w Ollamie, co oznacza 16 GB pamięci i ile ważą pliki. Własny pomiar repozytorium oraz ograniczenia lokalnego modelu.Czytaj →
03Qwen-Image-2.1: przewodnik po modelu, który mieści się na jednej karcieObraz 2048×2048 w 44 sekundy na RTX 4090, komplet plików 16,6 GB. Wszystko, co sprawdziłem, w jednym miejscu.Czytaj →
04Jak zainstalować Qwen-Image-2.1 lokalnie na Windowsie - krok po krokuPo instalacji obraz 1024×1024 powstaje w 8 sekund. Najgorsza pułapka: requirements.txt nadpisuje sterowaną kartę wersją procesorową.Czytaj →
05LM Studio, MCP i lokalne modele: ile VRAM naprawdę potrzebujeszModel na Twoim dysku plus MCP do Twoich plików. Podaję progi VRAM, które decydują o wszystkim, i mówię wprost, kiedy to nie ma sensu.Czytaj →
06Jaki komputer do lokalnego AI? Konkretny poradnik (2026)Ile VRAM naprawdę potrzeba, jaka karta graficzna, ile RAM i kiedy Mac ma sens. Konkretny poradnik zakupowy do uruchamiania modeli AI lokalnie.Czytaj →Najczęstsze pytania
Jaki jest najlepszy lokalny model AI po polsku?
W moim teście z 26.09.2026 wygrała Gemma 4 12B (72,3 pkt), tuż przed Qwen 3.8 27B (72,2). Bielik 11B v3 ma najpoprawniejszą polszczyznę i najlepiej zna polskie realia, ale słabiej wykonuje polecenia.
Czy lokalne AI działa bez internetu?
Tak. Po pobraniu modelu LM Studio, Ollama, llama.cpp i ComfyUI działają całkowicie offline, a polecenia i pliki nie opuszczają komputera.
Czy mogę uruchomić lokalne AI bez karty graficznej?
Małe modele tekstowe działają na samym procesorze, ale kilka do kilkunastu razy wolniej. Obrazy i wideo bez karty graficznej są w praktyce zbyt wolne.
Źródła i data sprawdzenia
Testy własne promptowy.com z 26.09.2026 (RTX 4090 24 GB, llama.cpp b11194 CUDA, ComfyUI 0.37). Licencje: karty modeli na Hugging Face. Sprawdzone 26 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Jaki lokalny model AI najlepiej pisze po polsku?
W teście z 26 września 2026 roku na RTX 4090 najlepszy wynik uzyskała Gemma 4 12B z 72,3 pkt, minimalnie przed Qwen 3.8 27B z 72,2 pkt. Bielik 11B v3 ma najpoprawniejszą polszczyznę i lepiej zna polskie realia, ale słabiej wykonuje polecenia.
Ile VRAM potrzeba do uruchomienia lokalnego modelu AI?
Modele tekstowe do 12 mld parametrów w wersji Q4 mieszczą się w 8 GB VRAM. Większe modele, jak Qwen 3.8 27B, wymagają 16-24 GB, a generatory obrazów i wideo w pełnej jakości zajmują 16-20 GB.
Czy lokalne modele AI działają bez połączenia z internetem?
Tak - po jednorazowym pobraniu modelu programy LM Studio, Ollama, llama.cpp i ComfyUI działają w pełni offline. Żadne polecenia ani pliki nie opuszczają komputera użytkownika.
Który program najlepiej nadaje się do uruchamiania lokalnych modeli AI dla początkujących?
Dla początkujących najprostszym startem jest LM Studio - okienkowy program z wbudowaną wyszukiwarką modeli. Ollama sprawdza się w automatyzacjach, a ComfyUI służy do generowania obrazów i wideo.
