Lokalne AI: modele tekstowe, obrazy i wideo na własnym komputerze
Przewodnik po lokalnym AI z własnymi testami na RTX 4090: 7 modeli tekstowych po polsku, generatory obrazów i wideo, instalacja i koszty.

👁 116 przeczytań
Lokalne AI to modele językowe, graficzne i wideo, które działają na twoim komputerze: bez konta, bez abonamentu i bez wysyłania danych do chmury. W tym przewodniku zebrałem wszystko, co przetestowaliśmy na promptowy.com. Są tu wyniki 7 modeli tekstowych po polsku, 2 generatorów obrazów i modelu wideo, zmierzone 26 września 2026 roku na karcie RTX 4090, a do tego instalacja krok po kroku i rachunek, kiedy to się opłaca.
W skrócie
Na start: Gemma 4 12B do tekstu, Z-Image Turbo do obrazów, Wan 2.2 5B do krótkich klipów. Gemma dostała 72,3 pkt w naszym teście pisania po polsku, więcej niż płatny Claude Haiku 4.5, i działa na karcie z 8 GB. Z-Image robi obraz w 4,2 s i wolno go używać komercyjnie. Wan 2.2 to około 4 minuty na 5 sekund wideo 720p. Do tekstów, które mają wyjść bez poprawek, chmura (Claude Opus 5.5, GPT-6 Luna) jest nadal wyraźnie lepsza.
Nasze testy i poradniki
017 lokalnych modeli AI po polsku: test na RTX 4090 kontra chmuraGemma 4 12B, Qwen 3.8, Bielik, GPT-OSS i inne w tym samym teście co Opus 5.5. Najlepsze lokalne pobiły Claude Haiku 4.5.Czytaj →
02Z-Image Turbo lokalnie: test na 8 promptach i porównanie z Qwen-Image16 obrazów z tych samych poleceń: Z-Image Turbo robi obraz w 4,2 s i wolno go używać komercyjnie. Oba modele pomyliły polskie litery.Czytaj →
03Wan 2.2 lokalnie: wideo z AI na własnej karcie - czas, VRAM, próbkiCztery klipy 5 s w 720p z Wan 2.2 5B na RTX 4090: ok. 4 minuty na klip, 2 grosze prądu. Co wychodzi dobrze, a gdzie model gubi fizykę.Czytaj →
04llama.cpp na Windowsie: instalacja, czat w przeglądarce i test CUDAJedna komenda instaluje llama.cpp, ale wersja z winget była u nas 2-2,6 raza wolniejsza. Jak pobrać wersję CUDA, uruchomić serwer i wyłączyć zapętlone myślenie.Czytaj →
05ComfyUI: instalacja na Windowsie, pierwszy obraz i wymaganiaDarmowy program do obrazów i wideo AI na własnym komputerze. Trzy sposoby instalacji, szablony zamiast pustej tablicy i ile naprawdę potrzeba VRAM.Czytaj →
06Lokalny model czy API: ile naprawdę kosztuje AI z własnej kartyPomiar prądu na RTX 4090 kontra rachunki z API za te same zadania. Gemma lokalnie: 0,4 gr, GPT-6 Luna: 1,6 gr. Kiedy karta się zwraca.Czytaj →Co wybrać: tekst, obraz, wideo
| Do czego | Model | Pamięć karty | Szybkość (RTX 4090) | Licencja |
|---|---|---|---|---|
| Tekst po polsku, karta 8-16 GB | Gemma 4 12B | 8 GB | 104 tok/s | Apache 2.0 |
| Tekst, karta 24 GB | Qwen 3.8 27B | 17 GB | 50 tok/s | Apache 2.0 |
| Poprawna polszczyzna i wiedza o Polsce | Bielik 11B v3 | 17 GB (Q8) | 72 tok/s | Apache 2.0 |
| Laptop, słabsza karta | Gemma 4 E4B | 6 GB | 110 tok/s | Apache 2.0 |
| Obrazy do użytku komercyjnego | Z-Image Turbo | do 18 GB | 4,2 s / obraz | Apache 2.0 |
| Obrazy, projekty prywatne | Qwen-Image 2.1 | do 16 GB | 6,5 s / obraz | tylko niekomercyjnie |
| Wideo | Wan 2.2 TI2V 5B | ok. 20 GB | ok. 4 min / 5 s | Apache 2.0 |
Programy do uruchamiania
- LM Studio - okienkowy program z wyszukiwarką modeli. Najprostszy start z modelami tekstowymi.
- Ollama - modele tekstowe z terminala i prosty serwer API. Popularna w automatyzacjach.
- llama.cpp - silnik pod spodem obu powyższych. Daje pełną kontrolę i czat w przeglądarce. Na karcie Nvidii bierz wersję CUDA, bo Vulkan był u nas 2-2,6 raza wolniejszy.
- ComfyUI - obrazy i wideo. Tablica z blokami, szablony dla nowych modeli i sterowanie ze skryptu.
Sprzęt: ile czego potrzeba
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
Najważniejsza jest pamięć karty graficznej (VRAM). Modele tekstowe do 12 mld parametrów w wersji skompresowanej (Q4) mieszczą się w 8 GB. Większe, jak Qwen 3.8 27B, wymagają 16-24 GB. Generatory obrazów i wideo w pełnej jakości zajmowały w naszych testach 16-20 GB. Szczegóły i konkretne zestawy są w poradniku jaki komputer do lokalnego AI. Jak LM Studio współpracuje z narzędziami MCP i ile wtedy potrzeba pamięci, opisuje tekst LM Studio, MCP i lokalne modele.
Czy to się opłaca
Prąd za 13 zadań na Gemmie 4 12B kosztował 0,4 grosza, a te same zadania w GPT-6 Luna przez API 1,6 grosza. Obraz z Z-Image to 0,04 grosza prądu. Zakup karty zwraca się jednak dopiero po setkach godzin pracy, a najtańsze API pisze lepiej. Lokalne AI wygrywa przede wszystkim prywatnością: nic nie wychodzi z komputera. Pełny rachunek jest w tekście lokalny model czy API.
Więcej o modelach lokalnych
01Jak uruchomić Bielika lokalnie na własnym komputerzePobierz i uruchom Bielika na własnym komputerze przez LM Studio, Ollamę lub llama.cpp. Dobór wersji, wymagania sprzętowe i gotowe komendy.Czytaj →
02GPT-OSS-20B lokalnie: wymagania, pliki i start w OllamieGPT-OSS-20B: jak uruchomić w Ollamie, co oznacza 16 GB pamięci i ile ważą pliki. Własny pomiar repozytorium oraz ograniczenia lokalnego modelu.Czytaj →
03Qwen-Image-2.1: przewodnik po modelu, który mieści się na jednej karcieObraz 2048×2048 w 44 sekundy na RTX 4090, komplet plików 16,6 GB. Wszystko, co sprawdziłem, w jednym miejscu.Czytaj →
04Jak zainstalować Qwen-Image-2.1 lokalnie na Windowsie - krok po krokuPo instalacji obraz 1024×1024 powstaje w 8 sekund. Najgorsza pułapka: requirements.txt nadpisuje sterowaną kartę wersją procesorową.Czytaj →
05LM Studio, MCP i lokalne modele: ile VRAM naprawdę potrzebujeszModel na Twoim dysku plus MCP do Twoich plików. Podaję progi VRAM, które decydują o wszystkim, i mówię wprost, kiedy to nie ma sensu.Czytaj →
06Jaki komputer do lokalnego AI? Konkretny poradnik (2026)Ile VRAM naprawdę potrzeba, jaka karta graficzna, ile RAM i kiedy Mac ma sens. Konkretny poradnik zakupowy do uruchamiania modeli AI lokalnie.Czytaj →Najczęstsze pytania
Jaki jest najlepszy lokalny model AI po polsku?
W naszym teście z 26.09.2026 wygrała Gemma 4 12B (72,3 pkt), tuż przed Qwen 3.8 27B (72,2). Bielik 11B v3 ma najpoprawniejszą polszczyznę i najlepiej zna polskie realia, ale słabiej wykonuje polecenia.
Czy lokalne AI działa bez internetu?
Tak. Po pobraniu modelu LM Studio, Ollama, llama.cpp i ComfyUI działają całkowicie offline, a polecenia i pliki nie opuszczają komputera.
Czy mogę uruchomić lokalne AI bez karty graficznej?
Małe modele tekstowe działają na samym procesorze, ale kilka do kilkunastu razy wolniej. Obrazy i wideo bez karty graficznej są w praktyce zbyt wolne.
Źródła i data sprawdzenia
Testy własne promptowy.com z 26.09.2026 (RTX 4090 24 GB, llama.cpp b11194 CUDA, ComfyUI 0.37). Licencje: karty modeli na Hugging Face. Sprawdzone 26 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →