Llama lokalnie: jak uruchomić Llamę w Ollamie i ile potrzeba VRAM
Instalacja Llamy w Ollamie krok po kroku, wybór wersji pod kartę graficzną, moje pomiary prędkości i pamięci na RTX 4090 oraz to, jak Llama 3.1 8B radzi sobie po polsku.

👁 116 przeczytań
- Do uruchomienia Llamy 3.1 8B lokalnie wystarczy karta z 8 GB VRAM - plik waży 4,9 GB, a z kontekstem zajmuje 5,9 GB pamięci karty.
- Na RTX 4090 Llama 3.1 8B generuje 147,5-150,8 tokena na sekundę przy poborze mocy karty rzędu 310-320 W.
- Do polskich tekstów lepiej wybrać Bielik 11B (7,60/10) lub Gemma 4 12B (8,33/10), bo Llama 3.1 8B uzyskała tylko 5,33/10 w ocenie polszczyzny.
Llamę uruchomisz lokalnie jednym poleceniem: ollama run llama3.1:8b. Ollama pobierze 4,9 GB i model zadziała na karcie graficznej z 8 GB pamięci, bez konta i bez internetu po pobraniu. Na słabszym sprzęcie wybierz Llama 3.2 3B (2 GB), a do Llamy 3.3 70B potrzebujesz około 43 GB pamięci. Czym jest Llama, jak wygląda licencja i co Meta robi po niej, opisałem w przewodniku Llama. Tutaj jest sama instalacja, wybór wersji i moje pomiary na RTX 4090.
Stan na 3 października 2026
- Sprawdzone na: Ollama 0.35.1, Windows 11, RTX 4090 24 GB.
- Najpopularniejszy wybór: Llama 3.1 8B (4,9 GB w Ollamie, kontekst 128 tys. tokenów).
- Najnowsza Llama: Llama 4 Scout (67 GB) - nie zmieści się na domowej karcie.
- Otwarty następca od Mety: Muse Glimmer 30B (18 GB, Apache 2.0).
Którą Llamę wybrać pod swój sprzęt
| Model | Polecenie w Ollamie | Plik | Sprzęt | Do czego |
|---|---|---|---|---|
| Llama 3.2 1B | ollama run llama3.2:1b | 1,3 GB | dowolny komputer, nawet bez karty | proste klasyfikacje, testy |
| Llama 3.2 3B | ollama run llama3.2:3b | 2,0 GB | laptop, karta 4 GB | krótkie pytania, streszczenia po angielsku |
| Llama 3.1 8B | ollama run llama3.1:8b | 4,9 GB | karta 6-8 GB | codzienny czat, maile, wyciąganie danych |
| Llama 3.3 70B | ollama run llama3.3:70b | ok. 43 GB | 2 karty po 24 GB albo Mac z 64 GB pamięci | najlepsza jakość z Llam do uruchomienia u siebie |
| Llama 4 Scout | ollama run llama4:scout | 67 GB | stacja robocza albo serwer | długi kontekst, obraz; licencja z wyjątkiem dla UE |
| Muse Glimmer 30B | ollama run muse-glimmer:30b | 18 GB | karta 24 GB | następca Llamy od Mety, Apache 2.0 |
Rozmiary plików według biblioteki Ollamy (domyślna kwantyzacja Q4_K_M). Na karcie potrzebujesz o 1-2 GB więcej niż waży plik, bo dochodzi pamięć na kontekst rozmowy. Ogólną zasadę liczenia opisałem w tekście ile pamięci potrzeba do modelu lokalnie.
Instalacja krok po kroku (Windows)
- Pobierz instalator z ollama.com/download i uruchom go. Ollama działa w tle i ma ikonę w zasobniku systemowym.
- Jeśli dysk C: ma mało miejsca, ustaw zmienną środowiskową
OLLAMA_MODELSna folder na innym dysku (ja trzymam modele w D:\AI\ollama) i uruchom Ollamę ponownie. - Otwórz terminal (PowerShell) i wpisz
ollama run llama3.1:8b. Pierwsze uruchomienie pobiera model. - Po pobraniu zobaczysz znak zachęty
>>>. Napisz pytanie po polsku i naciśnij Enter. - Wyjście z rozmowy:
/bye. Lista pobranych modeli:ollama list. Usunięcie modelu:ollama rm llama3.1:8b. - Do programów i skryptów używaj lokalnego API: http://localhost:11434 (jest też wersja zgodna z API OpenAI pod /v1).
Szczegóły instalacji, pułapki z folderami i import własnych plików GGUF opisałem w przewodniku Ollama. Jeśli wolisz okienko zamiast terminala, te same modele pobierzesz w LM Studio - wpisz w wyszukiwarce „Llama 3.1 8B Instruct” i wybierz wersję Q4_K_M. Najwięcej kontroli daje llama.cpp.
Moje pomiary na RTX 4090
Pobrałem Llamę 3.1 8B z biblioteki Ollamy (Q4_K_M, 4,9 GB) i zmierzyłem ją 3 października 2026 obok trzech innych modeli podobnej wielkości:
| Model | Plik | Pamięć karty (kontekst 8192) | Tokeny na sekundę |
|---|---|---|---|
| Llama 3.1 8B | 4,9 GB | 5,9 GB | 149 |
| Ministral 3 8B | 6,0 GB | 6,3 GB | 136 |
| Gemma 4 12B | 7,0 GB | 7,9 GB | 96 |
| Bielik 11B v3 (Q8_0) | 11,9 GB | 13,6 GB | 67 |
- Prędkość: 147,5-150,8 tokena na sekundę w trzech próbach po 450 tokenów. Akapit tekstu pojawia się w niecałą sekundę.
- Start odpowiedzi: 0,013-0,019 s od wysłania polecenia, gdy model jest już w pamięci karty.
- Pobór mocy: karta brała przy generowaniu około 310-320 W.
- Ładowanie: pierwsze wczytanie z dysku USB trwało u mnie ponad 5 minut, bo jednocześnie z karty i dysku korzystał inny proces. To skrajny przypadek - z szybkiego dysku wewnętrznego model ładuje się znacznie szybciej.
Llama 3.1 8B jest więc najszybsza z tej czwórki i zajmuje najmniej pamięci. Na karcie z 8 GB zmieści się z zapasem na dłuższy kontekst. Jak liczyć koszt prądu przy takich pomiarach, pokazuję w tekście lokalny model czy API.
Jak Llama radzi sobie po polsku lokalnie
Szybkość to nie wszystko. Tego samego dnia dałem Llamie 3.1 8B pięć poleceń po polsku i porównałem ją z Bielikiem, Gemmą 4, Mistralami i większymi Llamami. Wynik: 5,33 na 10 w ślepej ocenie sędziego (Claude Opus 5.5), dziewiąte miejsce na 11 wariantów (za nią były tylko dwa Ministrale 3 8B). Najważniejsze błędy:
- tłumaczenie zaczęła od „Przyjdźmy do rzeczy” zamiast „Przejdźmy do rzeczy”,
- w korekcie zostawiła „poszłem”,
- 8-latkowi wyjaśniła, że „niebo odbija światło” (a światło się rozprasza),
- w mailu napisała „Drogi Panie Wiśniewski” i dopisała, że kurier „nie mógł wejść do budynku”.
Dla porównania Bielik 11B dostał 7,60, a Gemma 4 12B 8,33 - obie są wolniejsze, ale piszą wyraźnie lepiej po polsku. Do polskich tekstów wybrałbym je zamiast Llamy. Do zadań po angielsku, klasyfikacji czy wyciągania danych Llama 3.1 8B jest w porządku. Pełne wyniki są w tekście Bielik, Llama czy Mistral po polsku.
Llama 4 lokalnie: czy to ma sens
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
Llama 4 Scout ma 109 mld parametrów, z czego przy każdym tokenie pracuje 17 mld. Plik w Ollamie waży 67 GB, więc na karcie z 24 GB zmieści się tylko część modelu, a reszta trafi do zwykłej pamięci RAM. Model ruszy, jeśli masz co najmniej 64-96 GB RAM, ale będzie wyraźnie wolniejszy niż Llama 3.1 8B w całości na karcie. Maverick (245 GB w Ollamie) to już sprzęt serwerowy.
Jest też kwestia licencji. Zasady użycia Llamy 4 nie przyznają praw do modeli multimodalnych osobom mieszkającym w UE ani firmom z siedzibą w UE, a Scout i Maverick są multimodalne. Do lokalnych eksperymentów w Polsce wybrałbym więc Llamę 3.1 albo 3.3, a do czegoś większego - Muse Glimmer 30B, który ma licencję Apache 2.0 i mieści się na jednej karcie 24 GB.
Najczęstsze problemy
- Model odpowiada po angielsku. Napisz pierwsze polecenie po polsku i dodaj „Odpowiadaj tylko po polsku”. W API ustaw to w wiadomości systemowej.
- Bardzo wolne odpowiedzi. Model nie mieści się w pamięci karty i część pracuje na procesorze. Sprawdź
ollama ps- w kolumnie PROCESSOR powinno być „100% GPU”. Jeśli nie jest, wybierz mniejszy model albo krótszy kontekst. - Długie ładowanie przy pierwszym pytaniu. Model wczytuje się z dysku do karty. U mniee, z modelami na zewnętrznym dysku USB i obciążoną kartą, trwało to ponad 5 minut. Trzymaj modele na szybkim dysku wewnętrznym.
- Dziwne znaczniki w odpowiedzi. Przy ręcznie importowanym pliku GGUF brakuje szablonu czatu. Używaj modeli z biblioteki Ollamy albo dopisz szablon w pliku Modelfile.
Najczęstsze pytania
Jak zainstalować Llamę na komputerze?
Zainstaluj Ollamę z ollama.com, otwórz terminal i wpisz ollama run llama3.1:8b. Program sam pobierze model (4,9 GB) i otworzy rozmowę. Nie potrzebujesz konta ani klucza API.
Ile pamięci RAM i VRAM potrzebuje Llama?
Llama 3.2 3B: około 3 GB pamięci karty albo 8 GB RAM przy pracy na procesorze. Llama 3.1 8B: 6-8 GB pamięci karty. Llama 3.3 70B: około 43 GB na sam plik, czyli dwie karty po 24 GB albo Mac z dużą pamięcią zunifikowaną.
Czy Llama działa offline?
Tak. Po pobraniu modelu Ollama nie potrzebuje internetu, a tekst nie opuszcza Twojego komputera.
Czy Llama lokalnie jest darmowa?
Tak, licencja Llama Community License pozwala używać jej za darmo, także komercyjnie (z limitem 700 mln użytkowników miesięcznie i zasadami użycia Mety). Płacisz tylko za prąd.
Llama czy Bielik lokalnie po polsku?
Do polskich tekstów Bielik. W moim teście pięciu poleceń Bielik 11B pisał wyraźnie poprawniej po polsku niż Llama 3.1 8B. Llama ma przewagę w zadaniach po angielsku i w liczbie gotowych narzędzi. Pełne porównanie: Bielik, Llama czy Mistral po polsku.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła i data sprawdzenia
- Ollama: llama3.1, llama3.2, llama4 i muse-glimmer (rozmiary plików i kontekst)
- Zasady użycia Llamy 4 (klauzula o UE)
- Własne pomiary: Ollama 0.35.1, RTX 4090 24 GB, Windows 11, 3 października 2026
Sprawdzone 3 października 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
