✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Llama lokalnie: jak uruchomić Llamę w Ollamie i ile potrzeba VRAM

Instalacja Llamy w Ollamie krok po kroku, wybór wersji pod kartę graficzną, moje pomiary prędkości i pamięci na RTX 4090 oraz to, jak Llama 3.1 8B radzi sobie po polsku.

6 min czytania
Logo Meta i napis Llama lokalnie - Ollama, VRAM i pomiary na RTX 4090

👁 116 przeczytań

// w skrócie
  • Do uruchomienia Llamy 3.1 8B lokalnie wystarczy karta z 8 GB VRAM - plik waży 4,9 GB, a z kontekstem zajmuje 5,9 GB pamięci karty.
  • Na RTX 4090 Llama 3.1 8B generuje 147,5-150,8 tokena na sekundę przy poborze mocy karty rzędu 310-320 W.
  • Do polskich tekstów lepiej wybrać Bielik 11B (7,60/10) lub Gemma 4 12B (8,33/10), bo Llama 3.1 8B uzyskała tylko 5,33/10 w ocenie polszczyzny.

Llamę uruchomisz lokalnie jednym poleceniem: ollama run llama3.1:8b. Ollama pobierze 4,9 GB i model zadziała na karcie graficznej z 8 GB pamięci, bez konta i bez internetu po pobraniu. Na słabszym sprzęcie wybierz Llama 3.2 3B (2 GB), a do Llamy 3.3 70B potrzebujesz około 43 GB pamięci. Czym jest Llama, jak wygląda licencja i co Meta robi po niej, opisałem w przewodniku Llama. Tutaj jest sama instalacja, wybór wersji i moje pomiary na RTX 4090.

Stan na 3 października 2026

  • Sprawdzone na: Ollama 0.35.1, Windows 11, RTX 4090 24 GB.
  • Najpopularniejszy wybór: Llama 3.1 8B (4,9 GB w Ollamie, kontekst 128 tys. tokenów).
  • Najnowsza Llama: Llama 4 Scout (67 GB) - nie zmieści się na domowej karcie.
  • Otwarty następca od Mety: Muse Glimmer 30B (18 GB, Apache 2.0).

Którą Llamę wybrać pod swój sprzęt

ModelPolecenie w OllamiePlikSprzętDo czego
Llama 3.2 1Bollama run llama3.2:1b1,3 GBdowolny komputer, nawet bez kartyproste klasyfikacje, testy
Llama 3.2 3Bollama run llama3.2:3b2,0 GBlaptop, karta 4 GBkrótkie pytania, streszczenia po angielsku
Llama 3.1 8Bollama run llama3.1:8b4,9 GBkarta 6-8 GBcodzienny czat, maile, wyciąganie danych
Llama 3.3 70Bollama run llama3.3:70bok. 43 GB2 karty po 24 GB albo Mac z 64 GB pamięcinajlepsza jakość z Llam do uruchomienia u siebie
Llama 4 Scoutollama run llama4:scout67 GBstacja robocza albo serwerdługi kontekst, obraz; licencja z wyjątkiem dla UE
Muse Glimmer 30Bollama run muse-glimmer:30b18 GBkarta 24 GBnastępca Llamy od Mety, Apache 2.0

Rozmiary plików według biblioteki Ollamy (domyślna kwantyzacja Q4_K_M). Na karcie potrzebujesz o 1-2 GB więcej niż waży plik, bo dochodzi pamięć na kontekst rozmowy. Ogólną zasadę liczenia opisałem w tekście ile pamięci potrzeba do modelu lokalnie.

Instalacja krok po kroku (Windows)

  1. Pobierz instalator z ollama.com/download i uruchom go. Ollama działa w tle i ma ikonę w zasobniku systemowym.
  2. Jeśli dysk C: ma mało miejsca, ustaw zmienną środowiskową OLLAMA_MODELS na folder na innym dysku (ja trzymam modele w D:\AI\ollama) i uruchom Ollamę ponownie.
  3. Otwórz terminal (PowerShell) i wpisz ollama run llama3.1:8b. Pierwsze uruchomienie pobiera model.
  4. Po pobraniu zobaczysz znak zachęty >>>. Napisz pytanie po polsku i naciśnij Enter.
  5. Wyjście z rozmowy: /bye. Lista pobranych modeli: ollama list. Usunięcie modelu: ollama rm llama3.1:8b.
  6. Do programów i skryptów używaj lokalnego API: http://localhost:11434 (jest też wersja zgodna z API OpenAI pod /v1).

Szczegóły instalacji, pułapki z folderami i import własnych plików GGUF opisałem w przewodniku Ollama. Jeśli wolisz okienko zamiast terminala, te same modele pobierzesz w LM Studio - wpisz w wyszukiwarce „Llama 3.1 8B Instruct” i wybierz wersję Q4_K_M. Najwięcej kontroli daje llama.cpp.

Moje pomiary na RTX 4090

Pobrałem Llamę 3.1 8B z biblioteki Ollamy (Q4_K_M, 4,9 GB) i zmierzyłem ją 3 października 2026 obok trzech innych modeli podobnej wielkości:

ModelPlikPamięć karty (kontekst 8192)Tokeny na sekundę
Llama 3.1 8B4,9 GB5,9 GB149
Ministral 3 8B6,0 GB6,3 GB136
Gemma 4 12B7,0 GB7,9 GB96
Bielik 11B v3 (Q8_0)11,9 GB13,6 GB67
  • Prędkość: 147,5-150,8 tokena na sekundę w trzech próbach po 450 tokenów. Akapit tekstu pojawia się w niecałą sekundę.
  • Start odpowiedzi: 0,013-0,019 s od wysłania polecenia, gdy model jest już w pamięci karty.
  • Pobór mocy: karta brała przy generowaniu około 310-320 W.
  • Ładowanie: pierwsze wczytanie z dysku USB trwało u mnie ponad 5 minut, bo jednocześnie z karty i dysku korzystał inny proces. To skrajny przypadek - z szybkiego dysku wewnętrznego model ładuje się znacznie szybciej.

Llama 3.1 8B jest więc najszybsza z tej czwórki i zajmuje najmniej pamięci. Na karcie z 8 GB zmieści się z zapasem na dłuższy kontekst. Jak liczyć koszt prądu przy takich pomiarach, pokazuję w tekście lokalny model czy API.

Jak Llama radzi sobie po polsku lokalnie

Szybkość to nie wszystko. Tego samego dnia dałem Llamie 3.1 8B pięć poleceń po polsku i porównałem ją z Bielikiem, Gemmą 4, Mistralami i większymi Llamami. Wynik: 5,33 na 10 w ślepej ocenie sędziego (Claude Opus 5.5), dziewiąte miejsce na 11 wariantów (za nią były tylko dwa Ministrale 3 8B). Najważniejsze błędy:

  • tłumaczenie zaczęła od „Przyjdźmy do rzeczy” zamiast „Przejdźmy do rzeczy”,
  • w korekcie zostawiła „poszłem”,
  • 8-latkowi wyjaśniła, że „niebo odbija światło” (a światło się rozprasza),
  • w mailu napisała „Drogi Panie Wiśniewski” i dopisała, że kurier „nie mógł wejść do budynku”.

Dla porównania Bielik 11B dostał 7,60, a Gemma 4 12B 8,33 - obie są wolniejsze, ale piszą wyraźnie lepiej po polsku. Do polskich tekstów wybrałbym je zamiast Llamy. Do zadań po angielsku, klasyfikacji czy wyciągania danych Llama 3.1 8B jest w porządku. Pełne wyniki są w tekście Bielik, Llama czy Mistral po polsku.

Llama 4 lokalnie: czy to ma sens

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

Llama 4 Scout ma 109 mld parametrów, z czego przy każdym tokenie pracuje 17 mld. Plik w Ollamie waży 67 GB, więc na karcie z 24 GB zmieści się tylko część modelu, a reszta trafi do zwykłej pamięci RAM. Model ruszy, jeśli masz co najmniej 64-96 GB RAM, ale będzie wyraźnie wolniejszy niż Llama 3.1 8B w całości na karcie. Maverick (245 GB w Ollamie) to już sprzęt serwerowy.

Jest też kwestia licencji. Zasady użycia Llamy 4 nie przyznają praw do modeli multimodalnych osobom mieszkającym w UE ani firmom z siedzibą w UE, a Scout i Maverick są multimodalne. Do lokalnych eksperymentów w Polsce wybrałbym więc Llamę 3.1 albo 3.3, a do czegoś większego - Muse Glimmer 30B, który ma licencję Apache 2.0 i mieści się na jednej karcie 24 GB.

Najczęstsze problemy

  • Model odpowiada po angielsku. Napisz pierwsze polecenie po polsku i dodaj „Odpowiadaj tylko po polsku”. W API ustaw to w wiadomości systemowej.
  • Bardzo wolne odpowiedzi. Model nie mieści się w pamięci karty i część pracuje na procesorze. Sprawdź ollama ps - w kolumnie PROCESSOR powinno być „100% GPU”. Jeśli nie jest, wybierz mniejszy model albo krótszy kontekst.
  • Długie ładowanie przy pierwszym pytaniu. Model wczytuje się z dysku do karty. U mniee, z modelami na zewnętrznym dysku USB i obciążoną kartą, trwało to ponad 5 minut. Trzymaj modele na szybkim dysku wewnętrznym.
  • Dziwne znaczniki w odpowiedzi. Przy ręcznie importowanym pliku GGUF brakuje szablonu czatu. Używaj modeli z biblioteki Ollamy albo dopisz szablon w pliku Modelfile.

Najczęstsze pytania

Jak zainstalować Llamę na komputerze?

Zainstaluj Ollamę z ollama.com, otwórz terminal i wpisz ollama run llama3.1:8b. Program sam pobierze model (4,9 GB) i otworzy rozmowę. Nie potrzebujesz konta ani klucza API.

Ile pamięci RAM i VRAM potrzebuje Llama?

Llama 3.2 3B: około 3 GB pamięci karty albo 8 GB RAM przy pracy na procesorze. Llama 3.1 8B: 6-8 GB pamięci karty. Llama 3.3 70B: około 43 GB na sam plik, czyli dwie karty po 24 GB albo Mac z dużą pamięcią zunifikowaną.

Czy Llama działa offline?

Tak. Po pobraniu modelu Ollama nie potrzebuje internetu, a tekst nie opuszcza Twojego komputera.

Czy Llama lokalnie jest darmowa?

Tak, licencja Llama Community License pozwala używać jej za darmo, także komercyjnie (z limitem 700 mln użytkowników miesięcznie i zasadami użycia Mety). Płacisz tylko za prąd.

Llama czy Bielik lokalnie po polsku?

Do polskich tekstów Bielik. W moim teście pięciu poleceń Bielik 11B pisał wyraźnie poprawniej po polsku niż Llama 3.1 8B. Llama ma przewagę w zadaniach po angielsku i w liczbie gotowych narzędzi. Pełne porównanie: Bielik, Llama czy Mistral po polsku.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Sprawdzone 3 października 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›