✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Llama od Mety: wersje, licencja, jak uruchomić i test po polsku

Wszystko o Llamie w jednym miejscu: wersje od LLaMA do Llamy 4, następca Muse Glimmer, licencja z wyjątkiem dla UE, jak uruchomić model w Ollamie, ceny API i mój test pięciu poleceń po polsku.

10 min czytania
Logo Meta obok napisu Llama - przewodnik po modelach Llama

👁 117 przeczytań

// w skrócie
  • Llama 4 Scout (109 mld parametrów) i Maverick (400 mld) to najnowsze modele z tej rodziny, wydane 5 kwietnia 2025, ale od 2026 Meta rozwija już markę Muse.
  • Na domowym komputerze z kartą 8 GB można uruchomić Llamę 3.1 8B (4,9 GB) przez Ollamę, wpisując jedną komendę: ollama run llama3.1:8b.
  • W teście pięciu poleceń po polsku Muse Glimmer 30B uzyskał 8,67/10 i wygrał z Llamą 4 Maverick (7,33) oraz Llamą 3.3 70B (6,60), kosztując jednak 16 razy więcej niż Maverick.

Llama to rodzina modeli językowych Mety z otwartymi wagami: możesz je pobrać i uruchomić u siebie, także komercyjnie, na licencji Llama Community License. Ostatnia Llama (Llama 4 Scout i Maverick) wyszła w kwietniu 2025, a od 2026 roku Meta wydaje nowe modele pod marką Muse. Na domowym komputerze najczęściej uruchamia się dziś Llama 3.1 8B i 3.2 3B - po polsku są poprawne w prostych zadaniach, ale polski nie należy do oficjalnie wspieranych języków, co widać w moim teście.

Stan na 3 października 2026

  • Najnowsza Llama: Llama 4 Scout (109 mld parametrów) i Maverick (400 mld), premiera 5 kwietnia 2025. Zapowiadany Llama 4 Behemoth nie został wydany.
  • Następca: modele Muse z Meta Superintelligence Labs - zamknięty Muse Spark 1.3 (2 września 2026) i otwarty Muse Glimmer 30B na licencji Apache 2.0 (10 sierpnia 2026).
  • Licencja Llamy: Llama Community License - za darmo także komercyjnie, ale z ograniczeniami, w tym dla modeli multimodalnych w UE.
  • Lokalnie: w Ollamie od 1,3 GB (Llama 3.2 1B) do 67 GB (Llama 4 Scout).
  • Mój test: 5 poleceń po polsku - Llama 3.1 8B lokalnie na RTX 4090 oraz Llama 3.3 70B, Llama 4 Maverick i Muse Glimmer 30B w chmurze.

Co to jest Llama

Llama (pierwotnie LLaMA, od „Large Language Model Meta AI”) to modele językowe Mety, firmy od Facebooka, Instagrama i WhatsAppa. Pierwsza wersja z lutego 2023 była dostępna tylko dla naukowców, a jej wagi po tygodniu wyciekły do internetu. Od Llamy 2 (lipiec 2023) Meta udostępnia wagi każdemu, kto zaakceptuje licencję. Dlaczego firma rozdaje modele za darmo, wyjaśniam w tekście Mark Zuckerberg i AI.

Przez trzy lata Llama była punktem odniesienia dla wszystkich otwartych modeli. Na niej dotrenowano tysiące wersji specjalistycznych, a narzędzia do uruchamiania AI lokalnie, takie jak llama.cpp czy Ollama, powstały właśnie wokół niej - stąd „llama” w ich nazwach. W 2026 roku sytuacja się zmieniła: Meta przeniosła rozwój do nowego laboratorium Meta Superintelligence Labs, w kwietniu 2026 zastąpiła Llamę w swoich czatach zamkniętym modelem Muse Spark, a nowy otwarty model wydała już pod nazwą Muse Glimmer.

Wszystkie wersje Llamy

DataWersjaRozmiaryCo ważne
24.02.2023LLaMA7, 13, 33, 65 mldtylko dla naukowców, wagi wyciekły
18.07.2023Llama 27, 13, 70 mldpierwsza z licencją komercyjną
18.04.2024Llama 38, 70 mldtrening na ok. 15 bln tokenów
23.07.2024Llama 3.18, 70, 405 mldkontekst 128 tys. tokenów, 8 oficjalnych języków
25.09.2024Llama 3.21, 3 mld (tekst), 11, 90 mld (obraz)małe modele na telefon, pierwsze modele widzące obraz
06.12.2024Llama 3.370 mldwedług Mety jakość zbliżona do 405B
05.04.2025Llama 4 Scout i Maverick109 i 400 mld (po 17 mld aktywnych)architektura MoE, obraz i tekst, kontekst do 10 mln tokenów (Scout)

Muse: co Meta robi po Llamie

ModelPremieraWagiAPI (USD za 1 mln tokenów)
Muse Spark 1.0-1.38.04.2026 - 2.09.2026zamknięte1,25 / 4,25 (wersja 1.3)
Muse Glimmer 30B10.08.2026otwarte, Apache 2.00,35 / 1,50 (OpenRouter)

Muse Glimmer to praktyczny następca Llamy dla osób, które chcą otwartego modelu Mety. Ma 30 mld parametrów, 128 tys. tokenów kontekstu, rozumie obraz i wideo, a w Ollamie zajmuje 18 GB, więc zmieści się na karcie z 24 GB. W przeciwieństwie do Llamy 4 ma licencję Apache 2.0 bez wyjątków dla Unii Europejskiej. Model Muse Spark i jego wyniki po polsku opisałem w tekście Muse Spark 1.3.

Jak zacząć z Llamą krok po kroku

Najprościej: lokalnie w Ollamie

  1. Pobierz i zainstaluj Ollamę z ollama.com.
  2. Sprawdź, ile pamięci ma Twoja karta graficzna (w Windows: Menedżer zadań, karta Wydajność, GPU).
  3. Do 4 GB: wpisz ollama run llama3.2:3b (2 GB). Od 8 GB: ollama run llama3.1:8b (4,9 GB).
  4. Rozmawiaj w terminalu albo zainstaluj nakładkę z oknem czatu, na przykład LM Studio, które pobiera te same modele z Hugging Face.
  5. Pisz polecenia po polsku, ale do ważnych tekstów dopisz „Odpowiadaj poprawną polszczyzną” - Llama czasem przechodzi na angielski albo kalkuje angielską składnię.

Pełny poradnik z wymaganiami sprzętowymi, moimi pomiarami prędkości i wyborem wersji jest w tekście Llama lokalnie.

Bez instalacji

  • Meta AI w WhatsAppie, Messengerze, Instagramie i na meta.ai działa w Polsce od marca 2025, ale Meta nie podaje, na jakim modelu - od kwietnia 2026 w USA jest to Muse Spark, a nie Llama.
  • Przez API u dostawców takich jak OpenRouter, Together czy Groq. To najtańszy sposób, żeby porozmawiać z dużymi wersjami (Llama 3.3 70B, Llama 4 Maverick), których nie uruchomisz w domu.

Licencja Llamy: co wolno, a czego nie

Llama nie jest open source w rozumieniu Open Source Initiative. To „otwarte wagi” na własnej licencji Mety. W praktyce:

  • Wolno: pobrać model, uruchomić go u siebie, dotrenować i wbudować w płatny produkt bez opłat.
  • Trzeba: zaakceptować licencję i zasady dopuszczalnego użycia (AUP), a przy produkcie opartym na Llamie umieścić dopisek „Built with Llama”.
  • Nie wolno bez osobnej zgody Mety: używać Llamy w produkcie, który miał ponad 700 mln aktywnych użytkowników miesięcznie w dniu premiery modelu.
  • Pułapka dla Unii Europejskiej: zasady użycia Llamy 4 mówią, że prawa do modeli multimodalnych „nie są przyznawane” osobom mieszkającym w UE i firmom z główną siedzibą w UE. Takie samo zastrzeżenie dotyczy modeli Llama 3.2 widzących obraz (11B i 90B). Wyjątek: zwykli użytkownicy gotowego produktu zbudowanego na tych modelach. Modele tylko tekstowe (Llama 3.1, 3.2 1B i 3B, 3.3 70B) tego zastrzeżenia nie mają.

Wniosek dla polskiej firmy: jeśli chcesz otwarty model Mety do własnego produktu, wybierz Llamę 3.1 lub 3.3 albo nowego Muse Glimmer na Apache 2.0, a nie Llamę 4. To moja interpretacja licencji, nie porada prawna.

Ile kosztuje Llama

Same wagi są darmowe. Płacisz za sprzęt i prąd albo za API u zewnętrznego dostawcy. Najniższe stawki na OpenRouter, 3 października 2026, za milion tokenów:

ModelWejście (USD)Wyjście (USD)Kontekst
Llama 3.2 3B0,050,33131 tys.
Llama 3.1 8B0,050,08131 tys.
Llama 3.3 70B0,100,32131 tys.
Llama 4 Scout0,100,301,3 mln
Llama 4 Maverick0,1880,6521 mln
Muse Glimmer 30B0,351,50131 tys.

Cały mój test pięciu poleceń kosztował 0,0006 USD na Llamie 3.3 70B i 0,0006 USD na Llamie 4 Maverick. Muse Glimmer zużył 0,0101 USD, bo przed każdą odpowiedzią długo „myślał” (od 2,6 do 12,1 tys. znaków rozumowania na zadanie; przy streszczeniu musiałem podnieść limit tokenów, bo za pierwszym razem przemyślał cały limit i nie oddał odpowiedzi).

Llama po polsku

Meta oficjalnie wspiera w Llamie 3.1 osiem języków (angielski, niemiecki, francuski, włoski, portugalski, hindi, hiszpański i tajski), a w Llamie 4 dwanaście. Polskiego nie ma na żadnej z tych list. Model rozumie polski, bo widział go w danych treningowych, ale jakość tekstu zależy mocno od rozmiaru:

  • Llama 3.2 1B i 3B - w tym teście ich nie sprawdzałem; skoro Llama 3.1 8B robi sporo błędów, od mniejszych modeli nie oczekiwałbym lepszej polszczyzny. To moja opinia.
  • Llama 3.1 8B - zrozumiała polszczyzna z widocznymi kalkami i błędami, szczegóły w moim teście niżej.
  • Llama 3.3 70B i Llama 4 Maverick - poprawna polszczyzna, ale bez polotu; w moim teście 70B streścił tekst zbyt skrótowo, a w mailu pomylił formę „Panie Tomaszu Wiśniewskim”.

Jeśli zależy Ci na polskim tekście z modelu lokalnego, lepiej wypadają Bielik i Gemma 4 12B. Porównanie siedmiu modeli lokalnych na 13 zadaniach jest w tekście lokalne modele AI po polsku.

Mój test: 5 poleceń po polsku

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

3 października 2026 dałem pięć poleceń po polsku (streszczenie z limitem słów, mail do administratora, korekta 10 błędów, wyjaśnienie dla dziecka, tłumaczenie idiomów) czterem modelom Mety: Llamie 3.1 8B lokalnie w Ollamie na RTX 4090 oraz Llamie 3.3 70B, Llamie 4 Maverick i Muse Glimmer 30B przez OpenRouter. W tej samej puli były Bielik, modele Mistrala i Gemma 4. Odpowiedzi ocenił w ciemno Claude Opus 5.5 w skali 1-10.

Model MetyWynik (1-10)PoprawnośćWykonanieNajsłabszy punkt
Muse Glimmer 30B (chmura)8,679,28,8mail „Szanowny Panie Wiśniewski” (7,7)
Llama 4 Maverick (chmura)7,338,27,0wyjaśnienie dla dziecka (4,7)
Llama 3.3 70B (chmura)6,607,46,0mail „Panie Tomaszu Wiśniewskim” (4,7)
Llama 3.1 8B (RTX 4090)5,336,64,4dziecko i tłumaczenie (po 4,0)

Dla porównania: lokalna Gemma 4 12B dostała 8,33, Bielik 11B 7,60, a najlepszy Mistral (Large 3) 7,67. Muse Glimmer wygrał cały test, więc otwarty następca Llamy jest dziś najlepszym modelem Mety do polskich tekstów z tych, które sprawdziłem.

Co zapamiętałem z odpowiedzi:

  • Llama 3.1 8B zaczęła tłumaczenie od „Przyjdźmy do rzeczy”, w korekcie zostawiła „poszłem”, a dziecku wyjaśniła, że „niebo odbija światło”. W mailu napisała „Drogi Panie Wiśniewski” i dodała fakt, którego nie było w poleceniu.
  • Llama 3.3 70B streściła artykuł w 17 słowach, gubiąc miasto, datę i wynik głosowania.
  • Llama 4 Maverick zrobiła bezbłędną korektę, ale przetłumaczyła „missed the deadline by a hair” jako „ledwo zdążyliśmy na czas”, czyli odwrotnie, i wspomniała ośmiolatkowi o „rozpraszaniu Rayleigha”.
  • Muse Glimmer jako jedyny model Mety poprawnie oddał „spóźniliśmy się z terminem o włos”, ale przed każdą odpowiedzią długo myślał, więc kosztował 16 razy więcej niż Maverick.

Lokalnie Llama 3.1 8B generowała 149 tokenów na sekundę i zajmowała 5,9 GB pamięci karty - jest szybka, ale do polskich tekstów za słaba. Pełne wyniki: Bielik, Llama czy Mistral po polsku.

Llama na tle innych otwartych modeli

ModelFirmaLicencjaPolski jako główny językNajmniejszy sensowny wariant lokalnie
Llama 3.1 / 3.3Meta (USA)Llama Community Licensenie (8 innych języków)8B, 4,9 GB
Muse Glimmer 30BMeta (USA)Apache 2.0nie30B, 18 GB
Ministral 3 / Mistral SmallMistral AI (Francja)Apache 2.0nie8B, 6 GB
Bielik 11B v3SpeakLeash (Polska)Apache 2.0tak, główny język11B Q4, 6,7 GB
Gemma 4Google (USA)otwarte waginie12B, 7 GB
GPT-OSS 20BOpenAI (USA)Apache 2.0nie20B, 12 GB

Europejską alternatywę, czyli modele Mistrala, opisałem w przewodniku Mistral AI, a chińską - w tekście o DeepSeeku.

Dla kogo jest Llama

  • Do nauki lokalnego AI - Llama 3.1 8B i 3.2 3B to najlepiej opisane modele w internecie, z gotowymi poradnikami do każdego narzędzia.
  • Do zadań po angielsku - streszczenia, klasyfikacja, wyciąganie danych z tekstu.
  • Do dotrenowania - na Llamie istnieje najwięcej gotowych przepisów i wersji pochodnych.
  • Nie dla Ciebie, jeśli piszesz głównie po polsku (wybierz Bielika albo Gemmę) albo budujesz w UE produkt na Llamie 4 widzącej obraz (wybierz Muse Glimmer lub Mistrala).

Najczęstsze pytania

Czy Llama jest darmowa?

Tak. Wagi Llamy pobierasz za darmo i możesz ich używać komercyjnie, o ile Twój produkt nie przekracza 700 mln aktywnych użytkowników miesięcznie i przestrzegasz zasad użycia Mety. Płacisz tylko za sprzęt albo API u zewnętrznego dostawcy.

Jaka jest najnowsza wersja Llamy?

Llama 4 Scout i Maverick z 5 kwietnia 2025. Od tego czasu Meta nie wydała nowej Llamy - nowe modele to Muse Spark (zamknięty) i Muse Glimmer 30B (otwarty, Apache 2.0, sierpień 2026).

Czy Llama działa po polsku?

Rozumie i pisze po polsku, ale polski nie jest oficjalnie wspieranym językiem. Mała Llama 3.1 8B robi zauważalne błędy, duże wersje (70B, Maverick) piszą poprawnie, choć sztywno.

Czy mogę używać Llamy 4 w Polsce?

Jako użytkownik gotowej aplikacji - tak. Jako osoba albo firma z UE, która chce sama pobrać i wdrożyć Llamę 4, licencja Mety nie przyznaje Ci praw do modeli multimodalnych, a Llama 4 Scout i Maverick właśnie takie są. Bezpieczniej wybrać Llamę 3.1, 3.3 albo Muse Glimmer.

Jaki komputer potrzebny do Llamy?

Llama 3.2 3B działa nawet na laptopie bez karty graficznej. Llama 3.1 8B potrzebuje karty z 6-8 GB pamięci, Llama 3.3 70B - około 43 GB pamięci (dwie karty po 24 GB albo Mac z dużą pamięcią). Szczegóły w tekście Llama lokalnie.

Llama czy ChatGPT?

To różne rzeczy. ChatGPT to gotowa usługa w chmurze z dużo mocniejszymi modelami. Llama to model, który uruchamiasz sam: słabszy, ale darmowy, prywatny i działający offline.

Czym jest Muse Glimmer?

To otwarty model Mety z 10 sierpnia 2026: 30 mld parametrów, licencja Apache 2.0, obsługa obrazu i wideo, 18 GB w Ollamie. W praktyce następca Llamy dla osób, które chcą uruchomić model Mety u siebie.

Czy Meta AI w WhatsAppie to Llama?

Do kwietnia 2026 Meta AI działał na Llamie. Od kwietnia 2026 w USA zasila go Muse Spark. Dla Polski Meta nie podaje, który model odpowiada.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła i data sprawdzenia

Sprawdzone 3 października 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›