Przejdź do treści
AI

Jak uruchomić Bielika lokalnie na własnym komputerze

Pobierz i uruchom Bielika na własnym komputerze przez LM Studio, Ollamę lub llama.cpp. Dobór wersji, wymagania sprzętowe i gotowe komendy.

6 min czytania
Bielik lokalnie na komputerze z kartą graficzną

👁 111 przeczytań

Bielika możesz pobrać i uruchomić bez zewnętrznego API. Najłatwiejsza droga prowadzi przez LM Studio, a najkrótsza komenda przez Ollamę. Na komputerze z 8 GB VRAM zacznij od Bielika 11B w kwantyzacji Q4_K_M. Jeśli masz słabszy sprzęt, wybierz mniejszy model z rodziny Bielik v3.

Sam użyłem trzeciej metody, czyli llama.cpp. Pobrałem Bielika-11B-v3.0-Instruct Q8_0, załadowałem całość na RTX 4090 i uruchomiłem przez lokalny serwer. Model odpowiadał bez połączenia z usługą chmurową.

Poniżej są trzy drogi. Jeśli nie chcesz dotykać terminala, wybierz LM Studio. Jeśli zależy ci na prostej integracji i jednej komendzie, wybierz Ollamę. Jeśli chcesz kontrolować niemal każdy parametr, wybierz llama.cpp.

Zanim zaczniesz: wybierz właściwy wariant

W nazwach modeli łatwo się pogubić. Do zwykłej rozmowy szukaj wariantu Instruct. Do LM Studio, Ollamy i llama.cpp najwygodniejszy jest format GGUF.

Najważniejsza część nazwy pliku to kwantyzacja:

Kwantyzacja Bielik 11B v3RozmiarPraktyczne zastosowanie
Q4_K_Mokoło 6,72 GBnajlepszy punkt startowy
Q5_K_Mokoło 7,91 GBtrochę wyższa jakość
Q6_Kokoło 9,16 GBmocniejszy komputer
Q8_0około 11,9 GBtesty jakościowe i dużo VRAM
BF16 lub F16około 22,3 GBspecjalistyczne zastosowania

Q4 nie oznacza, że cały program potrzebuje dokładnie 6,72 GB pamięci. Dochodzą bufory, kontekst rozmowy i sam interfejs. Bezpiecznie zostawić zapas.

Prosty dobór do sprzętu

  • 8 GB VRAM - zacznij od Q4_K_M i umiarkowanego kontekstu
  • 12 GB VRAM - Q5 albo Q6 powinny być rozsądnym wyborem
  • 16 GB VRAM - Q8 zwykle mieści się z zapasem na kontekst
  • brak dedykowanej karty - model może działać w RAM na CPU, ale wolniej
  • bardzo słaby komputer - wybierz Bielika 1,5B lub 4,5B zamiast 11B

Dokładne zużycie zależy od programu, systemu, długości kontekstu i sposobu przenoszenia warstw na GPU.

Metoda 1: Bielik w LM Studio

LM Studio jest najprostsze, ponieważ ma interfejs graficzny. Nie musisz wpisywać komend ani ręcznie tworzyć konfiguracji.

Krok 1: zainstaluj LM Studio

Pobierz program z oficjalnej strony lmstudio.ai i zainstaluj wersję dla swojego systemu.

Krok 2: wyszukaj model

Otwórz katalog modeli i wpisz:

speakleash Bielik 11B v3 GGUF

Sprawdź, czy repozytorium należy do speakleash. Przy modelach publikowanych przez inne konta można trafić na nieaktualną konwersję albo brak poprawnego szablonu rozmowy.

Krok 3: wybierz kwantyzację

Na początek wybierz Q4_K_M. Plik ma około 6,72 GB, więc pobieranie może potrwać kilka lub kilkanaście minut. Jeśli masz kartę z 16 GB VRAM i zależy ci na jakości, możesz wybrać Q8_0.

Krok 4: załaduj model

Przejdź do zakładki czatu, wybierz pobrany model i kliknij przycisk ładowania. LM Studio spróbuje dobrać ustawienia do sprzętu. Jeżeli model się nie mieści, zmniejsz kontekst albo wybierz mniejszą kwantyzację.

Krok 5: wykonaj pierwszy test

Nie zaczynaj od pytania „cześć, co potrafisz”. Daj modelowi zadanie, którego wynik można sprawdzić:

Popraw poniższy tekst pod względem językowym. Nie zmieniaj faktów. Najpierw pokaż poprawioną wersję, a potem w trzech punktach wymień najważniejsze zmiany.

TEKST:
[wklej tekst]

Metoda 2: Bielik w Ollamie

Ollama jest wygodna, jeśli chcesz uruchamiać modele z terminala i korzystać z lokalnego API.

Krok 1: zainstaluj Ollamę

Pobierz aplikację z ollama.com i zakończ instalację.

Krok 2: uruchom oficjalny model GGUF

W terminalu wpisz:

ollama run hf.co/speakleash/Bielik-11B-v3.0-Instruct-GGUF:Q4_K_M

Przy pierwszym uruchomieniu Ollama pobierze model. Kolejne rozmowy będą korzystać z pliku zapisanego lokalnie.

Krok 3: sprawdź dostępne modele

ollama list

Krok 4: użyj lokalnego API

Ollama domyślnie wystawia API na komputerze. Przykładowe zapytanie:

curl http://localhost:11434/api/chat -d '{
  "model": "hf.co/speakleash/Bielik-11B-v3.0-Instruct-GGUF:Q4_K_M",
  "messages": [
    {"role": "user", "content": "Streść ten tekst w trzech punktach: [TEKST]"}
  ],
  "stream": false
}'

Na Windowsie wygodniej wysłać to samo zapytanie z PowerShella albo użyć klienta zgodnego z API Ollamy.

Metoda 3: Bielik w llama.cpp

llama.cpp daje najwięcej kontroli. Możesz wskazać liczbę warstw na GPU, rozmiar kontekstu, port serwera i parametry generowania.

Krok 1: zainstaluj llama.cpp

W Windows możesz użyć Winget:

winget install llama.cpp

Możesz też pobrać gotowe pliki wykonywalne z repozytorium ggml-org/llama.cpp.

Krok 2: uruchom model bez ręcznego pobierania

Mam to spisane w całości

Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.

Pobierz ebooki

llama cli -hf speakleash/Bielik-11B-v3.0-Instruct-GGUF:Q4_K_M

Krok 3: uruchom lokalny serwer

llama serve -hf speakleash/Bielik-11B-v3.0-Instruct-GGUF:Q4_K_M

Po załadowaniu modelu serwer udostępni interfejs w przeglądarce oraz lokalne API. Adres i port pojawią się w terminalu.

Jeśli pobrałeś plik ręcznie, wskaż jego ścieżkę:

llama-server -m Bielik-11B-v3.0-Instruct.Q4_K_M.gguf -ngl 99 -c 8192

Parametr -ngl 99 próbuje przenieść wszystkie warstwy na GPU. Parametr -c 8192 ustawia kontekst. Jeśli zabraknie pamięci, zmniejsz kontekst albo liczbę warstw na GPU.

Ustawienia na dobry początek

Nie ma jednego zestawu idealnego do wszystkiego, ale poniższe wartości są rozsądnym startem:

ParametrWartość startowaCo zmienia
temperatura0,1-0,3niska wartość daje bardziej przewidywalne odpowiedzi
top_p0,9-0,95ogranicza dobór mniej prawdopodobnych tokenów
kontekst4096-8192ile tekstu model może brać pod uwagę
maksymalna odpowiedź512-1024 tokenówchroni przed niepotrzebnie długim wynikiem

Do ekstrakcji danych i klasyfikacji używaj niskiej temperatury. Do pomysłów i tekstu kreatywnego możesz podnieść ją do 0,6-0,8.

Jak sprawdzić, czy model używa GPU

Na karcie NVIDIA uruchom w drugim oknie terminala:

nvidia-smi

Podczas generowania powinien pojawić się proces programu oraz wyraźnie większe użycie pamięci karty. Jeżeli VRAM się nie zmienia, model może działać głównie na CPU.

W llama.cpp możesz także wyświetlić dostępne urządzenia:

llama-server --list-devices

Najczęstsze problemy

Model nie mieści się w pamięci

Wybierz Q4 zamiast Q8, zmniejsz kontekst i zamknij programy używające GPU. Jeżeli to nie wystarczy, uruchom część warstw na CPU albo wybierz Bielika 4,5B.

Odpowiedzi są bardzo wolne

Sprawdź, czy program korzysta z GPU. Na CPU duży model może generować tylko kilka tokenów na sekundę. Pomaga mniejsza kwantyzacja, krótszy kontekst i pełne przeniesienie modelu na kartę graficzną.

Model odpowiada dziwnie albo nie kończy wypowiedzi

Najczęstszą przyczyną jest niepoprawny szablon czatu. Użyj oficjalnego repozytorium SpeakLeash i aktualnej wersji programu. Nie traktuj modelu bazowego jak wariantu Instruct.

Odpowiedzi zawierają błędy

To nie jest błąd instalacji. Lokalny model nadal może halucynować. Dodaj źródłowy tekst do promptu, każ mu wskazywać fragmenty uzasadniające odpowiedź i weryfikuj wynik.

Czy lokalny Bielik jest prywatny

Jeżeli program działa wyłącznie lokalnie i nie łączy się z zewnętrznym API, treść promptów może pozostać na twoim komputerze. Sprawdź jednak ustawienia aplikacji, telemetrię, logi i wtyczki. W firmie potrzebujesz także kontroli dostępu, szyfrowania dysku, zasad retencji i audytu całej aplikacji.

Co dalej

Po instalacji nie testuj modelu przypadkowymi pytaniami. Weź dziesięć realnych zadań: pięć prostych, trzy typowe i dwa trudne. Zapisz oczekiwany wynik i oceń odpowiedzi według stałych kryteriów. W ten sposób dowiesz się, czy Bielik nadaje się do twojej pracy, a nie tylko czy potrafi prowadzić miłą rozmowę.

Gotowe polecenia znajdziesz w zestawie 25 promptów do Bielika. Informacje o samym modelu, licencji i moim teście są w pełnym przewodniku po Bieliku.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok ElevenLabs Creator 352 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie