Jak uruchomić Bielika lokalnie na własnym komputerze
Pobierz i uruchom Bielika na własnym komputerze przez LM Studio, Ollamę lub llama.cpp. Dobór wersji, wymagania sprzętowe i gotowe komendy.

👁 111 przeczytań
Bielika możesz pobrać i uruchomić bez zewnętrznego API. Najłatwiejsza droga prowadzi przez LM Studio, a najkrótsza komenda przez Ollamę. Na komputerze z 8 GB VRAM zacznij od Bielika 11B w kwantyzacji Q4_K_M. Jeśli masz słabszy sprzęt, wybierz mniejszy model z rodziny Bielik v3.
Sam użyłem trzeciej metody, czyli llama.cpp. Pobrałem Bielika-11B-v3.0-Instruct Q8_0, załadowałem całość na RTX 4090 i uruchomiłem przez lokalny serwer. Model odpowiadał bez połączenia z usługą chmurową.
Poniżej są trzy drogi. Jeśli nie chcesz dotykać terminala, wybierz LM Studio. Jeśli zależy ci na prostej integracji i jednej komendzie, wybierz Ollamę. Jeśli chcesz kontrolować niemal każdy parametr, wybierz llama.cpp.
Zanim zaczniesz: wybierz właściwy wariant
W nazwach modeli łatwo się pogubić. Do zwykłej rozmowy szukaj wariantu Instruct. Do LM Studio, Ollamy i llama.cpp najwygodniejszy jest format GGUF.
Najważniejsza część nazwy pliku to kwantyzacja:
| Kwantyzacja Bielik 11B v3 | Rozmiar | Praktyczne zastosowanie |
|---|---|---|
| Q4_K_M | około 6,72 GB | najlepszy punkt startowy |
| Q5_K_M | około 7,91 GB | trochę wyższa jakość |
| Q6_K | około 9,16 GB | mocniejszy komputer |
| Q8_0 | około 11,9 GB | testy jakościowe i dużo VRAM |
| BF16 lub F16 | około 22,3 GB | specjalistyczne zastosowania |
Q4 nie oznacza, że cały program potrzebuje dokładnie 6,72 GB pamięci. Dochodzą bufory, kontekst rozmowy i sam interfejs. Bezpiecznie zostawić zapas.
Prosty dobór do sprzętu
- 8 GB VRAM - zacznij od Q4_K_M i umiarkowanego kontekstu
- 12 GB VRAM - Q5 albo Q6 powinny być rozsądnym wyborem
- 16 GB VRAM - Q8 zwykle mieści się z zapasem na kontekst
- brak dedykowanej karty - model może działać w RAM na CPU, ale wolniej
- bardzo słaby komputer - wybierz Bielika 1,5B lub 4,5B zamiast 11B
Dokładne zużycie zależy od programu, systemu, długości kontekstu i sposobu przenoszenia warstw na GPU.
Metoda 1: Bielik w LM Studio
LM Studio jest najprostsze, ponieważ ma interfejs graficzny. Nie musisz wpisywać komend ani ręcznie tworzyć konfiguracji.
Krok 1: zainstaluj LM Studio
Pobierz program z oficjalnej strony lmstudio.ai i zainstaluj wersję dla swojego systemu.
Krok 2: wyszukaj model
Otwórz katalog modeli i wpisz:
speakleash Bielik 11B v3 GGUF
Sprawdź, czy repozytorium należy do speakleash. Przy modelach publikowanych przez inne konta można trafić na nieaktualną konwersję albo brak poprawnego szablonu rozmowy.
Krok 3: wybierz kwantyzację
Na początek wybierz Q4_K_M. Plik ma około 6,72 GB, więc pobieranie może potrwać kilka lub kilkanaście minut. Jeśli masz kartę z 16 GB VRAM i zależy ci na jakości, możesz wybrać Q8_0.
Krok 4: załaduj model
Przejdź do zakładki czatu, wybierz pobrany model i kliknij przycisk ładowania. LM Studio spróbuje dobrać ustawienia do sprzętu. Jeżeli model się nie mieści, zmniejsz kontekst albo wybierz mniejszą kwantyzację.
Krok 5: wykonaj pierwszy test
Nie zaczynaj od pytania „cześć, co potrafisz”. Daj modelowi zadanie, którego wynik można sprawdzić:
Popraw poniższy tekst pod względem językowym. Nie zmieniaj faktów. Najpierw pokaż poprawioną wersję, a potem w trzech punktach wymień najważniejsze zmiany.
TEKST:
[wklej tekst]
Metoda 2: Bielik w Ollamie
Ollama jest wygodna, jeśli chcesz uruchamiać modele z terminala i korzystać z lokalnego API.
Krok 1: zainstaluj Ollamę
Pobierz aplikację z ollama.com i zakończ instalację.
Krok 2: uruchom oficjalny model GGUF
W terminalu wpisz:
ollama run hf.co/speakleash/Bielik-11B-v3.0-Instruct-GGUF:Q4_K_M
Przy pierwszym uruchomieniu Ollama pobierze model. Kolejne rozmowy będą korzystać z pliku zapisanego lokalnie.
Krok 3: sprawdź dostępne modele
ollama list
Krok 4: użyj lokalnego API
Ollama domyślnie wystawia API na komputerze. Przykładowe zapytanie:
curl http://localhost:11434/api/chat -d '{
"model": "hf.co/speakleash/Bielik-11B-v3.0-Instruct-GGUF:Q4_K_M",
"messages": [
{"role": "user", "content": "Streść ten tekst w trzech punktach: [TEKST]"}
],
"stream": false
}'
Na Windowsie wygodniej wysłać to samo zapytanie z PowerShella albo użyć klienta zgodnego z API Ollamy.
Metoda 3: Bielik w llama.cpp
llama.cpp daje najwięcej kontroli. Możesz wskazać liczbę warstw na GPU, rozmiar kontekstu, port serwera i parametry generowania.
Krok 1: zainstaluj llama.cpp
W Windows możesz użyć Winget:
winget install llama.cpp
Możesz też pobrać gotowe pliki wykonywalne z repozytorium ggml-org/llama.cpp.
Krok 2: uruchom model bez ręcznego pobierania
Mam to spisane w całości
Zebrałem te rzeczy w ebookach, które możesz pobrać za darmo - bez zapisu na listę, bez haczyka.
llama cli -hf speakleash/Bielik-11B-v3.0-Instruct-GGUF:Q4_K_M
Krok 3: uruchom lokalny serwer
llama serve -hf speakleash/Bielik-11B-v3.0-Instruct-GGUF:Q4_K_M
Po załadowaniu modelu serwer udostępni interfejs w przeglądarce oraz lokalne API. Adres i port pojawią się w terminalu.
Jeśli pobrałeś plik ręcznie, wskaż jego ścieżkę:
llama-server -m Bielik-11B-v3.0-Instruct.Q4_K_M.gguf -ngl 99 -c 8192
Parametr -ngl 99 próbuje przenieść wszystkie warstwy na GPU. Parametr -c 8192 ustawia kontekst. Jeśli zabraknie pamięci, zmniejsz kontekst albo liczbę warstw na GPU.
Ustawienia na dobry początek
Nie ma jednego zestawu idealnego do wszystkiego, ale poniższe wartości są rozsądnym startem:
| Parametr | Wartość startowa | Co zmienia |
|---|---|---|
| temperatura | 0,1-0,3 | niska wartość daje bardziej przewidywalne odpowiedzi |
| top_p | 0,9-0,95 | ogranicza dobór mniej prawdopodobnych tokenów |
| kontekst | 4096-8192 | ile tekstu model może brać pod uwagę |
| maksymalna odpowiedź | 512-1024 tokenów | chroni przed niepotrzebnie długim wynikiem |
Do ekstrakcji danych i klasyfikacji używaj niskiej temperatury. Do pomysłów i tekstu kreatywnego możesz podnieść ją do 0,6-0,8.
Jak sprawdzić, czy model używa GPU
Na karcie NVIDIA uruchom w drugim oknie terminala:
nvidia-smi
Podczas generowania powinien pojawić się proces programu oraz wyraźnie większe użycie pamięci karty. Jeżeli VRAM się nie zmienia, model może działać głównie na CPU.
W llama.cpp możesz także wyświetlić dostępne urządzenia:
llama-server --list-devices
Najczęstsze problemy
Model nie mieści się w pamięci
Wybierz Q4 zamiast Q8, zmniejsz kontekst i zamknij programy używające GPU. Jeżeli to nie wystarczy, uruchom część warstw na CPU albo wybierz Bielika 4,5B.
Odpowiedzi są bardzo wolne
Sprawdź, czy program korzysta z GPU. Na CPU duży model może generować tylko kilka tokenów na sekundę. Pomaga mniejsza kwantyzacja, krótszy kontekst i pełne przeniesienie modelu na kartę graficzną.
Model odpowiada dziwnie albo nie kończy wypowiedzi
Najczęstszą przyczyną jest niepoprawny szablon czatu. Użyj oficjalnego repozytorium SpeakLeash i aktualnej wersji programu. Nie traktuj modelu bazowego jak wariantu Instruct.
Odpowiedzi zawierają błędy
To nie jest błąd instalacji. Lokalny model nadal może halucynować. Dodaj źródłowy tekst do promptu, każ mu wskazywać fragmenty uzasadniające odpowiedź i weryfikuj wynik.
Czy lokalny Bielik jest prywatny
Jeżeli program działa wyłącznie lokalnie i nie łączy się z zewnętrznym API, treść promptów może pozostać na twoim komputerze. Sprawdź jednak ustawienia aplikacji, telemetrię, logi i wtyczki. W firmie potrzebujesz także kontroli dostępu, szyfrowania dysku, zasad retencji i audytu całej aplikacji.
Co dalej
Po instalacji nie testuj modelu przypadkowymi pytaniami. Weź dziesięć realnych zadań: pięć prostych, trzy typowe i dwa trudne. Zapisz oczekiwany wynik i oceń odpowiedzi według stałych kryteriów. W ten sposób dowiesz się, czy Bielik nadaje się do twojej pracy, a nie tylko czy potrafi prowadzić miłą rozmowę.
Gotowe polecenia znajdziesz w zestawie 25 promptów do Bielika. Informacje o samym modelu, licencji i moim teście są w pełnym przewodniku po Bieliku.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
