Claude for Startups i 100+ programów z darmowymi kredytami AI dla startupów i JDG Darmowe kredyty AI dla Twojej firmy Sprawdź, co dostaniesz
✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Narzędzia

Ile pamięci potrzeba, żeby uruchomić model AI u siebie na komputerze

Pytanie „czy to pójdzie na mojej karcie” ma policzalną odpowiedź. Rozkładam ją na trzy składniki: wagi modelu, pamięć podręczną uwagi i narzut, i pokazuję, dlaczego prędkość zależy od przepustowości pamięci, a nie od mocy obliczeniowej.

6 min czytania
Ile pamięci potrzeba, żeby uruchomić model AI u siebie na komputerze

👁 147 przeczytań

// w skrócie
  • Wymagana pamięć to suma trzech składników: wag modelu, pamięci podręcznej uwagi i narzutu - i to środkowy składnik odpowiada za większość rozczarowań.
  • Model 8 miliardów parametrów w 16 bitach zajmuje ok. 15 GB, a w 4-bitowej kwantyzacji schodzi do ok. 5 GB, natomiast model 70B w 4 bitach wymaga ok. 40 GB.
  • Schodzenie poniżej 4 bitów kwantyzacji rzadko się opłaca - lepiej wybrać mniejszy model w wyższej dokładności, bo jakość przy 3 bitach wyraźnie spada, szczególnie przy polszczyźnie i kodzie.

Najczęstsze pytanie, jakie dostaję o modelach uruchamianych lokalnie, brzmi zawsze tak samo: czy to pójdzie na mojej karcie. Odpowiedź jest policzalna, tylko rozbija się na trzy składniki, z których jeden zwykle wypada z rachunku i to on odpowiada za większość rozczarowań. Przykład z pomiaru: Gemma 4 31B zajmuje 19,2 GB VRAM w Ollamie. Co konkretnie pójdzie na karcie 8, 12 i 24 GB, na Macu i na samym procesorze, rozpisałem w przewodniku Lokalne AI.

Składnik pierwszy: wagi

Model to zbiór liczb, a każda z nich zajmuje miejsce. Wzór jest tak prosty, że można go zrobić w pamięci: liczba parametrów razy liczba bitów na parametr, podzielona przez osiem, i wychodzą bajty.

Model o ośmiu miliardach parametrów w pełnej dokładności szesnastu bitów to blisko piętnaście gigabajtów. Ten sam model w czterobitowej kwantyzacji schodzi w okolice pięciu. Model siedemdziesięciomiliardowy w tej samej czterobitowej kwantyzacji to około czterdziestu gigabajtów, czyli więcej, niż ma jakakolwiek karta konsumencka.

Składnik drugi: kwantyzacja, czyli co tracisz

Kwantyzacja polega na zapisaniu tych samych wag z mniejszą dokładnością. Osiem bitów wobec pełnych szesnastu daje różnicę w jakości, której w praktyce nie widać. Sześć bitów to bezpieczny sufit, jeśli masz zapas pamięci. Cztery bity to wybór domyślny większości ludzi i sensowny kompromis.

Poniżej czterech bitów zaczyna się robić ciekawie w złym znaczeniu. Model dalej odpowiada, ale częściej gubi wątek, a przy polszczyźnie i przy kodzie widać to wcześniej niż przy prostej angielskiej konwersacji. Jeśli musisz zejść do trzech bitów, żeby coś się zmieściło, prawie zawsze lepiej wychodzi wzięcie mniejszego modelu w wyższej dokładności.

Składnik trzeci: ten, o którym się zapomina

Pamięć podręczna uwagi. Model zapamiętuje w niej to, co już przeczytał, żeby nie liczyć tego od nowa przy każdym kolejnym tokenie. Jej rozmiar nie zależy od wielkości modelu w prosty sposób, za to rośnie liniowo z długością kontekstu.

W praktyce wygląda to tak: model mieści się na karcie bez trudu przy ośmiu tysiącach tokenów kontekstu, a przy stu trzydziestu tysiącach brakuje kilkunastu gigabajtów, choć sam model ani drgnął. To jest ten moment, w którym ludzie piszą, że coś się zepsuło, a arytmetyka po prostu się nie zgadza. Tę pamięć też można kwantyzować, do ośmiu albo czterech bitów, i to zwykle jest najtańszy sposób na odzyskanie miejsca.

Wszystkie trzy składniki liczy kalkulator pamięci dla modeli lokalnych. Wybierasz kartę z listy, rozmiar modelu, kwantyzację i długość kontekstu, a dostajesz rozbicie na wagi, pamięć uwagi i narzut, razem z informacją, ile warstw zmieści się na karcie, jeśli całość się nie mieści.

Prędkość zależy od czegoś innego, niż myślisz

Przy generowaniu odpowiedzi karta nie liczy tak dużo, jak się wydaje. Dla każdego kolejnego tokenu musi za to przeczytać wszystkie wagi modelu. To znaczy, że wąskim gardłem jest przepustowość pamięci, a nie moc obliczeniowa.

Stąd bierze się prosta reguła: podziel przepustowość pamięci karty przez rozmiar modelu w pamięci, a dostaniesz rząd wielkości liczby tokenów na sekundę. Realny wynik będzie niższy o kilkanaście procent przez narzut oprogramowania, ale kierunek się zgadza. Stąd też wynika, że karta z mniejszą liczbą rdzeni, ale szybszą pamięcią, potrafi generować szybciej od mocniejszej z wolniejszą.

Zrzucanie warstw do pamięci systemowej

Kiedy model nie mieści się w całości, część warstw ląduje w pamięci systemowej. Programy pozwalają to zrobić jednym parametrem i wygląda to na wygodne wyjście. Nie jest.

Magistrala do pamięci systemowej jest kilkanaście razy wolniejsza od pamięci karty, więc każdy token przechodzi przez to wąskie gardło. Spadek nie wynosi kilkunastu procent, tylko rząd wielkości. Z trzydziestu tokenów na sekundę robią się dwa i praca przy takim modelu przestaje przypominać rozmowę.

Wniosek jest niepopularny, ale konsekwentny: lepiej działa mniejszy model, który mieści się w całości, niż większy rozłożony na dwie pamięci. W kalkulatorze widać to od razu, bo prędkość liczę osobno dla części na karcie i dla części w pamięci systemowej.

Kiedy w ogóle warto trzymać model u siebie

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Bo to nie jest wybór oczywisty. Model uruchomiony lokalnie prawie zawsze będzie słabszy od tego, który dostaniesz przez interfejs czatu za kilkadziesiąt złotych miesięcznie, a sprzęt zdolny do sensownej pracy kosztuje tyle, co kilka lat takiego abonamentu. Jeśli liczysz wyłącznie pieniądze, rachunek zwykle wychodzi na niekorzyść lokalnego rozwiązania.

Są jednak trzy sytuacje, w których to się spina. Pierwsza to dane, które nie mogą wyjść poza firmę, i tu żaden cennik nie ma znaczenia, bo alternatywy po prostu nie ma. Druga to praca masowa: jeśli przepuszczasz przez model dziesiątki tysięcy dokumentów dziennie, koszt stały zaczyna bić koszt zmienny. Trzecia to niezależność od cudzych decyzji, czyli pewność, że model, który dziś działa, będzie działał tak samo za rok, bez zmiany zachowania po cichej aktualizacji i bez limitów nałożonych przez dostawcę.

Jeśli żadna z tych trzech sytuacji Cię nie dotyczy, model lokalny zostaje ciekawą zabawką, a nie narzędziem pracy. Nie ma w tym nic złego, warto tylko wiedzieć, po co się w to wchodzi, zanim wyda się pieniądze na kartę.

Przed kupnem czegokolwiek policz najpierw, ile pamięci realnie potrzebujesz przy kontekście, z którego zamierzasz korzystać. To jest jedna liczba i oszczędza sporo pieniędzy.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Najczęściej zadawane pytania

Ile pamięci GPU zajmuje model AI o 8 miliardach parametrów?

Model o ośmiu miliardach parametrów w pełnej dokładności szesnastu bitów zajmuje blisko piętnaście gigabajtów. Ten sam model w czterobitowej kwantyzacji schodzi w okolice pięciu gigabajtów.

Dlaczego model AI nagle przestaje się mieścić w pamięci karty graficznej przy długim kontekście?

Przyczyną jest pamięć podręczna uwagi, która rośnie liniowo z długością kontekstu. Model może mieścić się na karcie bez trudu przy ośmiu tysiącach tokenów, a przy stu trzydziestu tysiącach brakuje kilkunastu gigabajtów, choć sam model ani drgnął.

Czy warto uruchamiać model AI lokalnie zamiast korzystać z płatnego czatu?

Model uruchomiony lokalnie prawie zawsze będzie słabszy od tego dostępnego przez interfejs czatu za kilkadziesiąt złotych miesięcznie, a sprzęt zdolny do sensownej pracy kosztuje tyle, co kilka lat takiego abonamentu. Lokalne rozwiązanie opłaca się głównie wtedy, gdy dane nie mogą wyjść poza firmę, gdy przetwarza się dziesiątki tysięcy dokumentów dziennie lub gdy potrzebna jest niezależność od decyzji zewnętrznego dostawcy.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Ile pamięci GPU potrzeba do uruchomienia modelu 7B lub 8B lokalnie?

Model o 8 miliardach parametrów w pełnej dokładności 16-bitowej zajmuje blisko 15 GB pamięci, a w popularnej 4-bitowej kwantyzacji około 5 GB. Do tego trzeba doliczyć pamięć podręczną uwagi, której rozmiar zależy od długości kontekstu.

Dlaczego model mieści się na karcie przy krótkim kontekście, ale przy długim już nie?

Pamięć podręczna uwagi rośnie liniowo z długością kontekstu - model może bez problemu działać przy 8 tysiącach tokenów, a przy 130 tysiącach brakować kilkunastu gigabajtów, choć wagi modelu są takie same. Tę pamięć podręczną można kwantyzować do 8 lub 4 bitów, co jest najtańszym sposobem na odzyskanie miejsca.

Czy warto zrzucać część warstw modelu AI do pamięci RAM zamiast VRAM?

Nie warto, bo magistrala do pamięci systemowej jest kilkanaście razy wolniejsza od pamięci karty graficznej. Prędkość generowania spada nie o kilkanaście procent, lecz o rząd wielkości - z około 30 tokenów na sekundę do około 2.

Kiedy opłaca się uruchamiać model AI lokalnie zamiast korzystać z płatnego czatu?

Lokalne uruchomienie ma sens w trzech przypadkach: gdy dane nie mogą opuścić firmy, gdy przetwarza się dziesiątki tysięcy dokumentów dziennie, albo gdy potrzebna jest niezależność od zmian i limitów narzucanych przez dostawcę. Jeśli żaden z tych warunków nie zachodzi, rachunek finansowy zwykle wypada na niekorzyść lokalnego rozwiązania wobec abonamentu za kilkadziesiąt złotych miesięcznie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 450 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›