🎬 Higgsfield Plus na rok 649 zł 1 990 zł -67% zostało 8 szt. albo Gemini Pro na 18 miesięcy 170 zł Kup teraz →
Przejdź do treści
PROMPTOWY NA ANDROIDZIE

Blog pod ręką. Teraz w nowej odsłonie.

Wygodny czytnik, zapisane artykuły i wygląd, który znasz z Promptowego.

// sprzęt

Co uruchomisz na własnej karcie

Pytanie „czy to pójdzie na mojej karcie” ma policzalną odpowiedź: wagi razy liczba bitów, plus pamięć podręczna uwagi, która rośnie z długością kontekstu i potrafi zaskoczyć bardziej niż sam model. Wybierz sprzęt i rozmiar modelu, a pokażę, co się zmieści, co trzeba zrzucić do pamięci systemowej i ile mniej więcej tokenów na sekundę z tego wyjdzie.

40 kart Pamięć uwagi Szacunek tokenów na sekundę Edytowalne dane Link do wyniku
Procesor, wtyczka i przewód zamkniętego obwodu

Twój sprzęt

Wartości podstawiają się z listy i są danymi katalogowymi producenta. Możesz je nadpisać, bo realnie dostępna pamięć zależy od tego, co jeszcze masz uruchomione, a na komputerach Apple pamięć jest wspólna dla procesora i układu graficznego, więc modelowi nie oddasz wszystkiego.

Model, który chcesz uruchomić

Dwie ostatnie liczby to budowa modelu. Podstawiam wartości typowe dla tej wielkości; jeśli znasz dokładne z karty modelu, wpisz swoje.

Werdykt

-
wagi modelu pamięć uwagi narzut wolne
Wagi modelu
0
GB przy tej kwantyzacji
Pamięć uwagi
0
GB przy tym kontekście
Razem
0
GB
Prędkość, szacunek
0
tokenów na sekundę

Wszystkie kwantyzacje na tym sprzęcie

Ta sama liczba parametrów, różna dokładność wag. Schodzenie poniżej czterech bitów zwykle widać w jakości odpowiedzi, zwłaszcza przy polszczyźnie i przy kodzie.

KwantyzacjaBity na wagęWagiRazem z uwagąMieści sięTokeny na sekundę

Ile kontekstu udźwigniesz

Pamięć uwagi przy różnych długościach

To jest ta pozycja, która zaskakuje. Model mieści się bez trudu, a przy stu tysiącach tokenów kontekstu nagle brakuje pamięci.

Maksimum, które wejdzie

-

tokenów przy obecnych ustawieniach, czyli mniej więcej - słów polskiego tekstu.

Liczę jeden token na 0,55 polskiego słowa, bo tyle wychodzi na realnych tekstach. Dokładnie policzysz to w liczniku tokenów.

Jak to uruchomić

Prędkość liczę z przepustowości pamięci, bo przy generowaniu odpowiedzi to ona jest wąskim gardłem: model musi przeczytać wszystkie swoje wagi dla każdego kolejnego tokenu. Realny wynik bywa o kilkanaście procent niższy przez narzut oprogramowania, a przy zrzuceniu części warstw do pamięci systemowej spada dramatycznie, bo magistrala do RAM-u jest kilkanaście razy wolniejsza. Traktuj tę liczbę jako rząd wielkości, nie jako obietnicę.
Stawki modeli pobierane codziennie z OpenRoutera, ostatnio 2026-09-16 07:11:14. Kurs średni NBP 3,7667 zł za dolara z 2026-09-15. Ten sam zestaw danych zasila stronę kosztów AI.
// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Cursor Pro+ 99 zł/mc Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie