Strata: model 125B na karcie 12 GB i 94 tokeny na sekundę. Co wiadomo
Darmowy silnik Strata uruchamia model o 125 mld parametrów na karcie 12 GB. Projekt ma ponad 10 tys. gwiazdek, ale liczby pochodzą od autora - opisuję wymagania i ograniczenia.

👁 124 przeczytań
Darmowy silnik Strata uruchamia model Qwen3.8-Flash-Next o 125 mld parametrów na zwykłej karcie graficznej z 12 GB pamięci i według autora generuje na RTX 5070 około 94 tokeny na sekundę. Projekt na GitHubie zebrał ponad 10 tys. gwiazdek, ale wszystkie liczby pochodzą na razie od samego twórcy.
Strata to silnik do uruchamiania modeli na licencji MIT, który opublikował Niko Veit (na GitHubie Niko1221/Strata). Na początku października projekt opisały m.in. AlphaSignal i AI Weekly, a filmy z testami pojawiły się na YouTube. Instalacja to jeden skrypt na Windowsie albo Linuksie, a silnik wystawia lokalnie API zgodne z OpenAI i Anthropic.
Jak 125 mld parametrów mieści się w 12 GB
Sztuczka tkwi w architekturze modelu. Qwen3.8-Flash-Next to model typu mixture of experts: ma 24 576 „ekspertów”, ale na każdy token używa około 10 z nich, czyli około 6 mld aktywnych parametrów. Strata:
Zobacz wpis na X
- trzyma na karcie graficznej tych ekspertów, których model używa najczęściej;
- resztę doczytuje z pamięci RAM, a w razie potrzeby z dysku SSD;
- używa wbudowanego modelu szkicującego (speculative decoding), który według projektu przyspiesza generowanie 1,6-1,8 raza;
- ma jądra CUDA przepisane specjalnie pod ten jeden model - to nie jest uniwersalny zamiennik llama.cpp czy Ollamy.
→
→
→
Wymagania i deklarowane wyniki
| Element | Według README projektu |
|---|---|
| Karta graficzna | min. 12 GB VRAM; NVIDIA RTX 20-50 albo AMD RX 7800/7900/9070 |
| RAM | min. 32 GB, zalecane 64 GB |
| Dysk | ok. 80 GB wolnego miejsca, najlepiej SSD |
| Szybkość (RTX 5070, kwantyzacja Q2_0) | ok. 94-95 tok/s w krótkiej rozmowie, 65 tok/s przy kontekście 128K |
| Szybkość (RTX 5070, IQ3_S) | 54 tok/s |
Pierwsze uruchomienie przez 1-3 minuty mocno obciąża komputer, bo do RAM-u trafia 35-55 GB danych. Długi początkowy prompt wczytuje się około minuty na każde 30 tys. tokenów.
Na co uważać
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
- Brak niezależnych testów. Wszystkie liczby w README to deklaracje autora, a wyniki dla RTX 3090 i serii 40 projekt sam oznacza jako szacunki.
- Rozrzut wyników użytkowników. Na Reddicie są relacje o ponad 100 tok/s na dwóch RTX 3090, ale też komentarz o średnio 20 tok/s na RTX 4070 z 64 GB RAM.
- Niska kwantyzacja. Najszybsze wyniki dotyczą wariantu Q2_0, czyli mocno skompresowanego modelu. Jakość odpowiedzi przy takiej kompresji spada, a projekt nie podaje porównania jakości.
- Szybkie zmiany. Silnik w dwa dni przeszedł z wersji 0.1.24 do 0.1.27, a w sieci krążą też forki z innymi wymaganiami.
Co to znaczy dla Ciebie
Jeśli masz komputer do gier z kartą 12 GB i 64 GB RAM, możesz spróbować uruchomić model tej klasy bez chmury i bez opłat za tokeny. Instaluj go jednak jak każdy świeży projekt z GitHuba: ze świadomością, że to wczesna wersja, najlepiej na osobnym koncie. Jeśli zaczynasz przygodę z lokalnymi modelami, prostszą i sprawdzoną drogą jest Ollama - opisałem ją razem z uruchamianiem Llamy i potrzebną pamięcią VRAM. Rodzinę modeli Qwen, z której pochodzi Flash-Next, omawiam w przewodniku po Qwen, a jak lokalne modele radzą sobie po polsku na RTX 4090, sprawdziłem w teście Bielika, Llamy i Mistrala.
Źródła: repozytorium Niko1221/Strata (README), AlphaSignal, AI Weekly, wpisy użytkowników na Reddicie i YouTube. Sprawdzone 4 października 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
