✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Newsy

Strata: model 125B na karcie 12 GB i 94 tokeny na sekundę. Co wiadomo

Darmowy silnik Strata uruchamia model o 125 mld parametrów na karcie 12 GB. Projekt ma ponad 10 tys. gwiazdek, ale liczby pochodzą od autora - opisuję wymagania i ograniczenia.

3 min czytania
Logo Qwen - silnik Strata i model 125B na karcie 12 GB

👁 118 przeczytań

Darmowy silnik Strata uruchamia model Qwen3.8-Flash-Next o 125 mld parametrów na zwykłej karcie graficznej z 12 GB pamięci i według autora generuje na RTX 5070 około 94 tokeny na sekundę. Projekt na GitHubie zebrał ponad 10 tys. gwiazdek, ale wszystkie liczby pochodzą na razie od samego twórcy.

Strata to silnik do uruchamiania modeli na licencji MIT, który opublikował Niko Veit (na GitHubie Niko1221/Strata). Na początku października projekt opisały m.in. AlphaSignal i AI Weekly, a filmy z testami pojawiły się na YouTube. Instalacja to jeden skrypt na Windowsie albo Linuksie, a silnik wystawia lokalnie API zgodne z OpenAI i Anthropic.

Jak 125 mld parametrów mieści się w 12 GB

Sztuczka tkwi w architekturze modelu. Qwen3.8-Flash-Next to model typu mixture of experts: ma 24 576 „ekspertów”, ale na każdy token używa około 10 z nich, czyli około 6 mld aktywnych parametrów. Strata:

  • trzyma na karcie graficznej tych ekspertów, których model używa najczęściej;
  • resztę doczytuje z pamięci RAM, a w razie potrzeby z dysku SSD;
  • używa wbudowanego modelu szkicującego (speculative decoding), który według projektu przyspiesza generowanie 1,6-1,8 raza;
  • ma jądra CUDA przepisane specjalnie pod ten jeden model - to nie jest uniwersalny zamiennik llama.cpp czy Ollamy.
Gdzie Strata trzyma model o 125 mld parametrów
Karta (12 GB)najczęściej używani eksperci

→

RAM (32-64 GB)pozostali eksperci modelu

→

SSDtablica n-gramów i dane doczytywane w razie potrzeby

→

Na tokenok. 10 z 24 576 ekspertów, ok. 6 mld aktywnych parametrów
Źródło: README i dokumentacja projektu Strata, VRAM Calculator. Grafika: promptowy.com.

Wymagania i deklarowane wyniki

ElementWedług README projektu
Karta graficznamin. 12 GB VRAM; NVIDIA RTX 20-50 albo AMD RX 7800/7900/9070
RAMmin. 32 GB, zalecane 64 GB
Dyskok. 80 GB wolnego miejsca, najlepiej SSD
Szybkość (RTX 5070, kwantyzacja Q2_0)ok. 94-95 tok/s w krótkiej rozmowie, 65 tok/s przy kontekście 128K
Szybkość (RTX 5070, IQ3_S)54 tok/s

Pierwsze uruchomienie przez 1-3 minuty mocno obciąża komputer, bo do RAM-u trafia 35-55 GB danych. Długi początkowy prompt wczytuje się około minuty na każde 30 tys. tokenów.

Strata na RTX 5070 12 GB: tokeny na sekundę w krótkiej rozmowie
Q2_095 tok/s
IQ2_XS78 tok/s
IQ3_XXS66 tok/s
IQ3_S54 tok/s
Źródło: deklaracje autora projektu (README Strata), bez niezależnych testów. Niższa kwantyzacja = szybciej, ale słabsza jakość. Wykres: promptowy.com.

Na co uważać

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

  • Brak niezależnych testów. Wszystkie liczby w README to deklaracje autora, a wyniki dla RTX 3090 i serii 40 projekt sam oznacza jako szacunki.
  • Rozrzut wyników użytkowników. Na Reddicie są relacje o ponad 100 tok/s na dwóch RTX 3090, ale też komentarz o średnio 20 tok/s na RTX 4070 z 64 GB RAM.
  • Niska kwantyzacja. Najszybsze wyniki dotyczą wariantu Q2_0, czyli mocno skompresowanego modelu. Jakość odpowiedzi przy takiej kompresji spada, a projekt nie podaje porównania jakości.
  • Szybkie zmiany. Silnik w dwa dni przeszedł z wersji 0.1.24 do 0.1.27, a w sieci krążą też forki z innymi wymaganiami.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Co to znaczy dla Ciebie

Jeśli masz komputer do gier z kartą 12 GB i 64 GB RAM, możesz spróbować uruchomić model tej klasy bez chmury i bez opłat za tokeny. Instaluj go jednak jak każdy świeży projekt z GitHuba: ze świadomością, że to wczesna wersja, najlepiej na osobnym koncie. Jeśli zaczynasz przygodę z lokalnymi modelami, prostszą i sprawdzoną drogą jest Ollama - opisałem ją razem z uruchamianiem Llamy i potrzebną pamięcią VRAM. Rodzinę modeli Qwen, z której pochodzi Flash-Next, omawiam w przewodniku po Qwen, a jak lokalne modele radzą sobie po polsku na RTX 4090, sprawdziłem w teście Bielika, Llamy i Mistrala.

Źródła: repozytorium Niko1221/Strata (README), AlphaSignal, AI Weekly, wpisy użytkowników na Reddicie i YouTube. Sprawdzone 4 października 2026.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›