Strands Decider 2B od AWS: otwarty model decyzyjny, test po polsku
AWS wydał mały model decyzyjny z otwartymi wagami, danymi i skryptami. Uruchomiłem go na RTX 4090: 3,8 GB VRAM, 135 ms, 30/30 polskich zgłoszeń.

👁 113 przeczytań
- Strands Decider 2B przypisuje polskie zgłoszenia klientów do działów bezbłędnie (30/30) w medianie 135 ms na RTX 4090.
- Model ma 2 mld parametrów, licencję Apache-2.0 i zajmuje 3,8 GB VRAM, a adapter LoRA waży zaledwie 67 MB.
- Na benchmarku JevBench model uzyskał 72,3% (167/231 zadań), co daje 3. miejsce wśród 33 modeli klasy 2B.
Strands Decider 2B to otwarty model decyzyjny od AWS: zamiast pisać tekst, wybiera odpowiedź z podanej listy i podaje pewność. Ma 2 mld parametrów, licencję Apache-2.0, a AWS opublikował nie tylko wagi, ale też dane treningowe i skrypty. Uruchomiłem go na RTX 4090: zajął 3,8 GB pamięci karty, a polskie zgłoszenia klientów przypisał do działów bezbłędnie w 135 ms. Szersze tło i porównanie z Cloudflare Clef jest w przewodniku Modele decyzyjne AI.
Co to jest Strands Decider 2B
Model wydał 1 października 2026 zespół Strands Labs z AWS (autorzy wpisu: Marc Brooker, Mike Chambers i Fabio Nonato de Paula). Nazwa pochodzi od Strands Agents, otwartego frameworka AWS do budowy agentów. Najważniejsze fakty:
- Baza: Qwen3.5-2B-Base. AWS usunął głowicę językową i dołożył głowę wskaźnikową (pointer head) z nieco ponad milionem parametrów, która ocenia stan ukryty na pozycji każdej opcji.
- Dostrojenie: adapter LoRA rangi 16. Na Hugging Face jest checkpoint
StrandsAgents/strands-decider-2B-hobson-v19- adapter waży 67 MB, model bazowy dociąga się sam przy pierwszym uruchomieniu (u mnie 4,3 GB). - Licencja: Apache-2.0 dla modelu, kodu i receptury treningu; baza Qwen3.5-2B-Base również Apache-2.0.
- Otwartość: w repozytorium
strands-labs/strands-decidersą skrypty treningu, spis 29 publicznych zbiorów danych (m.in. BANKING77, CLINC, AG News, HotpotQA) i surowe wyniki ewaluacji. - Instalacja:
pip install strands-deciderdaje polecenie w terminalu i serwer HTTP. - API: zgodne z formatem System One, czyli tym samym, którego używają Jev od TypeSafe, Cloudflare Clef i Kev.
Jak zadajesz pytania
Jak każdy model decyzyjny, Strands Decider przyjmuje stan i nazwane pytania trzech typów:
| Typ | Przykład | Wynik |
|---|---|---|
choice | Który dział: płatności, dostawa, zwroty? | opcja + pewność + rozkład |
noul | Czy klient jest zdenerwowany? | prawdopodobieństwo „tak” |
score | Jak pilne: może poczekać / ten tydzień / dziś? | oczekiwany poziom + rozkład |
Liczba opcji nie jest ograniczona, bo etykiety przychodzą razem z zapytaniem, a nie są wpisane w model. Wynik powstaje w jednym przejściu przez sieć, bez pętli generowania. Stan jest liczony raz, a pytania doliczane są na jego kopii pamięci podręcznej, więc dodatkowe pytanie prawie nie wydłuża czasu.
Wyniki według AWS
- JevBench (231 publicznych zadań): 167 trafień, czyli 72,3%. AWS pisze, że to 3. miejsce na 33 modele w klasie 2B i 1. na 30, jeśli pominąć modele nieco większe niż 2B.
- Łatwe zadania JevBench: 100% poprawnych.
- Opóźnienie: mediana ok. 115 ms na RTX 3090, ok. 153 ms na MacBooku z M3.
- Wewnętrzne zestawy: od 64,1% (krótkie zadania, 6000 przykładów) do 89,8% (rozpoznawanie pytań bez odpowiedzi w MuSiQue).
AWS uczciwie wypisuje ograniczenia. Model jest wyraźnie słabszy od modeli rozumujących w złożonych problemach, nie nadaje się do kodu, czatu ani streszczeń. Karta modelu ostrzega też, że model „czyta pytanie słabiej niż dokument”: przy tym samym stanie i opcjach zmiana treści pytania często nie zmienia odpowiedzi, więc pytanie trzeba formułować jednoznacznie.
Mój test na polskich zgłoszeniach
Zestaw: 30 zgłoszeń, jakie dostaje sklep albo firma z aplikacją - po 5 na dział (płatności, dostawa, zwroty, konto, awarie, sprzedaż), część bez polskich znaków i z literówkami. Do każdego dwa pytania: dział i czy sprawa wymaga reakcji jeszcze dziś. Sprzęt: RTX 4090, Windows 11, PyTorch 2.11.
| Wariant | Dział | Pilność (próg 0,5) | Mediana czasu |
|---|---|---|---|
| Polskie zgłoszenia, polskie opisy działów | 30/30 | 24/30 | 135 ms |
| Polskie zgłoszenia, angielskie opisy | 30/30 | 26/30 | 135 ms |
| Wszystko po angielsku | 29/30 | 26/30 | 130 ms |
- Pamięć: 3,8 GB VRAM w szczycie, ładowanie modelu 16 s.
- Dział: bezbłędnie po polsku. Jedyny błąd po angielsku to zmiana planu w trakcie okresu rozliczeniowego, którą model uznał za płatność zamiast sprzedaży - ten sam przypadek mylił większość testowanych modeli.
- Pilność po polsku: tu wyszedł problem z kalibracją. Prawdopodobieństwo „tak” dla 6 naprawdę pilnych zgłoszeń wynosiło od 0,22 do 0,47 - żadne nie przekroczyło 0,5, więc przy domyślnym progu model nie oznaczył nic jako pilne. Kolejność była jednak sensowna: przy progu 0,4 wynik rośnie do 26/30.
- Pewność działu: mediana 0,86, najniższa 0,31. Dla porównania większy Clef-flash miał medianę 0,97.
Na tej samej karcie Gemma 4 12B w Ollamie z wymuszonym JSON-em też przypisała 30/30, ale w 413 ms, a Llama 3.1 8B w 173 ms z wynikiem 25/30. Pełne zestawienie ośmiu modeli jest w przewodniku po modelach decyzyjnych.
Strands Decider czy Cloudflare Clef
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
| Strands Decider 2B | Clef-flash | |
|---|---|---|
| Rozmiar | 2B, ok. 4,4 GB pobrania | 9B, 19 GB |
| VRAM w moim teście | 3,8 GB | 18,3 GB |
| Mediana czasu (PL, 4090) | 135 ms | 112 ms |
| Obrazy i wideo | nie | tak |
| Hosting | brak, tylko własny serwer | Workers AI, 0,09 USD / mln tokenów |
| Dane treningowe | publiczne | wewnętrzne, syntetyczne |
| CPU / Mac | tak | w praktyce potrzebna karta 24 GB |
Wybrałbym Strands Decider, gdy model ma działać na laptopie, małym serwerze bez dużej karty albo na procesorze, i gdy liczy się możliwość dotrenowania na własnych etykietach według opublikowanej receptury. Clef-flash, gdy masz kartę 24 GB albo chcesz gotowy hosting i obrazy. O premierze Clef piszę w osobnym tekście.
Jak uruchomić w 3 krokach
- Zainstaluj PyTorch (z CUDA, jeśli masz kartę NVIDIA), potem
pip install strands-decider. Pakiet wymaga transformers 5.15 lub nowszego. - Zadaj pytanie:
strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19 --state "Kurier zostawił karton pod drzwiami sąsiada i teraz go nie ma" --choice "Który dział?=platnosci,dostawa,zwrot,konto" --noul "Czy klient jest zdenerwowany?" - Uruchom serwer:
strands-decider serve StrandsAgents/strands-decider-2B-hobson-v19 --port 8000i wysyłaj żądania na/v1/systemone.
Na Windowsie biblioteka transformers zgłosi, że brakuje pakietów flash-linear-attention i causal-conv1d. Model działa bez nich (moje 135 ms zmierzyłem właśnie w tym trybie), tylko wolniej niż mógłby. Serwer nasłuchuje wyłącznie na 127.0.0.1 i nie ma uwierzytelniania - przed wystawieniem na zewnątrz trzeba dołożyć własną warstwę. Kompletny przykład z progami i kolejką „do człowieka” pokazuję w poradniku o routingu zgłoszeń.
Źródła
- Strands Agents: Introducing Strands Decider 2B (1.10.2026)
- Karta modelu na Hugging Face
- Kod na GitHubie
- Własny test: 5.10.2026, RTX 4090.
Najczęściej zadawane pytania
Ile pamięci GPU zajmuje Strands Decider 2B i jak szybko działa?
Model zajmuje 3,8 GB VRAM na karcie graficznej. W teście na RTX 4090 mediana czasu odpowiedzi dla polskich zgłoszeń wyniosła 135 ms, a według danych AWS mediana opóźnienia to ok. 115 ms na RTX 3090 i ok. 153 ms na MacBooku z M3.
Na jakiej licencji jest dostępny Strands Decider 2B i co dokładnie AWS udostępnił?
Model jest dostępny na licencji Apache-2.0, która obejmuje model, kod i recepturę treningu. AWS opublikował nie tylko wagi modelu, ale też skrypty treningu, spis 29 publicznych zbiorów danych oraz surowe wyniki ewaluacji w repozytorium strands-labs/strands-decider.
Jaką skuteczność osiągnął Strands Decider 2B w teście na polskich zgłoszeniach klientów?
W teście 30 polskich zgłoszeń przypisanych do 6 działów model przypisał dział bezbłędnie - uzyskując wynik 30 na 30. Gorzej wypadła ocena pilności: przy domyślnym progu 0,5 model nie oznaczył żadnego ze zgłoszeń jako pilnego, jednak obniżenie progu do 0,4 poprawiło wynik do 26 na 30.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czy Strands Decider 2B działa na polskich tekstach bez błędów?
Tak, w teście 30 polskich zgłoszeń model przypisał dział bezbłędnie (30/30) zarówno z polskimi, jak i angielskimi opisami działów. Problem pojawił się tylko przy detekcji pilności - przy domyślnym progu 0,5 żadne z 6 pilnych zgłoszeń nie zostało oznaczone, ale zmiana progu na 0,4 poprawia wynik do 26/30.
Ile pamięci GPU potrzeba do uruchomienia Strands Decider 2B?
Model zajmuje 3,8 GB VRAM w szczycie na RTX 4090. Pobieranie przy pierwszym uruchomieniu to łącznie ok. 4,4 GB - adapter LoRA waży 67 MB, a model bazowy Qwen3.5-2B-Base dociąga się sam i zajmuje 4,3 GB.
Czym różni się Strands Decider 2B od Cloudflare Clef-flash?
Strands Decider 2B jest mniejszy (ok. 4,4 GB pobrania vs 19 GB VRAM dla Clef-flash) i działa na laptopie lub CPU bez dużej karty. Clef-flash jest szybszy (112 ms vs 135 ms na RTX 4090), obsługuje obrazy i wideo oraz oferuje gotowy hosting za 0,09 USD za milion tokenów, ale wymaga w praktyce karty 24 GB.
Jak zainstalować i uruchomić Strands Decider 2B?
Wystarczy zainstalować PyTorch z obsługą CUDA, a następnie wykonać pip install strands-decider - pakiet wymaga transformers w wersji 5.15 lub nowszej. Pytanie zadaje się poleceniem strands-decider ask z parametrami --state, --choice lub --noul, a serwer HTTP uruchamia się przez strands-decider serve na wybranym porcie.
