✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Strands Decider 2B od AWS: otwarty model decyzyjny, test po polsku

AWS wydał mały model decyzyjny z otwartymi wagami, danymi i skryptami. Uruchomiłem go na RTX 4090: 3,8 GB VRAM, 135 ms, 30/30 polskich zgłoszeń.

6 min czytania
Logo AWS i napis Strands Decider 2B - mały model decyzyjny

👁 113 przeczytań

// w skrócie
  • Strands Decider 2B przypisuje polskie zgłoszenia klientów do działów bezbłędnie (30/30) w medianie 135 ms na RTX 4090.
  • Model ma 2 mld parametrów, licencję Apache-2.0 i zajmuje 3,8 GB VRAM, a adapter LoRA waży zaledwie 67 MB.
  • Na benchmarku JevBench model uzyskał 72,3% (167/231 zadań), co daje 3. miejsce wśród 33 modeli klasy 2B.

Strands Decider 2B to otwarty model decyzyjny od AWS: zamiast pisać tekst, wybiera odpowiedź z podanej listy i podaje pewność. Ma 2 mld parametrów, licencję Apache-2.0, a AWS opublikował nie tylko wagi, ale też dane treningowe i skrypty. Uruchomiłem go na RTX 4090: zajął 3,8 GB pamięci karty, a polskie zgłoszenia klientów przypisał do działów bezbłędnie w 135 ms. Szersze tło i porównanie z Cloudflare Clef jest w przewodniku Modele decyzyjne AI.

Co to jest Strands Decider 2B

Model wydał 1 października 2026 zespół Strands Labs z AWS (autorzy wpisu: Marc Brooker, Mike Chambers i Fabio Nonato de Paula). Nazwa pochodzi od Strands Agents, otwartego frameworka AWS do budowy agentów. Najważniejsze fakty:

  • Baza: Qwen3.5-2B-Base. AWS usunął głowicę językową i dołożył głowę wskaźnikową (pointer head) z nieco ponad milionem parametrów, która ocenia stan ukryty na pozycji każdej opcji.
  • Dostrojenie: adapter LoRA rangi 16. Na Hugging Face jest checkpoint StrandsAgents/strands-decider-2B-hobson-v19 - adapter waży 67 MB, model bazowy dociąga się sam przy pierwszym uruchomieniu (u mnie 4,3 GB).
  • Licencja: Apache-2.0 dla modelu, kodu i receptury treningu; baza Qwen3.5-2B-Base również Apache-2.0.
  • Otwartość: w repozytorium strands-labs/strands-decider są skrypty treningu, spis 29 publicznych zbiorów danych (m.in. BANKING77, CLINC, AG News, HotpotQA) i surowe wyniki ewaluacji.
  • Instalacja: pip install strands-decider daje polecenie w terminalu i serwer HTTP.
  • API: zgodne z formatem System One, czyli tym samym, którego używają Jev od TypeSafe, Cloudflare Clef i Kev.

Jak zadajesz pytania

Jak każdy model decyzyjny, Strands Decider przyjmuje stan i nazwane pytania trzech typów:

TypPrzykładWynik
choiceKtóry dział: płatności, dostawa, zwroty?opcja + pewność + rozkład
noulCzy klient jest zdenerwowany?prawdopodobieństwo „tak”
scoreJak pilne: może poczekać / ten tydzień / dziś?oczekiwany poziom + rozkład

Liczba opcji nie jest ograniczona, bo etykiety przychodzą razem z zapytaniem, a nie są wpisane w model. Wynik powstaje w jednym przejściu przez sieć, bez pętli generowania. Stan jest liczony raz, a pytania doliczane są na jego kopii pamięci podręcznej, więc dodatkowe pytanie prawie nie wydłuża czasu.

Wyniki według AWS

  • JevBench (231 publicznych zadań): 167 trafień, czyli 72,3%. AWS pisze, że to 3. miejsce na 33 modele w klasie 2B i 1. na 30, jeśli pominąć modele nieco większe niż 2B.
  • Łatwe zadania JevBench: 100% poprawnych.
  • Opóźnienie: mediana ok. 115 ms na RTX 3090, ok. 153 ms na MacBooku z M3.
  • Wewnętrzne zestawy: od 64,1% (krótkie zadania, 6000 przykładów) do 89,8% (rozpoznawanie pytań bez odpowiedzi w MuSiQue).

AWS uczciwie wypisuje ograniczenia. Model jest wyraźnie słabszy od modeli rozumujących w złożonych problemach, nie nadaje się do kodu, czatu ani streszczeń. Karta modelu ostrzega też, że model „czyta pytanie słabiej niż dokument”: przy tym samym stanie i opcjach zmiana treści pytania często nie zmienia odpowiedzi, więc pytanie trzeba formułować jednoznacznie.

Mój test na polskich zgłoszeniach

Zestaw: 30 zgłoszeń, jakie dostaje sklep albo firma z aplikacją - po 5 na dział (płatności, dostawa, zwroty, konto, awarie, sprzedaż), część bez polskich znaków i z literówkami. Do każdego dwa pytania: dział i czy sprawa wymaga reakcji jeszcze dziś. Sprzęt: RTX 4090, Windows 11, PyTorch 2.11.

WariantDziałPilność (próg 0,5)Mediana czasu
Polskie zgłoszenia, polskie opisy działów30/3024/30135 ms
Polskie zgłoszenia, angielskie opisy30/3026/30135 ms
Wszystko po angielsku29/3026/30130 ms
  • Pamięć: 3,8 GB VRAM w szczycie, ładowanie modelu 16 s.
  • Dział: bezbłędnie po polsku. Jedyny błąd po angielsku to zmiana planu w trakcie okresu rozliczeniowego, którą model uznał za płatność zamiast sprzedaży - ten sam przypadek mylił większość testowanych modeli.
  • Pilność po polsku: tu wyszedł problem z kalibracją. Prawdopodobieństwo „tak” dla 6 naprawdę pilnych zgłoszeń wynosiło od 0,22 do 0,47 - żadne nie przekroczyło 0,5, więc przy domyślnym progu model nie oznaczył nic jako pilne. Kolejność była jednak sensowna: przy progu 0,4 wynik rośnie do 26/30.
  • Pewność działu: mediana 0,86, najniższa 0,31. Dla porównania większy Clef-flash miał medianę 0,97.

Na tej samej karcie Gemma 4 12B w Ollamie z wymuszonym JSON-em też przypisała 30/30, ale w 413 ms, a Llama 3.1 8B w 173 ms z wynikiem 25/30. Pełne zestawienie ośmiu modeli jest w przewodniku po modelach decyzyjnych.

Strands Decider czy Cloudflare Clef

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Strands Decider 2BClef-flash
Rozmiar2B, ok. 4,4 GB pobrania9B, 19 GB
VRAM w moim teście3,8 GB18,3 GB
Mediana czasu (PL, 4090)135 ms112 ms
Obrazy i wideonietak
Hostingbrak, tylko własny serwerWorkers AI, 0,09 USD / mln tokenów
Dane treningowepublicznewewnętrzne, syntetyczne
CPU / Mactakw praktyce potrzebna karta 24 GB

Wybrałbym Strands Decider, gdy model ma działać na laptopie, małym serwerze bez dużej karty albo na procesorze, i gdy liczy się możliwość dotrenowania na własnych etykietach według opublikowanej receptury. Clef-flash, gdy masz kartę 24 GB albo chcesz gotowy hosting i obrazy. O premierze Clef piszę w osobnym tekście.

Jak uruchomić w 3 krokach

  1. Zainstaluj PyTorch (z CUDA, jeśli masz kartę NVIDIA), potem pip install strands-decider. Pakiet wymaga transformers 5.15 lub nowszego.
  2. Zadaj pytanie:
    strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19 
      --state "Kurier zostawił karton pod drzwiami sąsiada i teraz go nie ma" 
      --choice "Który dział?=platnosci,dostawa,zwrot,konto" 
      --noul "Czy klient jest zdenerwowany?"
  3. Uruchom serwer: strands-decider serve StrandsAgents/strands-decider-2B-hobson-v19 --port 8000 i wysyłaj żądania na /v1/systemone.

Na Windowsie biblioteka transformers zgłosi, że brakuje pakietów flash-linear-attention i causal-conv1d. Model działa bez nich (moje 135 ms zmierzyłem właśnie w tym trybie), tylko wolniej niż mógłby. Serwer nasłuchuje wyłącznie na 127.0.0.1 i nie ma uwierzytelniania - przed wystawieniem na zewnątrz trzeba dołożyć własną warstwę. Kompletny przykład z progami i kolejką „do człowieka” pokazuję w poradniku o routingu zgłoszeń.

Źródła

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Najczęściej zadawane pytania

Ile pamięci GPU zajmuje Strands Decider 2B i jak szybko działa?

Model zajmuje 3,8 GB VRAM na karcie graficznej. W teście na RTX 4090 mediana czasu odpowiedzi dla polskich zgłoszeń wyniosła 135 ms, a według danych AWS mediana opóźnienia to ok. 115 ms na RTX 3090 i ok. 153 ms na MacBooku z M3.

Na jakiej licencji jest dostępny Strands Decider 2B i co dokładnie AWS udostępnił?

Model jest dostępny na licencji Apache-2.0, która obejmuje model, kod i recepturę treningu. AWS opublikował nie tylko wagi modelu, ale też skrypty treningu, spis 29 publicznych zbiorów danych oraz surowe wyniki ewaluacji w repozytorium strands-labs/strands-decider.

Jaką skuteczność osiągnął Strands Decider 2B w teście na polskich zgłoszeniach klientów?

W teście 30 polskich zgłoszeń przypisanych do 6 działów model przypisał dział bezbłędnie - uzyskując wynik 30 na 30. Gorzej wypadła ocena pilności: przy domyślnym progu 0,5 model nie oznaczył żadnego ze zgłoszeń jako pilnego, jednak obniżenie progu do 0,4 poprawiło wynik do 26 na 30.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Czy Strands Decider 2B działa na polskich tekstach bez błędów?

Tak, w teście 30 polskich zgłoszeń model przypisał dział bezbłędnie (30/30) zarówno z polskimi, jak i angielskimi opisami działów. Problem pojawił się tylko przy detekcji pilności - przy domyślnym progu 0,5 żadne z 6 pilnych zgłoszeń nie zostało oznaczone, ale zmiana progu na 0,4 poprawia wynik do 26/30.

Ile pamięci GPU potrzeba do uruchomienia Strands Decider 2B?

Model zajmuje 3,8 GB VRAM w szczycie na RTX 4090. Pobieranie przy pierwszym uruchomieniu to łącznie ok. 4,4 GB - adapter LoRA waży 67 MB, a model bazowy Qwen3.5-2B-Base dociąga się sam i zajmuje 4,3 GB.

Czym różni się Strands Decider 2B od Cloudflare Clef-flash?

Strands Decider 2B jest mniejszy (ok. 4,4 GB pobrania vs 19 GB VRAM dla Clef-flash) i działa na laptopie lub CPU bez dużej karty. Clef-flash jest szybszy (112 ms vs 135 ms na RTX 4090), obsługuje obrazy i wideo oraz oferuje gotowy hosting za 0,09 USD za milion tokenów, ale wymaga w praktyce karty 24 GB.

Jak zainstalować i uruchomić Strands Decider 2B?

Wystarczy zainstalować PyTorch z obsługą CUDA, a następnie wykonać pip install strands-decider - pakiet wymaga transformers w wersji 5.15 lub nowszej. Pytanie zadaje się poleceniem strands-decider ask z parametrami --state, --choice lub --noul, a serwer HTTP uruchamia się przez strands-decider serve na wybranym porcie.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›