Przejdź do treści
Warsztat

TypeSafe i model Jev: AI, które zwracają decyzje zamiast tekstu

Model, który nie pisze zdań, tylko oddaje decyzję z prawdopodobieństwem. Rozbieram, na czym polega System One i gdzie to realnie pasuje.

6 min czytania
TypeSafe i model Jev: AI, która zwraca decyzje zamiast tekstu

👁 115 przeczytań

// w skrócie
  • Model Jev od TypeSafe AI nie generuje tekstu, lecz zwraca decyzje jako typy danych z rozkładem prawdopodobieństw, co pozwala kodowi automatycznie rozgałęziać program.
  • Cena Jeva wynosi 42 USD za miliard tokenów wejściowych, a producent deklaruje, że jest to 238 razy mniej niż kosztuje Claude Fable 5.1.
  • API Jeva opiera się na trzech typach pytań - Choice, Score i Noul - które są oceniane równolegle i w izolacji, więc dodanie kolejnych pytań prawie nie zmienia czasu odpowiedzi.

Przez dwa lata w ukryciu, a potem jedna liczba, która każe się zatrzymać: 42 dolary za miliard tokenów wejściowych. TypeSafe AI wypuścił model Jev, który nie pisze tekstu. Odpowiada na pytania typami danych i podaje, jak bardzo jest pewny. To nie jest kolejny czat - to jest coś, co ma być używane przez kod, nie przez człowieka.

Co to jest w jednym akapicie

Jev to model, który zamiast tekstu zwraca decyzję z typem i prawdopodobieństwem. Pytasz „czy to zgłoszenie dotyczy reklamacji?” i dostajesz nie zdanie, tylko wartość logiczną z liczbą mówiącą, na ile model jest tego pewny. Twój kod może na tym rozgałęzić program - działać sam, gdy pewność jest wysoka, i odesłać do człowieka, gdy niska. TypeSafe nazywa tę klasę System One Models i trenuje je metodą RLCD zamiast RLHF, który stoi za wszystkimi czatami.

Dla kogo: jeśli budujesz automatyzację, w której model ma podejmować tysiące drobnych rozstrzygnięć. Dla kogo nie: jeśli potrzebujesz, żeby coś napisało tekst - Jev tego nie robi i nie ma takiego zamiaru.

Dlaczego to w ogóle powstało

Argument twórców jest prosty i trudno się z nim nie zgodzić. Duże modele językowe trenuje się metodą RLHF, czyli uczenia ze wzmocnieniem na podstawie ludzkich preferencji. Efekt: modele są znakomite w wykonywaniu poleceń i brzmią przekonująco. Ale ta sama metoda daje trzy skutki uboczne, które TypeSafe wymienia wprost: mode dropping, nadmierną pewność siebie i brak niezawodności. Dlatego przy modelach językowych zawsze musi stać człowiek.

Gdy potrzebujesz, żeby model podjął decyzję, którą skonsumuje Twój kod, pojawia się rozjazd: zmuszasz system do generowania tekstu, żeby wyprodukował strukturę, a potem parsujesz ten tekst z powrotem na coś, na czym kod może polegać. To jest opis problemu, na który sam trafiłem w tym tygodniu - generator tekstów zwracał JSON, który się nie parsował, bo długa treść łamała strukturę łańcucha. Musiałem napisać własny, tolerancyjny parser.

Trzy prymitywy - cała powierzchnia API

Typ pytaniaCo robiCo zwraca
ChoiceWybierz opcję z listywybór, rozkład prawdopodobieństw, pewność
ScoreOceń stan według rubrykiocena, rozkład prawdopodobieństw, pewność
NoulCzy to zdanie jest prawdziwe?wartość 0-1

To wszystko. Trzy typy pytań, które można mieszać w jednym wywołaniu API.

Najciekawsza część jest w tym, jak są liczone: każde pytanie jest oceniane równolegle i w izolacji wobec tego samego stanu. Konsekwencje są dwie i obie mają znaczenie praktyczne. Po pierwsze, dodanie kolejnych pytań prawie nie zmienia czasu odpowiedzi. Po drugie - i to jest ważniejsze - nie ma efektu gnicia kontekstu, bo pytania nie widzą się nawzajem.

Liczby, którymi się chwalą

TypeSafeModel językowy
Koszt zadania0,000081 USD0,013880 USD
Czas0,114 s8,566 s
Różnica193,6× szybciej, 444,6× taniej
Cena wejścia42 USD za miliard tokenów - deklarowane 238× mniej niż Claude Fable 5.1

To są liczby producenta z materiału o nazwie „Proof”, dotyczące zadań typu System One - czyli takich, pod które ten model powstał. Nie są to wyniki niezależnego benchmarku i nie oznaczają, że Jev jest 444 razy tańszy od modelu językowego w czymkolwiek. Oznaczają, że przy zadaniach decyzyjnych porównanie wygląda tak.

W jednym z przykładów w dokumentacji: 13 pytań do briefingu regulacyjnego na podstawie artykułu z Wikipedii, wrzuconych jako jedno wywołanie TypeSafe zamiast osobnych zapytań, wyszło 11,5× taniej i 9,6× szybciej bez zmiany odpowiedzi.

Zasada, która decyduje, czy to zadziała

To jest rzecz, której nie da się obejść i w której siedzi cała trudność: pytania muszą być atomowe.

Dokumentacja opisuje właściwe pytanie jako takie, na które bardzo kompetentna osoba odpowie w kilka sekund, mając odpowiedni kontekst. Jeśli pytanie wymaga dłuższego rozumowania albo waży kilka niezależnych czynników - trzeba je rozłożyć.

Przykład wprost z dokumentacji: zamiast pytać „oceń ten pomysł na startup”, zapytaj osobno o wielkość rynku, wykonalność techniczną i wyróżnienie na tle konkurencji, a wyniki połącz własnym wzorem w kodzie.

I tu jest prawdziwa zaleta, którą łatwo przeoczyć: gdy zmieniają się priorytety, zmieniasz współczynnik w kodzie zamiast przepisywać prompt. To przenosi logikę biznesową z tekstu, którego nie da się przetestować, do kodu, który można objąć testami.

Gdzie to realnie pasuje, a gdzie nie

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

ZastosowanieWerdykt
Klasyfikacja zgłoszeń, moderacja, routingTak. Dokładnie ten kształt problemu
Wymuszenie struktury na wyjściu, gdy nie chcesz parsować JSON-aTak. To jest główny ból, który znika
Ocena tysięcy elementów według rubrykiTak. Score plus własny wzór w kodzie
Decyzja „działać samemu czy pytać człowieka”Tak. Po to jest pewność
Pisanie tekstów, streszczenia, tłumaczeniaNie. Jev nie generuje tekstu
Zadania wymagające długiego rozumowaniaNie wprost - trzeba je rozłożyć na pytania atomowe

Czego bym nie kupował bez sprawdzenia

To jest opinia. Hasło „zero halucynacji ze strony głównej jest sformułowane mocniej, niż wynika z opisu obok - a opis mówi, że każda decyzja ma oszacowanie pewności, więc software może działać przy wysokiej i eskalować przy niskiej. To jest bardzo sensowny mechanizm, ale to nie to samo co brak pomyłek. W często zadawanych pytaniach producent ma zresztą osobny punkt „Czy Jev może się mylić?”, co sugeruje uczciwą odpowiedź w środku.

Druga rzecz: ceny. W FAQ jest pytanie, czy są tymczasowe albo dotowane. Przy modelu biznesowym opartym na cenie 238 razy niższej od konkurencji to jest pytanie, na które trzeba znać odpowiedź przed wpięciem czegokolwiek w produkcję.

Jak zacząć

  1. Załóż konto i odbierz klucz API w panelu.
  2. Zacznij od Playground - zanim napiszesz kod, sprawdź, czy Twoje pytanie w ogóle da się zadać atomowo.
  3. Jeśli pracujesz w Claude Code: claude plugin marketplace add typesafe-ai/skills, potem claude plugin install typesafe-ai@typesafe-ai.
  4. Weź jeden wąski przypadek z własnego systemu i zmierz go przeciwko temu, co masz teraz. Nie przepinaj wszystkiego naraz.

Najczęstsze pytania

Czym jest model System One?

To klasa modeli budowana pod decyzje wewnątrz oprogramowania, a nie pod rozmowę z człowiekiem. Jev jest pierwszym publicznym modelem tej klasy od TypeSafe.

Czym to się różni od trybu JSON i structured outputs?

Tryb JSON wymusza format na modelu, który i tak generuje tekst. Jev w ogóle nie generuje tekstu - zwraca wartość typu i rozkład prawdopodobieństw. Producent ma to jako osobne pytanie w FAQ, bo to jest najczęstsze nieporozumienie.

Co to jest RLCD?

Reinforcement Learning for Calibrated Decisions - metoda uczenia nastawiona na skalibrowane decyzje, w opozycji do RLHF, które optymalizuje pod ludzkie preferencje.

Czy Jev zastąpi modele językowe?

Nie i nie taki jest zamiar. To narzędzie do innego zadania. Realistyczny układ to model językowy do treści i Jev do rozstrzygnięć, które konsumuje kod.

Ile kosztuje Jev?

42 USD za miliard tokenów wejściowych według strony producenta, stan na 21 września 2026.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Źródła i data sprawdzenia

Wszystkie liczby, nazwy prymitywów i opis metody odczytane 21 września 2026 ze strony typesafe.ai i dokumentacji docs.typesafe.ai. Porównania wydajnościowe pochodzą od producenta i dotyczą zadań typu System One - nie są wynikiem niezależnego testu. Nie testowałem jeszcze Jeva na własnym zadaniu; gdy to zrobię, dopiszę pomiar.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.

Najczęstsze pytania

Czym różni się model Jev od trybu JSON i structured outputs w modelach językowych?

Jev w ogóle nie generuje tekstu - zwraca wartość typu i rozkład prawdopodobieństw, podczas gdy tryb JSON jedynie wymusza format na modelu, który nadal produkuje tekst. Producent wskazuje to jako najczęstsze nieporozumienie i ma je opisane jako osobne pytanie w FAQ.

Co to jest metoda RLCD i czym różni się od RLHF?

RLCD, czyli Reinforcement Learning for Calibrated Decisions, to metoda uczenia nastawiona na skalibrowane decyzje, którą TypeSafe stosuje zamiast RLHF. RLHF optymalizuje modele pod ludzkie preferencje, co według TypeSafe powoduje mode dropping, nadmierną pewność siebie i brak niezawodności.

Do jakich zadań model Jev się nie nadaje?

Jev nie nadaje się do pisania tekstów, streszczeń ani tłumaczeń, bo w ogóle nie generuje tekstu. Nie obsługuje też bezpośrednio zadań wymagających długiego rozumowania - takie pytania trzeba wcześniej rozłożyć na pytania atomowe.

Jak szybko i tanio działa Jev w porównaniu do modelu językowego przy zadaniach decyzyjnych?

Według danych producenta z materiału 'Proof' Jev jest 193,6 razy szybszy i 444,6 razy tańszy od modelu językowego przy zadaniach typu System One. Przykładowe wywołanie z 13 pytaniami do briefingu regulacyjnego wyszło 11,5 razy taniej i 9,6 razy szybciej bez zmiany odpowiedzi, jednak są to liczby producenta, a nie wyniki niezależnego benchmarku.

// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie