TypeSafe i model Jev: AI, które zwracają decyzje zamiast tekstu
Model, który nie pisze zdań, tylko oddaje decyzję z prawdopodobieństwem. Rozbieram, na czym polega System One i gdzie to realnie pasuje.

👁 115 przeczytań
- Model Jev od TypeSafe AI nie generuje tekstu, lecz zwraca decyzje jako typy danych z rozkładem prawdopodobieństw, co pozwala kodowi automatycznie rozgałęziać program.
- Cena Jeva wynosi 42 USD za miliard tokenów wejściowych, a producent deklaruje, że jest to 238 razy mniej niż kosztuje Claude Fable 5.1.
- API Jeva opiera się na trzech typach pytań - Choice, Score i Noul - które są oceniane równolegle i w izolacji, więc dodanie kolejnych pytań prawie nie zmienia czasu odpowiedzi.
Przez dwa lata w ukryciu, a potem jedna liczba, która każe się zatrzymać: 42 dolary za miliard tokenów wejściowych. TypeSafe AI wypuścił model Jev, który nie pisze tekstu. Odpowiada na pytania typami danych i podaje, jak bardzo jest pewny. To nie jest kolejny czat - to jest coś, co ma być używane przez kod, nie przez człowieka.
Co to jest w jednym akapicie
Jev to model, który zamiast tekstu zwraca decyzję z typem i prawdopodobieństwem. Pytasz „czy to zgłoszenie dotyczy reklamacji?” i dostajesz nie zdanie, tylko wartość logiczną z liczbą mówiącą, na ile model jest tego pewny. Twój kod może na tym rozgałęzić program - działać sam, gdy pewność jest wysoka, i odesłać do człowieka, gdy niska. TypeSafe nazywa tę klasę System One Models i trenuje je metodą RLCD zamiast RLHF, który stoi za wszystkimi czatami.
Dla kogo: jeśli budujesz automatyzację, w której model ma podejmować tysiące drobnych rozstrzygnięć. Dla kogo nie: jeśli potrzebujesz, żeby coś napisało tekst - Jev tego nie robi i nie ma takiego zamiaru.
Dlaczego to w ogóle powstało
Argument twórców jest prosty i trudno się z nim nie zgodzić. Duże modele językowe trenuje się metodą RLHF, czyli uczenia ze wzmocnieniem na podstawie ludzkich preferencji. Efekt: modele są znakomite w wykonywaniu poleceń i brzmią przekonująco. Ale ta sama metoda daje trzy skutki uboczne, które TypeSafe wymienia wprost: mode dropping, nadmierną pewność siebie i brak niezawodności. Dlatego przy modelach językowych zawsze musi stać człowiek.
Gdy potrzebujesz, żeby model podjął decyzję, którą skonsumuje Twój kod, pojawia się rozjazd: zmuszasz system do generowania tekstu, żeby wyprodukował strukturę, a potem parsujesz ten tekst z powrotem na coś, na czym kod może polegać. To jest opis problemu, na który sam trafiłem w tym tygodniu - generator tekstów zwracał JSON, który się nie parsował, bo długa treść łamała strukturę łańcucha. Musiałem napisać własny, tolerancyjny parser.
Trzy prymitywy - cała powierzchnia API
| Typ pytania | Co robi | Co zwraca |
|---|---|---|
| Choice | Wybierz opcję z listy | wybór, rozkład prawdopodobieństw, pewność |
| Score | Oceń stan według rubryki | ocena, rozkład prawdopodobieństw, pewność |
| Noul | Czy to zdanie jest prawdziwe? | wartość 0-1 |
To wszystko. Trzy typy pytań, które można mieszać w jednym wywołaniu API.
Najciekawsza część jest w tym, jak są liczone: każde pytanie jest oceniane równolegle i w izolacji wobec tego samego stanu. Konsekwencje są dwie i obie mają znaczenie praktyczne. Po pierwsze, dodanie kolejnych pytań prawie nie zmienia czasu odpowiedzi. Po drugie - i to jest ważniejsze - nie ma efektu gnicia kontekstu, bo pytania nie widzą się nawzajem.
Liczby, którymi się chwalą
| TypeSafe | Model językowy | |
|---|---|---|
| Koszt zadania | 0,000081 USD | 0,013880 USD |
| Czas | 0,114 s | 8,566 s |
| Różnica | 193,6× szybciej, 444,6× taniej | |
| Cena wejścia | 42 USD za miliard tokenów - deklarowane 238× mniej niż Claude Fable 5.1 | |
To są liczby producenta z materiału o nazwie „Proof”, dotyczące zadań typu System One - czyli takich, pod które ten model powstał. Nie są to wyniki niezależnego benchmarku i nie oznaczają, że Jev jest 444 razy tańszy od modelu językowego w czymkolwiek. Oznaczają, że przy zadaniach decyzyjnych porównanie wygląda tak.
W jednym z przykładów w dokumentacji: 13 pytań do briefingu regulacyjnego na podstawie artykułu z Wikipedii, wrzuconych jako jedno wywołanie TypeSafe zamiast osobnych zapytań, wyszło 11,5× taniej i 9,6× szybciej bez zmiany odpowiedzi.
Zasada, która decyduje, czy to zadziała
To jest rzecz, której nie da się obejść i w której siedzi cała trudność: pytania muszą być atomowe.
Dokumentacja opisuje właściwe pytanie jako takie, na które bardzo kompetentna osoba odpowie w kilka sekund, mając odpowiedni kontekst. Jeśli pytanie wymaga dłuższego rozumowania albo waży kilka niezależnych czynników - trzeba je rozłożyć.
Przykład wprost z dokumentacji: zamiast pytać „oceń ten pomysł na startup”, zapytaj osobno o wielkość rynku, wykonalność techniczną i wyróżnienie na tle konkurencji, a wyniki połącz własnym wzorem w kodzie.
I tu jest prawdziwa zaleta, którą łatwo przeoczyć: gdy zmieniają się priorytety, zmieniasz współczynnik w kodzie zamiast przepisywać prompt. To przenosi logikę biznesową z tekstu, którego nie da się przetestować, do kodu, który można objąć testami.
Gdzie to realnie pasuje, a gdzie nie
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
| Zastosowanie | Werdykt |
|---|---|
| Klasyfikacja zgłoszeń, moderacja, routing | Tak. Dokładnie ten kształt problemu |
| Wymuszenie struktury na wyjściu, gdy nie chcesz parsować JSON-a | Tak. To jest główny ból, który znika |
| Ocena tysięcy elementów według rubryki | Tak. Score plus własny wzór w kodzie |
| Decyzja „działać samemu czy pytać człowieka” | Tak. Po to jest pewność |
| Pisanie tekstów, streszczenia, tłumaczenia | Nie. Jev nie generuje tekstu |
| Zadania wymagające długiego rozumowania | Nie wprost - trzeba je rozłożyć na pytania atomowe |
Czego bym nie kupował bez sprawdzenia
To jest opinia. Hasło „zero halucynacji„ ze strony głównej jest sformułowane mocniej, niż wynika z opisu obok - a opis mówi, że każda decyzja ma oszacowanie pewności, więc software może działać przy wysokiej i eskalować przy niskiej. To jest bardzo sensowny mechanizm, ale to nie to samo co brak pomyłek. W często zadawanych pytaniach producent ma zresztą osobny punkt „Czy Jev może się mylić?”, co sugeruje uczciwą odpowiedź w środku.
Druga rzecz: ceny. W FAQ jest pytanie, czy są tymczasowe albo dotowane. Przy modelu biznesowym opartym na cenie 238 razy niższej od konkurencji to jest pytanie, na które trzeba znać odpowiedź przed wpięciem czegokolwiek w produkcję.
Jak zacząć
- Załóż konto i odbierz klucz API w panelu.
- Zacznij od Playground - zanim napiszesz kod, sprawdź, czy Twoje pytanie w ogóle da się zadać atomowo.
- Jeśli pracujesz w Claude Code:
claude plugin marketplace add typesafe-ai/skills, potemclaude plugin install typesafe-ai@typesafe-ai. - Weź jeden wąski przypadek z własnego systemu i zmierz go przeciwko temu, co masz teraz. Nie przepinaj wszystkiego naraz.
Najczęstsze pytania
Czym jest model System One?
To klasa modeli budowana pod decyzje wewnątrz oprogramowania, a nie pod rozmowę z człowiekiem. Jev jest pierwszym publicznym modelem tej klasy od TypeSafe.
Czym to się różni od trybu JSON i structured outputs?
Tryb JSON wymusza format na modelu, który i tak generuje tekst. Jev w ogóle nie generuje tekstu - zwraca wartość typu i rozkład prawdopodobieństw. Producent ma to jako osobne pytanie w FAQ, bo to jest najczęstsze nieporozumienie.
Co to jest RLCD?
Reinforcement Learning for Calibrated Decisions - metoda uczenia nastawiona na skalibrowane decyzje, w opozycji do RLHF, które optymalizuje pod ludzkie preferencje.
Czy Jev zastąpi modele językowe?
Nie i nie taki jest zamiar. To narzędzie do innego zadania. Realistyczny układ to model językowy do treści i Jev do rozstrzygnięć, które konsumuje kod.
Ile kosztuje Jev?
42 USD za miliard tokenów wejściowych według strony producenta, stan na 21 września 2026.
Źródła i data sprawdzenia
Wszystkie liczby, nazwy prymitywów i opis metody odczytane 21 września 2026 ze strony typesafe.ai i dokumentacji docs.typesafe.ai. Porównania wydajnościowe pochodzą od producenta i dotyczą zadań typu System One - nie są wynikiem niezależnego testu. Nie testowałem jeszcze Jeva na własnym zadaniu; gdy to zrobię, dopiszę pomiar.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →Najczęstsze pytania
Czym różni się model Jev od trybu JSON i structured outputs w modelach językowych?
Jev w ogóle nie generuje tekstu - zwraca wartość typu i rozkład prawdopodobieństw, podczas gdy tryb JSON jedynie wymusza format na modelu, który nadal produkuje tekst. Producent wskazuje to jako najczęstsze nieporozumienie i ma je opisane jako osobne pytanie w FAQ.
Co to jest metoda RLCD i czym różni się od RLHF?
RLCD, czyli Reinforcement Learning for Calibrated Decisions, to metoda uczenia nastawiona na skalibrowane decyzje, którą TypeSafe stosuje zamiast RLHF. RLHF optymalizuje modele pod ludzkie preferencje, co według TypeSafe powoduje mode dropping, nadmierną pewność siebie i brak niezawodności.
Do jakich zadań model Jev się nie nadaje?
Jev nie nadaje się do pisania tekstów, streszczeń ani tłumaczeń, bo w ogóle nie generuje tekstu. Nie obsługuje też bezpośrednio zadań wymagających długiego rozumowania - takie pytania trzeba wcześniej rozłożyć na pytania atomowe.
Jak szybko i tanio działa Jev w porównaniu do modelu językowego przy zadaniach decyzyjnych?
Według danych producenta z materiału 'Proof' Jev jest 193,6 razy szybszy i 444,6 razy tańszy od modelu językowego przy zadaniach typu System One. Przykładowe wywołanie z 13 pytaniami do briefingu regulacyjnego wyszło 11,5 razy taniej i 9,6 razy szybciej bez zmiany odpowiedzi, jednak są to liczby producenta, a nie wyniki niezależnego benchmarku.
