🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Magazyn

Przetestowałem Fable 5.1 po polsku w dniu premiery. Jedno zadanie zawiesiło go na dobre

Ten sam zestaw zadań, którym mierzę modele od sierpnia, ta sama metoda, trzy modele Anthropica obok siebie. Nowa wersja jest szybsza i oszczędniejsza w słowach, ale na liczebnikach nie odpowiedziała wcale.

5 min czytania
Przetestowałem Fable 5.1 po polsku w dniu premiery. Jedno zadanie zawiesiło go na dobre

👁 229 przeczytań

Premiera modelu to zawsze ten sam rytuał: producent pokazuje wykresy, na których jego nowość jest lepsza od poprzedniczki, a niezależne pomiary pojawiają się kilka dni później. W środku jest luka, w której nie wiadomo nic pewnego. Postanowiłem ją wypełnić po swojemu i wieczorem w dniu premiery puściłem Claude Fable 5.1 przez zestaw zadań z polszczyzny, którym mierzę modele od połowy sierpnia.

Metoda jest nudna i właśnie dlatego działa. Sześć zadań, każde z jednoznacznym rozstrzygnięciem: odmiana obcych nazw własnych, liczebniki zbiorowe, wielkie i małe litery, imiesłowowe równoważniki zdania, przecinki oraz przepisanie zdania z urzędniczej polszczyzny na ludzką. Ta sama temperatura 0,2, ten sam limit odpowiedzi, ten sam limit czasu. Obok Fable 5.1 postawiłem jego poprzednika, Fable 5, oraz Opusa 5, czyli model, którego ta sama firma sprzedaje o połowę taniej.

Zadanie, którego nowy model nie skończył

Najciekawsze wydarzyło się na zadaniu drugim, czyli liczebnikach. Fable 5.1 nie odpowiedział. Nie pomylił się, nie odmówił, po prostu nie zwrócił nic przez trzy minuty, aż zamknąłem połączenie. Zero tokenów wyjścia, zero kosztu, brak odpowiedzi.

To nie jest przypadek jednego wieczoru. Kiedy ten sam zestaw uruchamiałem w sierpniu, dokładnie tak samo zachował się Fable 5: zawiesił się na zadaniu z odmianą nazw własnych i wisiał, aż upłynął limit pięciu minut. Innymi słowy, ta rodzina modeli ma powtarzalny problem z zacinaniem się na krótkich zadaniach językowych, i nowa wersja go nie usunęła. W tym samym przebiegu Fable 5 i Opus 5 odpowiedziały na liczebniki bez zająknięcia, w niecałe dziesięć sekund, i obie odpowiedzi były poprawne.

Warto wiedzieć, że mówimy o zadaniu, które w polskiej szkole robi się w podstawówce: pięcioro dzieci, dwóch chłopców, cztery kobiety, trzech studentów zdało egzamin, siedem samochodów. Nie ma tu żadnej pułapki poza samą polszczyzną.

Tam, gdzie odpowiedział, wypadł bardzo dobrze

Reszta pomiaru wygląda dla nowej wersji korzystnie. Fable 5.1 rozwiązał pozostałe pięć zadań poprawnie i był przy tym najszybszy z całej trójki: średnio 6,5 sekundy na odpowiedź, wobec 7,2 sekundy u Fable 5 i 8,2 sekundy u Opusa 5.

Najwyraźniejsza różnica jakościowa pojawiła się w zadaniu o wielkich i małych literach. Oba modele Fable poprawiły zdanie tak, jak każe polska norma: prezydent Warszawy małą literą, urząd miasta jako nazwa nieoficjalna małą, pan dyrektor małą, a Ministerstwo Cyfryzacji i Święta Bożego Narodzenia wielką. Opus 5 zostawił Urząd Miasta i Pana Dyrektora wielkimi literami, czyli popełnił dokładnie ten błąd, który w polskich pismach urzędowych jest najczęstszy.

Drobiazg, który mnie rozbawił: w zadaniu z przecinkami tekst wejściowy był pozbawiony ogonków, bo tak go od początku podaję. Fable 5.1 jako jedyny sam z siebie przywrócił polskie znaki diakrytyczne w całym akapicie, choć nikt go o to nie prosił. Fable 5 i Opus 5 grzecznie zostawiły tekst takim, jaki dostały. Nadgorliwość, ale w dobrą stronę.

Ile to kosztowało

Cały zestaw sześciu zadań kosztował mnie 7 centów na Fable 5.1, prawie 9,6 centa na Fable 5 i niecałe 6 centów na Opusie 5. Fable 5.1 wyszedł taniej od poprzednika mimo identycznej stawki za tokeny, bo zwyczajnie mniej gadał: przy poprawianiu imiesłowów zamknął się w 88 tokenach tam, gdzie Fable 5 potrzebował 257, a Opus 5 aż 358.

Jest jednak wyjątek, który psuje ten obrazek. W zadaniu o wielkich literach Fable 5.1 zużył 675 tokenów wyjścia, żeby zwrócić odpowiedź co do znaku identyczną z tą, którą Fable 5 dał w 359 tokenach. Za dokładnie ten sam wynik zapłaciłem prawie dwa razy więcej. Przy jednym zdaniu to grosze, przy tysiącach zapytań dziennie to już pozycja w budżecie.

Co z tego wynika przy wyborze modelu

Fable 5.1 kosztuje 10 dolarów za milion tokenów wejścia i 50 za milion wyjścia. Opus 5 z tej samej stajni kosztuje 5 i 25, czyli dokładnie połowę. W moim teście polszczyzny droższy model wygrał jednym zadaniem, przegrał jednym przez brak odpowiedzi i był szybszy o półtorej sekundy na zapytanie.

To nie jest wynik, który uzasadnia dwukrotną różnicę w cenie przy pisaniu i redagowaniu po polsku. Jeżeli robisz to na co dzień, tańszy Opus 5 zrobi tę pracę równie dobrze, a przy dłuższych tekstach zostawi w kieszeni połowę rachunku. Fable 5.1 broni się gdzie indziej, w kodzie i długich zadaniach badawczych, których ten zestaw celowo nie dotyka.

Jedno zastrzeżenie, które sam sobie stawiam: to jest pomiar z dnia premiery, na sześciu zadaniach i jednym przebiegu każdego. Nie jest to benchmark z setkami powtórzeń i nie udaje nim być. Pokazuje, jak modele zachowały się na moim biurku pierwszego wieczoru, i pokazuje jedną rzecz, której żadne oficjalne materiały nie pokażą: że nowa wersja potrafi zawiesić się na zadaniu dla ósmoklasisty.

Powtórzę ten sam zestaw za kilka dni, gdy premierowy ruch opadnie, i sprawdzę, czy zacinanie się na liczebnikach zniknie. Jeżeli zostanie, będzie to znaczyło, że problem siedzi w modelu, a nie w obciążeniu serwerów.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Najczęściej zadawane pytania

Czy Fable 5.1 radzi sobie z polszczyzną lepiej od tańszego Opusa 5?

W teście na sześciu zadaniach Fable 5.1 wygrał jednym zadaniem i przegrał jednym przez brak odpowiedzi, będąc przy tym szybszy o półtorej sekundy na zapytanie. Autor stwierdza, że wynik nie uzasadnia dwukrotnej różnicy w cenie przy pisaniu i redagowaniu po polsku.

Dlaczego Fable 5.1 był tańszy w użyciu od swojego poprzednika, skoro stawki za tokeny są identyczne?

Fable 5.1 generował krótsze odpowiedzi - na przykład przy poprawianiu imiesłowów zamknął się w 88 tokenach, podczas gdy Fable 5 potrzebował 257, a Opus 5 aż 358. Wyjątkiem było zadanie o wielkich literach, gdzie Fable 5.1 zużył 675 tokenów wyjścia na odpowiedź identyczną z tą, którą Fable 5 dał w 359 tokenach.

Na czym polegał problem z zawieszaniem się modeli Fable?

Fable 5.1 nie zwrócił żadnej odpowiedzi na zadanie z liczebnikami - nie pomylił się ani nie odmówił, po prostu przez trzy minuty nie wygenerował żadnych tokenów wyjścia. Identyczny problem wystąpił wcześniej u Fable 5, który zawiesił się na zadaniu z odmianą nazw własnych i wisiał przez pięć minut.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie