✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

Cloudflare Clef: otwarty model decyzyjny. Sprawdziłem go na RTX 4090

Clef i Clef-flash od Cloudflare nie piszą tekstu, tylko oceniają dozwolone odpowiedzi. Licencja Apache-2.0, Workers AI i mój test na RTX 4090.

5 min czytania
Logo Cloudflare i napis Clef - otwarty model decyzyjny

👁 119 przeczytań

Cloudflare wypuścił 1 października 2026 dwa otwarte modele decyzyjne: Clef (27B) i Clef-flash (9B). Nie piszą tekstu - dostają sytuację i listę pytań z dozwolonymi odpowiedziami, a zwracają prawdopodobieństwo każdej opcji. Wagi są na Hugging Face na licencji Apache-2.0, a hostowana wersja kosztuje w Workers AI od 0,09 USD za milion tokenów. Clef-flash uruchomiłem na swoim RTX 4090 - na 30 polskich zgłoszeniach klientów trafił dział w 30 przypadkach, w medianie 112 ms. Całą kategorię i porównanie z innymi modelami opisałem w przewodniku Modele decyzyjne AI.

Co dokładnie wydał Cloudflare

  • Clef - 27 mld parametrów, zbudowany na zamrożonym Qwen3.8-27B. Wagi ważą 55 GB w bf16.
  • Clef-flash - 9 mld parametrów, na Qwen3.5-9B, 19 GB wag. Przeznaczony do decyzji, w których liczy się opóźnienie.
  • Licencja Apache-2.0 dla obu, zgodnie z licencją modeli bazowych Qwen. Można używać komercyjnie.
  • Hosting w Workers AI pod nazwami @cf/cloudflare/clef i @cf/cloudflare/clef-flash.
  • Usługa dostrajania (RL fine-tuning) - na razie jako współpraca z zespołem inżynierów Cloudflare, później jako samoobsługowa platforma.

Autorami wpisu na blogu Cloudflare są Michelle Chen, Alex Reneau i Kevin Flansburg. Nazwa nawiązuje do klucza muzycznego (ang. clef), który ustala, jak czytać nuty na pięciolinii - a litery „CF” to skrót Cloudflare.

Jak działa „joint schema head”

Klasyczny model językowy, nawet zmuszony do odpowiedzi w JSON, generuje ją token po tokenie. Clef tego nie robi:

  1. Przepuszcza wejście (tekst, JSON, obrazy lub wideo) przez model Qwen tylko raz, w trybie prefill.
  2. Ukryte stany trafiają do małej sieci, którą Cloudflare nazywa joint schema head. W Clef-flash ma ona 4 warstwy i szerokość 1024.
  3. Głowa dla każdej dozwolonej opcji wyciąga z wejścia pasujące fragmenty, pozwala pytaniom „zajrzeć” do siebie nawzajem i dopiero wtedy ocenia opcje.
  4. Wynik to jeden logit na opcję. Softmax w obrębie pytania daje prawdopodobieństwa.

Cloudflare trenował samą głowę i adaptery LoRA rangi 256, a model Qwen pozostał zamrożony. Do funkcji straty dołożył wynik Briera, który karze za źle skalibrowaną pewność, a jako drugi etap metodę RLCD (Reinforcement Learning for Calibrated Decisions), dającą częściowe punkty za odpowiedzi „obok” na skalach. Dane treningowe to wewnętrzne, syntetyczne zbiory Cloudflare.

Format zapytań: zgodny z Jevem

Clef mówi tym samym API, co Jev od TypeSafe, który 15 września otworzył kategorię modeli decyzyjnych (pisałem o nim w tekście TypeSafe i model Jev). Żądanie ma pole state i słownik questions z trzema typami: choice (wybór z listy), noul (tak/nie) i score (skala). Cloudflare podkreśla, że kod napisany pod System One przełączy się na Clef zmianą adresu. Ten sam format przyjęli też Kev Jareda Palmera i Strands Decider od AWS, wydany tego samego dnia co Clef.

Od siebie Cloudflare dodaje dwie rzeczy: enkoder obrazu (Clef może np. ocenić, czy paragon na zdjęciu jest czytelny) i okno 64 tys. tokenów. Limity w Workers AI: od 1 do 64 pytań w jednym żądaniu, do 4 obrazów po 4 MiB, całe żądanie do 13 MiB.

Liczby, które podaje Cloudflare

TestClefClef-flash
BFCL (wybór funkcji, dokładne trafienie)98,4798,76
API-Bank (trafność)91,9393,11
BANKING77 (intencje klientów banku, macro-F1)94,2090,93
CLINC150+OOS (intencje, macro-F1)97,4366,77
Mediana opóźnienia w Workers AI209,3 ms38,8 ms
Opóźnienie p95238,6 ms122,4 ms

Pełne tabele z 43 zestawów i porównaniem z innymi modelami decyzyjnymi Cloudflare opublikował na karcie modelu i na stronie z wynikami Decision Index. Warto zwrócić uwagę na CLINC150: mały Clef-flash wyraźnie odstaje tam od dużego, więc „flash” nie jest po prostu tańszą kopią.

Przykład z produkcji: zespół Threat Intelligence Cloudflare klasyfikuje domeny. Clef razem z pobraniem i wyrenderowaniem strony potrzebował 2,2 s, a gpt-oss-120b w tym samym procesie 4,7 s - i zwrócił tylko dwie kategorie zamiast pełnego rozkładu.

Ile to kosztuje

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

ModelCena za mln tokenów wejściaNeurony za mln tokenówDarmowo dziennie (10 000 neuronów)
Clef0,24 USD21 818ok. 458 tys. tokenów
Clef-flash0,09 USD8182ok. 1,2 mln tokenów

Płaci się tylko za wejście, bo model nie generuje wyjścia. Darmowy przydział 10 000 neuronów dziennie obowiązuje w planach Workers Free i Paid; powyżej płaci się 0,011 USD za 1000 neuronów. Do Workers AI potrzebne jest konto Cloudflare - na potrzeby testu go nie zakładałem, więc wersję hostowaną znam tylko z dokumentacji. Więcej o samej firmie i jej darmowym planie piszę w przewodniku Cloudflare.

Sprawdziłem Clef-flash na RTX 4090

  • Pobranie: 19 GB z oficjalnego repozytorium Cloudflare/clef-flash. Załadowanie z mojego wolnego dysku USB trwało około 7,5 minuty.
  • Pamięć: 18,3 GB VRAM w szczycie, więc mieści się na karcie 24 GB.
  • Wynik: 30 polskich zgłoszeń (płatności, dostawa, zwroty, konto, awarie, sprzedaż) - dział trafiony 30 na 30, mediana 112 ms na decyzję z dwoma pytaniami.
  • Dla porównania Gemma 4 12B w Ollamie z wymuszonym JSON-em też trafiła 30/30, ale w 413 ms, a Qwen3.8 27B w 762 ms.
  • Uwaga: przy pytaniu „czy pilne?” Clef-flash przy progu 0,5 dawał fałszywe alarmy. Przy progu 0,95 pomylił się tylko 2 razy na 30. Próg trzeba dobrać na własnych danych.

Dużego Clef nie uruchomiłem: 55 GB w bf16 nie zmieści się na 24 GB, oficjalnej kwantyzacji nie ma, a własny kod głowy wyklucza Ollamę i pliki GGUF. Pełne wyniki z ośmioma modelami, wykresem i wnioskami są w przewodniku Modele decyzyjne AI, a o tym, jak zmusić zwykły model do odpowiedzi w schemacie, piszę w tekście Structured output.

Dlaczego to ważne

W ciągu trzech tygodni modele decyzyjne przeszły drogę od jednego zamkniętego API do kilku otwartych modeli z tym samym formatem: Kev, Clef, Strands Decider, a OpenAI pokazało na DevDay własne Decisions API (opisuję je przy Agents API). Dla kogoś, kto buduje agentów AI albo automatyzuje helpdesk, to oznacza, że małe rozstrzygnięcia - który dział, czy eskalować, które narzędzie - można zabrać dużemu modelowi i robić je taniej, szybciej i z prawdziwą miarą pewności. Cloudflare dokłada do tego hosting na brzegu sieci i dostrajanie na własnych danych, więc celuje w firmy, które chcą mieć cały proces u jednego dostawcy.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →

Źródła

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›