Cloudflare Clef: otwarty model decyzyjny. Sprawdziłem go na RTX 4090
Clef i Clef-flash od Cloudflare nie piszą tekstu, tylko oceniają dozwolone odpowiedzi. Licencja Apache-2.0, Workers AI i mój test na RTX 4090.

👁 119 przeczytań
Cloudflare wypuścił 1 października 2026 dwa otwarte modele decyzyjne: Clef (27B) i Clef-flash (9B). Nie piszą tekstu - dostają sytuację i listę pytań z dozwolonymi odpowiedziami, a zwracają prawdopodobieństwo każdej opcji. Wagi są na Hugging Face na licencji Apache-2.0, a hostowana wersja kosztuje w Workers AI od 0,09 USD za milion tokenów. Clef-flash uruchomiłem na swoim RTX 4090 - na 30 polskich zgłoszeniach klientów trafił dział w 30 przypadkach, w medianie 112 ms. Całą kategorię i porównanie z innymi modelami opisałem w przewodniku Modele decyzyjne AI.
Co dokładnie wydał Cloudflare
- Clef - 27 mld parametrów, zbudowany na zamrożonym Qwen3.8-27B. Wagi ważą 55 GB w bf16.
- Clef-flash - 9 mld parametrów, na Qwen3.5-9B, 19 GB wag. Przeznaczony do decyzji, w których liczy się opóźnienie.
- Licencja Apache-2.0 dla obu, zgodnie z licencją modeli bazowych Qwen. Można używać komercyjnie.
- Hosting w Workers AI pod nazwami
@cf/cloudflare/clefi@cf/cloudflare/clef-flash. - Usługa dostrajania (RL fine-tuning) - na razie jako współpraca z zespołem inżynierów Cloudflare, później jako samoobsługowa platforma.
Autorami wpisu na blogu Cloudflare są Michelle Chen, Alex Reneau i Kevin Flansburg. Nazwa nawiązuje do klucza muzycznego (ang. clef), który ustala, jak czytać nuty na pięciolinii - a litery „CF” to skrót Cloudflare.
Jak działa „joint schema head”
Klasyczny model językowy, nawet zmuszony do odpowiedzi w JSON, generuje ją token po tokenie. Clef tego nie robi:
- Przepuszcza wejście (tekst, JSON, obrazy lub wideo) przez model Qwen tylko raz, w trybie prefill.
- Ukryte stany trafiają do małej sieci, którą Cloudflare nazywa joint schema head. W Clef-flash ma ona 4 warstwy i szerokość 1024.
- Głowa dla każdej dozwolonej opcji wyciąga z wejścia pasujące fragmenty, pozwala pytaniom „zajrzeć” do siebie nawzajem i dopiero wtedy ocenia opcje.
- Wynik to jeden logit na opcję. Softmax w obrębie pytania daje prawdopodobieństwa.
Cloudflare trenował samą głowę i adaptery LoRA rangi 256, a model Qwen pozostał zamrożony. Do funkcji straty dołożył wynik Briera, który karze za źle skalibrowaną pewność, a jako drugi etap metodę RLCD (Reinforcement Learning for Calibrated Decisions), dającą częściowe punkty za odpowiedzi „obok” na skalach. Dane treningowe to wewnętrzne, syntetyczne zbiory Cloudflare.
Format zapytań: zgodny z Jevem
Clef mówi tym samym API, co Jev od TypeSafe, który 15 września otworzył kategorię modeli decyzyjnych (pisałem o nim w tekście TypeSafe i model Jev). Żądanie ma pole state i słownik questions z trzema typami: choice (wybór z listy), noul (tak/nie) i score (skala). Cloudflare podkreśla, że kod napisany pod System One przełączy się na Clef zmianą adresu. Ten sam format przyjęli też Kev Jareda Palmera i Strands Decider od AWS, wydany tego samego dnia co Clef.
Od siebie Cloudflare dodaje dwie rzeczy: enkoder obrazu (Clef może np. ocenić, czy paragon na zdjęciu jest czytelny) i okno 64 tys. tokenów. Limity w Workers AI: od 1 do 64 pytań w jednym żądaniu, do 4 obrazów po 4 MiB, całe żądanie do 13 MiB.
Liczby, które podaje Cloudflare
| Test | Clef | Clef-flash |
|---|---|---|
| BFCL (wybór funkcji, dokładne trafienie) | 98,47 | 98,76 |
| API-Bank (trafność) | 91,93 | 93,11 |
| BANKING77 (intencje klientów banku, macro-F1) | 94,20 | 90,93 |
| CLINC150+OOS (intencje, macro-F1) | 97,43 | 66,77 |
| Mediana opóźnienia w Workers AI | 209,3 ms | 38,8 ms |
| Opóźnienie p95 | 238,6 ms | 122,4 ms |
Pełne tabele z 43 zestawów i porównaniem z innymi modelami decyzyjnymi Cloudflare opublikował na karcie modelu i na stronie z wynikami Decision Index. Warto zwrócić uwagę na CLINC150: mały Clef-flash wyraźnie odstaje tam od dużego, więc „flash” nie jest po prostu tańszą kopią.
Przykład z produkcji: zespół Threat Intelligence Cloudflare klasyfikuje domeny. Clef razem z pobraniem i wyrenderowaniem strony potrzebował 2,2 s, a gpt-oss-120b w tym samym procesie 4,7 s - i zwrócił tylko dwie kategorie zamiast pełnego rozkładu.
Ile to kosztuje
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
| Model | Cena za mln tokenów wejścia | Neurony za mln tokenów | Darmowo dziennie (10 000 neuronów) |
|---|---|---|---|
| Clef | 0,24 USD | 21 818 | ok. 458 tys. tokenów |
| Clef-flash | 0,09 USD | 8182 | ok. 1,2 mln tokenów |
Płaci się tylko za wejście, bo model nie generuje wyjścia. Darmowy przydział 10 000 neuronów dziennie obowiązuje w planach Workers Free i Paid; powyżej płaci się 0,011 USD za 1000 neuronów. Do Workers AI potrzebne jest konto Cloudflare - na potrzeby testu go nie zakładałem, więc wersję hostowaną znam tylko z dokumentacji. Więcej o samej firmie i jej darmowym planie piszę w przewodniku Cloudflare.
Sprawdziłem Clef-flash na RTX 4090
- Pobranie: 19 GB z oficjalnego repozytorium
Cloudflare/clef-flash. Załadowanie z mojego wolnego dysku USB trwało około 7,5 minuty. - Pamięć: 18,3 GB VRAM w szczycie, więc mieści się na karcie 24 GB.
- Wynik: 30 polskich zgłoszeń (płatności, dostawa, zwroty, konto, awarie, sprzedaż) - dział trafiony 30 na 30, mediana 112 ms na decyzję z dwoma pytaniami.
- Dla porównania Gemma 4 12B w Ollamie z wymuszonym JSON-em też trafiła 30/30, ale w 413 ms, a Qwen3.8 27B w 762 ms.
- Uwaga: przy pytaniu „czy pilne?” Clef-flash przy progu 0,5 dawał fałszywe alarmy. Przy progu 0,95 pomylił się tylko 2 razy na 30. Próg trzeba dobrać na własnych danych.
Dużego Clef nie uruchomiłem: 55 GB w bf16 nie zmieści się na 24 GB, oficjalnej kwantyzacji nie ma, a własny kod głowy wyklucza Ollamę i pliki GGUF. Pełne wyniki z ośmioma modelami, wykresem i wnioskami są w przewodniku Modele decyzyjne AI, a o tym, jak zmusić zwykły model do odpowiedzi w schemacie, piszę w tekście Structured output.
Dlaczego to ważne
W ciągu trzech tygodni modele decyzyjne przeszły drogę od jednego zamkniętego API do kilku otwartych modeli z tym samym formatem: Kev, Clef, Strands Decider, a OpenAI pokazało na DevDay własne Decisions API (opisuję je przy Agents API). Dla kogoś, kto buduje agentów AI albo automatyzuje helpdesk, to oznacza, że małe rozstrzygnięcia - który dział, czy eskalować, które narzędzie - można zabrać dużemu modelowi i robić je taniej, szybciej i z prawdziwą miarą pewności. Cloudflare dokłada do tego hosting na brzegu sieci i dostrajanie na własnych danych, więc celuje w firmy, które chcą mieć cały proces u jednego dostawcy.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Źródła
- Cloudflare Blog: Introducing Clef (1.10.2026)
- Karta modelu Clef-flash i Clef
- Cennik Workers AI
- Własny test: 5.10.2026, RTX 4090, PyTorch 2.11, transformers 5.18.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
