Przejdź do treści
Newsy

UK AISI i EvalEval publikują wyniki benchmarków z pełną dokumentacją

Brytyjski Instytut Bezpieczeństwa AI (AISI) zaczął udostępniać wyniki ewaluacji modeli w ustandaryzowanym formacie, który pozwala innym badaczom weryfikować i porównywać te rezultaty. Współpracuje przy tym z koalicją EvalEval, która buduje wspólną infrastrukturę do raportowania testów.

4 min czytania
UK AISI i EvalEval publikują wyniki benchmarków z pełną dokumentacją

👁 113 przeczytań

Ocenianie modeli językowych ma poważny problem z reprodukowalnością. Wyniki benchmarków są publikowane w różnych formatach, na różnych platformach i często bez informacji potrzebnych do powtórzenia testu. Ponowne uruchomienie ewaluacji bywa zaś prohibitywnie drogie - tak przynajmniej opisuje ten problem sam dokument. Właśnie temu ma zaradzić współpraca między UK AI Security Institute (AISI) a koalicją EvalEval.

Co to jest EvalEval i czym jest schemat EEE

EvalEval to społeczność badawcza, której celem jest poprawa ekosystemu ewaluacji modeli AI. Jej główne projekty to dwa narzędzia: schemat Every Eval Ever (EEE) - wspólny format zapisu wyników ewaluacji - oraz Evaluation Cards, platforma łącząca metadane benchmarku, dane z konkretnego uruchomienia testu i metadane modelu w jeden czytelny rekord. Razem mają ułatwiać rozumienie, kiedy podobne wyniki liczbowe powstały w istotnie różnych warunkach testowych.

AISI współpracuje z EvalEval od jakiegoś czasu - zaczęło się od wspólnego warsztatu przy konferencji NeurIPS 2025. Instytut pomagał też kształtować sam schemat EEE. Teraz współpraca wchodzi w etap praktyczny: AISI zaczyna publikować swoje wyniki przez infrastrukturę EvalEval.

Co dokładnie AISI opublikował

AISI udostępnił zweryfikowane wyniki, kontekst i informacje o konfiguracji dla pięciu benchmarków z głównego eksperymentu swojego artykułu naukowego How Inference Compute Shapes Frontier LLM Evaluation. Są to:

- HealthBench
- FrontierMath
- Humanity’s Last Exam
- SWE-Bench Pro
- Terminal-Bench 2.0

Wyniki dotyczą sześciu modeli z czołówki: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 i GPT-5.4. Dodatkowo opublikowano wyniki z dwóch ewaluacji z obszaru cyberbezpieczeństwa - Cyber CTFs i The Last Ones - które obejmują częściowo inny zestaw modeli.

O czym jest powiązany artykuł naukowy

Wspomniana praca AISI bada, jak wyniki benchmarków zależą od tzw. inference-time compute, czyli od ilości obliczeń wykonywanych w czasie generowania odpowiedzi, oraz od protokołu ewaluacji. Dokument podaje przykład: wyniki modeli na benchmarku Humanity’s Last Exam zmieniają się w zależności od protokołu i ilości tokenów. Kiedy modele otrzymywały informację zwrotną od wyroczni (oracle) po każdej próbie, rozwiązywały kolejne zadania w miarę wzrostu zużycia tokenów. Bez takiej informacji zwrotnej - inaczej. To pokazuje, że samo porównywanie liczb bez znajomości warunków testu jest mylące.

Do czego służy ta infrastruktura w praktyce

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

Idea jest taka, że kiedy wyniki są publicznie dostępne razem z informacjami o konfiguracji, inni badacze mogą dokładniej analizować poszczególne badania i porównywać je z szerszym ekosystemem. Tam, gdzie innym raportom brakuje takich szczegółów, publikacje pokroju tej od AISI mają służyć jako zweryfikowane punkty odniesienia. Dokument wymienia trzy grupy, do których skierowane jest to narzędzie: twórcy modeli (mogą raportować wyniki), twórcy ewaluacji (mogą dokumentować benchmarki w schemacie EEE) oraz badacze z obszaru polityki i zarządzania AI (mogą przeglądać Evaluation Cards i badać stan raportowania ewaluacji jako całości).

AISI, poza tą współpracą, buduje też własne narzędzia do bardziej efektywnej i statystycznie rygorystycznej ewaluacji - dokument wymienia OptStop i HiBayES, ale szczegółów tych projektów nie zawiera.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

To jest krok w kierunku, który od dawna jest potrzebny - ustandaryzowania tego, jak raportuje się wyniki testów modeli. Fakt, że instytucja rządowa z UK publikuje dane w otwartym, wspólnym formacie zamiast w kolejnym PDF-ie, to dobry znak. Moje zastrzeżenie jest jednak takie: sam dokument jest w istocie komunikatem prasowym o partnerstwie, a nie opisem technicznym ani wynikami badań. Nie wiadomo z niego, ile organizacji faktycznie używa schematu EEE, jak trudno go wdrożyć ani czy branża pójdzie za tym przykładem. Wartość tej inicjatywy zależeć będzie od tego, czy inni duzi gracze - nie tylko AISI - zaczną raportować w ten sam sposób. Na razie mamy jeden instytut i pięć benchmarków.

Źródło: Hugging Face: How UK AISI and EvalEval Are Making Benchmark Results Reproducible (dokument z 2026-09-22). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok n8n Cloud Starter 320 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie