🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Rankingi modeli AI są fikcją: wynik zależy od konfiguracji testu, nie od modelu

Badacz V.S. Raghu Parupudi pokazuje, że ten sam model może uzyskać od 31 do 89 procent poprawnych odpowiedzi w zależności wyłącznie od sposobu przeprowadzenia testu. Aż 95,7 procent różnicy między sąsiadującymi modelami w rankingu pochodzi z pytań, które są niestabilne konfiguracyjnie.

3 min czytania
Orange sheet of paper with horizontal lines representing text on a dark blue background (a document icon)

👁 132 przeczytań

Benchmarki wielokrotnego wyboru - takie jak ARC, HellaSwag, MMLU czy TruthfulQA - ustalają pytania i poprawne odpowiedzi, ale nie ustalają tzw. uprzęży ewaluacyjnej (harness). Chodzi o kolejność opcji odpowiedzi, brzmienie promptu oraz sposób odczytywania odpowiedzi modelu: czy pochodzi ona z wygenerowanego tekstu, czy z prawdopodobieństw przypisanych poszczególnym opcjom. Autor traktuje tę uprzęż jako niezależną zmienną i sprawdza, co dokładnie ona zmienia.

Siatka kruchości - jak wyglądał eksperyment

Parupudi skonstruował tzw. siatkę kruchości (fragility grid). Dwanaście modeli open-weight z czterech rodzin odpowiadało na te same 3 679 pytań z czterech benchmarków, ale w 26 równie uzasadnionych konfiguracjach uprzęży. Dla każdej kombinacji model-pytanie-konfiguracja zapisywano jeden bit poprawności. Wagi modeli, pytania i sposób dekodowania (greedy decoding) pozostawały stałe - zmieniała się wyłącznie konfiguracja testu. Dzięki temu porównanie jest wyrównane i pozwala izolować efekt uprzęży.

Wyniki: zakres, a nie punkt

Główny wynik jest taki, że wynik modelu to przedział, a nie jedna liczba. Przykład podany wprost w abstrakcie: gemma4-31b uzyskuje wyniki między 31 a 89 procent - różnica wynikająca wyłącznie z konfiguracji testu, nie ze zmiany modelu. To rozpiętość 58 punktów procentowych na tym samym modelu, przy tych samych pytaniach.

Dalej autor stwierdza, że na pytaniach, na które dwa sąsiadujące w rankingu modele odpowiadają stabilnie, para jest remisem. Natomiast pytania wrażliwe konfiguracyjnie odpowiadają za średnio 95,7 procent różnicy między parą modeli. Innymi słowy: ranking nie mierzy, który model jest lepszy - mierzy, który model lepiej radzi sobie z niestabilnymi pytaniami w konkretnej konfiguracji testu.

Kto wygrywa - zależy od konfiguracji

Cztery z dwunastu testowanych modeli osiągają pierwszą pozycję w rankingu przy jakiejś konfiguracji uprzęży. Autor formułuje to wprost: uprzęż wybiera zwycięzcę. Nie ma neutralnej konfiguracji, która dawałaby obiektywny wynik.

Problem z kompresją benchmarków

Osobny wynik dotyczy tzw. kompresji benchmarków - praktyki wybierania podzbioru pytań, które najlepiej różnicują modele (item discrimination). Autor wykazuje, że dyskryminacyjność pytań koreluje z ich kruchością konfiguracyjną na poziomie 0,28 (95-procentowy przedział ufności: 0,25 do 0,30). Oznacza to, że metody kompresji zamiast usuwać niestabilne pytania, aktywnie je zatrzymują - bo to właśnie one najbardziej różnicują modele.

Co tak naprawdę decyduje o wyniku

Autor wskazuje, że kluczową osią nie jest kolejność opcji odpowiedzi - którą protokoły testowe zwykle kontrolują - lecz sposób punktowania: czy odpowiedź modelu jest odczytywana z wygenerowanego tekstu, czy z per-option likelihoods. To ten wybór dźwiga największy ciężar.

Na koniec Parupudi udostępnia dane per-pytanie oraz skrypt analityczny, który pozwala odtworzyć każdą liczbę z artykułu na zwykłym CPU w ciągu sekund. Proponuje siatkę kruchości jako sprawdzian, który leaderboard powinien przeprowadzić zanim opublikuje ranking.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem to jeden z ważniejszych argumentów przeciwko traktowaniu publicznie dostępnych rankingów modeli jako obiektywnych pomiarów. Liczba, którą widać na leaderboardzie, nie jest właściwością modelu - jest właściwością konfiguracji testu. Fakt, że cztery różne modele mogą zajmować pierwsze miejsce w zależności od tego, jak zadaje się pytania, powinien skłonić zarówno twórców benchmarków, jak i osoby podejmujące decyzje na podstawie rankingów do znacznie ostrożniejszego ich czytania. Artykuł nie mówi, jak naprawić ten problem - proponuje jedynie narzędzie diagnostyczne, nie rozwiązanie.

Źródło: arXiv cs.AI: There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items (dokument z 2026-08-25). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie