Rankingi modeli AI są fikcją: wynik zależy od konfiguracji testu, nie od modelu
Badacz V.S. Raghu Parupudi pokazuje, że ten sam model może uzyskać od 31 do 89 procent poprawnych odpowiedzi w zależności wyłącznie od sposobu przeprowadzenia testu. Aż 95,7 procent różnicy między sąsiadującymi modelami w rankingu pochodzi z pytań, które są niestabilne konfiguracyjnie.
👁 132 przeczytań
Benchmarki wielokrotnego wyboru - takie jak ARC, HellaSwag, MMLU czy TruthfulQA - ustalają pytania i poprawne odpowiedzi, ale nie ustalają tzw. uprzęży ewaluacyjnej (harness). Chodzi o kolejność opcji odpowiedzi, brzmienie promptu oraz sposób odczytywania odpowiedzi modelu: czy pochodzi ona z wygenerowanego tekstu, czy z prawdopodobieństw przypisanych poszczególnym opcjom. Autor traktuje tę uprzęż jako niezależną zmienną i sprawdza, co dokładnie ona zmienia.
Siatka kruchości - jak wyglądał eksperyment
Parupudi skonstruował tzw. siatkę kruchości (fragility grid). Dwanaście modeli open-weight z czterech rodzin odpowiadało na te same 3 679 pytań z czterech benchmarków, ale w 26 równie uzasadnionych konfiguracjach uprzęży. Dla każdej kombinacji model-pytanie-konfiguracja zapisywano jeden bit poprawności. Wagi modeli, pytania i sposób dekodowania (greedy decoding) pozostawały stałe - zmieniała się wyłącznie konfiguracja testu. Dzięki temu porównanie jest wyrównane i pozwala izolować efekt uprzęży.
Wyniki: zakres, a nie punkt
Główny wynik jest taki, że wynik modelu to przedział, a nie jedna liczba. Przykład podany wprost w abstrakcie: gemma4-31b uzyskuje wyniki między 31 a 89 procent - różnica wynikająca wyłącznie z konfiguracji testu, nie ze zmiany modelu. To rozpiętość 58 punktów procentowych na tym samym modelu, przy tych samych pytaniach.
Dalej autor stwierdza, że na pytaniach, na które dwa sąsiadujące w rankingu modele odpowiadają stabilnie, para jest remisem. Natomiast pytania wrażliwe konfiguracyjnie odpowiadają za średnio 95,7 procent różnicy między parą modeli. Innymi słowy: ranking nie mierzy, który model jest lepszy - mierzy, który model lepiej radzi sobie z niestabilnymi pytaniami w konkretnej konfiguracji testu.
Kto wygrywa - zależy od konfiguracji
Cztery z dwunastu testowanych modeli osiągają pierwszą pozycję w rankingu przy jakiejś konfiguracji uprzęży. Autor formułuje to wprost: uprzęż wybiera zwycięzcę. Nie ma neutralnej konfiguracji, która dawałaby obiektywny wynik.
Problem z kompresją benchmarków
Osobny wynik dotyczy tzw. kompresji benchmarków - praktyki wybierania podzbioru pytań, które najlepiej różnicują modele (item discrimination). Autor wykazuje, że dyskryminacyjność pytań koreluje z ich kruchością konfiguracyjną na poziomie 0,28 (95-procentowy przedział ufności: 0,25 do 0,30). Oznacza to, że metody kompresji zamiast usuwać niestabilne pytania, aktywnie je zatrzymują - bo to właśnie one najbardziej różnicują modele.
Co tak naprawdę decyduje o wyniku
Autor wskazuje, że kluczową osią nie jest kolejność opcji odpowiedzi - którą protokoły testowe zwykle kontrolują - lecz sposób punktowania: czy odpowiedź modelu jest odczytywana z wygenerowanego tekstu, czy z per-option likelihoods. To ten wybór dźwiga największy ciężar.
Na koniec Parupudi udostępnia dane per-pytanie oraz skrypt analityczny, który pozwala odtworzyć każdą liczbę z artykułu na zwykłym CPU w ciągu sekund. Proponuje siatkę kruchości jako sprawdzian, który leaderboard powinien przeprowadzić zanim opublikuje ranking.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co z tego wynika
Moim zdaniem to jeden z ważniejszych argumentów przeciwko traktowaniu publicznie dostępnych rankingów modeli jako obiektywnych pomiarów. Liczba, którą widać na leaderboardzie, nie jest właściwością modelu - jest właściwością konfiguracji testu. Fakt, że cztery różne modele mogą zajmować pierwsze miejsce w zależności od tego, jak zadaje się pytania, powinien skłonić zarówno twórców benchmarków, jak i osoby podejmujące decyzje na podstawie rankingów do znacznie ostrożniejszego ich czytania. Artykuł nie mówi, jak naprawić ten problem - proponuje jedynie narzędzie diagnostyczne, nie rozwiązanie.
Źródło: arXiv cs.AI: There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items (dokument z 2026-08-25). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


