LMArena: co to jest, jak czytać ranking modeli AI i gdzie myli
Arena (dawniej LMArena) zbiera 8 mln głosów ludzi w ślepych pojedynkach modeli. Jak czytać wynik i przedział ufności, gdzie ranking myli i jak wybrać model.

👁 123 przeczytań
- LMArena (od stycznia 2026 Arena, adres arena.ai) mierzy preferencje ludzi w ślepych pojedynkach modeli, a nie poprawność odpowiedzi ani wyniki testów zadaniowych.
- Czołówka tablicy tekstowej z 13 września 2026 to Claude Fable 5 (1506 pkt), Claude Opus 4.6 (1505 pkt) i Claude Opus 4.7 (1502 pkt), które przy przedziałach ±4-5 pkt są statystycznie nierozróżnialne.
- W kwietniu 2025 roku Meta testowała prywatnie 27 wariantów Llama 4, a dwa identyczne modele wystawione pod różnymi nazwami dostały wyniki różniące się o 17 punktów.
LMArena (od stycznia 2026 po prostu Arena, adres arena.ai) to najczęściej cytowany ranking modeli AI. Nie mierzy testów z zadaniami, tylko zbiera głosy ludzi, którzy zadają pytanie dwóm anonimowym modelom i wskazują lepszą odpowiedź. Z ponad 8 milionów takich głosów powstaje tablica z wynikiem punktowym dla każdego modelu. Wyjaśniam, skąd biorą się te liczby, jak czytać przedziały ufności i dlaczego pierwsze miejsce w Arenie nie znaczy, że model najlepiej rozwiąże Twoje zadanie.
W skrócie
Arena to najlepszy publiczny pomiar tego, które odpowiedzi ludzie lubią, a nie tego, które są najbardziej poprawne. Tablica tekstowa (stan z 13 września 2026) opiera się na 8 146 274 głosach dla 402 modeli. Czołówka mieści się w kilku punktach: Claude Fable 5 (1506), Claude Opus 4.6 (1505) i Claude Opus 4.7 (1502), więc przy przedziałach ufności rzędu ±4-5 punktów te modele są statystycznie nierozróżnialne. Ranking jest darmowy i przydaje się do porównania dwóch modeli na własnym zadaniu. Nie nadaje się do wyboru modelu do polskich tekstów bez własnego testu, bo głosy w większości pochodzą z pytań po angielsku i chińsku.
Co to jest LMArena i kto za nią stoi
Projekt zaczął się w 2023 roku jako Chatbot Arena na Uniwersytecie Kalifornijskim w Berkeley, w grupie LMSYS. Twórcy, Wei-Lin Chiang i Anastasios Angelopoulos, opisali metodę w pracy naukowej z marca 2024 roku, gdy platforma miała 240 tysięcy głosów. W kwietniu 2025 roku projekt stał się firmą Arena Intelligence Inc., w maju 2025 zebrał 100 mln USD (wycena 600 mln USD), a w styczniu 2026 kolejne 150 mln USD przy wycenie 1,7 mld USD. 28 stycznia 2026 marka LMArena zmieniła się na Arena.
Firma zarabia na płatnych ewaluacjach dla laboratoriów AI (usługa AI Evaluations od września 2025) i według własnych danych z czerwca 2026 ma 100 mln USD rocznego przychodu. Pisaliśmy o tym w tekście o przychodach Areny. Strona podaje ponad 354 mln sesji, a laboratoria testują tam modele przed premierą pod kryptonimami: OpenAI sprawdzało GPT-5 jako „summit”.
Jak powstaje ranking
Mechanizm ma trzy kroki:
- Pojedynek. W trybie Battle wpisujesz pytanie, dostajesz dwie odpowiedzi od dwóch anonimowych modeli i głosujesz: A lepsze, B lepsze, remis albo obie złe. Nazwy modeli odsłaniają się dopiero po głosie.
- Model Bradleya-Terry’ego. Z milionów par wygrana/przegrana algorytm wylicza dla każdego modelu jedną liczbę, tak że różnica wyników przekłada się na prawdopodobieństwo wygranej w pojedynku. To ta sama rodzina metod co Elo w szachach, tylko liczona na całym zbiorze naraz, a nie sekwencyjnie.
- Przedział ufności. Przy każdym wyniku jest wartość ±. Model z 3 tysiącami głosów ma ±11, model z 70 tysiącami ±4. Jeśli przedziały dwóch modeli na siebie nachodzą, ich kolejność w tabeli jest przypadkiem.
Tablica ma też przełącznik „Style Control”. Po jego włączeniu algorytm odejmuje wpływ długości odpowiedzi, liczby nagłówków i list, żeby zmierzyć treść, a nie opakowanie. To ważne, bo ludzie częściej głosują na dłuższe odpowiedzi z wypunktowaniami.
Tablice: tekst, obraz, wideo, kod, WebDev
Arena prowadzi kilkanaście osobnych rankingów: Text, Agent, WebDev (budowa strony z opisu), Image-to-WebDev, Vision (pytania o obraz), Document, Search, Text-to-Image, Image Edit, Text-to-Video, Image-to-Video i Video Edit. Każda tablica ma własne głosy i własne miejsca: model najlepszy w tekście może być w środku stawki w WebDev. Kolumny do czytania:
| Kolumna | Co znaczy | Jak czytać |
|---|---|---|
| Rank (UB) | miejsce z uwzględnieniem górnej granicy przedziału | kilka modeli może mieć to samo miejsce |
| Score | wynik Bradleya-Terry’ego | 10 punktów różnicy to ok. 51,4% szans na wygraną |
| 95% CI | przedział ufności | im mniej głosów, tym szerszy |
| Votes | liczba pojedynków | poniżej 5 tys. wynik jest wstępny |
Przykład z tablicy tekstowej z 13 września 2026: muse-spark-1.2 od Meta ma 1500 punktów przy ±11 i 3227 głosach, a claude-opus-4-6 ma 1497 przy ±3 i 75 878 głosach. Na papierze Meta jest wyżej, statystycznie to remis.
Gdzie ranking myli
Styl kontra treść. Głosujący widzą odpowiedź przez kilkanaście sekund. Nagradzają pewny ton, długość i formatowanie, rzadko sprawdzają fakty. Dlatego Arena nie mierzy halucynacji; do tego służą osobne testy, jak nasz test halucynacji po polsku.
Język polski. Tablica ma filtr językowy, ale polskich pojedynków jest za mało, żeby przedziały ufności były wąskie. Wynik ogólny odzwierciedla angielski i chiński. Jeśli piszesz po polsku, zajrzyj do naszego porównania modeli po polsku.
Gra laboratoriów. W kwietniu 2025 roku Meta wystawiła w Arenie eksperymentalną wersję Llama 4 Maverick, inną niż ta, którą później udostępniła publicznie. Praca „The Leaderboard Illusion” (Cohere, AI2, Princeton, Stanford) policzyła, że przed premierą Llama 4 Meta testowała prywatnie 27 wariantów tekstowych (43 z tablicą obrazów), a Google i OpenAI dostały odpowiednio 19,2% i 20,4% wszystkich danych z platformy, podczas gdy 83 modele otwarte razem 29,7%. Dwa identyczne modele wystawione pod różnymi nazwami dostały wyniki różniące się o 17 punktów. Arena odpowiedziała 9 maja 2025 roku, broniąc testów przedpremierowych, i zmieniła zasady publikowania wyników wycofanych wariantów.
Jak używać Areny w praktyce
Nie przepłacaj za te subskrypcje
Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.
- Wejdź na arena.ai, wybierz tryb Side by Side i wskaż dwa konkretne modele, które rozważasz. Wklej własne zadanie: mail do klienta, fragment umowy, funkcję do poprawienia.
- Powtórz z 5-10 różnymi zadaniami. Jeden pojedynek to anegdota, dziesięć to już sygnał.
- Na tablicy włącz Style Control i filtr kategorii (np. „Coding” albo „Longer Query”), bo model dobry w krótkich pytaniach może przegrywać w długich.
- Sprawdź kolumnę Votes. Nowy model z 3 tys. głosów może za miesiąc spaść o kilka miejsc.
Co miesiąc publikujemy przegląd tablicy, ostatni to ranking z lipca 2026. Podstawy działania modeli wyjaśnia tekst co to jest LLM.
Najczęstsze pytania
Czy LMArena jest darmowa?
Tak. Pojedynki, tryb porównania obok siebie i czat bezpośredni z wybranym modelem są bezpłatne. Bez logowania dostajesz ograniczoną liczbę wiadomości, po zalogowaniu więcej. więcej. Płatna jest tylko usługa ewaluacji dla firm.
Czy da się testować po polsku?
Tak, modele odpowiadają po polsku, a Twój głos trafia do puli. Ranking filtrowany po polskim ma jednak szerokie przedziały ufności, bo głosów jest mało.
Jak często ranking się zmienia?
Tablica jest przeliczana co kilka dni, nowe modele pojawiają się zwykle w dniu premiery albo kilka dni po. Data ostatniej aktualizacji jest podana pod tablicą.
Czy wynik w Arenie mówi, który model jest „najmądrzejszy”?
Nie. Mówi, które odpowiedzi ludzie częściej wybierali w ślepej próbie. To miara preferencji, nie poprawności. To opinia redakcji: do wyboru modelu do pracy Arena jest dobrym punktem wyjścia, a złym punktem końcowym.
Źródła i data sprawdzenia
- Tablica tekstowa Arena (stan z 13 września 2026)arena.ai
- praca „Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference”arxiv.org
- praca „The Leaderboard Illusion”arxiv.org
- TechCrunch o rundzie 150 mln USDtechcrunch.com
- omówienie krytyki u Simona Willisonasimonwillison.net
Sprawdzone 25 września 2026.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →
