✨ Świeża dostawa•nowe kody na kinetyka.pl: Gemini Pro 18 mies. 170 zł•Cursor, ElevenLabs, Lovable i więcej, roczne plany AI w ułamku ceny Zobacz →
Przejdź do treści
Artykuły

LMArena: co to jest, jak czytać ranking modeli AI i gdzie myli

Arena (dawniej LMArena) zbiera 8 mln głosów ludzi w ślepych pojedynkach modeli. Jak czytać wynik i przedział ufności, gdzie ranking myli i jak wybrać model.

6 min czytania
LMArena: co to jest, jak czytać ranking modeli AI i gdzie myli

👁 122 przeczytań

// w skrócie
  • LMArena (od stycznia 2026 Arena, adres arena.ai) mierzy preferencje ludzi w ślepych pojedynkach modeli, a nie poprawność odpowiedzi ani wyniki testów zadaniowych.
  • Czołówka tablicy tekstowej z 13 września 2026 to Claude Fable 5 (1506 pkt), Claude Opus 4.6 (1505 pkt) i Claude Opus 4.7 (1502 pkt), które przy przedziałach ±4-5 pkt są statystycznie nierozróżnialne.
  • W kwietniu 2025 roku Meta testowała prywatnie 27 wariantów Llama 4, a dwa identyczne modele wystawione pod różnymi nazwami dostały wyniki różniące się o 17 punktów.

LMArena (od stycznia 2026 po prostu Arena, adres arena.ai) to najczęściej cytowany ranking modeli AI. Nie mierzy testów z zadaniami, tylko zbiera głosy ludzi, którzy zadają pytanie dwóm anonimowym modelom i wskazują lepszą odpowiedź. Z ponad 8 milionów takich głosów powstaje tablica z wynikiem punktowym dla każdego modelu. Wyjaśniam, skąd biorą się te liczby, jak czytać przedziały ufności i dlaczego pierwsze miejsce w Arenie nie znaczy, że model najlepiej rozwiąże Twoje zadanie.

W skrócie

Arena to najlepszy publiczny pomiar tego, które odpowiedzi ludzie lubią, a nie tego, które są najbardziej poprawne. Tablica tekstowa (stan z 13 września 2026) opiera się na 8 146 274 głosach dla 402 modeli. Czołówka mieści się w kilku punktach: Claude Fable 5 (1506), Claude Opus 4.6 (1505) i Claude Opus 4.7 (1502), więc przy przedziałach ufności rzędu ±4-5 punktów te modele są statystycznie nierozróżnialne. Ranking jest darmowy i przydaje się do porównania dwóch modeli na własnym zadaniu. Nie nadaje się do wyboru modelu do polskich tekstów bez własnego testu, bo głosy w większości pochodzą z pytań po angielsku i chińsku.

Co to jest LMArena i kto za nią stoi

Projekt zaczął się w 2023 roku jako Chatbot Arena na Uniwersytecie Kalifornijskim w Berkeley, w grupie LMSYS. Twórcy, Wei-Lin Chiang i Anastasios Angelopoulos, opisali metodę w pracy naukowej z marca 2024 roku, gdy platforma miała 240 tysięcy głosów. W kwietniu 2025 roku projekt stał się firmą Arena Intelligence Inc., w maju 2025 zebrał 100 mln USD (wycena 600 mln USD), a w styczniu 2026 kolejne 150 mln USD przy wycenie 1,7 mld USD. 28 stycznia 2026 marka LMArena zmieniła się na Arena.

Firma zarabia na płatnych ewaluacjach dla laboratoriów AI (usługa AI Evaluations od września 2025) i według własnych danych z czerwca 2026 ma 100 mln USD rocznego przychodu. Pisaliśmy o tym w tekście o przychodach Areny. Strona podaje ponad 354 mln sesji, a laboratoria testują tam modele przed premierą pod kryptonimami: OpenAI sprawdzało GPT-5 jako „summit”.

Jak powstaje ranking

Mechanizm ma trzy kroki:

  • Pojedynek. W trybie Battle wpisujesz pytanie, dostajesz dwie odpowiedzi od dwóch anonimowych modeli i głosujesz: A lepsze, B lepsze, remis albo obie złe. Nazwy modeli odsłaniają się dopiero po głosie.
  • Model Bradleya-Terry’ego. Z milionów par wygrana/przegrana algorytm wylicza dla każdego modelu jedną liczbę, tak że różnica wyników przekłada się na prawdopodobieństwo wygranej w pojedynku. To ta sama rodzina metod co Elo w szachach, tylko liczona na całym zbiorze naraz, a nie sekwencyjnie.
  • Przedział ufności. Przy każdym wyniku jest wartość ±. Model z 3 tysiącami głosów ma ±11, model z 70 tysiącami ±4. Jeśli przedziały dwóch modeli na siebie nachodzą, ich kolejność w tabeli jest przypadkiem.

Tablica ma też przełącznik „Style Control”. Po jego włączeniu algorytm odejmuje wpływ długości odpowiedzi, liczby nagłówków i list, żeby zmierzyć treść, a nie opakowanie. To ważne, bo ludzie częściej głosują na dłuższe odpowiedzi z wypunktowaniami.

Tablice: tekst, obraz, wideo, kod, WebDev

Arena prowadzi kilkanaście osobnych rankingów: Text, Agent, WebDev (budowa strony z opisu), Image-to-WebDev, Vision (pytania o obraz), Document, Search, Text-to-Image, Image Edit, Text-to-Video, Image-to-Video i Video Edit. Każda tablica ma własne głosy i własne miejsca: model najlepszy w tekście może być w środku stawki w WebDev. Kolumny do czytania:

KolumnaCo znaczyJak czytać
Rank (UB)miejsce z uwzględnieniem górnej granicy przedziałukilka modeli może mieć to samo miejsce
Scorewynik Bradleya-Terry’ego10 punktów różnicy to ok. 51,4% szans na wygraną
95% CIprzedział ufnościim mniej głosów, tym szerszy
Votesliczba pojedynkówponiżej 5 tys. wynik jest wstępny

Przykład z tablicy tekstowej z 13 września 2026: muse-spark-1.2 od Meta ma 1500 punktów przy ±11 i 3227 głosach, a claude-opus-4-6 ma 1497 przy ±3 i 75 878 głosach. Na papierze Meta jest wyżej, statystycznie to remis.

Gdzie ranking myli

Styl kontra treść. Głosujący widzą odpowiedź przez kilkanaście sekund. Nagradzają pewny ton, długość i formatowanie, rzadko sprawdzają fakty. Dlatego Arena nie mierzy halucynacji; do tego służą osobne testy, jak nasz test halucynacji po polsku.

Język polski. Tablica ma filtr językowy, ale polskich pojedynków jest za mało, żeby przedziały ufności były wąskie. Wynik ogólny odzwierciedla angielski i chiński. Jeśli piszesz po polsku, zajrzyj do naszego porównania modeli po polsku.

Gra laboratoriów. W kwietniu 2025 roku Meta wystawiła w Arenie eksperymentalną wersję Llama 4 Maverick, inną niż ta, którą później udostępniła publicznie. Praca „The Leaderboard Illusion” (Cohere, AI2, Princeton, Stanford) policzyła, że przed premierą Llama 4 Meta testowała prywatnie 27 wariantów tekstowych (43 z tablicą obrazów), a Google i OpenAI dostały odpowiednio 19,2% i 20,4% wszystkich danych z platformy, podczas gdy 83 modele otwarte razem 29,7%. Dwa identyczne modele wystawione pod różnymi nazwami dostały wyniki różniące się o 17 punktów. Arena odpowiedziała 9 maja 2025 roku, broniąc testów przedpremierowych, i zmieniła zasady publikowania wyników wycofanych wariantów.

Jak używać Areny w praktyce

Nie przepłacaj za te subskrypcje

Prowadzę sklep z rocznymi dostępami do narzędzi AI - te same konta, o których piszę wyżej, tylko taniej niż w cenniku producenta.

Zobacz, co jest dostępne

  • Wejdź na arena.ai, wybierz tryb Side by Side i wskaż dwa konkretne modele, które rozważasz. Wklej własne zadanie: mail do klienta, fragment umowy, funkcję do poprawienia.
  • Powtórz z 5-10 różnymi zadaniami. Jeden pojedynek to anegdota, dziesięć to już sygnał.
  • Na tablicy włącz Style Control i filtr kategorii (np. „Coding” albo „Longer Query”), bo model dobry w krótkich pytaniach może przegrywać w długich.
  • Sprawdź kolumnę Votes. Nowy model z 3 tys. głosów może za miesiąc spaść o kilka miejsc.

Co miesiąc publikujemy przegląd tablicy, ostatni to ranking z lipca 2026. Podstawy działania modeli wyjaśnia tekst co to jest LLM.

Najczęstsze pytania

Czy LMArena jest darmowa?

Tak. Pojedynki, tryb porównania obok siebie i czat bezpośredni z wybranym modelem są bezpłatne. Bez logowania dostajesz ograniczoną liczbę wiadomości, po zalogowaniu więcej. więcej. Płatna jest tylko usługa ewaluacji dla firm.

Czy da się testować po polsku?

Tak, modele odpowiadają po polsku, a Twój głos trafia do puli. Ranking filtrowany po polskim ma jednak szerokie przedziały ufności, bo głosów jest mało.

Jak często ranking się zmienia?

Tablica jest przeliczana co kilka dni, nowe modele pojawiają się zwykle w dniu premiery albo kilka dni po. Data ostatniej aktualizacji jest podana pod tablicą.

Czy wynik w Arenie mówi, który model jest „najmądrzejszy”?

Nie. Mówi, które odpowiedzi ludzie częściej wybierali w ślepej próbie. To miara preferencji, nie poprawności. To opinia redakcji: do wyboru modelu do pracy Arena jest dobrym punktem wyjścia, a złym punktem końcowym.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

AUTOR I WYDAWCA

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony

🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 400 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× ‹ powiększenie ›