🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

LivingArena: modele AI wzajemnie się egzaminują, by wykryć swoje słabości

Badacze z Xingyu Chen i współautorzy zaproponowali system, w którym modele językowe nawzajem zadają sobie pytania, celowo szukając słabych punktów rywala. Turniej 3600 rund z udziałem dziesięciu modeli ujawnił wyraźną asymetrię: dobry uczeń nie zawsze jest dobrym egzaminatorem.

3 min czytania
Orange document icon with text lines on a dark blue background.

👁 123 przeczytań

Standardowe benchmarki mają dwa problemy: są drogie w aktualizacji i nie dostosowują pytań do konkretnych słabości danego modelu. Autorzy pracy - Xingyu Chen, Rui Wang, Zhaopeng Tu i Liefeng Bo - postawili inne pytanie: czy modele językowe mogą samodzielnie odkrywać nawzajem swoje luki i przekuć te obserwacje w proces ewaluacji?

Na czym polega LivingArena

LivingArena to zautomatyzowana platforma, którą autorzy nazywają „peer-probing framework”. Modele kolejno wcielają się w dwie role: pytającego i odpowiadającego. Pytający analizuje historię poprzednich interakcji, identyfikuje potencjalne słabości przeciwnika, a następnie konstruuje celowane, weryfikowalne pytania, które mają te słabości obnażyć. Cały proces jest zautomatyzowany - nie wymaga ludzkiego tworzenia nowych zadań testowych.

Autorzy przeprowadzili turniej obejmujący 3600 rund z udziałem dziesięciu modeli. Więcej szczegółów na temat tego, które konkretnie modele wzięły udział, nie pojawia się w dostępnym abstrakcie.

Kluczowe odkrycia

Najważniejszy wynik to „wyraźna asymetria ról” (z angielskiego: „clear role asymmetry”): silne modele jako odpowiadający nie są automatycznie rzetelnymi pytającymi. Autorzy wskazują dwa konkretne powody - mocny model może generować pytania wewnętrznie niespójne albo nie potrafić zweryfikować własnych wzorcowych odpowiedzi.

Drugi istotny wniosek dotyczy dynamiki słabości. Gdy pytający raz obnażył porażkę rywala w jakiejś dziedzinie, ma tendencję do kontynuowania testów w tej samej kategorii zdolności. Co ważniejsze, słabość odpowiadającego ujawnia się ponownie na niezależnie wygenerowanych pytaniach - w tym na pytaniach napisanych przez zupełnie inne modele. To sugeruje, że wykryte słabości są trwałe i specyficzne dla danego modelu, a nie wynikają z przypadkowego doboru pytań.

Dlaczego benchmark nazywa się „living”

Autorzy podkreślają, że trudność testów ewoluuje wraz z możliwościami modeli - w przeciwieństwie do statycznych zestawów pytań, które z czasem stają się zbyt łatwe. System rozdziela też dwie odrębne umiejętności: trafne odpowiadanie i rzetelne konstruowanie pytań. Zdaniem autorów LivingArena nadaje się do trzech zastosowań: śledzenia rozwoju modeli, red-teamingu (czyli celowego szukania podatności) oraz koordynacji w systemach wieloagentowych uwzględniających różnice w zdolnościach poszczególnych modeli.

Kod źródłowy systemu jest publicznie dostępny pod adresem wskazanym w pracy. Praca została zgłoszona 19 czerwca 2026 roku, a jej poprawiona wersja ukazała się 2 września 2026 roku.

Czego w dokumencie nie ma

Dostępny tekst to wyłącznie abstrakt - nie zawiera szczegółowych wyników liczbowych dla poszczególnych modeli, nie wymienia nazw dziesięciu uczestniczących systemów ani nie opisuje metodyki weryfikacji poprawności odpowiedzi.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co z tego wynika

Moim zdaniem najciekawsze jest odkrycie asymetrii ról - intuicja podpowiadałaby, że najlepszy model powinien być najlepszym egzaminatorem, a okazuje się, że to dwie różne kompetencje. Jeśli wyniki z pełnej pracy to potwierdzają, oznacza to, że dotychczasowe testy, w których silniejszy model ocenia słabszego, mogą dawać wyniki obarczone systematycznym błędem. Pomysł samoaktualizującego się benchmarku jest intrygujący, ale bez dostępu do pełnych danych nie mogę ocenić, jak duże są opisane efekty i czy system nie tworzy własnych ślepych plam - na przykład pomijając kategorie, w których wszystkie testowane modele są jednakowo słabe.

Źródło: arXiv cs.AI: LivingArena: Do LLMs Know What Other LLMs Don’t? Peer-Probing as Scalable Evaluation (dokument z 2026-09-03). To omówienie powstało na podstawie pełnego tekstu dokumentu, nie relacji innych mediów.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie