🔥 5 promocji w KinetyceGemini Pro 170 zł -91%Adobe CC 169 zł -84%Brain.fm 109 zł -70%i 2 więcej do 13.09 Zobacz →
Przejdź do treści
Newsy

Wynik 99,9% OpenAI na benchmarku AGI pochodził z własnego narzędzia firmy, nie ze standardowego testu

ARC Prize opublikowało dwa wyniki dla modelu GPT-6 Astra na tym samym benchmarku: 99,9% przy użyciu adaptera OpenAI i 62,7% przy standardowym narzędziu testowym.

2 min czytania
Wynik 99,9% OpenAI na benchmarku AGI pochodził z własnego narzędzia firmy, nie ze standardowego testu

👁 122 przeczytań

Organizacja ARC Prize, twórca benchmarku ARC-AGI-3, opublikowała dwa różne wyniki dla modelu GPT-6 Astra w tym samym teście: 99,9% i 62,7%. Różnica nie wynika z błędu ani z metodologii rywali - pochodzi od organizacji, która benchmark zbudowała.

Kluczem jest tak zwany harness, czyli oprogramowanie otaczające model. Decyduje ono o tym, jakie narzędzia ma do dyspozycji, co zapamiętuje między zapytaniami i jak zarządzany jest kontekst rozmowy. Te same parametry modelu, inne rusztowanie - inny wynik.

Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł

Co faktycznie mierzyły oba testy

ARC Prize uruchomiło Astrę na dwa sposoby. Standardowy harness daje każdemu modelowi minimalistyczny, jednolity interfejs i pozwala mu samodzielnie decydować, co zachować w pamięci. Provider Adapter OpenAI zachowuje natomiast wewnętrzny stan rozumowania modelu między zapytaniami i kompresuje dłuższe rozmowy. W standardowym środowisku przy maksymalnym poziomie rozumowania Astra uzyskała 62,7% i kosztowała 26 098 dolarów. Z adapterem OpenAI przy wysokim poziomie rozumowania - 99,9% za 18 817 dolarów.

Jeden wiersz w tabeli wyników mówi więcej niż jakikolwiek komentarz: po ustawieniu wysiłku rozumowania na zero wewnątrz adaptera OpenAI Astra nadal osiąga 96,7%. To o 34 punkty procentowe więcej niż ten sam model przy maksymalnym rozumowaniu w standardowym harnesie. Rusztowanie przebiło suwak intensywności rozumowania.

Wynik 99,9%, który obiegł media - w tym pierwotne doniesienia TNW - był zestawiany z 7,8% modelu GPT-5.6 Sol. Problem w tym, że to nie jest porównanie jabłek do jabłek: Astra była testowana adapterem OpenAI, Sol standardowym harnesem. Uczciwe zestawienie to 62,7% do 7,8% - wciąż ogromna różnica, ale ta właśnie jest poparta benchmarkiem.

ARC Prize wprost odrzuciło wniosek, który OpenAI z tych liczb wyciągnęło.

„Brakuje nam dowodów, by nazwać to AGI” - napisał współzałożyciel Mike Knoop.

Do historii doszedł jeszcze jeden wątek. Serwis Fortune wykrył, że wyniki w poście OpenAI zmieniały się po publikacji. Wskaźnik halucynacji Astry wynosił najpierw 4,2%, potem spadł do 2%, by ostatecznie wrócić do 4,2%. Wynik Anthropic na FrontierMath zmalał z 87,8% do 78%, a następnie ustabilizował się na 83%. Wynik Sol na ExploitBench podwoił się z 5,5% do 11,5% - OpenAI poinformowało Fortune, że rozważa cofnięcie tej zmiany, bo 11,5% odpowiada poziomowi rozumowania niedostępnemu komercyjnie. Wersja wysłana mediom przed publikacją podawała wynik ARC-AGI-3 jako 98,6%; w wersji opublikowanej pojawiło się 99,99%.

Od teraz ARC Prize zapowiedziało, że będzie publikować wyniki obu harnesów równolegle.

// Newsletter

Cały tydzień w AI, w jednym mailu

Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.

Zapisz się za darmo →
Za darmo. Wypisujesz się jednym kliknięciem.
// czytaj też

Podobne tematy na Promptowym

Piotr Olszewski

Piotr Olszewski

ADMINISTRATOR

Piotr Olszewski - twórca i autor Promptowego, polskiego serwisu o sztucznej inteligencji. Codziennie śledzi premiery modeli, narzędzia i regulacje AI, i tłumaczy je prostym, konkretnym językiem.

// mapa strony
🛒 Sklep Kinetyka Google AI Gemini Pro 170 zł CapCut Pro 460 zł/rok Lovable Pro 336 zł/rok Zobacz wszystko →
promptowy w liczbach 0tekstów w archiwum0newsów z ostatnich 7 dni0modeli wideo w obserwatorium0zagadek w grach
× powiększenie