Wynik 99,9% OpenAI na benchmarku AGI pochodził z własnego narzędzia firmy, nie ze standardowego testu
ARC Prize opublikowało dwa wyniki dla modelu GPT-6 Astra na tym samym benchmarku: 99,9% przy użyciu adaptera OpenAI i 62,7% przy standardowym narzędziu testowym.
👁 122 przeczytań
Organizacja ARC Prize, twórca benchmarku ARC-AGI-3, opublikowała dwa różne wyniki dla modelu GPT-6 Astra w tym samym teście: 99,9% i 62,7%. Różnica nie wynika z błędu ani z metodologii rywali - pochodzi od organizacji, która benchmark zbudowała.
Kluczem jest tak zwany harness, czyli oprogramowanie otaczające model. Decyduje ono o tym, jakie narzędzia ma do dyspozycji, co zapamiętuje między zapytaniami i jak zarządzany jest kontekst rozmowy. Te same parametry modelu, inne rusztowanie - inny wynik.
Google · Twoje źródłaPromptowy wyżej w Twoim Google - jednym kliknięciemDodaj do preferowanych źródeł →Co faktycznie mierzyły oba testy
ARC Prize uruchomiło Astrę na dwa sposoby. Standardowy harness daje każdemu modelowi minimalistyczny, jednolity interfejs i pozwala mu samodzielnie decydować, co zachować w pamięci. Provider Adapter OpenAI zachowuje natomiast wewnętrzny stan rozumowania modelu między zapytaniami i kompresuje dłuższe rozmowy. W standardowym środowisku przy maksymalnym poziomie rozumowania Astra uzyskała 62,7% i kosztowała 26 098 dolarów. Z adapterem OpenAI przy wysokim poziomie rozumowania - 99,9% za 18 817 dolarów.
Jeden wiersz w tabeli wyników mówi więcej niż jakikolwiek komentarz: po ustawieniu wysiłku rozumowania na zero wewnątrz adaptera OpenAI Astra nadal osiąga 96,7%. To o 34 punkty procentowe więcej niż ten sam model przy maksymalnym rozumowaniu w standardowym harnesie. Rusztowanie przebiło suwak intensywności rozumowania.
Wynik 99,9%, który obiegł media - w tym pierwotne doniesienia TNW - był zestawiany z 7,8% modelu GPT-5.6 Sol. Problem w tym, że to nie jest porównanie jabłek do jabłek: Astra była testowana adapterem OpenAI, Sol standardowym harnesem. Uczciwe zestawienie to 62,7% do 7,8% - wciąż ogromna różnica, ale ta właśnie jest poparta benchmarkiem.
ARC Prize wprost odrzuciło wniosek, który OpenAI z tych liczb wyciągnęło.
„Brakuje nam dowodów, by nazwać to AGI” - napisał współzałożyciel Mike Knoop.
Do historii doszedł jeszcze jeden wątek. Serwis Fortune wykrył, że wyniki w poście OpenAI zmieniały się po publikacji. Wskaźnik halucynacji Astry wynosił najpierw 4,2%, potem spadł do 2%, by ostatecznie wrócić do 4,2%. Wynik Anthropic na FrontierMath zmalał z 87,8% do 78%, a następnie ustabilizował się na 83%. Wynik Sol na ExploitBench podwoił się z 5,5% do 11,5% - OpenAI poinformowało Fortune, że rozważa cofnięcie tej zmiany, bo 11,5% odpowiada poziomowi rozumowania niedostępnemu komercyjnie. Wersja wysłana mediom przed publikacją podawała wynik ARC-AGI-3 jako 98,6%; w wersji opublikowanej pojawiło się 99,99%.
Od teraz ARC Prize zapowiedziało, że będzie publikować wyniki obu harnesów równolegle.
Cały tydzień w AI, w jednym mailu
Wybrane premiery, narzędzia i analizy. Raz w tygodniu, prosto do skrzynki.
Zapisz się za darmo →


