PROMPTOWY_
Newsy

Wynik 99,9% OpenAI na benchmarku AGI pochodził z własnego narzędzia firmy, nie ze standardowego testu

promptowy@ai:~$ cat news_1

GPT-6 Astra uzyskał 99,9% na ARC-AGI-3 tylko z użyciem własnego adaptera OpenAI, a w standardowym środowisku testowym ten sam model osiągnął 62,7%.

promptowy@ai:~$ cat news_2

ARC Prize wprost odrzuciło tezę o AGI - współzałożyciel Mike Knoop napisał, że 'brakuje dowodów, by nazwać to AGI'.

promptowy@ai:~$ cat news_3

Po publikacji OpenAI kilkukrotnie zmieniało wyniki w swoim poście: wskaźnik halucynacji Astry wahał się między 2% a 4,2%, a wyniki innych modeli również ulegały zmianom.

promptowy@ai:~$ open --full
Czytaj całość

Wynik 99,9% OpenAI na benchmarku AGI pochodził z własnego narzędzia firmy, nie ze standardowego testu

Otwórz artykuł na promptowy.com