› Benchmarki miały porządkować rozmowę o sztucznej inteligencji.
› Problem w tym, że najmocniejsze modele zaczynają wyrastać ponad narzędzia, którymi próbujemy je mierzyć.
› Przez lata wyniki testów dawały wygodną iluzję kontroli.
› Model zdobywał określony procent w zadaniach matematycznych, programistycznych, językowych albo bezpieczeństwa.