› Ocenianie modeli językowych ma poważny problem z reprodukowalnością.
› Wyniki benchmarków są publikowane w różnych formatach, na różnych platformach i często bez informacji potrzebnych do powtórzenia testu.
› Ponowne uruchomienie ewaluacji bywa zaś prohibitywnie drogie - tak przynajmniej opisuje ten problem sam dokument.
› Właśnie temu ma zaradzić współpraca między UK AI Security Institute (AISI) a koalicją EvalEval.Co to jest EvalEval i czym jest schemat EEEEvalEval to społeczność badawcza, której celem jest poprawa ekosystemu ewaluacji modeli AI.