PROMPTOWY_
Newsy

UK AISI i EvalEval publikują wyniki benchmarków z pełną dokumentacją

promptowy@ai:~$ cat news_1

Ocenianie modeli językowych ma poważny problem z reprodukowalnością.

promptowy@ai:~$ cat news_2

Wyniki benchmarków są publikowane w różnych formatach, na różnych platformach i często bez informacji potrzebnych do powtórzenia testu.

promptowy@ai:~$ cat news_3

Ponowne uruchomienie ewaluacji bywa zaś prohibitywnie drogie - tak przynajmniej opisuje ten problem sam dokument.

promptowy@ai:~$ cat news_4

Właśnie temu ma zaradzić współpraca między UK AI Security Institute (AISI) a koalicją EvalEval.Co to jest EvalEval i czym jest schemat EEEEvalEval to społeczność badawcza, której celem jest poprawa ekosystemu ewaluacji modeli AI.

promptowy@ai:~$ open --full
Czytaj całość

UK AISI i EvalEval publikują wyniki benchmarków z pełną dokumentacją

Otwórz artykuł na promptowy.com