PROMPTOWY_
Newsy

Rankingi modeli AI są fikcją: wynik zależy od konfiguracji testu, nie od modelu

promptowy@ai:~$ cat news_1

Benchmarki wielokrotnego wyboru - takie jak ARC, HellaSwag, MMLU czy TruthfulQA - ustalają pytania i poprawne odpowiedzi, ale nie ustalają tzw.

promptowy@ai:~$ cat news_2

uprzęży ewaluacyjnej (harness).

promptowy@ai:~$ cat news_3

Chodzi o kolejność opcji odpowiedzi, brzmienie promptu oraz sposób odczytywania odpowiedzi modelu: czy pochodzi ona z wygenerowanego tekstu, czy z prawdopodobieństw przypisanych poszczególnym opcjom.

promptowy@ai:~$ cat news_4

Autor traktuje tę uprzęż jako niezależną zmienną i sprawdza, co dokładnie ona zmienia.Siatka kruchości - jak wyglądał eksperymentParupudi skonstruował tzw.

promptowy@ai:~$ open --full
Czytaj całość

Rankingi modeli AI są fikcją: wynik zależy od konfiguracji testu, nie od modelu

Otwórz artykuł na promptowy.com