› Benchmarki wielokrotnego wyboru - takie jak ARC, HellaSwag, MMLU czy TruthfulQA - ustalają pytania i poprawne odpowiedzi, ale nie ustalają tzw.
› uprzęży ewaluacyjnej (harness).
› Chodzi o kolejność opcji odpowiedzi, brzmienie promptu oraz sposób odczytywania odpowiedzi modelu: czy pochodzi ona z wygenerowanego tekstu, czy z prawdopodobieństw przypisanych poszczególnym opcjom.
› Autor traktuje tę uprzęż jako niezależną zmienną i sprawdza, co dokładnie ona zmienia.Siatka kruchości - jak wyglądał eksperymentParupudi skonstruował tzw.