› Wyniki modeli rozpoznawania mowy (ASR) na publicznych benchmarkach zbliżają się do poziomu ludzkiego.
› Jednak autorzy tego wpisu - zespół z Hume AI opublikowany na blogu Hugging Face - stawiają niewygodne pytanie: czy modele naprawdę lepiej rozumieją mowę, czy po prostu nauczyły się zdawać konkretne testy?Na czym polega problemZjawisko określane jako "benchmark optimization" lub "benchmaxxing" polega na tym, że model poprawia wyniki na testach nie dlatego, że stał się lepszy w zadaniu, lecz dlatego, że nauczył się wzorców specyficznych dla danego benchmarku.
› W przypadku rozpoznawania mowy było to do tej pory trudne do zmierzenia.
› Autorzy zaproponowali trzy konkretne testy i zastosowali je wobec 11 powszechnie używanych modeli open-source.