PROMPTOWY_
Newsy

Modele ASR rozpoznają benchmarki po dźwięku i piszą to, czego nie słyszą

promptowy@ai:~$ cat news_1

Wyniki modeli rozpoznawania mowy (ASR) na publicznych benchmarkach zbliżają się do poziomu ludzkiego.

promptowy@ai:~$ cat news_2

Jednak autorzy tego wpisu - zespół z Hume AI opublikowany na blogu Hugging Face - stawiają niewygodne pytanie: czy modele naprawdę lepiej rozumieją mowę, czy po prostu nauczyły się zdawać konkretne testy?Na czym polega problemZjawisko określane jako "benchmark optimization" lub "benchmaxxing" polega na tym, że model poprawia wyniki na testach nie dlatego, że stał się lepszy w zadaniu, lecz dlatego, że nauczył się wzorców specyficznych dla danego benchmarku.

promptowy@ai:~$ cat news_3

W przypadku rozpoznawania mowy było to do tej pory trudne do zmierzenia.

promptowy@ai:~$ cat news_4

Autorzy zaproponowali trzy konkretne testy i zastosowali je wobec 11 powszechnie używanych modeli open-source.

promptowy@ai:~$ open --full
Czytaj całość

Modele ASR rozpoznają benchmarki po dźwięku i piszą to, czego nie słyszą

Otwórz artykuł na promptowy.com