HumeAI 연구팀은 음성 인식 모델이 벤치마크에 최적화되어 실제 성능을 과대평가하는 현상(benchmaxxing)을 측정하는 세 가지 테스트를 공개했어요.
연구 결과, 11개의 오픈소스 음성 인식 모델 중 일부는 VoxPopuli, LibriSpeech 데이터셋의 잘못된 스크립트를 재생산하는 경향을 보였으며, 심지어 오디오와 모순되는 경우에도 그랬어요.
연구팀은 모델이 벤치마크 식별을 위한 음향 단서에 의존하는 것으로 보이며, 이는 실제 음성 인식 성능을 과장하는 결과를 낳고 있다고 분석했어요.