연구진은 저자원 방언의 경우 단일 실행 비교에서 얻는 성과가 재현되지 않을 수 있음을 Garhwali를 예시로 들어 보였어요. 공식 VAANI 데이터셋 분할을 기반으로 최초의 재현 가능한 멀티 시드 ASR 벤치마크를 구축하여 시드별 출력과 유의성 검정을 제공했어요. Focal CTC나 마트라 가중치 목표 함수가 표준 CTC를 능가하지 못하는 등, 기존의 성과가 취약하다는 점을 확인했어요.
w2v-BERT 2.0과 표준 CTC를 결합하면 5개의 시드에서 47.0% WER을 달성하며, 더 큰 MMS-1B 모델보다 우수한 성능을 보여줬어요. 모델 파라미터 수보다 사전 훈련 설계가 성능을 좌우한다는 점이 확인됐고, 속도 증강은 일관성 있는 소폭의 이득을 제공했어요. 공식 분할에서의 멀티 시드 평가는 실제 성과와 시드 노이즈를 분리하는 데 도움이 돼요.
연구 결과는 저자원 언어 ASR 평가 시 멀티 시드 평가의 중요성을 강조하며, 모델 성능 평가 방식에 대한 새로운 시각을 제시해요.