StreamHear는 스트리밍 ASR의 도메인 변화 문제 해결을 위한 준지도 학습 파이프라인입니다. 오프라인 교사 모델을 활용하여 음성 데이터를 학습하고, 가짜 레이블을 생성하여 학생 모델을 개선합니다. 스트리밍 ASR 성능을 향상시키기 위해 청크 수준의 단어 배치를 수정하는 동적 프로그래밍 재정렬 단계를 도입했습니다.
금융 통화, 준비된 읽기 음성, 전화 품질 대화 등 4개 데이터 세트에서 StreamHear는 지도 학습 학생 모델을 능가하고 오프라인 교사 모델과의 격차를 좁혔습니다. StreamHear는 레이블이 없는 음성 데이터를 활용하여 스트리밍 ASR의 정확도를 높이는 데 기여합니다.
StreamHear는 스트리밍 ASR 환경에서 데이터 부족 문제를 해결하고, 실시간 음성 인식 시스템의 성능을 향상시키는 데 중요한 역할을 합니다.