연구진은 SpeechLLM을 포함한 현재 연설 번역 시스템이 청결한 텍스트로 학습되어 불유창성(침묵, 잘못된 시작)을 제거하는 경향이 있다고 밝혔습니다. 이러한 불유창성은 의미를 담고 있으며, 청결하게 정리하면 의미가 손실됩니다.
Uh-Mazing 벤치마크를 통해 영어에서 8개 타겟 언어로의 인간 번역된 불유창성 주석 Switchboard 연설을 연구한 결과, 잘못된 시작과 자기 수정이 번역 품질 저하의 주요 원인임을 확인했습니다.
추론 시간 디코딩을 통해 재학습 없이 불유창성을 보존할 수 있으며, 벤치마크와 코드를 공개했습니다.