본문은 화자 분리 기술(speaker diarization)의 개념, 작동 방식, 관련 기술과의 차이점, 활용 사례 등을 설명해요.
화자 분리는 음성 스트림을 누가 말했는지에 따라 구간으로 나누어 '화자 A 0:00~0:42, 화자 B 0:42~1:15'와 같이 라벨링하는 기술이에요.
화자 분리 기술은 회의록 작성, 콜센터 분석, 인터뷰 기록, 팟캐스트 편집, 법적 기록 등 다양한 분야에서 활용되며, 음성 활동 감지(VAD), 분할, 임베딩 추출, 클러스터링의 4단계 파이프라인으로 작동해요.