연구진은 자기 증류(SD) 방식의 한계를 분석했어요. SD는 기존 솔루션에 대한 특권 정보(PI)를 활용해 학생 모델을 학습시키지만, 어려운 문제에서는 성능 향상이 미미해요. 연구 결과, SD는 정답과 무관한 토큰에 집중하며, 모델은 더 나은 추론 능력을 갖추지 못했어요. PI 편향으로 인해 모델은 특정 정답 경로에 맞춰 학습되어, 정답 여부와 상관없이 낮은 정보 토큰에 집중하는 경향이 있어요.
연구진은 PI 편향 점수(PI Bias Score)를 통해 이러한 현상을 정량화했어요. 학생 모델은 정답을 결정하는 토큰 대신 불필요한 토큰에 집중하게 되어, 추론 과정에서 망설임을 겪는 토큰을 과도하게 penalize 해요. 결과적으로 SD는 과제 성공과 동떨어진 신호를 최적화하게 돼요.
연구진은 자기 증류 방식의 한계를 지적하며, 더 나은 학습 신호 설계의 필요성을 강조했어요.