연구진이 언어 모델의 해석 가능성을 능력 저하 없이 높이는 새로운 훈련 방식을 제시했어요. 3가지 규모의 컴퓨팅 환경에서 해석 가능성이 모델 성능과 함께 향상되는 것을 확인했어요. Steerling-8B 모델은 출력 토큰에 대한 입력 토큰, 개념, 훈련 데이터의 관련성을 명확하게 제시하며, 이를 통해 모델의 행동을 수정할 수 있어요.
Steerling-8B 모델은 기존 모델 대비 경쟁력을 유지하면서도 더 적은 컴퓨팅 자원으로 훈련 가능했어요. 모델 표현이 인간이 이해할 수 있는 개념과 더욱 일치하는 것을 확인했어요.