연구진은 SAEVerbalizer라는 새로운 프레임워크를 개발하여 LLM의 표현에 희소 오토인코더(SAE) 디코더 방향을 주입하고, LLM의 다운스트림 레이어를 미세 조정하여 자연어 설명을 생성합니다.
SAEVerbalizer는 기존 방식의 표면적인 추론과 대규모 행동 증거 수집의 비효율성을 해결하며, 학습된 설명 기능은 새로운 특징에 일반화되고, 다른 SAE 사전으로 전이 가능합니다.
실험 결과, 여러 방향을 주입하면 의미를 결합한 설명이 생성되고, 개별 방향을 뒤집으면 의미 변화가 발생하는 것을 확인했습니다.