연구진은 강화 학습에서 검증 가능한 보상을 활용한 대규모 언어 모델 에이전트 훈련 방법인 GRSD(Group-Reflective Self-Distillation)를 제안했어요. GRSD는 정책 자체의 검증된 실행 경로에서 역량에 부합하고 결과에 차별화된 지침을 파생시켜 기존 방법의 한계를 극복해요.
각 프롬프트에 대해 정책은 on-policy 그룹 내의 각 검증된 경로를 반사하고 성공 및 실패한 실행 경로의 반사 결과가 대비되도록 스톱 그래디언트 스냅샷을 생성하여 그룹 수준의 특권 지침을 구성해요.
다양한 에이전트 환경과 모델 규모에서 실험한 결과 GRSD는 경쟁 모델보다 우수한 성능을 보였으며, 새로운 작업에도 효과적으로 일반화되었어요.