Pulse · AI 뉴스

에이전트 강화 학습을 위한 그룹 반사적 자기 증류

Group-Reflective Self-Distillation · 2026-07-30

연구진은 강화 학습에서 검증 가능한 보상을 활용한 대규모 언어 모델 에이전트 훈련 방법인 GRSD(Group-Reflective Self-Distillation)를 제안했어요. GRSD는 정책 자체의 검증된 실행 경로에서 역량에 부합하고 결과에 차별화된 지침을 파생시켜 기존 방법의 한계를 극복해요.

각 프롬프트에 대해 정책은 on-policy 그룹 내의 각 검증된 경로를 반사하고 성공 및 실패한 실행 경로의 반사 결과가 대비되도록 스톱 그래디언트 스냅샷을 생성하여 그룹 수준의 특권 지침을 구성해요.

다양한 에이전트 환경과 모델 규모에서 실험한 결과 GRSD는 경쟁 모델보다 우수한 성능을 보였으며, 새로운 작업에도 효과적으로 일반화되었어요.

##강화학습##에이전트##자기증류##LLM
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기