Pulse · AI 뉴스

Latent On-Policy Self-Distillation: 경험 기반 학습을 통한 에이전트 진화

arXiv cs.CL · 2026-08-13

연구진은 에이전트가 경험을 통해 스스로 학습하고 정책에 통합하는 문제를 해결하기 위해 Latent On-Policy Self-Distillation (LOPD)를 제안했어요.

LOPD는 기존 OPSD 방식의 한계를 극복하기 위해 경험으로부터 직접 학습된 잠재적 컨텍스트를 활용하여 에이전트 진화를 가능하게 해요.

LOPD는 RLVR, SDPO, Skill-SD 등 기존 방식보다 뛰어난 성능과 학습 효율성을 보여주며, 잠재적 컨텍스트 학습의 중요성을 입증했어요.

##에이전트##자기학습##강화학습##LOPD
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기