연구진은 에이전트가 경험을 통해 스스로 학습하고 정책에 통합하는 문제를 해결하기 위해 Latent On-Policy Self-Distillation (LOPD)를 제안했어요.
LOPD는 기존 OPSD 방식의 한계를 극복하기 위해 경험으로부터 직접 학습된 잠재적 컨텍스트를 활용하여 에이전트 진화를 가능하게 해요.
LOPD는 RLVR, SDPO, Skill-SD 등 기존 방식보다 뛰어난 성능과 학습 효율성을 보여주며, 잠재적 컨텍스트 학습의 중요성을 입증했어요.