연구진은 LLM 정책 최적화 과정의 안정성-탐색 딜레마를 해결하기 위해 새로운 방법인 환경 정규화(ERPO)를 제안했어요. ERPO는 기존 방식과 달리 입력 측면에서 정규화를 수행하여 쿼리 분포의 변화를 제한하고, 쿼리 가중치를 통해 업데이트를 조절해요. 실험 결과, ERPO는 6개의 수학적 추론 벤치마크에서 기존 방식보다 더 높은 정확도와 안정적인 성능을 보여줬으며, 코드는 GitHub에서 확인할 수 있어요.