Pulse · AI 뉴스

LLM 정책 최적화의 안정성-탐색 딜레마 극복: 환경 정규화

alibaba · 2026-08-24

연구진은 LLM 정책 최적화 과정의 안정성-탐색 딜레마를 해결하기 위해 새로운 방법인 환경 정규화(ERPO)를 제안했어요.

ERPO는 기존 방식과 달리 입력 측면에서 정규화를 수행하여 쿼리 분포의 변화를 제한하고, 쿼리 가중치를 통해 업데이트를 조절해요.

실험 결과, ERPO는 6개의 수학적 추론 벤치마크에서 기존 방식보다 더 높은 정확도와 안정적인 성능을 보여줬으며, 코드는 GitHub에서 확인할 수 있어요.

##LLM##정책최적화##환경정규화##ERPO
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기