연구진은 오프라인 강화 학습에서 목표 정책을 평가할 때 발생하는 잔여 점유율 불균형 문제를 해결하기 위해 벨만 교정 방법을 제시했어요.
등장한 이소성 벨만 교정은 초기 점유율 비율 추정치의 순위를 유지하면서 추정치의 크기와 모양을 수정하는 모델에 구애받지 않는 후처리 방법이에요.
연구 결과, 이 방법은 통계적 오차 내에서 초기 추정치의 최적 단조 변환에 해당하는 작은 교정 오차와 KL 위험을 달성하며, 정책 가치 추정 등 하위 목표 점유율 함수에 대한 보장을 제공해요.
이소성 벨만 교정은 점유율 불균형을 줄이고, 초매개변수 튜닝, 모델 선택, 조기 종료를 위한 직접적인 감독 검증 손실이 부족한 문제를 해결하는 데 기여해요.