연구진은 GRPO 기반 LLM 언러닝에서 타겟 지식 억제와 비타겟 유틸리티 보존 외에, 타겟과 유사한 프롬프트에 대한 답변 수준을 조절하는 보상 명세 문제를 연구했어요.
네 가지 보상 설계를 비교한 결과, 최적화 성공이 실제 행동 언러닝과 일치하지 않는다는 점을 발견했는데, 이는 벤치마크 프로브의 한계 때문일 수 있어요.
연구 결과는 GRPO의 정책 지원 한계, 벤치마크 프로브의 변화 감지 실패, 그리고 최적화 과정에서 광범위한 주제 답변을 선택하는 보상 설계의 문제점을 시사합니다.