연구진은 MLLM이 존재하지 않는 객체를 인식하고 '거절'하는 능력을 향상시키는 GREC(Generalized Referring Expression Comprehension) 문제를 해결하기 위해 RC-GRPO(Refusal-Calibrated Group Relative Policy Optimization)를 제안했어요.
RC-GRPO는 강화 학습 전략으로, 부정 샘플에 대한 정확한 보상 추정을 위해 'None' 출력을 강제하고, 긍정 샘플에 대한 과도한 거절을 방지하는 페널티를 적용하여 정확도와 신뢰성 간 균형을 맞추고 있어요.
세 개의 GREC 벤치마크 실험 결과, RC-GRPO는 기존 방식보다 뛰어난 위치 정확도와 강력한 거절 능력을 동시에 달성했어요.