Pulse · AI 뉴스

MLLM의 '거절' 능력 향상: RC-GRPO를 활용한 일반화된 지칭 표현 이해

OpenAI · 2026-08-05

연구진은 MLLM이 존재하지 않는 객체를 인식하고 '거절'하는 능력을 향상시키는 GREC(Generalized Referring Expression Comprehension) 문제를 해결하기 위해 RC-GRPO(Refusal-Calibrated Group Relative Policy Optimization)를 제안했어요.

RC-GRPO는 강화 학습 전략으로, 부정 샘플에 대한 정확한 보상 추정을 위해 'None' 출력을 강제하고, 긍정 샘플에 대한 과도한 거절을 방지하는 페널티를 적용하여 정확도와 신뢰성 간 균형을 맞추고 있어요.

세 개의 GREC 벤치마크 실험 결과, RC-GRPO는 기존 방식보다 뛰어난 위치 정확도와 강력한 거절 능력을 동시에 달성했어요.

##MLLM##GREC##강화학습##거절능력##OpenAI
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기