Pulse · AI 뉴스

GRPO 기반 LLM 언러닝에서 보상 명세와 벤치마크 신뢰성에 대한 경험적 연구

GRPO · 2026-08-18

연구진은 GRPO 기반 LLM 언러닝에서 타겟 지식 억제와 비타겟 유틸리티 보존 외에, 타겟과 유사한 프롬프트에 대한 답변 수준을 조절하는 보상 명세 문제를 연구했어요.

네 가지 보상 설계를 비교한 결과, 최적화 성공이 실제 행동 언러닝과 일치하지 않는다는 점을 발견했는데, 이는 벤치마크 프로브의 한계 때문일 수 있어요.

연구 결과는 GRPO의 정책 지원 한계, 벤치마크 프로브의 변화 감지 실패, 그리고 최적화 과정에서 광범위한 주제 답변을 선택하는 보상 설계의 문제점을 시사합니다.

##LLM##언러닝##GRPO##보상설계##벤치마크
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기