Pulse · AI 뉴스

반복되는 올바른 해결책: GRPO를 위한 희귀도 인지 신용 재분배

GRPO · 2026-08-04

연구진은 강화 학습에서 반복되는 올바른 해결책이 구조적 편향을 유발한다는 점을 발견했어요. 이를 해결하기 위해 클러스터 희귀도에 따라 긍정적 이점을 재분배하는 방법을 제안했어요. Cue-GRPO는 Strategy Cues를 활용해 로우오버헤드로 구현되었으며, Qwen2.5-Math-7B와 Llama-3.1-8B-Instruct에서 샘플링 성능을 향상시켰어요.

Cue-GRPO는 기존 GRPO에 비해 6%의 벽시계 훈련 오버헤드만 추가돼 효율적이며, 판사 파티션을 활용한 신용 재분배 가능성을 보여줬어요. 이 연구는 RLVR 설계 시 구조적 신용 재분배의 중요성을 강조하고, Strategy Cues가 실용적인 구현 방법이 될 수 있음을 시사해요.

연구 코드는 GitHub에서 공개되었으며, 경쟁 수학 분야에서 RLVR의 효율성을 높이는 데 기여할 것으로 기대돼요.

##강화학습##RLVR##GRPO##희귀도
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기