연구진이 GRPO(Group Relative Policy Optimization)를 활용한 다국어 모델 학습을 대규모로 연구했어요. 영어가 아닌 언어로 학습해도 영어 학습 모델과 성능 차이가 크지 않다는 사실을 발견했어요. 다양한 모델, 언어, 추론 보상 방식에서 실험을 진행하며 GRPO의 효과를 입증했어요.
GRPO는 강화 학습과 결합하여 언어 모델의 추론 능력을 향상시키는 데 사용돼요. 기존 연구는 주로 영어에 집중되었지만, 이번 연구는 다양한 언어 환경에서 GRPO의 성능을 분석했어요. 연구 결과, 원어민 언어로 학습하는 것이 영어 학습보다 성능이 크게 떨어지지 않는다는 점을 확인했어요.