연구자가 353M, 316M, 672M 파라미터의 3가지 LLM을 처음부터 구축하고 SFT, GRPO를 적용했는데, 동일한 과정에도 결과가 달랐습니다.
GRPO는 V2와 V3 모델의 성능을 저하시켰는데, 그 원인은 불분명하며, 모델 규모가 커질수록 성능 저하 폭이 줄어드는 경향을 보였습니다.
연구자는 KV 캐시를 직접 구현하여 추론 속도를 3.7배에서 10.1배까지 향상시켰으며, 관련 체크포인트와 플레이그라운드를 Hugging Face에서 확인할 수 있습니다.