연구진은 70~500만 파라미터 SLM의 강화 학습 불안정성을 조사했어요. Pythia-70M, SmolLM2-135M 등 15개 모델을 TinyStories, CNN/DailyMail, Wikitext-103 데이터셋으로 학습했어요. LoRA 파라미터 고정, 수치 오버플로우, 정책 붕괴 등 3가지 실패 요인을 발견했어요.
실패 요인 해결을 위해 어댑터 병합·재초기화, float32 정밀도 사용, 보상 화이트닝 등 안전 장치를 적용했어요. SLM의 PPO 성능은 fluent한 사전 모델과 discriminative한 보상 신호에 의존한다는 가설을 제시했어요.
제안된 시스템은 모든 실험에서 안정적으로 수렴하며, SFT baseline보다 preference win rate가 향상됐어요. instruction-tuned baseline보다 성능이 뛰어나면서도 적은 학습 데이터로도 가능했어요.
모든 체크포인트, preference 데이터셋, 학습 스크립트를 공개적으로 배포했어요.