연구진이 Qwen3와 Gemma 모델을 활용해 자체 개선 파이프라인의 단계별 모델 크기 효과를 분석했어요. 생성 및 개선 모델의 크기는 성능에 큰 영향을 미치지만, 비평 모델 크기는 중요하지 않다는 결과가 나왔어요. 자체 개선 파이프라인에서 모델 용량을 균등하게 할당하는 것이 아니라, 단계별 특성에 맞춰 비대칭적으로 할당해야 효율적입니다.
연구 결과, 작은 비평 모델이라도 포함하는 것이 비평을 아예 생략하는 것보다 성능 향상에 도움이 된다고 밝혔어요.
연구는 다양한 도메인의 5개 벤치마크를 사용하여 6가지 크기의 Qwen3 모델과 4가지 크기의 Gemma 모델을 분석하여 자체 개선 파이프라인의 단계별 모델 크기 효과를 처음으로 밝혀냈습니다.