Wang 등이 자체 검토 및 재작성 방식이 반복 샘플링보다 성능이 떨어질 수 있다고 보고했지만, 신뢰 구간이나 유의성 검증 없이 추정치를 제시했어요.
연구진은 1.5B, 3B, 7B 파라미터 모델과 수학 벤치마크를 활용해 7가지 방법론을 비교한 결과, 자체 검토 방식이 반복 샘플링보다 성능이 떨어지는 것을 확인했어요.
모델이 자체 출력을 검토하는 방식은 모델 크기가 커질수록 성능 차이가 줄어들며, 최적의 샘플 개수를 선택하는 것조차 성능 향상에 기여하지 못했어요.