GLM-5.3과 GPT-5.6 Sol을 활용한 DeepSWE 롤아웃을 904번 진행했어요. GPT-5.6 Sol이 pass@1에서 3.7% 더 높은 성능을 보였어요. GLM-5.3은 pass@4에서 절반 가격으로 우위를 점했고, GLM 우선 캐스케이드로 85.9% 달성했어요.
두 모델의 비용 효율성, 코딩 능력, 라우팅 성능을 비교 분석한 결과, GLM-5.3은 특정 조건에서 GPT-5.6 Sol보다 유리한 점이 있음을 확인했어요. DeepSWE 롤아웃 전략에 따라 모델 선택이 중요해요.