GLM 5.3이 SlopCodeBench 벤치마크에서 Fable/Sol과 동일한 성능을 보여줬어요. 17개 문제 벤치마크에서 8/17 (47.1%)의 정확도를 기록했고, 30개 문제 벤치마크에서는 10/30 (33.3%)로 GPT-5.6 Sol과 동률을 기록했어요. 문제 해결 난이도가 높을수록 토큰 사용량이 증가하는 경향을 보였으며, 더 어려운 문제 해결에 더 많은 비용이 소요돼요.