Reddit 사용자 chocolateUI가 Artificial Analysis (AA) 벤치마크의 의미를 지적했어요. Qwen 3.8 27B 모델이 AA 점수에서 DeepSeek v4 Flash, Kimi 2.7 Code, GPT-5.2 등 여러 모델을 능가했어요. AA 벤치마크가 LLM 성능 비교에 적합하지 않다는 비판이 제기됐어요.