로컬 LLM의 성능은 GPU 명령어, 추론 소프트웨어, 정밀도 설정에 따라 달라져 실제보다 멍청하게 느껴질 수 있어요. Qwen3.6-27B와 10만 토큰 문맥 실험 결과, vLLM의 어텐션 백엔드 차이가 도구 호출 실패를 유발했어요. 긴 문맥에서 LLM 성능 차이는 단순 모델 가중치 비교로 판단하기 어려움을 보여줘요.