사용자가 RTX 6000 Pro에서 vLLM을 사용한 Qwen 3.8 27B 실행 시 과도한 추론 시간 문제를 겪고 있어요. 'xhigh' 설정 시 5분, 'medium' 설정 시 2~4분, 'low' 설정 시 1~2분이나 추론 시간이 소요돼요.
Qwen 3.6이나 DeepSeek V4 Flash 모델은 동일 환경에서 20~30초 내에 응답하는 반면, Qwen 3.8은 성능이 현저히 떨어져요.
다양한 양자화 방식, 프록시 설정, vLLM 플래그 조정 등을 시도했지만 문제 해결에 실패했으며, 다른 사용자도 유사한 문제를 겪고 있다는 보고가 있어요.