Pulse · AI 뉴스

Qwen 3.8 27B, vLLM에서 원활하게 실행 가능한가? 과도한 추론 시간 문제 해결 방법

Qwen · 2026-08-16

사용자가 RTX 6000 Pro에서 vLLM을 사용한 Qwen 3.8 27B 실행 시 과도한 추론 시간 문제를 겪고 있어요. 'xhigh' 설정 시 5분, 'medium' 설정 시 2~4분, 'low' 설정 시 1~2분이나 추론 시간이 소요돼요.

Qwen 3.6이나 DeepSeek V4 Flash 모델은 동일 환경에서 20~30초 내에 응답하는 반면, Qwen 3.8은 성능이 현저히 떨어져요.

다양한 양자화 방식, 프록시 설정, vLLM 플래그 조정 등을 시도했지만 문제 해결에 실패했으며, 다른 사용자도 유사한 문제를 겪고 있다는 보고가 있어요.

##Qwen##vLLM##추론시간##최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기