Pulse · AI 뉴스

Qwen 3.8 27B (RTX 6000 Pro) 최적 llama.cpp/server 설정

Qwen · 2026-08-25

사용자가 RTX 6000 Pro에서 Qwen 3.8 27B 모델을 BF16 캐시로 실행하기 위한 llama.cpp/server 설정을 공유했어요. ZFS 파일 시스템 문제로 인해 mmap 옵션을 사용하지 않고, draft-mtp를 활용한 추론 방식을 적용했어요. 현재 생성 속도는 초당 50~60 토큰이며, 긴 프롬프트 처리 시 최대 3000 토큰/초를 보여요.

모델 교체 기능과 최적 성능을 위해 vLLM 또는 sglang으로 전환하는 것을 고려 중이며, 관련 설정 추천을 요청했어요. 기존 설정은 나쁘지 않지만, 더 나은 성능을 위한 다른 설정 경험을 공유해 달라고 부탁했어요. 현재 설정은 BF16 + 256kb 컨텍스트를 지원하는 환경에서 사용되고 있어요.

ZFS 파일 시스템의 OOM 문제를 해결하기 위해 `--no-mmap` 옵션을 사용하고 있으며, `--spec-draft-n-max 4`와 `--spec-draft-n-min 0` 옵션을 통해 추론 성능을 최적화했어요. 코드 분석에 적합하도록 `--temp`를 0.1로 설정하고, `--top-p`와 `--top-k` 값을 조정하여 결과의 다양성을 조절했어요.

##Qwen##llama.cpp##vLLM##RTX6000##최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기