사용자가 Qwen3.8-27B 모델을 RTX 5090에서 400W 제한으로 구동하는 데 성공했어요. vLLM을 사용해 196K 컨텍스트, 451K 글로벌 KV-캐시로 설정했어요.
NVFP4 방식으로 모델과 캐시를 구성해 평균 120 토큰/초의 빠른 속도를 기록했으며, 코딩 세션에서 정확한 결과가 나온다고 해요.
자세한 설정 방법과 벤치마크 결과는 GitHub gist에서 확인할 수 있으며, Linux 환경에서 UI를 비활성화해 메모리 사용률을 98%까지 끌어올렸다고 합니다.