Pulse · AI 뉴스

Qwen3.8-27B 모델, RTX 5090에서 120 토큰/초 속도로 구동 성공

Qwen · 2026-08-23

사용자가 Qwen3.8-27B 모델을 RTX 5090에서 400W 제한으로 구동하는 데 성공했어요. vLLM을 사용해 196K 컨텍스트, 451K 글로벌 KV-캐시로 설정했어요.

NVFP4 방식으로 모델과 캐시를 구성해 평균 120 토큰/초의 빠른 속도를 기록했으며, 코딩 세션에서 정확한 결과가 나온다고 해요.

자세한 설정 방법과 벤치마크 결과는 GitHub gist에서 확인할 수 있으며, Linux 환경에서 UI를 비활성화해 메모리 사용률을 98%까지 끌어올렸다고 합니다.

##Qwen##RTX5090##vLLM##모델최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기