Pulse · AI 뉴스

Qwen3.8 27B 모델, Dflash2와 LMCache 조합으로 165t/s 속도 달성

Qwen · 2026-08-29

사용자가 2개의 RTX 3090 GPU 환경에서 Qwen3.8 27B 모델을 Dflash2와 LMCache를 활용해 165t/s 속도로 구동하는 방법을 공유했어요.

Dflash2와 LMCache를 함께 사용하기 위해 수정한 패치가 필요하며, 이를 통해 KV 캐시를 NVMe에 저장해 GPU 메모리 부담을 줄이고 빠른 재호출이 가능해요.

최적화된 환경에서 평균 90~150 tok/s의 속도를 보여주며, 실제 작업 유형에 따라 최대 3.8배의 성능 향상을 경험할 수 있어요.

##Qwen##Dflash2##LMCache##최적화##LLM
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기