사용자가 2개의 RTX 3090 GPU 환경에서 Qwen3.8 27B 모델을 Dflash2와 LMCache를 활용해 165t/s 속도로 구동하는 방법을 공유했어요.
Dflash2와 LMCache를 함께 사용하기 위해 수정한 패치가 필요하며, 이를 통해 KV 캐시를 NVMe에 저장해 GPU 메모리 부담을 줄이고 빠른 재호출이 가능해요.
최적화된 환경에서 평균 90~150 tok/s의 속도를 보여주며, 실제 작업 유형에 따라 최대 3.8배의 성능 향상을 경험할 수 있어요.