사용자가 Qwen3.8-27B 모델을 2x RTX 3090 GPU 환경에서 vLLM + DFlash2를 활용해 실행했어요. 단일 요청 시 218 토큰/초의 디코딩 속도를 기록했으며, 131K 컨텍스트 길이를 지원해요. Kimi K3를 활용한 vLLM 수정 덕분에 안정적인 부팅이 가능했어요.
Prefill 속도는 10K 컨텍스트에서 1342 토큰/초, 90K 컨텍스트에서 628 토큰/초를 보여줬어요. Spec-decode 과정에서는 draft 토큰 7개를 사용했으며, acceptance length는 3.35, acceptance 비율은 47.8%였어요. GPU VRAM 사용량은 카드당 22.3GB였어요.
Kimi K3 기반의 vLLM 수정 사항을 적용해 안정적인 환경을 구축했으며, AutoRound INT4 (group 128)를 사용했어요. 자세한 내용은 GitHub 링크에서 확인할 수 있으며, 사용된 환경은 PCIe Gen4 x16/x16 구성이었고, GPU 전력은 220/250W로 제한됐어요.