Pulse · AI 뉴스

Qwen3.8-27B, 2x 3090 + vLLM + DFlash2 조합으로 218 토큰/초 달성

Qwen · 2026-08-19

사용자가 Qwen3.8-27B 모델을 2x RTX 3090 GPU 환경에서 vLLM + DFlash2를 활용해 실행했어요. 단일 요청 시 218 토큰/초의 디코딩 속도를 기록했으며, 131K 컨텍스트 길이를 지원해요. Kimi K3를 활용한 vLLM 수정 덕분에 안정적인 부팅이 가능했어요.

Prefill 속도는 10K 컨텍스트에서 1342 토큰/초, 90K 컨텍스트에서 628 토큰/초를 보여줬어요. Spec-decode 과정에서는 draft 토큰 7개를 사용했으며, acceptance length는 3.35, acceptance 비율은 47.8%였어요. GPU VRAM 사용량은 카드당 22.3GB였어요.

Kimi K3 기반의 vLLM 수정 사항을 적용해 안정적인 환경을 구축했으며, AutoRound INT4 (group 128)를 사용했어요. 자세한 내용은 GitHub 링크에서 확인할 수 있으며, 사용된 환경은 PCIe Gen4 x16/x16 구성이었고, GPU 전력은 220/250W로 제한됐어요.

##Qwen##vLLM##DFlash2##RTX3090
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기