Pulse · AI 뉴스

2x DGX Spark에서 Qwen3.8-Flash-Next로 181 tok/s 달성

Qwen · 2026-08-29

사용자가 2개의 NVIDIA DGX Spark에서 Qwen3.8-Flash-Next 모델을 사용하여 181 tok/s의 집계 속도를 달성했습니다.

NVMe에서 PLE 테이블을 읽고 madvise(MADV_RANDOM)를 적용하여 모델 로딩 속도를 개선하고 KV 캐시 크기를 늘렸습니다.

vLLM 설정에서 prefix caching 활성화 및 동시 콜드 프리필 제한을 통해 실제 환경에서 성능을 향상시켰습니다.

##Qwen##DGXSpark##vLLM##Flash-Next##GPU
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기