사용자가 2개의 NVIDIA DGX Spark에서 Qwen3.8-Flash-Next 모델을 사용하여 181 tok/s의 집계 속도를 달성했습니다. NVMe에서 PLE 테이블을 읽고 madvise(MADV_RANDOM)를 적용하여 모델 로딩 속도를 개선하고 KV 캐시 크기를 늘렸습니다. vLLM 설정에서 prefix caching 활성화 및 동시 콜드 프리필 제한을 통해 실제 환경에서 성능을 향상시켰습니다.