Redditor 사용자가 GH200 2개를 활용해 vLLM을 최적화하는 방법을 공유했어요. DSv4 캐시 레이아웃 패치 적용 및 DSpark 설정 변경을 통해 10,000 토큰/초의 PP 속도를 달성했어요. SGLang은 ARM64 환경에서 빌드 및 로더 버그 수정 후, 모든 디코딩 워크로드에서 더 빠른 속도를 보여 317 토큰/초의 성능을 기록했어요. 1M 컨텍스트를 192GB HBM으로 처리 가능해요.