Amazon SageMaker HyperPod에서 LLM 추론 시 KV 캐시 크기 때문에 GPU 인스턴스 크기를 키우거나 토큰 응답 속도가 느려지는 문제가 발생했어요. Curvine을 활용해 NVMe 풀에 계층적 KV 캐시를 구축하여 저렴한 인스턴스에서도 빠른 속도로 캐시 재사용이 가능하도록 했습니다. 이를 통해 GPU 인스턴스 크기를 늘리거나 응답 속도를 희생하는 문제를 해결했어요.
Curvine은 NVMe 풀을 공유하여 캐시를 활용하는 기술로, SageMaker HyperPod 환경에서 LLM 추론 성능을 향상시키는 데 기여합니다. 계층적 KV 캐시를 통해 비용 효율적인 인스턴스에서도 빠른 응답 속도를 유지할 수 있습니다.