Pulse · AI 뉴스

SageMaker HyperPod에서 Curvine 활용한 LLM 계층적 KV 캐시 구축

Amazon SageMaker · 2026-08-12

Amazon SageMaker HyperPod에서 LLM 추론 시 KV 캐시 크기 때문에 GPU 인스턴스 크기를 키우거나 토큰 응답 속도가 느려지는 문제가 발생했어요. Curvine을 활용해 NVMe 풀에 계층적 KV 캐시를 구축하여 저렴한 인스턴스에서도 빠른 속도로 캐시 재사용이 가능하도록 했습니다. 이를 통해 GPU 인스턴스 크기를 늘리거나 응답 속도를 희생하는 문제를 해결했어요.

Curvine은 NVMe 풀을 공유하여 캐시를 활용하는 기술로, SageMaker HyperPod 환경에서 LLM 추론 성능을 향상시키는 데 기여합니다. 계층적 KV 캐시를 통해 비용 효율적인 인스턴스에서도 빠른 응답 속도를 유지할 수 있습니다.

##LLM##SageMaker##Curvine##KV캐시
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기