NVIDIA가 CUDA Multi-Process Service (MPS)와 NVIDIA Triton Inference Server를 Amazon EC2 GPU 인스턴스에 적용하여 ASR 추론 비용을 75% 절감하는 방법을 공개했어요. MPS를 사용하면 GPU 활용률을 높여, 지연 시간을 유지하면서 초당 92.1개의 요청을 처리할 수 있어요. 이번 기술은 대규모 ASR 모델 서빙 비용 효율성을 높이는 데 기여할 것으로 보입니다.