연구진이 희소 어텐션을 활용한 모델 파인튜닝 방법론을 제시했어요. 이 방법은 어떤 KV 캐시 정책에도 적용 가능하며, 단일 Nvidia A100 GPU 환경에서 실행돼요. 기존 방식 대비 성능을 능가하는 결과를 보여줬어요.
KeysAndValues라는 새로운 오픈소스 라이브러리를 공개해, 긴 컨텍스트 추론 및 파인튜닝을 위한 편리하고 효율적인 코드를 제공해요. 이 라이브러리는 H2O 희소 어텐션 구현체도 포함하고 있어요.
연구 결과는 KV 캐시 정책과 모델을 동시에 최적화하여, 기존 정확한 어텐션 방식보다 더 나은 성능을 낼 수 있음을 시사해요.