Pulse · AI 뉴스

Tesla P40에서 F16 KV 대신 Q8 사용 시 성능 분석

Tesla · 2026-08-23

Tesla P40 카드에서 Q8 방식이 VRAM 사용량을 줄여 더 빠른 TPS를 보일 것이라는 예상과 달리, 프롬프트 처리 속도는 거의 동일했어요. 생성 단계에서 KV 캐시를 읽을 때 발생하는 양자화 해제 과정이 병목 현상으로 작용하며, 낮은 컨텍스트에서는 F16 방식이 34% 더 빠른 성능을 보여요. 결국 TG는 어텐션 행렬 곱셈 연산에 의해 제한되며, 캐시 읽기 속도에 의해 제한되지 않아요.

Q8 방식은 토큰당 양자화 해제 연산, 새로운 KV 항목 양자화, 텐서 코어 활용 제한 등의 단점을 가지고 있어요. 반면 F16 방식은 더 많은 VRAM을 사용하지만, 텐서 코어 활용으로 인한 연산 효율성 증가를 통해 성능 향상을 가져와요. 낮은 컨텍스트에서는 F16 방식이 압도적으로 빠르지만, 높은 컨텍스트에서는 메모리 대역폭 문제로 인해 속도 차이가 줄어들 수 있어요.

결론적으로 TG는 어텐션 행렬 곱셈 연산에 의해 제한되며, 캐시 읽기 속도에 의해 제한되지 않으므로, 양자화 해제 연산 비용이 추가적인 바이트 절약 효과보다 크다는 것을 알 수 있어요.

##Tesla##P40##Q8##F16##KV
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기