bartowski1182 님이 llama.cpp 프로젝트에 IQ 모델의 대규모 배치 처리 속도를 높이는 AVX2 최적화 pull request를 제안했어요.
Qwen3.6-27B 모델의 경우, IQ1_M quantization을 사용했을 때 최대 664.7%의 토큰 생성 속도 향상을 보였어요.
대규모 배치 사이즈에서 IQ3_XXS quantization을 사용했을 때, Qwen3.6-35B-A3B 모델의 토큰 생성 속도가 158.4% 향상되는 등 괄목할 만한 성능 개선이 확인됐어요.