Reddit 사용자가 Qwen3.8-27B 양자화 모델 성능을 비교 분석하는 게시글을 올렸어요. 8비트와 4비트 양자화 간 성능 차이가 크며, 4비트 양자화의 KLD 값 편차가 큰 것으로 나타났어요. 특히, 컨텍스트 시작 부분에서 양자화 손실이 더 크게 발생하는 점이 확인됐어요.
그룹 크기가 성능에 큰 영향을 미치며, 그룹 크기 32가 128보다 더 나은 성능을 보였어요. lm_head, embed_tokens, linear_attn 양자화는 성능에 영향을 미치지 않는 것으로 확인됐어요.
게시글 작성자는 양자화 방식 선택 시 파일 크기만 고려하지 말고 KLD 값을 확인해야 한다고 조언하며, INT5-7 가중치를 활용할 수 있는 vLLM에 대한 정보도 언급했어요.