LLM 양자화 도구 llama.cpp의 버그로 인해 일부 GGUF 파일의 실제 양자화 방식이 파일 이름에 표기된 방식과 다를 수 있습니다.
k-quant 및 i-quant에서 첫 번째 텐서 차원이 256으로 나누어지지 않으면 llama.cpp가 호환 가능한 다른 유형으로 대체하며, 이 과정에서 4.5bpw (bits per weight) 수준의 성능 저하가 발생할 수 있습니다.
JoshBolding이 443개의 GGUF 파일을 감사한 결과, 64개의 파일이 실제 양자화 방식과 이름이 불일치했으며, Nemotron-3.5-Lightning, Qwen3.8-Flash-Next, Nemotron-3-Super-120B 등에서 심각하게 나타났습니다.