Pulse · AI 뉴스

GGUF 양자화 파일 감사 결과: 64개 파일이 실제 양자화 방식과 이름 불일치

llama.cpp · 2026-08-29

LLM 양자화 도구 llama.cpp의 버그로 인해 일부 GGUF 파일의 실제 양자화 방식이 파일 이름에 표기된 방식과 다를 수 있습니다.

k-quant 및 i-quant에서 첫 번째 텐서 차원이 256으로 나누어지지 않으면 llama.cpp가 호환 가능한 다른 유형으로 대체하며, 이 과정에서 4.5bpw (bits per weight) 수준의 성능 저하가 발생할 수 있습니다.

JoshBolding이 443개의 GGUF 파일을 감사한 결과, 64개의 파일이 실제 양자화 방식과 이름이 불일치했으며, Nemotron-3.5-Lightning, Qwen3.8-Flash-Next, Nemotron-3-Super-120B 등에서 심각하게 나타났습니다.

##GGUF##양자화##llama.cpp##LLM##오류
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기