Pulse · AI 뉴스

[공개] Qwen3.8-27B 최적 GGUF 공개: 2.5~3.0bpw의 GSQ-RCO

Qwen · 2026-08-29

ISTA-DASLab이 Qwen3.8-27B 모델을 GSQ·RCO 방식으로 양자화한 최적 GGUF 모델을 공개했어요. GSQ는 스칼라 양자화 간격을 좁히고, RCO는 텐서별 양자화 유형을 최적화하는 기술이에요. 2.50/2.75/3.00bpw 세 가지 버전(8.4~10.1GB)과 비전 프로젝터가 제공돼요.

3.00bpw 모델은 AIME25에서 기준 모델과 동등한 성능을 보이며, 2.75bpw 모델은 특정 조건에서 BF16 모델보다 뛰어난 성능을 보여줘요. 8.4GB 크기에서 UD-IQ2_S 대비 AIME25 점수 10% 향상, GPQA-Diamond 점수 8.6% 향상, LiveCodeBench 점수 4.6% 향상을 기록했어요.

모델 카드에는 자세한 벤치마크 결과와 그래프가 포함되어 있으며, llama.cpp, Ollama, LM Studio에서 바로 사용 가능해요. ISTA-DASLab은 앞으로도 다양한 모델 패밀리에 대한 최적 GGUF 모델을 공개할 예정이에요.

##Qwen##GGUF##양자화##ISTA-DASLab
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기