사용자가 16GB VRAM 환경에서 Qwen 3.8 27B 모델을 UD-IQ3_XXS 양자화로 20만 토큰 컨텍스트 처리 성공했어요. 기존 UD-Q3_K_XL 대비 프롬프트 처리 속도는 700~800tk/s에서 400tk/s로 감소했어요. 품질 차이는 아직 테스트 중이에요.
llama.cpp를 CUDA FA 양자화 옵션으로 컴파일했고, MTP와 mmproj 없이 서버를 실행했어요. Aorus 5060ti AI Box eGPU를 사용하는 Windows 11 환경에서 테스트했어요.
KV 캐시를 q5_1 양자화했고, 14만 토큰 컨텍스트를 처리하던 기존 방식 대비 성능 저하를 확인했지만, 품질 차이는 추가 테스트가 필요해요.