Reddit 사용자가 직접 GGUF 모델을 제작하는 것이 성능 향상에 도움이 되는지, 그리고 Vulkan/ROCm 환경에서 GGUF 제작 방식에 대한 질문을 남겼어요. 특히 Gemma 4 31B 모델을 주로 사용하며, 특정 모델 요소의 정밀도 조절에 대한 궁금증도 표현했어요.
Llama.cpp를 Vulkan/ROCM으로 컴파일했을 때 성능 향상이 있었던 경험을 바탕으로, 직접 GGUF를 제작하는 것도 유사한 효과를 낼 수 있는지 문의했어요. Vulkan 환경에서 llama-quantize Vulkan 버전을 사용하는 것이 가치 있는지에 대한 질문도 포함됐어요.