사용자가 Qwen3.8-Flash-Next 모델을 2x RTX 3060 + 7800X3D 환경에서 테스트한 결과, llama.cpp에서 -sm tensor 옵션 사용 시 프리필 속도가 현저히 느려지는 문제점을 발견했어요.
llama.cpp에서 -sm layer 옵션을 사용하고 -ubatch 2048, -c 131072 설정을 적용했더니 프리필 속도가 400 tps까지 향상되는 결과를 얻었으며, ik_llama.cpp는 더 높은 속도를 제공하지만 더 많은 RAM을 사용했어요.
ik_llama.cpp는 llama.cpp에 비해 시스템 RAM 사용량이 훨씬 많으며, 128GB RAM 이하 환경에서는 llama.cpp를 사용하는 것이 좋다고 권장하며, 전문가 레이어를 VRAM에 유지하는 것보다 ubatch 버퍼에 더 많은 VRAM을 할당하는 것이 효율적이에요.