Pulse · AI 뉴스

Qwen3.8-Flash-Next 모델, 2x RTX 3060 + 7800X3D 환경에서 초기 36 tps 프리필에서 400 tps로 성능 향상 + VRAM/RAM 사용량 분석

Qwen · 2026-08-28

사용자가 Qwen3.8-Flash-Next 모델을 2x RTX 3060 + 7800X3D 환경에서 테스트한 결과, llama.cpp에서 -sm tensor 옵션 사용 시 프리필 속도가 현저히 느려지는 문제점을 발견했어요.

llama.cpp에서 -sm layer 옵션을 사용하고 -ubatch 2048, -c 131072 설정을 적용했더니 프리필 속도가 400 tps까지 향상되는 결과를 얻었으며, ik_llama.cpp는 더 높은 속도를 제공하지만 더 많은 RAM을 사용했어요.

ik_llama.cpp는 llama.cpp에 비해 시스템 RAM 사용량이 훨씬 많으며, 128GB RAM 이하 환경에서는 llama.cpp를 사용하는 것이 좋다고 권장하며, 전문가 레이어를 VRAM에 유지하는 것보다 ubatch 버퍼에 더 많은 VRAM을 할당하는 것이 효율적이에요.

##Qwen##LLM##llama.cpp##ik_llama.cpp##벤치마크
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기