Pulse · AI 뉴스

llama.cpp 멀티 GPU 설정 문제 해결 요청

llama.cpp · 2026-08-22

사용자가 llama.cpp에서 멀티 GPU (Blackwell 5000 + RTX 3090)를 활용하는 데 어려움을 겪고 있어요. Deepseek4 flash 모델 (120GB)을 사용하며, Blackwell GPU만 사용할 때보다 3090 GPU를 활용하는 것이 더 빠를 것으로 예상했으나, 기대와 달리 속도가 느려지거나 할당 오류가 발생했어요. 다양한 시도를 해봤지만, GPU 간 작업 분배 및 컨텍스트 설정에 문제가 있는 것으로 보입니다.

Blackwell GPU만 사용할 때는 16t/s의 생성 속도를 보였지만, 3090 GPU를 활용하려 할 때 할당 오류가 발생하거나 속도가 11t/s로 감소했어요. 수동으로 레이어를 분배하는 방법도 시도했지만, 속도가 12t/s로 향상되는 데 그쳤어요. 현재 상황에서는 GPU 활용에 어려움을 겪고 있으며, 문제 해결을 위한 도움을 요청하고 있어요.

사용자는 다양한 명령줄 옵션(--split-mode layer, -ts, -c, -ot)을 조합하며 실험을 진행했지만, 최적의 GPU 활용 방법을 찾지 못했어요. 현재는 수동으로 레이어를 분배하여 12t/s의 속도를 얻고 있지만, 이는 baseline에 비해 낮은 성능이며, 문제 해결을 위한 추가적인 조언을 기다리고 있습니다.

##llama.cpp##GPU##멀티GPU##Deepseek4##최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기