Pulse · AI 뉴스

NPU 벤더 엔진 포맷 역공학: GGUF 모델 변환 없이 1.5배 빠른 성능 달성

llama.cpp · 2026-08-28

사용자가 NPU 벤더의 엔진 포맷을 역공학하여 GGUF 모델을 변환 없이 실행하는 방법을 개발했습니다. 이를 통해 기존 벤더 런타임보다 1.5배 빠른 성능을 달성했습니다.

M5Stack LLM-8850 카드(Axera AX8850 NPU)를 Raspberry Pi 5에 연결하여 Qwen3-0.6B 모델을 실행했으며, 24.5 t/s의 디코딩 속도를 기록했습니다.

개발자는 배치 처리 및 어휘 축소 최적화를 통해 성능을 향상시켰으며, 프로젝트 리포지토리를 공개하여 다른 사용자들이 쉽게 따라 할 수 있도록 했습니다.

##NPU##llama.cpp##GGUF##최적화##Axera
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기