사용자가 NPU 벤더의 엔진 포맷을 역공학하여 GGUF 모델을 변환 없이 실행하는 방법을 개발했습니다. 이를 통해 기존 벤더 런타임보다 1.5배 빠른 성능을 달성했습니다.
M5Stack LLM-8850 카드(Axera AX8850 NPU)를 Raspberry Pi 5에 연결하여 Qwen3-0.6B 모델을 실행했으며, 24.5 t/s의 디코딩 속도를 기록했습니다.
개발자는 배치 처리 및 어휘 축소 최적화를 통해 성능을 향상시켰으며, 프로젝트 리포지토리를 공개하여 다른 사용자들이 쉽게 따라 할 수 있도록 했습니다.