GLM-5.3-Flash 모델의 llama.cpp 및 TensorSharp 벤치마크 결과가 공개됐어요. TensorSharp 환경에서 llama.cpp보다 최대 2배 빠른 처리 속도를 보여줬어요. GPU 캐시 활용 및 하이브리드 스택 구조 덕분에 토큰 재구축 및 실행 오버헤드를 줄여 성능을 향상시켰어요. CPU-MoE 오프로딩을 통해 10개 레이어의 전문가를 호스트에 상주시켜 35~40 t/s의 디코딩 속도를 달성했어요.