라이언 센(Ryan Senn)이 700줄 C 코드로 Google Gemma 4 E2B 모델을 CPU에서 실행하는 'gemma4.c' 프로젝트를 공개했어요.
프로젝트는 LLM 추론 과정을 코드 수준에서 이해하기 위해 제작되었으며, 토크나이저, 트랜스포머, KV 캐시, 샘플링, CPU 커널을 자체적으로 처리해요.
Ryzen 7 7700에서 639 tok/s의 프리필 속도와 25.9 tok/s의 생성 속도를 보여, llama.cpp보다 빠르며 int8 가중치, OpenMP, AVX2, AVX-512 VNNI를 활용해요.
GitHub 저장소는 의도적으로 작게 유지하여 특정 모델과 CPU 추론에만 집중하여 코드 이해를 용이하게 해요.