사용자가 12억 개 파라미터 규모의 Kimi-K3 미니 모델을 250달러로 직접 구축했어요. 이 모델은 Kimi-K3 아키텍처를 기반으로 50억 개의 토큰으로 사전 훈련됐어요. HellaSwag 벤치마크에서 GPT-2 (124M)의 성능을 능가하는 33.4% 점수를 기록했어요.
Kimi-K3 미니 모델은 Kimi Delta Attention, Gated MLA, Attention Residuals 등 Kimi-K3의 핵심 아키텍처를 그대로 사용하며 163,840 토큰 토크나이저도 적용했어요. 사전 훈련 과정에서 instruction tuning은 전혀 사용되지 않았으며, 다음 토큰 예측이라는 단일 작업만 수행했어요.
자세한 구축 과정은 Vizura Books에서 확인할 수 있으며, 12억 개 파라미터 규모의 모델을 저렴한 비용으로 구축할 수 있다는 점이 주목할 만해요.