연구자가 4070 Ti와 32GB RAM으로 Kimi K3, DeepSeek V4 Flash, Qwen3.5-122B 등 거대 MoE 모델을 실행하는 실험을 진행했어요.
CRANE V2라는 커스텀 런타임 연구 프로젝트를 통해 모델 속도와 품질 간의 균형을 탐색했으며, 속도 향상을 위해 일부 설정을 변경했지만, 품질 저하를 초래하기도 했어요.
DeepSeek Q3의 경우, 원본 텐서를 사용하고 동적 라우팅을 적용해 8.08 tok/s의 속도를 달성하며, Paris 질문에 정확하게 답변하는 데 성공했어요.