GLM-4.5-Air 모델에서 MTP (Mixture of Experts)를 활성화하여 속도 향상을 얻을 수 있습니다. 106B MoE 모델이지만 12B 개의 활성 파라미터만 사용하며, Strix Halo 또는 DGX Spark와 같은 메모리는 많지만 컴퓨팅 자원은 제한적인 환경에 적합합니다. Hugging Face에서 다양한 창작 글쓰기/RP 파인튜닝 모델을 사용할 수 있으며, Intellect 3.x를 추천합니다.