Qwen이 MoE 대신 N-gram 기반의 Qwen4Exp 아키텍처를 공개했어요. MoE는 추론, N-gram은 기억을 담당하며, N-gram은 약 25%까지 가중치를 오프로드할 수 있어요. SSD에 N-gram 테이블을 저장해 RAM 사용량을 줄여 176B 모델을 125B(RAM) + 51B(SSD)로 구성했어요. N-gram은 추론 능력과 기억 능력을 결합하여 모델 성능을 향상시키는 역할을 해요.