연구진은 LLM의 계산 및 메모리 비용 문제를 해결하기 위해 ToMoE라는 새로운 방법을 제안했어요.
ToMoE는 밀집 모델의 MLP 레이어를 MoE 아키텍처로 변환하며, 파라미터를 영구적으로 제거하지 않고도 활성 파라미터 수를 줄여 성능 저하를 최소화해요.
Phi-2, LLaMA-2, LLaMA-3, Qwen-2.5 등 다양한 모델에서 기존 구조적 가지치기 기법보다 우수한 성능을 보여요.
연구 결과는 arXiv에 공개되었으며, GitHub에서 코드를 확인할 수 있어요.