Pulse · AI 뉴스

FreeToken: 엣지 환경에서 MoE 모델 서빙 효율화 기술 공개

Qwen · 2026-08-25

연구진이 FreeToken이라는 새로운 기술을 공개하여 게임 PC에서도 대규모 언어 모델(LLM)을 실시간 속도로 실행할 수 있게 됐어요. Qwen3.6 35B 모델은 8GB RTX 4060 노트북에서, DeepSeek-V4-Flash 284B 모델은 RTX 5090 데스크톱에서 실행 가능해요. FreeToken은 기존 Ollama보다 최대 30배 빠른 성능을 제공하며, CPU-GPU 연합 실행과 에이전트 턴 간의 의미 기반 캐싱을 활용해요.

FreeToken 기술을 통해 Claude 코드나 Codex 모델을 무료로 사용할 수 있으며, 엣지 환경에서 LLM 서빙 효율성을 높일 수 있어요. 연구 결과는 arXiv에 공개됐으며, 관련 정보는 트위터에서 확인할 수 있어요.

##MoE##LLM##FreeToken##엣지컴퓨팅
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기