연구진이 FreeToken이라는 새로운 기술을 공개하여 게임 PC에서도 대규모 언어 모델(LLM)을 실시간 속도로 실행할 수 있게 됐어요. Qwen3.6 35B 모델은 8GB RTX 4060 노트북에서, DeepSeek-V4-Flash 284B 모델은 RTX 5090 데스크톱에서 실행 가능해요. FreeToken은 기존 Ollama보다 최대 30배 빠른 성능을 제공하며, CPU-GPU 연합 실행과 에이전트 턴 간의 의미 기반 캐싱을 활용해요.
FreeToken 기술을 통해 Claude 코드나 Codex 모델을 무료로 사용할 수 있으며, 엣지 환경에서 LLM 서빙 효율성을 높일 수 있어요. 연구 결과는 arXiv에 공개됐으며, 관련 정보는 트위터에서 확인할 수 있어요.