Engram은 N-gram 테이블을 활용해 1T 파라미터 모델을 로컬에서 실행하는 것을 가능하게 하지 않습니다. 하지만 모델의 성능을 향상시키는 더 나은 방법을 제시합니다.
Engram은 토큰 ID 대신 최근 2~3 토큰의 N-gram을 인덱싱하는 임베딩 테이블로, 모델이 정적 정보를 재구성하는 데 소요되는 연산량을 줄여줍니다.
N-gram 테이블은 모델의 지식 저장 공간 역할을 하며, 더 작은 모델이 Opus나 Sol과 비슷한 수준의 지능을 갖도록 하여 로컬 모델의 성능을 향상시킬 것으로 기대됩니다.
Qwen 3.8 Next는 51B 파라미터의 N-gram 임베딩을 활성화하면서도 토큰당 약 6B만 활성화할 수 있습니다.
Engram은 모델이 추론에 집중할 수 있도록 '의미' 파생 작업을 실제 데이터베이스 조회로 옮겨줍니다.