연구진이 69억 파라미터 규모의 Memory Decoder 모델을 개발하고 3000억 토큰으로 사전 학습했어요. Faiss 인덱싱 및 검색 비용 문제를 해결하기 위해 분산 파이프라인을 구축했어요. 장기 기억에 더 많은 파라미터를 할당하는 것이 모델 성능 향상에 더 효과적이라는 결과가 나왔어요.
Pythia-410M 모델에 6.9B Memory Decoder를 결합했을 때 평균 점수가 29.86에서 37.34로 상승했어요. 이는 39% 적은 파라미터로 Pythia-12B를 능가하는 결과예요. Qwen3 Base 모델에 1.7B 도메인 기억을 적용했을 때 모든 규모에서 평균 점수가 9점 이상 향상됐어요.