연구진은 언어 모델 사전 훈련 시 훈련 데이터의 영향력을 측정하는 새로운 방법을 제안했어요. 이 방법은 특정 다운스트림 작업이나 검증 세트를 선택할 필요 없이, 중간 체크포인트에서 모델의 최종 파라미터와의 거리를 기반으로 데이터의 영향력을 추정해요. Pythia와 PolyPythia 모델을 분석한 결과, 훈련 초반에는 문학 관련 데이터가, 후반에는 STEM 관련 데이터가 모델의 최종 파라미터에 더 큰 영향을 미치는 것으로 나타났어요.