본 연구는 10억 규모의 사용자 데이터를 학습할 때 발생하는 원시 데이터 스케일링 병목 현상을 해결하기 위해 토큰화 전략의 중요성을 강조합니다.
알리페이 데이터셋을 활용한 실험 결과, 토큰화는 원시 데이터 스케일링의 한계를 극복하고 성능 향상을 가능하게 합니다.
연구진은 데이터 규모와 최소 필요 토큰화 용량 간의 관계를 설명하는 사용자 행동 밀도 법칙을 제안하고, 이를 바탕으로 적응형 토큰화 방법인 ALGN을 개발하여 기존 방식보다 성능을 개선했습니다.