Unbounded Labs가 1931년 이전 영어 텍스트로 학습한 28억 파라미터 LLM 'Bart'를 공개했어요. Bart는 20.1B 토큰으로 학습되었으며, 128K 컨텍스트를 지원해요.
연구팀은 Harvard Institutional Books 데이터셋을 활용해 242B 토큰을 23B 토큰으로 정제하고, Vintage CORE 벤치마크를 개발하는 등 독자적인 노력을 기울였어요.
Bart는 Vintage CORE 벤치마크에서 동일 규모 GPT-1900보다 뛰어난 성능을 보였으며, 모든 데이터셋과 코드를 오픈소스로 공개했어요.