사용자가 Nanbeige의 성능에 영감을 받아 Qwen3.5-9B 모델에 Nanbeige-4.5 스타일의 트리플 루프를 적용하는 실험을 진행했어요.
초기 실험에서 DeltaNet을 사용했지만, 모델이 중요한 세부 사항을 잊고 환각하는 문제가 발생하여 소프트맥스 어텐션으로 변경했어요.
학습률 스케줄링 문제를 해결한 후 루프는 답변을 개선하는 데 적극적으로 참여하게 되었고, 쉬운 질문에서는 루프를 생략할 수 있게 되었어요. 실험 결과, 수학, 긴 텍스트 처리, 지시사항 준수 능력에서 기존 모델보다 성능이 향상되었어요.
현재 모델은 완성이 덜 되었지만, Nanbeige 4.5 루프 디자인이 더 큰 파라미터 수에서도 수렴한다는 것을 입증했어요.
향후 추가적인 학습과 학습률 스케줄링 개선을 통해 성능을 더욱 향상시킬 계획이며, 현재는 개념 증명 모델로 평가돼요.