연구에서 Qwen2.5-7B-Instruct 로컬 모델에 Parishad 멀티 에이전트 시스템을 적용하여 GSM8K 및 HumanEval 데이터셋에서 성능을 평가했어요.
JSON 데이터 형식에서 멀티 에이전트 시스템은 오류 누적 문제로 GSM8K 정확도가 75.0%에서 45.0%로 떨어졌지만, 텍스트 형식에서는 82.0%까지 회복됐어요.
두 번의 자체 개선 전략은 GSM8K에서 86.2%의 정확도를 달성하며 토큰 사용량을 7.4배 줄였지만, HumanEval에서는 성능을 저해하는 결과를 보여줬어요.