Pulse · AI 뉴스

두 번의 호출이 다섯 에이전트보다 뛰어나다: 로컬 언어 모델을 위한 자체 개선 대비 멀티 에이전트 파이프라인 평가

Qwen · 2026-07-29

연구에서 Qwen2.5-7B-Instruct 로컬 모델에 Parishad 멀티 에이전트 시스템을 적용하여 GSM8K 및 HumanEval 데이터셋에서 성능을 평가했어요.

JSON 데이터 형식에서 멀티 에이전트 시스템은 오류 누적 문제로 GSM8K 정확도가 75.0%에서 45.0%로 떨어졌지만, 텍스트 형식에서는 82.0%까지 회복됐어요.

두 번의 자체 개선 전략은 GSM8K에서 86.2%의 정확도를 달성하며 토큰 사용량을 7.4배 줄였지만, HumanEval에서는 성능을 저해하는 결과를 보여줬어요.

##멀티에이전트##Qwen##GSM8K##HumanEval
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기