연구진은 LLM 기반 에이전트의 성능을 높이는 하니스 최적화 능력을 평가하는 벤치마크 'HarnessOpt-Bench'를 공개했어요.
HarnessOpt-Bench는 LLM이 제한된 예산 안에서 하니스를 수정하고 최종 후보를 선정하며, 평가 환경은 자원 사용량을 측정하고 후보 버전을 보존해요.
5개의 최첨단 LLM을 다양한 작업과 초기 환경에서 평가한 결과, 모델 간 성능 차이가 크고 작업 및 초기 환경에 따라 개선 효과가 크게 달라지는 것으로 나타났어요.