연구진은 LLM 하네스 최적화를 위한 새로운 방법인 Task-CoEvolve를 제안했어요. Task-CoEvolve는 하네스 코드를 반복적으로 수정하며 성능을 개선하지만, 검증 작업 선택을 통해 평가 비용을 절감해요.
Task-CoEvolve는 과거 결과를 기반으로 분산 가중 샘플링을 사용하여 하네스의 역량 경계선 근처의 작업에 집중하고, 샘플링 확률을 고려하여 전체 집합 점수를 추정해요.
온라인 텍스트 분류 및 Terminal-Bench 2.1 실험에서 Task-CoEvolve는 기존 방식보다 성능이 뛰어나고, 전체 집합 검색과 동일한 성능을 유지하면서 평가 횟수를 80% 줄였어요.