연구진은 AI 에이전트의 런타임 환경 평가를 위한 ClawProBench를 발표했어요. OpenClaw 런타임을 기반으로 에이전트의 증거 획득, 라우팅, 안전 경계, 반복 실행 과정 등을 평가합니다. ClawProBench는 라이브 워크스페이스와 고정된 JSON 출력 계약을 포함한 두 가지 트랙으로 구성돼요. 실행 추적을 통해 정확성, 프로세스 품질, 효율성을 평가하며, 실패 증거를 보존합니다.
68개의 구성 요소를 전체 프로필에서, 37개를 고정된 환경에서 평가한 결과, 안전성 기반 평균 추적 점수는 0.7671을 기록했어요. 라이브 워크스페이스 작업은 런타임 작업보다 성능이 낮았고, 전체 프로필과 고정된 환경의 순위는 낮은 상관관계를 보였어요. 최종 답변 기반 순위는 에이전트의 런타임 환경 약점을 숨길 수 있습니다.
ClawProBench는 에이전트 평가의 새로운 기준을 제시하며, 기존 방식의 한계를 극복하고 에이전트의 실제 성능을 정확하게 측정하는 데 기여할 것으로 기대돼요.