연구진은 검색 에이전트 훈련 시 발생하는 검색 어라이징 현상을 관찰했어요. 이 현상은 동일 질문에 대해 생성되는 쿼리 문자열이 달라지지만, 증거 집합은 겹치는 문제를 야기해요. 이를 해결하기 위해 그래프 기반 검색 프레임워크 Harness-G를 제안했어요. Harness-G는 자유 형식 쿼리 생성을 유한한 액션 선택으로 재구성하여 검색 어라이징을 줄이고 동일 상태의 대안을 직접 비교할 수 있도록 설계됐어요.
Harness-G는 액션 선택 시 증거 문장이나 엔티티를 선택하거나 답변을 선택하며, 환경은 메뉴를 구성하고 검색 상태를 추적하고 각 선택을 검증하고 실행해요. 새로운 Structured Non-myopic Credit (SNC) 기법은 고정된 답변 점수를 사용하여 선택된 액션과 대안을 비교하고 이전 액션에 다운스트림 이득을 할당해요.
6개의 QA 벤치마크에서 Harness-G는 1.5B 및 3B 규모에서 가장 높은 평균 F1 점수를 달성했어요. 기존 최고 성능 모델인 Graph-R1을 각각 10.74점 및 3.98점 앞섰어요.