연구진은 LLM 샘플 다수 투표 방식의 오류를 분석했어요. '플루랄리스틱 어그리먼트 인덱스'를 정의해 기계적 요소와 설명되지 않는 잔여 요소를 분해했어요. GPQA-Diamond 벤치마크에서는 응답 선호도가 81~93%의 합의를 설명했지만, AIME에서는 59~78%만 설명했어요. 어려운 질문에서 자기 일관성 오류가 재현되었고, 높은 합의 빈도에서도 정확도가 0.42~0.83에 불과했어요.
연구는 기존 투표 방식의 개선 없이, 코드와 증거를 공개하여 재현 가능성을 확보했어요.
본 연구는 LLM 자기 일관성이 단순히 정확성을 보장하는 것이 아니라, 등급화된 증거임을 시사합니다.