Pulse · AI 뉴스

LLM 자기 일관성 오류 합의 분해: GPT-4.1 사례 연구

OpenAI · 2026-08-19

연구진은 LLM 샘플 다수 투표 방식의 오류를 분석했어요. '플루랄리스틱 어그리먼트 인덱스'를 정의해 기계적 요소와 설명되지 않는 잔여 요소를 분해했어요. GPQA-Diamond 벤치마크에서는 응답 선호도가 81~93%의 합의를 설명했지만, AIME에서는 59~78%만 설명했어요. 어려운 질문에서 자기 일관성 오류가 재현되었고, 높은 합의 빈도에서도 정확도가 0.42~0.83에 불과했어요.

연구는 기존 투표 방식의 개선 없이, 코드와 증거를 공개하여 재현 가능성을 확보했어요.

본 연구는 LLM 자기 일관성이 단순히 정확성을 보장하는 것이 아니라, 등급화된 증거임을 시사합니다.

##LLM##자기일관성##GPT-4.1##연구분석
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기