연구진이 테스트 시간 동안 추론 성능을 높이기 위해 '핵심 주장 거짓화' 원칙을 제안하고, 이를 구현하는 CLR(Claim-Level Reliability Assessment) 프레임워크를 개발했어요.
CLR은 전체 추론 과정을 핵심적인 결정 주장의 집합으로 압축하여 오류를 명확히 식별하고, 잘못된 주장을 반증하는 데 집중하여 효율성을 높여요.
4개의 LLM과 벤치마크에서 CLR은 pass@1 성능을 향상시키고, GPT-OSS-20B/CMIMC25에서 pass@1을 27.15%p 향상시키고 self-consistency 정확도를 77.50%에서 82.19%로 끌어올렸어요.