LLM이 설문 조사 응답자를 시뮬레이션하는 데 널리 사용되지만 답변은 균일하고 실제 집단 간 차이와 충실하지 않습니다.
Mistral-7B 모델의 1089개 위치에서 대표성 유사성 분석을 통해 169개 인구 통계적 셀에 대한 Pew 데이터를 기반으로 모델 내부의 인구 통계적 그룹 정체성이 어디에 있는지, 그 기하학적 구조가 실제 집단 간 의견 구조를 얼마나 충실하게 반영하는지, 그리고 모델이 인코딩하는 내용을 어떻게 사용하는지 조사했습니다.
연구 결과, 표준 마지막 토큰 잔류 읽기 방식은 모델을 과소평가하며, 6가지 유형 중 5가지에서 어텐션 헤드 읽기 방식이 지배합니다. 수정된 선택 충실도는 렉시컬 유사성 제어를 통과하면서 최대 로(rho) = 0.63, 즉 측정 신뢰도 상한의 약 70%까지 유지됩니다.
단일 헤드(L11 H16)는 6가지 유형 모두에서 중요한 고정 위치이며, 인종 기반 유형은 약하고 프롬프트에 취약합니다. 이 현상은 두 번째 모델 패밀리의 세 체크포인트에서 반복되며, 100억 개의 학습 토큰은 지도를 거의 이동시키지 않습니다.