연구진은 LLM 양자화가 개인 정보 위험을 낮추는지 측정하기 위해 기존 연구의 membership inference 방식에 의문을 제기했어요.
Pythia 모델을 활용해 5단계 양자화 과정에서 verbatim 추출 현상을 측정했으며, 모델 크기 및 양자화 알고리즘에 따른 변화를 관찰했어요.
양자화는 선택적 망각을 유발하여 verbatim 추출이 모델 성능 저하보다 빠르게 감소하지만, 개인 정보 보호에 충분하지 않다는 결론을 내렸어요.
연구 결과, 대규모 모델의 경우 4비트 양자화에서도 상당량의 데이터가 그대로 추출되며, 모델 크기가 커질수록 생존하는 데이터 비율이 증가했어요.