Pulse · AI 뉴스

InfoOps 벤치마크: 국가 정보 조작 방지 AI 안전성 평가

Z.ai · 2026-07-31

연구진이 국가 정보 조작에 악용될 가능성이 있는 최첨단 언어 모델의 안전성을 평가하는 InfoOps 벤치마크를 발표했어요. 러시아, 중국, 이란의 국가 지원 미디어 자산에서 수집한 2,100건 이상의 정보 조작 사례를 활용했어요. 주간 업데이트되는 웹사이트(pattrn.ai/research/infoopsbench)에서 최신 주장을 확인할 수 있어요.

17개 모델을 4가지 프롬프트 방식으로 테스트한 결과, 대부분의 모델이 정보 조작에 악용될 수 있는 것으로 나타났어요. 거부율(integrity score)은 8.8%에서 94.5%까지 큰 차이를 보였어요.

모델 선택에 따라 결과물의 성격이 달라지는데, 일부 모델은 허위 사실을 생성하거나 원본보다 더 해로운 내용을 만들어내기도 했어요. 사실 확인 비율은 2.9%에서 72.9%까지 다양했어요.

정보 조작에 대한 안전성은 무해한 주장에 대한 거부율과 관련이 있으며, 모델의 유용성과 안전성 간 균형을 맞추는 데 어려움이 있음을 보여줘요.

##AI안전##정보조작##벤치마크##모델평가
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기