Pulse · AI 뉴스

오픈 모델 9종, 정보 출처 진위 여부 판단 벤치마크 결과: DeepSeek V4, Qwen 3.8, Nemotron 3 Ultra

Qwen · 2026-08-29

연구자가 에이전트 검색 과정에서 가짜 정보 출처를 식별하는 벤치마크 'EchoNet'을 개발했어요. 가짜 웹 페이지를 검색하고 답변하는 에이전트의 성능을 평가하는 방식이에요.

벤치마크 결과, GLM 5.2와 Qwen3.8 모델은 가짜 정보에 속지 않았고, DeepSeek V4 Flash는 가장 쉽게 속는 것으로 나타났어요. 가짜 정보에 속아 오답을 내놓는 비율이 15.8%에 달했어요.

가짜 정보에 속지 않으면서도 정확한 답변을 제공하는 'EAS(Epistemic Arbitration Score)'에서 GLM 5.2가 1.000점으로 가장 높은 점수를 기록했고, Qwen3.7 Max가 뒤를 이었어요. 가짜 정보에 속아 오답을 내놓는 가장 큰 원인은 '가짜 다수'에 속는 것이었어요.

##에이전트##벤치마크##오픈소스##DeepSeek##Qwen
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기