연구팀은 인간에게는 읽히지만 모델은 인식하기 어려운 시각적 공격에 취약한 OCR 모델의 문제를 제기하며, 새로운 벤치마크 AdvSpot을 공개했어요.
AdvSpot은 390장의 이미지로 구성되어 있으며, 5가지 주요 범주와 13가지 세분화된 시각적 공격 OCR 유형을 포함하고 있어요.
ArmorOCR 프레임워크는 On-Policy Self-Distillation (OPSD)과 Group Relative Policy Optimization (GRPO)을 활용하여 시각적 공격에 대한 OCR 인식 성능을 향상시키고 일반적인 OCR 능력도 유지했어요.