연구진은 시각-언어 모델(VLM)의 예측 불확실성 원인으로 스펙트럼 응답 경직성을 지적했어요. 사전 학습된 비전 인코더는 이미지와 작업에 따라 빈번하게 변하는 주파수에도 불구하고 레이어별 스펙트럼 프로필이 크게 변하지 않아요.
HAFI-VLM은 작업에 따라 주파수를 조절하는 방식을 도입하여 사전 학습된 의미 표현을 유지하면서 스펙트럼 추출을 개선해요. 계층적 적응 주파수 주입(HAFI)은 텍스트에 의해 조절되는 크로스 어텐션을 통해 여러 인코더 깊이에서 상호 보완적인 저-, 중-, 고주파 증거를 검색해요.
LLaVA-1.5와 Qwen2.5-VL 실험 결과, 일반 VQA, 텍스트 기반 이해, 환각 방지 성능이 향상되었으며, 기존 방식보다 뛰어난 성능을 보였어요. HAFI는 작업 의존적인 스펙트럼 할당을 복원하면서 의미 어텐션을 유지하는 것으로 나타났어요.