연구진이 의료 영상 질의응답(VQA) 성능 향상을 위해 주파수 영역 이중 분기 융합 모듈을 개발했어요. 이 모듈은 입력 질문에 따라 적응적으로 전역 저주파 구조와 미세 고주파 디테일을 선택하여 공간 표현을 재구성합니다. BiomedCLIP 인코더의 텍스처 민감 레이어와 의미 레이어에서 보완적인 특징을 추출하여 질문 표현과 정렬하고, BioBART 디코더와 함께 학습했어요.
PMC-VQA에서 사전 학습하고 VQA-RAD 및 SLAKE 벤치마크에서 미세 조정하여 의료 VQA 성능을 개선했습니다. 기존 방식 대비 가볍고 효율적인 구조를 유지합니다.