연구진이 UAV 이미지 내 시각적 지오그래핑 프레임워크 GrabVG를 제안했어요. 기존 방식의 한계를 극복하기 위해 사전 어텐션 가설 탐색과 그래프 어텐션 바인딩 두 단계로 분리했어요.
GrabVG는 텍스트 정보를 활용해 신뢰성 있는 객체 가설을 생성하고, 이를 그래프로 구성해 시각적 단서와 공간적 관계를 결합하여 정확한 타겟 위치를 찾아내요.
AerialVG 및 AerialSense 데이터셋 실험 결과, 기존 방식 대비 정확도가 각각 10.55% 및 8.76% 향상된 성능을 보여줬어요.