연구진이 UAV 비전-언어 내비게이션(UAV-VLN)의 한계, 즉 지시 관련 랜드마크 시각적 관찰의 약한 Grounding, 장기적 역사 활용 부족, 지역 함정에서의 불안정한 의사결정 문제를 해결하기 위해 통합 프레임워크를 제안했어요.
제안된 프레임워크는 객체 수준 의미론과 상대적 공간 단서를 현재 관찰 상태에 주입하는 Instruction-grounded Semantic Enhancement 모듈과 관련성을 인지하는 동적 시간 집계 전략을 포함해요.
AerialVLN과 OpenFly 벤치마크에서 실험 결과, 제안된 방법이 최고 성능을 달성했어요.