연구진은 의료 영상 분석에 사용되는 Vision-Language Model(VLM)의 설명 가능성을 높이기 위해 Tree-Gram Parsing을 활용한 ParseFIxLIP를 개발했어요.
기존 FIxLIP 프레임워크는 토크나이저의 세분화로 인해 의료 개념이 분산되어 노이즈가 많은 설명을 제공하는 문제를 겪었어요.
ParseFIxLIP는 의존성 파싱 트리를 활용하여 의미적으로 일관된 토큰 그룹으로 설명 플레이어를 정의하여 복잡한 의료 개념을 통합하고 설명의 해석 가능성을 높였어요.