연구진이 LLM에서 얻은 식재료 라벨과 다중 모드 융합을 활용하여 음식 이미지 분할 성능을 향상시키는 LIM-F 및 LIM-Q 모듈을 제안했어요.
LIM-F는 다양한 이미지 인코더와 호환되며 LIM-Q는 Mask2Former 기반 디코더에 적용 가능하며, 이미지와 텍스트를 미리 정렬할 필요 없이 시각 분석 파이프라인에 의미 있는 식재료 정보를 주입해요.
FoodSeg103 벤치마크에서 최고 성능을 달성했으며, Swin-L 이미지 인코더와 Mask2Former 디코더에 LIM-Q를 통합하여 평균 IoU 55.0을 기록했어요.
훈련 시 GPU 메모리 사용량이 3.8GB만 증가하여 실용적이고 확장 가능한 음식 이해 솔루션을 제공해요.