연구진이 시각과 촉각 정보를 통합하여 조작 능력을 향상시키는 VT-MUSE 프레임워크를 제안했어요. 기존 방식은 시각과 촉각 정보를 개별적으로 처리하여 미세한 상호 의존성을 놓치고, 시간적 변화를 고려하지 않았어요.
VT-MUSE는 시각적 맥락과 접촉 역학을 유지하는 잠재 표현을 학습하기 위해 마스크된 시각 시퀀스와 촉각 기록을 함께 처리하는 2단계 학습 프레임워크를 사용해요.
시뮬레이션 벤치마크에서 기존 방식보다 11% 향상된 성능을 보였고, 실제 환경에서도 상당한 개선을 달성했어요.