VANE는 비전-언어-행동(VLA) 정책을 테스트 시간 훈련(TTT)을 통해 개선하는 새로운 프레임워크입니다. 현재 시각-언어 맥락을 기반으로 프롬프트 적응을 조건부로 설정하고 실행된 행동의 미래 시각적 결과로부터 학습합니다.
후보 업데이트는 라이브 정책과 분리되어 후속 관찰에 대해 평가되며 미래 증거에 의해 뒷받침될 때만 커밋되므로 적응이 선택적이고 되돌릴 수 있습니다.
SimplerEnv WidowX 환경에서 VANE은 평균 성공률을 TTT 기준선보다 3.2% 향상시켰으며, Google Robot 환경에서도 배포 시간 동안의 이득이 과제 및 로봇에 따라 달라지는 것을 확인했습니다.