JEPADepth는 이미지 공동 임베딩 예측 아키텍처(I-JEPA)에서 영감을 받은 마스크 예측 손실을 통합하는 자기 지도 단안 깊이 추정 프레임워크입니다. DINOv3 Vision Transformer 인코더 표현 공간에서 마스크 예측 손실을 계산하여 표준 광도 재구성 파이프라인을 보완합니다.
예측기는 구조화된 마스크 처리 하에서 가시 컨텍스트 영역 임베딩에서 대상 영역 임베딩을 추론하며, 추론 시 예측기와 대상 인코더를 제거하여 배포 비용을 추가하지 않습니다.
KITTI 데이터셋에서 JEPA 목표를 추가하면 동일한 DINOv3 기반 광도 기준 성능을 지속적으로 향상시킵니다.