연구진은 컴퓨터 병리학 분야에서 테스트 시간 적응(TTA) 방법이 모델 설명의 신뢰성을 유지하는지 조사했어요. Camelyon17과 NCT CRC-HE 2개 병리 조직학 벤치마크에서 5가지 아키텍처와 17가지 TTA 방법을 활용해 2,958회 적응 실험을 진행했어요. CoTTA와 RoTTA 같은 지속적 방법은 모델 설명에 큰 변화를 주는 반면, frozen-backbone 방법은 설명에 거의 변화를 주지 않는다는 패턴을 발견했어요.
컨볼루션 신경망은 트랜스포머나 기초 모델보다 설명 변화에 더 민감하며, 적응 강도가 높아질수록 설명 변화도 커져요. 놀랍게도 설명 안정성은 적응 품질과 약하게 연결되어 있어, 정확도나 교정률이 저하되면서도 설명을 거의 완벽하게 보존하는 방법도 존재했어요.
연구진은 설명 안정성을 평가하는 지표, 프로토콜, 전체 벤치마크를 공개하여 정확하고 안정적이며 임상적으로 감사 가능한 적응 방법 개발을 지원할 예정이에요. 이 연구는 TTA에서 설명 안정성이 별도의 신뢰성 축임을 보여줍니다.