ScaleVid는 비디오 객체의 크기를 객체 중심 축을 따라 비균질적으로 조정하면서도 현실적인 기하학적 구조, 시간적 일관성, 배경 일관성을 유지하는 기술이에요.
메시 기반 방법이 필요 없고, 3D 재구축 없이 실제 비디오를 합성하는 방식으로 2단계 프레임워크를 사용하며, 객체 중심 3D 변형 지침을 도입하여 기하학적 스케일링을 가능하게 해요.
실험 결과, 기존 방식보다 기하학적 일관성, 전경 충실도, 배경 보존 측면에서 우수한 성능을 보였고, 더 빠르고 실용적인 추론이 가능했어요.