연구팀이 이미지 편집 모델을 활용한 영상 편집 방법인 Qwen-Video-Edit을 공개했어요. Wan 2.1의 잠재 공간과 DiT의 토큰 공간을 연결하는 방식으로 작동해요. Ditto-1M 데이터셋으로 LoRA 또는 전체 파라미터 미세 조정 후 Wan 2.2 디노이징 과정을 거쳐 완성됐어요.
Qwen-Video-Edit은 기존 영상 생성 모델의 잠재 공간을 직접 편집하여 영상 편집을 수행하며, 이미지 모델이 이해하는 방식으로 잠재 프레임을 배열해요. 프로젝트 페이지와 Hugging Face 모델 페이지, GitHub 코드 저장소를 통해 확인할 수 있어요.
연구팀은 Qwen-Video-Edit의 작동 방식과 기술적 세부 사항을 공개하며, 이미지 편집 모델을 활용한 새로운 영상 편집 가능성을 제시했어요.