Pulse · AI 뉴스

VA-Judger: 인간 선호도 피드백 기반의 공동 비디오-오디오 생성 보상 모델

VA-Judger · 2026-08-19

연구진이 인간 선호도를 반영한 공동 비디오-오디오 생성 보상 모델 VA-Judger를 개발했어요. VA-Judger는 9천 개의 프롬프트와 1만 3천 개의 세밀한 쌍방향 비교로 구성된 VAPref-10K 데이터셋을 활용했어요. VA-Judger는 기존 방식보다 인간 선호도를 더 잘 예측하고, 공동 비디오-오디오 생성 모델의 품질을 향상시키는 데 기여했어요.

VA-Judger는 명확한 품질 차이를 가진 쌍부터 학습하여 구조적인 출력과 대략적인 선호도 구분을 확립하고, 인간 주석으로 검증된 거부 샘플링을 통해 더 까다로운 근접 품질 비교에 대한 신뢰할 수 있는 선호도 설명을 증류해요. 마지막으로, 인간 피드백을 개별 품질 차원으로 분해하여 단일 이진 선호도 레이블보다 더 밀집된 보상 신호를 제공하는 차원별 강화 학습을 수행해요.

VA-Judger는 in-domain 및 out-of-domain 평가 모두에서 인간 선호도를 예측하는 데 있어 기존 메트릭 기반 모델보다 뛰어난 성능을 보여줬어요.

##비디오##오디오##AI##보상모델##VA-Judger
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기