연구진은 디퓨전 모델을 인간 선호도 및 특정 작업 목표에 맞추기 위해 강화 학습을 활용하는 DiffusionOPSD 프레임워크를 개발했어요.
DiffusionOPSD는 이미지 레벨 보상 지침을 샘플링된 쿼리에 대한 깨끗한 출력 예측의 명시적 목표로 변환하여 중간 노이즈 제거 예측이 어떻게 변경되어야 하는지 구체적으로 제시합니다.
실험 결과, DiffusionOPSD는 20개의 보상 매칭 설정에서 10명의 평가자 및 2개의 백본에서 가장 강력한 경쟁 방법보다 최대 44.0% 더 높은 최종 홀드아웃 점수를 달성하고 SD 3.5-M에서 DiffusionNFT보다 GPU 시간 40%, Z-Image-Turbo에서 63%를 줄였습니다.