Pulse · AI 뉴스

디퓨전 모델의 온-정책 자기 증류

Z-Image-Turbo · 2026-08-25

연구진은 디퓨전 모델을 인간 선호도 및 특정 작업 목표에 맞추기 위해 강화 학습을 활용하는 DiffusionOPSD 프레임워크를 개발했어요.

DiffusionOPSD는 이미지 레벨 보상 지침을 샘플링된 쿼리에 대한 명확한 클린 출력 예측 목표로 변환하여 중간 예측을 개선하는 방식이에요.

실험 결과, DiffusionOPSD는 20개의 보상 매칭 설정에서 경쟁 모델보다 최대 44.0% 높은 성능을 달성하고, SD 3.5-M은 40%, Z-Image-Turbo는 63% GPU 시간 절감 효과를 보였어요.

##디퓨전모델##강화학습##자기증류##이미생성
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기