연구진이 디퓨전 LLM(DLLM)의 안전 메커니즘 취약점을 분석했어요. 기존 autoregressive 모델의 안전성 패턴을 상속하여 공격을 쉽게 전가할 수 있다는 것을 발견했어요.
DLLM의 안전 정렬은 여전히 희소하며, 모델 아키텍처에 상관없이 전이 공격이 가능해요. 자기-가지치기(self-pruning)를 통해 공격 성공률이 크게 증가했어요.
SN-Guided Diffusion이라는 새로운 jailbreak 프레임워크를 개발하여 안전 신경망(safety neuron)을 활용, 안전 영역을 우회하는 방식으로 완벽에 가까운 프롬프트 분리(AUROC = 1.0)를 달성했어요.
개발된 프레임워크는 Llama-3, Qwen, Gemini 등 다양한 모델에서 높은 공격 성공률을 보이며, 기존 jailbreaking 방식보다 훨씬 저렴한 비용으로 작동해요.