[논문 리뷰] Towards Safe Self-Distillation of Internet-Scale Text-to-Image Diffusion Models
이 논문은 안전한 자기소양 확산(Safe Self-Distillation Diffusion, sdd)을 제안하며, 텍스트-이미지 확산 모델을 자기소양을 통해 미세조정하여 유해하거나 저작권이 보호된 콘텐츠—예를 들어 노골적 이미지나 특정 예술가의 스타일—을 제거하는 방법이다. 이는 목표 개념에 대한 노이즈 예측을 무조건적 모델의 출력과 일치시킴으로써 구현된다. sdd는 이미지 품질을 유지하면서 동시에 여러 개념을 효과적으로 제거할 수 있으며, 안전성과 충실도 측면에서 이전의 방법들을 능가한다.
Large-scale image generation models, with impressive quality made possible by the vast amount of data available on the Internet, raise social concerns that these models may generate harmful or copyrighted content. The biases and harmfulness arise throughout the entire training process and are hard to completely remove, which have become significant hurdles to the safe deployment of these models. In this paper, we propose a method called SDD to prevent problematic content generation in text-to-image diffusion models. We self-distill the diffusion model to guide the noise estimate conditioned on the target removal concept to match the unconditional one. Compared to the previous methods, our method eliminates a much greater proportion of harmful content from the generated images without degrading the overall image quality. Furthermore, our method allows the removal of multiple concepts at once, whereas previous works are limited to removing a single concept at a time.
연구 동기 및 목표
- 인터넷 규모의 텍스트-이미지 확산 모델에서의 유해 및 저작권 보호 콘텐츠 생성 문제를 해결하기 위해.
- 이미지 품질을 떨어뜨리거나 치명적인 기억 상실을 일으키지 않으면서 문제의 개념을 제거할 수 있는 방법을 개발하기 위해.
- 단일 개념 접근 방식의 한계를 극복하고, 동시에 여러 유해 또는 저작권 보호 콘텐츠 개념을 제거할 수 있도록 하기 위해.
- 실제 도입에 적합한 안전하고 효율적이며 구현 가능한 사후 훈련 솔루션을 제공하기 위해.
제안 방법
- 이 방법은 목표 개념에 대해 무조건적 노이즈 예측을 일치시킴으로써 자기소양을 수행하며, 텍스트 프롬프트를 사용해 소양 과정을 안내한다.
- 훈련을 안정화하고 사소한 기억 상실을 완화하기 위해 지수이동평균(EMA) 교사 모델을 사용한다.
- 학생 모델은 목표 개념 프롬프트에 조건화된 잠재 공간에서 노이즈를 예측하도록 최적화되며, EMA 교사 모델의 무조건적 예측과 일치시킨다.
- 이 방법은 사전훈련 이후 적용되며, 원본 훈련 데이터에 접근이 필요 없어, 실무 환경에서의 모델 미세조정에 적합하다.
- 다중 개념 제거를 위해 여러 목표 개념에 대해 순차적 또는 동시적으로 소양 과정을 적용할 수 있다.
- 훈련 목표는 학생의 노이즈 예측과 EMA 교사의 무조건적 예측 간 L2 거리의 최소화를 통해 과적합을 방지하면서 일치를 보장한다.
실험 결과
연구 질문
- RQ1자기소양이 이미지 품질을 떨어뜨리지 않으면서도 텍스트-이미지 확산 모델에서 유해 콘텐츠를 효과적으로 제거하는 데 유용한가?
- RQ2제안된 방법은 기존의 정화 기법과 비교해 안전성과 충실도 측면에서 어떻게 성능을 내는가?
- RQ3이 방법은 한 번의 미세조정 과정에서 동시에 여러 개념—예를 들어, 노골적 이미지나 특정 예술가의 스타일—을 제거할 수 있는가?
- RQ4EMA 교사 모델을 사용할 경우 개념 제거 과정에서 치명적인 기억 상실을 어느 정도 방지할 수 있는가?
- RQ5미세조정 이후, 이 방법은 관련 없는 프롬프트에 대해서도 다양한 고품질 이미지를 생성할 능력을 유지하는가?
주요 결과
- sdd는 기본 Stable Diffusion 모델의 NSFW(노골적) 이미지 비율을 5,000장의 벤치마크에서 74.18%에서 12.62%로 감소시켜, 기존 방법들을 크게 능가한다.
- 이 방법은 이미지 품질을 높게 유지하여, Fréchet Inception Distance(FID)가 15.142를 기록했으며, esd 및 sld와 같은 다른 방법들과 비교해 유사하거나 더 우수한 성능을 보였다.
- sdd는 생성된 이미지에서 특정 예술가의 스타일(예: 반 고흐의 스타일)을 성공적으로 제거하면서도 프롬프트의 핵심 내용과 예술적 의도를 유지했다.
- sd+neg나 sld와 같은 단일 개념 방법과 달리, sdd는 동시에 여러 개념을 제거할 때도 뛰어난 성능을 유지하여 다른 접근 방식에서 관찰되는 성능 저하를 피했다.
- EMA 교사 모델은 다수의 개념을 제거하는 동안에도 일반 지식을 효과적으로 유지하고 이미지 품질의 열화를 방지했다.
- 이 방법은 안정적이고 빠른 훈련을 보였으며, 소양 과정에서 서로 다른 개념 간 간섭이 최소화되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.