Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Latent Diffusion: Mitigating Inappropriate Degeneration in Diffusion Models

Patrick Schramowski, Manuel Brack|arXiv (Cornell University)|2022. 11. 09.
Generative Adversarial Networks and Image Synthesis인용 수 8
한 줄 요약

이 논문은 텍스트-이미지 확산 모델에서 부적절한 생성을 임의로 억제하기 위해 고도로 정제된 잠복 공간을 조작하는, 훈련이 필요 없고 분류기 기반의 새로운 방법인 안전한 잠복 확산(Safe Latent Diffusion, SLD)을 소개한다. 새로운 테스트베드인 부적절한 이미지 프롬프트(Inappropriate Image Prompts, I2P)를 사용하여, 저자들은 SLD가 흉악성, 폭력, 노골적인 노골성 등의 부적절한 콘텐츠를 효과적으로 억제함으로써 이미지 품질이나 텍스트 정렬도 손상시키지 않음을 입증한다.

ABSTRACT

Text-conditioned image generation models have recently achieved astonishing results in image quality and text alignment and are consequently employed in a fast-growing number of applications. Since they are highly data-driven, relying on billion-sized datasets randomly scraped from the internet, they also suffer, as we demonstrate, from degenerated and biased human behavior. In turn, they may even reinforce such biases. To help combat these undesired side effects, we present safe latent diffusion (SLD). Specifically, to measure the inappropriate degeneration due to unfiltered and imbalanced training sets, we establish a novel image generation test bed-inappropriate image prompts (I2P)-containing dedicated, real-world image-to-text prompts covering concepts such as nudity and violence. As our exhaustive empirical evaluation demonstrates, the introduced SLD removes and suppresses inappropriate image parts during the diffusion process, with no additional training required and no adverse effect on overall image quality or text alignment.

연구 동기 및 목표

  • 무분별하게 필터링되지 않은 대규모 데이터셋으로 훈련된 텍스트-이미지 확산 모델에서 발생하는 부적절하고 편향된 생성 문제를 해결하기 위해.
  • 실제 사용자가 생성한 프롬프트를 기반으로, 스테이블 디퓨전과 같은 모델에서 발생할 수 있는 열악한 행동과 편향의 위험을 체계적으로 측정하기 위해.
  • 추가 훈련이나 외부 분류기 없이도 유해 콘텐츠를 억제할 수 있는 보완 전략을 개발하기 위해.
  • 특화된 실세계 테스트베드를 통해 AI 생성 이미지의 윤리적 영향을 평가하기 위해.
  • 모델가 내재한 부적절성 인식 지식을 활용하여, 확산 모델의 안전하고 책임감 있는 배포를 위한 프레임워크를 제공하기 위해.

제안 방법

  • 확산 과정 중 잠복 공간을 수정함으로써 부적절한 생성을 억제하는 안전한 잠복 확산(Safe Latent Diffusion, SLD) 방법을 제안한다.
  • 부적절성 점수를 세 개의 검출기로부터 확보한 4,703개의 실세계 텍스트-이미지 프롬프트를 포함하는 새로운 테스트베드인 부적절한 이미지 프롬프트(Inappropriate Image Prompts, I2P)를 활용한다.
  • 사전 훈련 과정에서 학습된 내부 표현을 활용하여, 보완 훈련이나 외부 분류기가 필요 없이 부적절성에 대한 모델의 인식을 활용한다.
  • 정규화된 잡음 제거 동역학을 조정함으로써, 윤리적으로 부적절한 콘텐츠를 생성하지 않으면서도 의미적 정렬을 유지하는 잠복 공간 편집 기법을 적용한다.
  • 모델의 가중치에 내장된 도덕적 규범과 편향에 대한 기존 지식을 활용하여, 재훈련 없이도 윤리적 개입을 가능하게 한다.
  • I2P를 사용하여 다양한 실세계 프롬프트에 걸쳐 부적절한 콘텐츠 억제 정도를 정량화함으로써 방법의 유효성을 검증한다.
Figure 1 : Mitigating inappropriate degeneration in diffusion models. I2P (left) is a new testbed for evaluating neural text-to-image generations and their inappropriateness. Percentages represent the portion of inappropriate images this prompt generates using Stable Diffusion (SD). SD may generate
Figure 1 : Mitigating inappropriate degeneration in diffusion models. I2P (left) is a new testbed for evaluating neural text-to-image generations and their inappropriateness. Percentages represent the portion of inappropriate images this prompt generates using Stable Diffusion (SD). SD may generate

실험 결과

연구 질문

  • RQ1스테이블 디퓨전과 같은 사전 훈련된 텍스트-이미지 확산 모델이, 표면적으로 중립적이거나 명시적으로 표현되지 않은 프롬프트로도 부적절한 콘텐츠를 생성하는 정도는 어느 정도인가?
  • RQ2훈련이 필요 없고 분류기가 없는 방법이, 이미지 품질이나 텍스트 정렬에 영향을 주지 않으면서도 확산 모델에서의 부적절한 생성을 효과적으로 억제할 수 있는가?
  • RQ3기본 모델 대비, SLD는 다양한 실세계 프롬프트 세트에서 명시적인 콘텐츠를 얼마나 효과적으로 억제하는가?
  • RQ4모델 내부의 부적절성 인식 지식만으로도 윤리적 개입이 가능할 수 있는가? 외부 검출기나 보완 훈련이 필요 없는가?
  • RQ5I2P와 같은 표준화된 테스트베드가 확산 모델에서의 부적절한 생성 위험을 신뢰성 있게 측정하고 벤치마킹하는 데 유용한가?

주요 결과

  • I2P 테스트베드는 스테이블 디퓨전이 4,703개의 실세계 프롬프트에서 부적절한 콘텐츠를 생성하는 것으로 드러났으며, 폭력이나 노골성과 같은 직접적인 언급이 없는 경우에도 해당 사례가 존재했다.
  • SLD는 추가 훈련이나 외부 분류기가 필요 없이 I2P 벤치마크 전반에서 부적절한 이미지 생성을 성공적으로 억제하였다.
  • 이 방법은 이미지 품질을 유지하고 텍스트 정렬도 강력하게 유지하였으며, 생성 정밀도나 의미 정확도에 유의미한 손상이 없었다.
  • SLD는 노골성, 폭력, 혐오 관련 콘텐츠 등 다양한 부적절성 유형에 대해 강력한 억제 효과를 보였으며, 여러 검출기를 통한 검증을 통해 입증되었다.
  • 이 방법은 모델가 이미 내재한 부적절성 지식을 활용하여, 보완 훈련이나 외부 모델 구성 요소 없이도 효과적으로 작동함을 입증하였다.
  • I2P 데이터셋은 허깅페이스를 통해 MIT 라이선스 하에 공개되어 있으며, 향후 확산 모델의 안전성 벤치마킹을 위한 기초 자료로 활용 가능하다.
Figure 2 : Grounded in reporting bias, one can observe ethnic biases in DMs (left). For 50 selected countries, we generated 100 images with the prompt ‘ $<$ country $>$ body’ . The country Japan shows the highest probability of generating nude content. SLD uses the strong hyper parameter set to coun
Figure 2 : Grounded in reporting bias, one can observe ethnic biases in DMs (left). For 50 selected countries, we generated 100 images with the prompt ‘ $<$ country $>$ body’ . The country Japan shows the highest probability of generating nude content. SLD uses the strong hyper parameter set to coun

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.