Skip to main content
QUICK REVIEW

[논문 리뷰] Mitigating Inappropriateness in Image Generation: Can there be Value in Reflecting the World's Ugliness?

Manuel Brack, F. Friedrich|arXiv (Cornell University)|2023. 05. 28.
Artificial Intelligence in Games인용 수 5
한 줄 요약

이 논문은 텍스트에서 이미지로의 확산 모델에서 부적절한 이미지 생성을 줄이기 위해 명시적 텍스트 지시어—특히 의미적 안내(SEGA)와 부정적 프롬프팅—를 사용하는 것을 조사한다. 모델이 '세상의 부패함'을 학습한 표현을 활용하여, 저자들은 이러한 추론 시 간섭이 11개의 오픈소스 모델 전반에서 부적절한 콘텐츠 생성 가능성을 크게 감소시킴을 입증한다. 여기서 SEGA는 부정적 프롬프팅보다 더 효과적인 것으로 나타났다.

ABSTRACT

Text-conditioned image generation models have recently achieved astonishing results in image quality and text alignment and are consequently employed in a fast-growing number of applications. Since they are highly data-driven, relying on billion-sized datasets randomly scraped from the web, they also reproduce inappropriate human behavior. Specifically, we demonstrate inappropriate degeneration on a large-scale for various generative text-to-image models, thus motivating the need for monitoring and moderating them at deployment. To this end, we evaluate mitigation strategies at inference to suppress the generation of inappropriate content. Our findings show that we can use models' representations of the world's ugliness to align them with human preferences.

연구 동기 및 목표

  • 최신 텍스트에서 이미지로의 확산 모델에서의 부적절한 콘텐츠 생성 정도를 체계적으로 평가하는 것.
  • 특히 SEGA와 부정적 프롬프팅과 같은 추론 시 지시 방법의 효과를 평가하여 이러한 콘텐츠를 억제하는 것.
  • 다양한 모델과 아키텍처 전반에서 안전성 개선 전략에 대한 대규모이고 정량적인 벤치마크를 제공하는 것.
  • 모델 내부의 '부패함' 표현을 활용하여 생성된 이미지가 인간의 선호와 일치하도록 조정할 수 있는지 탐색하는 것.
  • 비용이 많이 들거나 재학습이 필요한 데이터 필터링을 피하면서도 실세계에서 적용 가능한, 융통성 있는 솔루션을 제공하는 것.

제안 방법

  • 저자들은 11개의 오픈소스 텍스트에서 이미지로의 확산 모델을 대상으로 150만 장 이상의 이미지를 생성하는 대규모 평가 프레임워크를 사용한다.
  • 두 가지 지시 기반 억제 전략을 적용한다: 의미적 안내(SEGA)는 원하지 않는 개념에서 멀어지도록 생성을 이끄는 스텝을 추가하고, 부정적 프롬프팅은 억제 프롬프트를 기반으로 비조건부 노이즈 제거 단계를 조건화한다.
  • 부적절한 콘텐츠 생성을 테스트하기 위해 I2P(부적절한 이미지 프롬프트) 데이터셋을 사용하여 프롬프트를 제공한다.
  • 부적절한 콘텐츠는 Q16/NudeNet 분류기의 조합을 통해 분류되며, 확률과 기대 최대 부적절성 수준을 측정한다.
  • 외부 분류기가 필요 없는 조건부 생성을 가능하게 하기 위해 분류기 없는 가이던스를 사용한다.
  • 평가에는 모델당 25개의 프롬프트에 대해 기대 최대 부적절성의 부트스트랩 추정이 포함된다.
Figure 1 : Examples of inappropriate degeneration and their mitigation across various models. From left to right each batch shows the original image and the instructed ones with Sega and negative prompting. Prompts are taken from the inappropriate-image-prompts (I2P) dataset. Images displaying nudit
Figure 1 : Examples of inappropriate degeneration and their mitigation across various models. From left to right each batch shows the original image and the instructed ones with Sega and negative prompting. Prompts are taken from the inappropriate-image-prompts (I2P) dataset. Images displaying nudit

실험 결과

연구 질문

  • RQ1모호하거나 명시적인 프롬프트가 주어졌을 때 현재의 텍스트에서 이미지로의 확산 모델이 얼마나 많은 부적절한 콘텐츠를 생성하는가?
  • RQ2SEGA와 부정적 프롬프팅은 다양한 모델과 아키텍처 전반에서 부적절한 이미지 생성을 효과적으로 줄일 수 있는가?
  • RQ3SEGA와 부정적 프롬프팅은 억제 효과와 콘텐츠 억제 제어 측면에서 어떻게 비교되는가?
  • RQ4모델 내부의 '부패함' 표현을 활용하여 이미지 생성을 인간의 안전 선호와 일치시킬 수 있는가?
  • RQ5실세계 배포 환경에서 지시 기반 억제 전략의 확장성과 일반화 능력은 어떠한가?

주요 결과

  • 연구는 11개의 오픈소스 텍스트에서 이미지로의 확산 모델 전반에서 부적절한 콘텐츠 생성이 널리 퍼져 있음을 입증하며, 비명시적 프롬프트에서도 부적절한 이미지 생성 확률이 높다는 점을 보여준다.
  • SEGA는 부적절한 콘텐츠 생성 확률을 크게 감소시키며, 성적 및 전반적인 부적절성 카테고리에서 부정적 프롬프팅보다 더 효과적임을 입증한다.
  • SEGA 적용 시 기대 최대 부적절성이 크게 감소하여, 프롬프트 세트당 적어도 한 번 이상의 공격적인 이미지 생성 가능성이 크게 줄어든다는 것을 시사한다.
  • 부정적 프롬프팅도 부적절성을 감소시키지만, 제어력이 떨어지고 SEGA에 비해 효과가 떨어지며, 특히 암시적 또는 암묵적인 형태의 부적절한 콘텐츠 억제에 취약하다.
  • 결과적으로 추론 시 지시 기반 억제 전략은 데이터 필터링이나 미세조정에 비해 확장성 있고 융통성 있는 대안이며, 계산 오버헤드가 최소한이다.
  • Q16/NudeNet 분류기는 보수적인 기준을 제공하므로 실제 부적절성은 다소 과소 평가될 수 있음을 시사하지만, 억제 효과의 추세는 여전히 강력하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.