Skip to main content
QUICK REVIEW

[논문 리뷰] Nepotistically Trained Generative-AI Models Collapse

Matyáš Boháček, Hany Farid|arXiv (Cornell University)|2023. 11. 20.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 인기 있는 텍스트-이미지 생성 확산 모델인 Stable Diffusion가 자체 생성 이미지의 3% 미만으로도 재학습될 경우 심각한 모델 붕괴를 겪는다는 것을 입증한다. 모델은 이미지 품질과 다양성이 급격히 악화되며, 이후 진짜 데이터로 재학습하더라도 완전한 복구가 이루어지지 않아, 자기 생성 콘텐츠를 통한 데이터 품질 낮추기 공격에 매우 취약한 것을 드러낸다.

ABSTRACT

Trained on massive amounts of human-generated content, AI-generated image synthesis is capable of reproducing semantically coherent images that match the visual appearance of its training data. We show that when retrained on even small amounts of their own creation, these generative-AI models produce highly distorted images. We also show that this distortion extends beyond the text prompts used in retraining, and that once affected, the models struggle to fully heal even after retraining on only real images.

연구 동기 및 목표

  • 생성형 AI 모델을 자체 합성 출력물로 재학습할 경우 발생하는 '모델 오염' 현상의 영향을 조사하기 위해.
  • 자체 생성 데이터가 Stable Diffusion와 같은 확산 기반 모델에서 이미지 품질과 다양성에 영구적인 악화를 초래하는지 평가하기 위해.
  • 이미지 품질과 의미적 일치도를 측정하기 위해 Fréchet Inception Distance (FID) 및 CLIP 점수를 사용하여 모델 성능을 평가하기 위해.
  • 재학습 과정에서 색상 일치 또는 품질 컨소시엄 기법이 모델 붕괴 효과를 완화할 수 있는지 평가하기 위해.
  • AI 훈련 데이터 기원과 모델의 강건성 맥락에서 데이터 오염의 광범위한 영향을 탐구하기 위해.

제안 방법

  • FFHQ에서 확보한 진짜 얼굴 데이터와 자체 생성 얼굴 데이터를 혼합한 다양한 비율의 데이터셋을 사용해 기초 Stable Diffusion 모델을 반복적으로 재학습시켰다.
  • 각 반복 단계에서 고정된 스텝 수를 가진 반복적 재학습을 수행하여, 혼합 데이터 배치마다 모델을 업데이트했다.
  • 색상 분포를 일치시켜 생성 이미지의 색상 분포를 진짜 이미지와 유사하게 만들기 위해 YCbCr 공간에서 히스토그램 매칭을 적용했다.
  • 단일 이미지 FID 점수를 사용해 저품질 생성 이미지를 선별하고, 이를 더 높은 품질의 합성 샘플로 대체한 후 재학습을 수행했다.
  • 이미지 품질과 의미적 일치도를 측정하기 위해 Fréchet Inception Distance (FID)와 CLIP 점수를 사용해 모델 성능을 평가했다.
  • 이미지 품질과 색상 분포의 영향을 분리하기 위해 컨소시엄된 데이터셋을 사용한 제어 실험을 수행했다.
Figure 3: Shown is the Fréchet inception distance (FID) and contrastive language-image pre-training score (CLIP) as a function of the number of retraining iterations and the composition of the retraining dataset ranging from $100\%$ SD-generated faces and $0\%$ real faces to $0\%$ SD-generated and $
Figure 3: Shown is the Fréchet inception distance (FID) and contrastive language-image pre-training score (CLIP) as a function of the number of retraining iterations and the composition of the retraining dataset ranging from $100\%$ SD-generated faces and $0\%$ real faces to $0\%$ SD-generated and $

실험 결과

연구 질문

  • RQ1Stable Diffusion가 자체 생성 이미지의 소량(예: 3%)만으로 재학습될 경우, 이미지 품질과 다양성은 어떻게 변화하는가?
  • RQ2진짜 이미지로만 재학습한 후에도 모델 붕괴 현상이 지속되는가? 이는 영구적인 손상임을 시사하는가?
  • RQ3색상 일치나 품질 컨소시엄과 같은 사전 처리 기법이 모델 붕괴를 방지하거나 연기할 수 있는가?
  • RQ4재학습 중 사용된 특정 텍스트 프롬프트 외부로도 오염 효과가 확장되는가?
  • RQ5이 붕괴 현상은 다양한 생성형 AI 모델과 훈련 데이터 조합에 대해 얼마나 일반화 가능한가?

주요 결과

  • Stable Diffusion는 자체 생성 이미지의 3%만으로도 재학습될 경우, 다섯 번째 재학습 반복 단계에서 이미지 품질이 심각하게 악화되는 급속한 모델 붕괴를 보인다.
  • 진짜 이미지로만 다섯 번의 추가 재학습을 수행한 후에도 모델은 회복되지 않아, 지속적인 악화와 제한된 복구 능력을 보이며 영구적인 손상 가능성을 시사한다.
  • 모든 오염 비율에서 FID 점수가 상승하고 CLIP 점수가 하락하며, 특히 100% 자체 생성 데이터일 경우 가장 심각한 악화가 관찰된다.
  • 색상 일치 및 고품질 컨소시엄 재학습 데이터를 사용한 제어 실험에서도 동일한 속도로 모델 붕괴가 발생하여, 색상 및 품질의 차이가 근본 원인이 아님을 시사한다.
  • 오염 효과는 재학습 중 사용된 원래 프롬프트 외부로까지 확장되어, 관련 없는 텍스트 프롬프트에 대해서도 모델 출력에 영향을 미치며, 광범위한 분포 이동을 나타낸다.
  • 첫 번째 재학습 반복 후에는 일시적으로 이미지 품질이 약간 향상되다가, 이후 일관되게 악화되는 경향을 보여, 붕괴 이전의 일시적 최적화가 있었음을 시사한다.
Nepotistically Trained Generative-AI Models Collapse

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.