Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating a Synthetic Image Dataset Generated with Stable Diffusion

Andreas Stöckl|arXiv (Cornell University)|2022. 11. 03.
Image Retrieval and Classification Techniques인용 수 9
한 줄 요약

이 논문은 WordNet 개념을 텍스트 프롬프트로 사용하여 Stable Diffusion를 통해 생성한 합성 이미지 데이터셋을 평가하며, 이미지 품질과 분류 성능을 검토한다. 비전 트랜스포머를 활용한 연구 결과, 73%의 개념이 적어도 한 장 이상의 이미지를 정확히 분류하는 것으로 나타났지만, 매우 구체적인 동물의 경우 성능이 크게 떨어져 모델의 광범위한 능력과 미세한 시각적 정확도에서의 한계를 동시에 드러낸다.

ABSTRACT

We generate synthetic images with the "Stable Diffusion" image generation model using the Wordnet taxonomy and the definitions of concepts it contains. This synthetic image database can be used as training data for data augmentation in machine learning applications, and it is used to investigate the capabilities of the Stable Diffusion model. Analyses show that Stable Diffusion can produce correct images for a large number of concepts, but also a large variety of different representations. The results show differences depending on the test concepts considered and problems with very specific concepts. These evaluations were performed using a vision transformer model for image classification.

연구 동기 및 목표

  • 시스템적이고 분류 기반 접근을 통해 Stable Diffusion에 의해 생성된 합성 이미지의 품질과 표현 정밀도를 평가하는 것.
  • WordNet 정의된 개념에서 파생된 합성 이미지의 분류 성능이 사전 훈련된 비전 트랜스포머에 얼마나 잘 맞는지 평가하는 것.
  • 특히 구체성과 시각적 복잡성 측면에서 다양한 의미적 범주 간 분류 성능의 패턴을 규명하는 것.
  • 감독 학습에서의 데이터 증강 및 모델 평가에 있어 이러한 합성 데이터셋의 잠재적 활용 가능성을 탐색하는 것.
  • Stable Diffusion의 콘텐츠 필터링 기능의 신뢰성을 검토하며, 잘못되거나 부적절한 콘텐츠 생성 실패 사례를 규명하는 것.

제안 방법

  • WordNet 개념의 정의에서 유도된 텍스트 프롬프트를 사용하여 Stable Diffusion 1.4 모델을 통해 합성 이미지를 생성한다.
  • 의미적 범주 간 체계적인 평가를 가능하게 하기 위해 WordNet의 계층적 구조를 활용해 데이터셋을 구성한다.
  • 실제 ImageNet 데이터를 벤치마크로 사용하여 top-1 및 top-5 정확도를 기준으로 사전 훈련된 비전 트랜스포머(vit_h_14)를 활용해 이미지 분류를 수행한다.
  • 2차원 공간에서 FastText 단어 임베딩을 사용해 의미적 클러스터를 시각화하기 위해 차원 축소를 위해 PCA와 t-SNE를 적용한다.
  • 희귀어나 복합어를 포함한 다단어 클래스 이름을 위한 FastText 임베딩(300D)을 사용하며, 개별 단어 벡터의 합을 통해 커버리지 확보를 도모한다.
  • 각 WordNet 초급군 및 하위군별 분류 성능을 평가하며, 정확도, 이미지 다양성, 실패 사례에 중점을 둔다.

실험 결과

연구 질문

  • RQ1Stable Diffusion가 WordNet 개념의 광범위한 범위에서 비전 트랜스포머에 의해 정확히 분류되는 이미지를 얼마나 잘 생성할 수 있는가?
  • RQ2일반적 개념과 매우 구체적인 개념 간에 분류 정확도가 어떻게 달라지는가?
  • RQ3의미적 계층과 개념의 특정성은 모델이 인식 가능한 이미지를 생성하는 데 어떤 역할을 하는가?
  • RQ4각 개념당 이미지 다양성이 분류 성능에 미치는 영향은 무엇이며, 이는 데이터 증강에 어떤 함의를 갖는가?
  • RQ5특히 잘못되거나 부적절한 표현을 생성하는 경우, Stable Diffusion의 콘텐츠 필터링 기능은 어느 정도 실패하는가?

주요 결과

  • 검토된 개념 중 73% (1180개 중 861개)가 비전 트랜스포머에 의해 적어도 한 장 이상의 이미지를 정확히 분류하여 광범위한 표현 능력을 보여준다.
  • 'Building' 초급군은 높은 인식률을 보였으며, 'Restaurant', 'Monastery', 'Greenhouse' 이미지의 경우 100% 정확도로 분류되었다.
  • 'Animal' 초급군은 평균 이하의 성능를 보였으며, 162개의 동물 클래스에서 정확히 분류된 이미지가 전혀 없었는데, 이는 높은 구체성과 계층 깊이 때문이었다.
  • 'Black footed ferret'와 'leafhopper'와 같은 특정 동물은 자주 잘못 분류되거나 시각적으로 정확하지 않아, 미세한 시각적 생성 능력의 한계를 보여준다.
  • t-SNE와 PCA를 활용한 시각화 결과, 정확히 분류된 이미지들은 의미적 임베딩 공간에서 의미 있는 클러스터를 형성하지만, 특히 'Animal' 그룹 내에서 저정확도 클래스를 나타내는 작은 빨간 점들이 산재해 있음을 확인했다.
  • 연구에서는 프롬프트 제약 조건에도 불구하고 일부 생성된 이미지에 부적절하거나 잘못된 콘텐츠가 포함된 경우가 있어, Stable Diffusion의 콘텐츠 필터링 기능의 실패 사례를 규명했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.