[논문 리뷰] Rarity Score : A New Metric to Evaluate the Uncommonness of Synthesized Images
이 논문은 특징 공간 내의 근접 이웃 거리 측정을 통해 실재 데이터 다양체 내에서의 조합 밀도를 측정하여 합성 이미지의 개별 희귀성(희귀도)을 평가하는 데 사용할 수 있는 새로운 지표인 희귀도 점수(rarity score)를 제안한다. 이 방법은 생성 모델과 데이터셋 간의 희귀 샘플 생성 능력을 미세하게 비교할 수 있게 하며, FFHQ가 CelebA-HQ보다 더 많은 희귀 얼굴을 포함하고 있으며, LSUN-Cat가 AFHQ-Cat보다 더 다양한 샘플을 포함하고 있음을 드러내며, 성능은 특징 추출기 종류에 따라 달라진다.
Evaluation metrics in image synthesis play a key role to measure performances of generative models. However, most metrics mainly focus on image fidelity. Existing diversity metrics are derived by comparing distributions, and thus they cannot quantify the diversity or rarity degree of each generated image. In this work, we propose a new evaluation metric, called `rarity score', to measure the individual rarity of each image synthesized by generative models. We first show empirical observation that common samples are close to each other and rare samples are far from each other in nearest-neighbor distances of feature space. We then use our metric to demonstrate that the extent to which different generative models produce rare images can be effectively compared. We also propose a method to compare rarities between datasets that share the same concept such as CelebA-HQ and FFHQ. Finally, we analyze the use of metrics in different designs of feature spaces to better understand the relationship between feature spaces and resulting sparse images. Code will be publicly available online for the research community.
연구 동기 및 목표
- 기존 지표인 FID나 IS가 포착하지 못하는 합성 이미지의 개별 희귀성에 대한 정량적 측정 지표 부족 문제를 해결하기 위해.
- 이미지 품질을 희생시키지 않고도 생성 모델 간의 희귀하고 독특한 샘플 생성 능력을 비교할 수 있도록 하기 위해.
- 예를 들어 CelebA-HQ와 FFHQ처럼 개념적으로 유사한 데이터셋 간의 희귀성 비교를 가능하게 하기 위해.
- 다양한 특징 추출기(예: VGG16, ViT, CLIP)가 생성된 이미지의 희귀성 인식에 어떤 영향을 미치는지 조사하기 위해.
- 정밀도를 유지하면서 원하는 희귀도 수준의 이미지를 샘플링할 수 있는 도구를 제공하기 위해.
제안 방법
- 희귀도 점수는 공유된 특징 공간 내에서 생성된 이미지와 실재 이미지 간의 근접 이웃 거리(NND)를 추정하여 계산된다.
- 실재 데이터 다양체 상에서 국소 밀도를 추정하기 위해 실재 데이터에 대해 k-최근접 이웃(k-NN) 접근법을 사용하며, NND가 클수록 이미지가 더 희귀하다는 의미이다.
- 다양한 모델과 데이터셋 간 비교를 가능하게 하기 위해 데이터셋 전체에 걸쳐 희귀도 점수를 정규화한다.
- 아키텍처 및 훈련 방식의 차이가 희귀성 인식에 어떤 영향을 미치는지 평가하기 위해 여러 특징 추출기(예: VGG16, DINO, CLIP)에 적용한다.
- 데이터셋 간 비교를 위해 두 데이터셋의 실재 다양체를 병합하고, 병합된 다양체 상에서 희귀도 점수를 계산하여 상대적 희귀성 수준을 평가한다.
- 특정 희귀도 수준을 가진 이미지를 선택하여 생성된 이미지 집합에서 샘플링할 수 있도록 하는데 활용 가능하다.
실험 결과
연구 질문
- RQ1기존 지표들이 포착하지 못하는 방식으로 합성 이미지의 개별 희귀성을 어떻게 정량화할 수 있는가?
- RQ2다양한 생성 모델이 얼마나 많은 희귀 이미지를 생성하는가? 그리고 이를 객관적으로 측정할 수 있는가?
- RQ3특징 추출기의 선택이 생성된 이미지의 희귀성 인식에 어떤 영향을 미치는가?
- RQ4희귀도 점수를 사용하여 동일한 개념을 공유하는 두 데이터셋(예: CelebA-HQ와 FFHQ) 간에 의미 있는 비교를 수행할 수 있는가?
- RQ5특징 공간 설계와 희귀한 샘플의 희박한 생성 능력 간의 관계는 무엇인가?
주요 결과
- FFHQ는 CelebA-HQ보다 희귀도 점수의 분포가 더 넓어, 더 많은 희귀 이미지를 포함하고 있음을 시사하며, 이는 FFHQ가 더 다양한 공개 촬영 자료로 구성되어 있기에 일치한다.
- LSUN-Cat는 AFHQ-Cat보다 희귀도 점수의 다양성이 더 크며, 이는 AFHQ-Cat가 캐리어된 촬영 및 근접 촬영 중심으로 인해 전체적인 변동성이 감소했음을 확인한다.
- VGG16 기반의 희귀도 점수는 시각적 패턴과 무늬를 강조하며, 색다른 얼굴 페인팅을 희귀한 특징으로 식별한다.
- DINO 기반 점수는 구조적 다양성을 강조하며, 높은 점수를 받은 이미지는 다양한 얼굴 각도를 보이고, 낮은 점수를 받은 이미지는 주로 정면을 향한 경우가 많다.
- CLIP 기반 점수는 유사한 의미적 특성 덕분에 아기 얼굴을 더 유사하게 간주하여 성인 얼굴에 비해 이러한 이미지의 희귀도 점수가 낮아진다.
- 희귀도 점수를 통해 이미지 품질을 훼손하지 않고도 생성 모델에서 희귀 이미지를 타겟으로 샘플링할 수 있으며, 창작적 응용에 실용적인 도구를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.