Skip to main content
QUICK REVIEW

[论文解读] Rarity Score : A New Metric to Evaluate the Uncommonness of Synthesized Images

Jiyeon Han, Hwanil Choi|arXiv (Cornell University)|Jun 17, 2022
Cell Image Analysis Techniques被引用 7
一句话总结

本文提出罕见度得分(rarity score),一种新颖的度量方法,通过在特征空间中测量最近邻距离来评估合成图像在真实数据流形中的密度,从而衡量其个体罕见程度。该方法实现了生成模型与数据集在罕见样本生成方面的细粒度比较,揭示了FFHQ中包含的罕见人脸多于CelebA-HQ,且LSUN-Cat比AFHQ-Cat更具多样性,而性能表现因特征提取器类型而异。

ABSTRACT

Evaluation metrics in image synthesis play a key role to measure performances of generative models. However, most metrics mainly focus on image fidelity. Existing diversity metrics are derived by comparing distributions, and thus they cannot quantify the diversity or rarity degree of each generated image. In this work, we propose a new evaluation metric, called `rarity score', to measure the individual rarity of each image synthesized by generative models. We first show empirical observation that common samples are close to each other and rare samples are far from each other in nearest-neighbor distances of feature space. We then use our metric to demonstrate that the extent to which different generative models produce rare images can be effectively compared. We also propose a method to compare rarities between datasets that share the same concept such as CelebA-HQ and FFHQ. Finally, we analyze the use of metrics in different designs of feature spaces to better understand the relationship between feature spaces and resulting sparse images. Code will be publicly available online for the research community.

研究动机与目标

  • 为解决现有度量方法(如FID和IS)无法捕捉合成图像个体罕见程度的问题。
  • 实现基于生成模型产生罕见、独特样本能力的比较,同时不牺牲图像质量。
  • 实现对概念相似数据集(如CelebA-HQ与FFHQ)之间罕见度的跨数据集比较。
  • 探究不同特征提取器(如VGG16、ViT、CLIP)如何影响生成图像中罕见度的感知。
  • 提供一种工具,用于按所需罕见度水平采样图像,同时保持图像保真度。

提出的方法

  • 通过在共享特征空间中估计生成图像与真实图像之间的最近邻距离(NND)来计算罕见度得分。
  • 该方法在真实数据流形上使用k-最近邻(k-NN)方法来估计局部密度,NND越大表示图像越罕见。
  • 对数据集内罕见度得分进行归一化处理,以实现模型与数据集之间的可比性。
  • 在多个特征提取器(如VGG16、DINO、CLIP)上应用该度量方法,以评估架构与训练差异对罕见度感知的影响。
  • 在跨数据集比较中,将两个数据集的真实流形合并,并在并集上计算罕见度得分,以评估相对罕见程度。
  • 该方法可通过根据罕见度得分从生成集合中选择图像,实现对特定罕见度水平图像的采样。

实验结果

研究问题

  • RQ1如何以现有度量方法无法实现的方式量化合成图像的个体罕见程度?
  • RQ2不同生成模型在产生罕见图像方面的表现程度如何?如何实现客观测量?
  • RQ3特征提取器的选择如何影响生成图像中罕见度的感知?
  • RQ4能否有意义地利用罕见度得分比较两个共享相同概念的数据集(如CelebA-HQ与FFHQ)?
  • RQ5特征空间设计与生成稀疏、罕见样本的能力之间存在何种关系?

主要发现

  • FFHQ的罕见度得分分布比CelebA-HQ更广,表明其包含更多罕见图像,这与FFHQ更具多样性的公众拍摄图像集合一致。
  • LSUN-Cat的罕见度得分多样性高于AFHQ-Cat,证实了AFHQ-Cat因经过筛选且聚焦于特写镜头,整体变化性降低。
  • 基于VGG16的罕见度得分强调视觉模式与纹理,识别出彩色面部彩绘为罕见特征。
  • 基于DINO的得分突出结构多样性,高分图像表现出多样的面部角度,而低分图像则主要为正面视角。
  • 基于CLIP的得分因婴儿面部具有共享语义属性,而将其视为更相似,导致此类图像的罕见度得分低于成人面部。
  • 罕见度得分可实现从生成模型中针对性采样罕见图像,且不损害图像质量,为创意应用提供了实用工具。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。