Skip to main content
QUICK REVIEW

[论文解读] Do better ImageNet classifiers assess perceptual similarity better?

M. Kumar, Neil Houlsby|arXiv (Cornell University)|Mar 9, 2022
Advanced Image Fusion Techniques被引用 13
一句话总结

本文研究了更高精度的ImageNet分类器是否能带来更优的感知相似性度量,发现对于ResNet、EfficientNet和Vision Transformer等现代架构,更高的ImageNet准确率反而与更差的感知相似性得分(PS)相关。令人惊讶的是,欠拟合模型——尤其是浅层ResNet或训练少于5个周期的模型——实现了最高的PS,揭示了一条帕累托前沿:当准确率超过某一阈值后,进一步提升准确率反而会降低感知相似性。

ABSTRACT

Perceptual distances between images, as measured in the space of pre-trained deep features, have outperformed prior low-level, pixel-based metrics on assessing perceptual similarity. While the capabilities of older and less accurate models such as AlexNet and VGG to capture perceptual similarity are well known, modern and more accurate models are less studied. In this paper, we present a large-scale empirical study to assess how well ImageNet classifiers perform on perceptual similarity. First, we observe a inverse correlation between ImageNet accuracy and Perceptual Scores of modern networks such as ResNets, EfficientNets, and Vision Transformers: that is better classifiers achieve worse Perceptual Scores. Then, we examine the ImageNet accuracy/Perceptual Score relationship on varying the depth, width, number of training steps, weight decay, label smoothing, and dropout. Higher accuracy improves Perceptual Score up to a certain point, but we uncover a Pareto frontier between accuracies and Perceptual Score in the mid-to-high accuracy regime. We explore this relationship further using a number of plausible hypotheses such as distortion invariance, spatial frequency sensitivity, and alternative perceptual functions. Interestingly we discover shallow ResNets and ResNets trained for less than 5 epochs only on ImageNet, whose emergent Perceptual Score matches the prior best networks trained directly on supervised human perceptual judgements. The checkpoints for the models in our study are available at https://console.cloud.google.com/storage/browser/gresearch/perceptual_similarity.

研究动机与目标

  • 研究ImageNet分类准确率的提升是否能带来更好的感知相似性度量。
  • 探索在不同架构和超参数下,ImageNet准确率与感知得分(PS)之间的关系。
  • 识别在不依赖分类准确率的前提下,能优化感知相似性的架构与训练选择。
  • 考察潜在因素(如失真不变性、空间频率敏感性、表征熵)是否构成准确率-PS权衡的成因。
  • 确定是否可通过架构修改或早停策略提升感知相似性,即使在现代模型中亦然。

提出的方法

  • 在64×64的ImageNet上训练了多种ImageNet分类器(ResNets、EfficientNets、Vision Transformers),超参数包括深度、宽度、权重衰减、标签平滑、Dropout和训练步数。
  • 在BAPPS数据集上评估所有模型,该数据集是大规模人类评估的感知判断基准,用于计算感知得分(PS)。
  • 分析表征属性,如激活熵、空间频率敏感性及逐层特征统计,以探究准确率-PS权衡的潜在成因。
  • 对比带与不带跳跃连接的模型,评估其对表征熵和PS的影响。
  • 通过低通滤波测量失真鲁棒性,以检验对高频图像成分的依赖程度。
  • 定期(每1000步)发布模型检查点,以确保可复现性与进一步分析。

实验结果

研究问题

  • RQ1更高的ImageNet准确率是否始终能提升感知相似性(以PS衡量)?
  • RQ2在ResNet和Vision Transformer等现代架构中,是否存在ImageNet准确率与感知相似性之间的权衡?
  • RQ3通过移除跳跃连接或早停等架构修改,是否能在准确率较低的情况下提升感知相似性?
  • RQ4低PS模型在多大程度上对图像失真更敏感,或更依赖高频成分?
  • RQ5表征层面属性(如激活熵和空间频率敏感性)与感知相似性之间存在何种关系?

主要发现

  • 在ImageNet准确率与感知得分(PS)之间存在帕累托前沿,中等准确率的模型实现最高PS,进一步提升准确率反而会降低感知相似性。
  • 浅层ResNet(如ResNet-6)以及训练少于5个周期的模型,其PS与此前被认为在感知相似性方面最先进的AlexNet和VGG相当或更优。
  • 采用高权重衰减或早停的ResNet,尽管ImageNet准确率较低,但PS表现优异,表明过拟合或过度优化会损害感知性能。
  • 移除跳跃连接虽增加激活熵,但并未提升PS,表明高熵本身并不能增强感知相似性。
  • 低PS模型并不一定更依赖高频图像成分,低通滤波实验表明:部分高PS模型(如ResNet-6)对高频成分的依赖程度甚至高于低PS模型。
  • 准确率与PS之间的倒U型关系在多个超参数(包括深度、宽度和训练时长)中持续存在,但标签平滑和Dropout的影响并不一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。