Skip to main content
QUICK REVIEW

[论文解读] What Does Rotation Prediction Tell Us about Classifier Accuracy under Varying Testing Environments?

Weijian Deng, Stephen Jay Gould|arXiv (Cornell University)|Jun 10, 2021
Digital Imaging for Blood Diseases被引用 11
一句话总结

本文提出使用旋转预测准确率作为代理指标,以在不同环境下估计未标注测试集上语义分类器的性能。通过联合训练同时优化分类与旋转预测的多任务网络,作者发现旋转准确率与分类准确率之间存在强烈的线性相关性(r > 0.88),从而可通过在未标注数据上进行简单线性回归,准确估计泛化性能。

ABSTRACT

Understanding classifier decision under novel environments is central to the community, and a common practice is evaluating it on labeled test sets. However, in real-world testing, image annotations are difficult and expensive to obtain, especially when the test environment is changing. A natural question then arises: given a trained classifier, can we evaluate its accuracy on varying unlabeled test sets? In this work, we train semantic classification and rotation prediction in a multi-task way. On a series of datasets, we report an interesting finding, i.e., the semantic classification accuracy exhibits a strong linear relationship with the accuracy of the rotation prediction task (Pearson's Correlation r > 0.88). This finding allows us to utilize linear regression to estimate classifier performance from the accuracy of rotation prediction which can be obtained on the test set through the freely generated rotation labels.

研究动机与目标

  • 解决在人类标注成本高昂或不可用的未标注、分布外测试集上评估分类器性能的挑战。
  • 探究自监督掩蔽任务(如旋转预测)是否可在分布偏移条件下可靠地作为语义分类准确率的代理指标。
  • 开发一种无需标注数据即可估计分类器在未见测试领域泛化性能的方法。
  • 评估旋转预测作为代理在多样化数据集和模型架构中的可行性与鲁棒性。

提出的方法

  • 联合训练一个多任务神经网络,同时优化语义图像分类和旋转预测(0°, 90°, 180°, 270°)。
  • 使用未标注测试集上的旋转预测准确率作为代理指标,因为旋转标签可无需人工标注而合成生成。
  • 利用标注的验证集学习一个线性回归模型,将旋转预测准确率映射到估计的语义分类准确率。
  • 将训练好的回归模型应用于仅使用旋转预测得分预测新、此前未见测试集上的分类准确率。
  • 在多个数据集(CIFAR-10, CIFAR-100, MNIST, Tiny-ImageNet, COCO)上评估该方法,涵盖不同分布偏移情况。
  • 比较其他自监督掩蔽任务(如拼图、色彩化)的性能,并基于对分类准确率影响最小的标准选择旋转预测。

实验结果

研究问题

  • RQ1在多样化测试环境中,旋转预测准确率与语义分类准确率之间是否存在强统计相关性?
  • RQ2能否可靠地利用未标注测试集上的旋转预测准确率来估计模型的真实分类准确率?
  • RQ3该相关性在不同数据集、模型架构和类别数量下是否依然成立?
  • RQ4其他自监督掩蔽任务是否能提供与旋转预测相当或更优的代理性能?
  • RQ5该方法在真实部署场景中能否泛化至分布外或未见类别?

主要发现

  • 在所有评估的数据集中(包括 CIFAR-10, CIFAR-100, MNIST, Tiny-ImageNet 和 COCO),语义分类准确率与旋转预测准确率之间存在强线性相关性(皮尔逊相关系数 r > 0.88)。
  • 即使类别数量增加,相关性依然保持较高水平,CIFAR-100 上的等级相关系数 ρ > 0.9,表明对类别复杂度具有鲁棒性。
  • 仅使用旋转预测准确率,该方法在未见测试集上实现了令人满意的估计性能,通过保留数据上的线性回归验证。
  • 在多任务设置中使用旋转预测时,对分类准确率无显著影响,而拼图任务则导致性能下降约 2%,表明其更具侵入性。
  • 拼图任务也与分类准确率呈现强线性相关性(r > 0.95),但其对主任务性能的负面影响使其作为代理指标的适用性较低。
  • 该方法实现了在分布偏移下对分类器泛化性能的无监督评估,为昂贵的人工标注测试集提供了实用替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。