Skip to main content
QUICK REVIEW

[论文解读] ConvNets and ImageNet Beyond Accuracy: Understanding Mistakes and Uncovering Biases

Pierre Stock, Moustapha Cissé|arXiv (Cornell University)|Nov 30, 2017
Adversarial Robustness in Machine Learning参考文献 36被引用 16
一句话总结

该论文表明,ImageNet 上最先进的卷积神经网络(ConvNets)的实际准确率和鲁棒性远超传统测量结果,因为人工评估将 top-1 错误率从 22.69% 降低至 9.47%。该研究通过对抗性样本引入模型批评机制,以揭示模型中隐藏的种族和语义偏见,表明解释方法可减轻误分类现象,并从终端用户视角揭示模型缺陷。

ABSTRACT

ConvNets and Imagenet have driven the recent success of deep learning for image classification. However, the marked slowdown in performance improvement combined with the lack of robustness of neural networks to adversarial examples and their tendency to exhibit undesirable biases question the reliability of these methods. This work investigates these questions from the perspective of the end-user by using human subject studies and explanations. The contribution of this study is threefold. We first experimentally demonstrate that the accuracy and robustness of ConvNets measured on Imagenet are vastly underestimated. Next, we show that explanations can mitigate the impact of misclassified adversarial examples from the perspective of the end-user. We finally introduce a novel tool for uncovering the undesirable biases learned by a model. These contributions also show that explanations are a valuable tool both for improving our understanding of ConvNets' predictions and for designing more reliable models.

研究动机与目标

  • 重新评估 SOTA 卷积神经网络在 ImageNet 上的真实性能,超越标准准确率指标。
  • 探究人工判断是否能揭示模型错误的严重性实际上低于传统假设的程度。
  • 评估解释在提升终端用户对模型预测的信任度以及增强对对抗性样本鲁棒性方面的作用。
  • 检测并揭示模型在 ImageNet 上学习到的不良偏见,特别是种族和语义偏见。
  • 开发并验证一种基于对抗性样本的新型模型批评框架,用于偏见检测。

提出的方法

  • 开展人工受试者研究,五名标注员判断模型误分类的 ImageNet 图像是否应被正确分类,采用五人中四人达成一致的共识阈值。
  • 通过显著性图进行基于特征的解释,并使用原型和批评(模型批评)进行基于样本的解释,以解读预测结果。
  • 将对抗性样本用作生成批评的工具,以突出模型中反直觉或有偏见的决策模式。
  • 采用多种解释基线方法:对抗性选择、MMD-critic 和基于概率的选择,用于模型批评。
  • 从互联网收集图像对,其内容完全相同,仅肤色不同,以测试模型在预测中是否存在种族偏见。
  • 在 ImageNet 上训练 ResNet-101 模型,并利用其内部表征提取原型和批评,用于偏见分析。

实验结果

研究问题

  • RQ1当通过人工共识评估时,SOTA 卷积神经网络在 ImageNet 上的真实准确率在多大程度上被低估?
  • RQ2解释如何影响终端用户对模型预测的感知与信任,尤其是在对抗性样本情境下?
  • RQ3对抗性样本能否有效用于生成揭示隐藏偏见的模型批评?
  • RQ4模型在 ImageNet 上学习到了哪些偏见——特别是种族或语义偏见——以及如何检测这些偏见?
  • RQ5与其它解释方法相比,模型批评在揭示模型缺陷和偏见方面表现如何?

主要发现

  • 人工共识将 ResNet-101 在 ImageNet 上的 top-1 错误率从 22.69% 降低至 9.47%,表明模型错误被严重低估。
  • 在人工评估下,top-5 错误率从 6.44% 降至 1.94%,表明当以人工共识为标准时,ImageNet 几乎已被解决。
  • 提供解释显著减轻了对抗性样本对终端用户感知的影响,降低了误分类的置信度。
  • 使用对抗性样本进行模型批评有效揭示了种族偏见:78% 的 'basketball' 类原型中至少包含一名黑人,而仅 44% 包含白人。
  • 在批评中,90% 包含白人,而仅 20% 包含黑人,表明模型对黑人球员作为该类别典型代表存在强烈偏见。
  • 仅肤色不同的图像对显示,模型将包含黑人球员的图像全部(100%)分类为 'basketball',而相似图像中若为肤色较浅的球员,则被误分类为其他类别。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。