Skip to main content
QUICK REVIEW

[论文解读] Not all Failure Modes are Created Equal: Training Deep Neural Networks for Explicable (Mis)Classification

Alberto Olmo, Sailik Sengupta|arXiv (Cornell University)|Jun 26, 2020
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文提出使用加权损失函数训练深度神经网络,根据与人类期望的语义相似性对分类错误进行惩罚,从而减少难以解释的错误。通过利用人工构建的知识库(如 WordNet)定义类别级别的语义距离,该方法提升了模型的可解释性——尤其在严重错误方面——同时保持高准确率,并相比先前方法降低了标注成本。

ABSTRACT

Deep Neural Networks are often brittle on image classification tasks and known to misclassify inputs. While these misclassifications may be inevitable, all failure modes cannot be considered equal. Certain misclassifications (eg. classifying the image of a dog to an airplane) can perplex humans and result in the loss of human trust in the system. Even worse, these errors (eg. a person misclassified as a primate) can have odious societal impacts. Thus, in this work, we aim to reduce inexplicable errors. To address this challenge, we first discuss methods to obtain the class-level semantics that capture the human's expectation ($M^h$) regarding which classes are semantically close {\em vs.} ones that are far away. We show that for popular image benchmarks (like CIFAR-10, CIFAR-100, ImageNet), class-level semantics can be readily obtained by leveraging either human subject studies or publicly available human-curated knowledge bases. Second, we propose the use of Weighted Loss Functions (WLFs) to penalize misclassifications by the weight of their inexplicability. Finally, we show that training (or fine-tuning) existing classifiers with the proposed methods lead to Deep Neural Networks that have (1) comparable top-1 accuracy, (2) more explicable failure modes on both in-distribution and out-of-distribution (OOD) test data, and (3) incur significantly less cost in the gathering of additional human labels compared to existing works.

研究动机与目标

  • 减少深度神经网络中的难以解释且可能具有危害性的分类错误,特别是那些违背人类期望或社会规范的错误。
  • 通过建模人类对哪些类别错误是合理或严重的认知,形式化分类失败可解释性的概念。
  • 开发一种低成本、可扩展的方法,将人类参与的语义期望融入深度神经网络训练,而无需实例级别的标注。
  • 通过将分类器的失败模式与人类对类别间相似性的感知和语义理解对齐,提升模型的可信度。

提出的方法

  • 该方法使用语义距离表示人类对类别相似性的期望,语义距离来源于人类受试者研究或预存在的语言知识库(如 WordNet)。
  • 构建一个类别级别的语义相似性矩阵 $ M^h $,量化人类感知中一个类别与另一个类别的接近或距离程度。
  • 提出一种新颖的加权损失函数 EKL(可解释性感知知识损失),对语义距离较远的类别错误分配更高的惩罚。
  • 在标准模型(如 ResNet、Inception-ResNet-v2)的训练或微调过程中应用 EKL 损失,修改标准的分类交叉熵损失以反映语义距离。
  • 在 CIFAR-10、CIFAR-100 和 ImageNet 上评估该方法,使用硬指标和软指标衡量可解释性。
  • 通过 Amazon Mechanical Turk 的人类评估验证:与使用标准 CCE 或其他基线方法训练的模型相比,使用 EKL 训练的模型在可解释性方面更受认可。

实验结果

研究问题

  • RQ1能否通过人工整理的知识库推导出的类别级别语义相似性,有效表征人类对哪些错误是可解释的、哪些是严重的认知?
  • RQ2如何设计一种加权损失函数,以更严厉地惩罚语义上相距较远的错误分类,从而引导模型向更符合人类认知的失败模式发展?
  • RQ3使用此类损失函数进行训练是否能在保持高准确率的同时,显著提升模型在分布内和分布外数据上的失败模式可解释性?
  • RQ4人类评估在多大程度上证实了使用该方法训练的模型比使用标准交叉熵损失训练的模型更易被理解为具有可解释性?

主要发现

  • 在 ImageNet 上,使用 EKL 训练的 Inception-ResNet-v2 模型在人类评估中得分达到 2.897,超过标准 CCE 基线(1.456)一倍以上,表明可解释性显著提升。
  • 尽管 Top-1 准确率下降了 0.95%,但 EKL 模型在可解释性指标上取得显著提升,证明了准确率与可解释性之间可实现有效平衡。
  • 在 CIFAR-10+ 上,使用 EKL 训练的 ResNet-v2 模型人类评估得分为 1.743,优于 CCE 基线(0.741),并持续提升了错误被感知为合理的程度。
  • 人类评估确认,与使用 CCE 或其他基线方法训练的模型相比,使用 EKL 训练的模型在可解释性方面更受认可,与基于指标的评估结果一致。
  • 梯度显著性分析显示,EKL 模型更关注图像中更具语义意义的区域,表明其对语义相关特征的关注度更高。
  • 与基于实例的标注方法相比,该方法降低了标注成本,因为它依赖于预先存在的类别级别语义知识,而非逐实例的标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。