Skip to main content
QUICK REVIEW

[论文解读] Have We Learned to Explain?: How Interpretability Methods Can Learn to Encode Predictions in their Interpretations

Neil Jethani, Mukund Sudarshan|arXiv (Cornell University)|Mar 2, 2021
Explainable Artificial Intelligence (XAI)被引用 11
一句话总结

本文提出 REAL-x,一种归因方法,通过近似真实数据生成分布来学习最小且高保真度的特征子集,避免在解释中编码预测结果。提出 EVAL-X 以检测此类编码现象,结果表明 REAL-x 在胸部 X 光数据集上的定量评估与放射科医生评估中均优于现有方法。

ABSTRACT

While the need for interpretable machine learning has been established, many common approaches are slow, lack fidelity, or hard to evaluate. Amortized explanation methods reduce the cost of providing interpretations by learning a global selector model that returns feature importances for a single instance of data. The selector model is trained to optimize the fidelity of the interpretations, as evaluated by a predictor model for the target. Popular methods learn the selector and predictor model in concert, which we show allows predictions to be encoded within interpretations. We introduce EVAL-X as a method to quantitatively evaluate interpretations and REAL-X as an amortized explanation method, which learn a predictor model that approximates the true data generating distribution given any subset of the input. We show EVAL-X can detect when predictions are encoded in interpretations and show the advantages of REAL-X through quantitative and radiologist evaluation.

研究动机与目标

  • 解决归因方法(AEMs)中的预测编码问题,即预测结果在特征解释中被无意间嵌入。
  • 开发一种评估解释的方法,以检测预测是否被编码而非真实反映特征重要性。
  • 提出 REAL-x,一种 AEM 方法,通过在估计的真实数据生成分布下最大化似然性,选择最小的特征子集。
  • 通过在医学影像数据上的定量评估与专家评估,提升解释的保真度与临床相关性。
  • 证明在 AEM 中联合训练选择器与预测器模型可能导致因分布偏移而产生误导性解释。

提出的方法

  • 引入 EVAL-X 作为评估方法,通过训练模型来近似目标在任意输入特征子集下的真实数据生成分布。
  • REAL-x 是一种归因方法,通过学习一个全局选择器模型,识别在估计的真实分布下具有高似然性的最小特征子集。
  • REAL-x 中的选择器模型通过最大化给定所选特征子集下目标的似然性进行训练,确保与真实数据生成过程保持一致。
  • 该方法对每个样本仅需一次前向传播,实现快速推理,并通过建模真实条件分布避免分布外输入。
  • REAL-x 中的预测器模型被训练以近似任意特征子集 S 的真实条件分布 P(y|S),而非依赖于掩码输入下的模型预测。
  • 超参数通过最小化特征数量并保留至少 95% 的全特征模型准确率进行调优。

实验结果

研究问题

  • RQ1我们能否检测到归因方法生成的解释中是否存在预测编码?
  • RQ2联合归因方法(JAMs)如 L2X 和 Invase 是否在特征选择中编码了预测结果,而非反映真实的特征重要性?
  • RQ3我们能否设计一种通过学习真实数据生成分布来避免预测编码的解释方法?
  • RQ4REAL-x 的解释保真度在定量与临床评估中与现有方法相比如何?
  • RQ5放射科医生是否认为 REAL-x 的解释比 L2X、Invase 或 BASE-x 更具临床意义?

主要发现

  • EVAL-X 通过评估预测是否依赖于分布外输入或模型人工产物,成功检测出解释中的预测编码。
  • REAL-x 在胸部 X 光数据集上达到 75.0% 的准确率,与基线方法相当或更优,同时使用更少的特征。
  • 在事后评估中,REAL-x 的 e-acc 为 70.3%,e-auroc 为 0.777,显著优于 L2X(54.0% e-acc)和 Invase(52.3% e-acc)。
  • 放射科医生将 REAL-x 评为最具临床意义的方法,平均排名为 1.08,显著优于 L2X(3.57)和 Invase(2.85)。
  • 在 MNIST 数据集上,L2X 仅使用一个选定像素即达到 96.0% 的准确率,表明通过二值特征选择可编码预测结果。
  • 本研究表明,JAM 中的联合训练使预测器能够与选择器共同适应,导致产生不反映真实特征重要性的误导性解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。