Skip to main content
QUICK REVIEW

[论文解读] Promises and Pitfalls of Black-Box Concept Learning Models

Anita Mahinpei, Justin Clark|arXiv (Cornell University)|Jun 24, 2021
Explainable Artificial Intelligence (XAI)参考文献 13被引用 20
一句话总结

本文揭示了黑箱概念学习模型(CLMs)中软概念表征会泄露超出目标概念的额外信息,即使采用任务无关训练和概念去相关化等缓解策略,也仍会损害可解释性。作者表明,标准的纯度度量方法(如AUC)不足以检测此类泄露,并提出了改进的评估方法以识别隐藏的信息泄露,结果表明下游模型可能因残余相关性而错误归因特征重要性。

ABSTRACT

Machine learning models that incorporate concept learning as an intermediate step in their decision making process can match the performance of black-box predictive models while retaining the ability to explain outcomes in human understandable terms. However, we demonstrate that the concept representations learned by these models encode information beyond the pre-defined concepts, and that natural mitigation strategies do not fully work, rendering the interpretation of the downstream prediction misleading. We describe the mechanism underlying the information leakage and suggest recourse for mitigating its effects.

研究动机与目标

  • 调查黑箱概念学习模型中软概念表征的信息泄露程度及其机制。
  • 评估现有缓解策略(任务无关训练、无监督维度增加、概念去相关化)在防止额外信息泄露方面的有效性。
  • 证明标准纯度度量(如AUC)在验证CLMs中概念独立性方面存在不足。
  • 提出一种新评估框架,通过在潜在维度上进行下游预测任务来检测隐藏的信息泄露。
  • 强调由于概念表征中存在残余相关性,下游模型在特征重要性解释方面存在误导风险。

提出的方法

  • 作者训练具有软概念输出(实值置信度分数)的概念学习模型(CLMs),并分析其潜在表征中是否包含超出目标概念的额外信息。
  • 采用与先前工作(Chen et al., 2020)一致的方法,基于潜在维度的单个激活值计算AUC分数来评估概念纯度。
  • 引入一个纯度检测神经网络,以单个潜在维度作为输入,预测每个概念,以检验是否存在任一维度能以高准确率预测任一概念。
  • 通过相关性矩阵和余弦相似性矩阵比较标准CNN模型与概念去相关化(CW)模型,可视化维度间的依赖关系。
  • 将该方法应用于合成数据集和真实世界数据集(包括水果销售任务),以实际演示概念精炼与信息泄露现象。
  • 分析CW模型最后一层的权重,表明当潜在维度包含混合信息时,可能导致对特征重要性的错误解释。

实验结果

研究问题

  • RQ1CLMs中的软概念表征在在多大程度上编码了超出目标概念的信息?
  • RQ2为何标准缓解策略(如任务无关训练和概念去相关化)无法完全消除软表征中的信息泄露?
  • RQ3当下游模型可访问完整的激活图时,基于AUC的纯度度量能否可靠检测CLMs中的概念独立性?
  • RQ4隐藏的信息泄露如何影响下游预测模型中特征重要性的解释?
  • RQ5有哪些替代评估方法可以检测标准度量所遗漏的、存在于概念表征中的残余信息泄露?

主要发现

  • 即使采用概念去相关化和任务无关训练,具有软概念表征的CLMs在下游模型使用完整激活图时,仍会编码额外信息。
  • 单个潜在维度的AUC分数超过0.95并不能保证概念纯度,因为下游模型可仅从任一维度(包括未对齐维度)以超过95%的准确率预测概念。
  • 相关性矩阵与余弦相似性分析表明,CW模型仍表现出显著的维度间依赖关系,表明存在残余信息泄露。
  • 在合成水果销售任务中,原始概念如'是葡萄柚'和'是苹果'本身不具备预测能力,但经过精炼的子概念如'是酸味葡萄柚'和'是小苹果'却能达到完美预测能力,凸显概念精炼的价值。
  • 下游模型权重可能错误归因重要性——例如,将权重0.874分配给一个与权重0.056的概念同等重要的特征,这是由于潜在维度中隐藏的信息所致。
  • 本研究表明,仅依赖单个激活值的AUC分数评估纯度是不足的,因为激活图的完整空间结构会引发信息泄露,从而破坏可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。