Skip to main content
QUICK REVIEW

[论文解读] Causal Proxy Models for Concept-Based Model Explanations

Zhengxuan Wu, Karel D’Oosterlinck|arXiv (Cornell University)|Sep 28, 2022
Explainable Artificial Intelligence (XAI)被引用 6
一句话总结

本文提出因果代理模型(Causal Proxy Models, CPMs),一种用于自然语言处理中基于概念的模型解释新框架,通过使用近似反事实输入(由人类标注或启发式生成)来训练代理模型,使其同时模仿黑箱模型的事实性与反事实行为。CPMs 在 CEBaB 基准上达到最先进性能,并可替代原始模型,实现高事实准确性与可解释的、基于因果推理的解释,通过隐藏状态中的局部化概念表征实现。

ABSTRACT

Explainability methods for NLP systems encounter a version of the fundamental problem of causal inference: for a given ground-truth input text, we never truly observe the counterfactual texts necessary for isolating the causal effects of model representations on outputs. In response, many explainability methods make no use of counterfactual texts, assuming they will be unavailable. In this paper, we show that robust causal explainability methods can be created using approximate counterfactuals, which can be written by humans to approximate a specific counterfactual or simply sampled using metadata-guided heuristics. The core of our proposal is the Causal Proxy Model (CPM). A CPM explains a black-box model $\mathcal{N}$ because it is trained to have the same actual input/output behavior as $\mathcal{N}$ while creating neural representations that can be intervened upon to simulate the counterfactual input/output behavior of $\mathcal{N}$. Furthermore, we show that the best CPM for $\mathcal{N}$ performs comparably to $\mathcal{N}$ in making factual predictions, which means that the CPM can simply replace $\mathcal{N}$, leading to more explainable deployed models. Our code is available at https://github.com/frankaging/Causal-Proxy-Model.

研究动机与目标

  • 解决 NLP 可解释性中因果推断的根本问题,即黑箱模型的真正反事实输入不可观测。
  • 开发一种稳健的、基于因果动机的解释方法,即使在实际中无法获得完美反事实的情况下也能有效工作。
  • 构建一种代理模型,复现黑箱模型的事实与反事实行为,实现可解释的部署。
  • 在模型表征中定位概念级信息,以获得更具可解释性与可操作性的洞察。

提出的方法

  • 使用类蒸馏目标训练因果代理模型(CPMs),使其匹配黑箱模型 𝒩 的事实预测。
  • 采用两种不同的训练策略:基于输入的干预(CPM_IN),在输入中追加表示反事实概念值的标记;基于隐藏状态的干预(CPM_HI),使用互换干预训练(IIT)将概念信息定位在特定隐藏状态中。
  • 利用人类标注或基于元数据引导的启发式方法生成的近似反事实作为反事实行为的训练数据。
  • 将路径积分梯度(Path Integrated Gradients)进行适配,以在 CPM_HI 中通过中间、概念局部化的隐藏状态实现输入级别的归因。
  • 确保 CPMs 维持与原始模型 𝒩 相当的事实性能,从而支持在可解释部署中直接替换 𝒩。
  • 使用 CEBaB 基准中的概念级与文本级情感标注来监督并评估反事实行为。

实验结果

研究问题

  • RQ1由人工或启发式方法生成的近似反事实是否能实现对 NLP 模型的稳健因果解释?
  • RQ2当在近似反事实上进行训练时,因果代理模型(CPMs)是否在 CEBaB 等因果解释基准上达到最先进性能?
  • RQ3CPMs 是否可用于替代原始黑箱模型,同时保持事实准确性并实现更深层次的可解释性?
  • RQ4CPMs 在隐藏表示中对概念级信息的定位能力如何?这种定位是否提升了解释质量?
  • RQ5基于梯度的归因方法(如积分梯度)是否可适配为通过概念局部化的隐藏状态突出显示因果相关的输入词?

主要发现

  • CPM_IN 与 CPM_HI 在使用人类标注和启发式生成的近似反事实时,均在 CEBaB 基准上达到最先进性能。
  • 对于黑箱模型 𝒩,性能最佳的 CPM 在事实预测上与 𝒩 表现相当,使得 CPM 可直接在部署中替代 𝒩,以实现更优的可解释性。
  • CPM_HI 模型成功地在特定隐藏状态中定位了概念级信息,从而实现更具可解释性与因果基础的解释。
  • CPM_HI 中的梯度归因在训练过程中表现出稳定、以概念为导向的词重要性模式,随着训练推进,对语义相关词汇(如‘decorations’ 对应 ‘ambiance’)的强调愈发清晰。
  • 训练过程在输入词上诱导出具有因果动机的梯度,表明 CPMs 学会突出那些因果上影响预测的特征。
  • 适配至 CPM_HI 的路径积分梯度实现了通过概念局部化中间状态中介的输入级归因,显著提升了解释的保真度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。