Skip to main content
QUICK REVIEW

[论文解读] Discretized Integrated Gradients for Explaining Language Models

Soumya Sanyal, Xiang Ren|arXiv (Cornell University)|Aug 31, 2021
Explainable Artificial Intelligence (XAI)参考文献 26被引用 4
一句话总结

本文提出离散化积分梯度(DIG),一种通过在词嵌入空间中用非线性、离散路径替代积分梯度中的线性插值路径,从而提升NLP中归因可解释性的方法。DIG采用两种策略——贪婪法(Greedy)与最大计数法(MaxCount),选择接近真实词汇的锚点词,确保插值点能代表实际数据,从而获得更忠实的梯度,并在BERT、DistilBERT和RoBERTa模型的情感分类任务中表现更优。

ABSTRACT

As a prominent attribution-based explanation algorithm, Integrated Gradients (IG) is widely adopted due to its desirable explanation axioms and the ease of gradient computation. It measures feature importance by averaging the model's output gradient interpolated along a straight-line path in the input data space. However, such straight-line interpolated points are not representative of text data due to the inherent discreteness of the word embedding space. This questions the faithfulness of the gradients computed at the interpolated points and consequently, the quality of the generated explanations. Here we propose Discretized Integrated Gradients (DIG), which allows effective attribution along non-linear interpolation paths. We develop two interpolation strategies for the discrete word embedding space that generates interpolation points that lie close to actual words in the embedding space, yielding more faithful gradient computation. We demonstrate the effectiveness of DIG over IG through experimental and human evaluations on multiple sentiment classification datasets. We provide the source code of DIG to encourage reproducible research.

研究动机与目标

  • 解决标准积分梯度(IG)在离散文本数据中因插值路径上的点非代表性、分布外(out-of-distribution)而导致的局限性。
  • 通过确保嵌入空间中的插值点接近词汇表中的实际词汇,提升基于梯度的归因忠实度。
  • 提出两种插值策略——DIG-Greedy与DIG-MaxCount,通过使用真实词汇锚点,单调地在输入嵌入与基线嵌入之间进行插值。
  • 证明DIG在多个预训练语言模型与情感数据集上,生成的解释比IG及其他基于梯度的基线方法更合理、更准确。
  • 通过人类评估增强用户对模型预测的信任,表明DIG生成的解释在可解释性方面更令人信服。

提出的方法

  • 提出一种在离散词嵌入空间中的非线性插值路径,替代标准积分梯度中使用的直线路径。
  • 提出DIG-Greedy,该方法选择在每个输入词的单调投影路径上最近的真实词汇作为锚点,以最小化与单调路径的距离。
  • 提出DIG-MaxCount,该方法选择在单调维度(即与输入到基线方向对齐的维度)数量最多的词汇作为锚点,随后调整非单调维度以确保单调性。
  • 利用所选锚点词构建插值路径,使得路径上每一点均单调地位于输入嵌入与基线嵌入之间,从而提升代表性。
  • 对路径应用因子为f的上采样,以增加点的密度并减少积分近似误差,同时计算成本未显著增加。
  • 使用标准积分梯度公式,但仅在非线性路径上的离散、数据代表性点处计算梯度,从而提升梯度保真度。

实验结果

研究问题

  • RQ1在词嵌入空间中,非线性、离散插值路径是否能在文本数据中生成比线性插值更忠实的梯度?
  • RQ2DIG-Greedy与DIG-MaxCount在情感分类任务中的归因质量与标准积分梯度相比如何?
  • RQ3DIG生成的解释在多大程度上改善了人类对模型解释合理性的感知,相较于IG及其他基线方法?
  • RQ4超参数m(锚点数量)与f(上采样因子)如何影响DIG的近似误差与性能?
  • RQ5在DIG中对路径进行上采样是否能有效降低积分近似误差,同时不显著增加计算成本?

主要发现

  • 在三个预训练语言模型(BERT、DistilBERT、RoBERTa)与三个情感数据集(SST2、IMDB、Rotten Tomatoes)的九组实验设置中,DIG在八组设置下优于积分梯度及其他基于梯度的基线方法。
  • 随着上采样因子f的增加,DIG的Delta %误差持续下降,表明积分近似效果提升,而WAE保持稳定。
  • 在固定上采样因子f=0时,增加锚点数量m会导致DIG的Delta %误差升高,表明路径越长,近似难度越大。
  • 人类评估显示,与IG及其他基线方法相比,DIG生成的解释在用户眼中更具合理性与可信度。
  • DIG-MaxCount在各项指标上平均表现更优,尤其在降低近似误差与提升忠实度方面表现突出。
  • 上采样策略能有效降低近似误差,同时对WAE影响较小,验证了其作为增加m的可扩展替代方案的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。