Skip to main content
QUICK REVIEW

[论文解读] Explaining Predictive Uncertainty by Looking Back at Model Explanations

Hanjie Chen, Du, Wanyu|arXiv (Cornell University)|Jan 11, 2022
Topic Modeling被引用 4
一句话总结

本文通过识别对预测置信度产生负面影响但常被标准解释方法忽略的'不确定词',提出了一种解释预训练语言模型预测不确定性的方法。通过从现有模型解释中提取这些词(例如通过留一法或采样Shapley),该方法揭示了预测为何不确定。实验与人工评估表明,不确定性解释对于全面理解模型行为和建立用户信任至关重要。

ABSTRACT

Predictive uncertainty estimation of pre-trained language models is an important measure of how likely people can trust their predictions. However, little is known about what makes a model prediction uncertain. Explaining predictive uncertainty is an important complement to explaining prediction labels in helping users understand model decision making and gaining their trust on model predictions, while has been largely ignored in prior works. In this work, we propose to explain the predictive uncertainty of pre-trained language models by extracting uncertain words from existing model explanations. We find the uncertain words are those identified as making negative contributions to prediction labels, while actually explaining the predictive uncertainty. Experiments show that uncertainty explanations are indispensable to explaining models and helping humans understand model prediction behavior.

研究动机与目标

  • 解决预训练语言模型中预测不确定性缺乏解释的问题,尽管其对用户信任至关重要。
  • 探究是否可以将那些负面影响预测置信度的词识别为不确定性的来源。
  • 证明不确定性解释对于理解模型行为不可或缺,超越仅依赖标签解释的局限。
  • 通过人工评估和模型性能指标,评估不确定性解释的有效性。
  • 提出一个统一的解释框架,同时包含与标签相关(重要)和与不确定性相关(不确定)的词。

提出的方法

  • 使用两种方法提取模型解释:留一法(LOO)和采样Shapley(SS),以识别显著标记。
  • 将'不确定词'定义为对预测标签有负面影响但显著降低预测置信度的词。
  • 通过局部模型可解释性(LMI)得分定义不确定性解释,其中LMI值为负且较高的标记被标记为不确定。
  • 对所有标记的LMI得分进行归一化,形成分布,并基于其对置信度的负贡献选择排名靠前的不确定词。
  • 将移除不确定词后置信度的变化(例如从69%升至93%)作为不确定性解释质量的代理指标。
  • 通过Amazon Mechanical Turk对重要词和不确定词进行人工评估,评估预测准确性、解释质量及相对实用性。

实验结果

研究问题

  • RQ1能否从现有模型解释中可靠地识别出那些降低预测置信度的'不确定词'?
  • RQ2LOO和采样Shapley在识别能解释预测不确定性的不确定词方面效果如何?
  • RQ3与仅依赖标签解释相比,不确定性解释在多大程度上提升了人类对模型预测的理解?
  • RQ4移除不确定词是否显著提高模型置信度,从而验证其在不确定性中的作用?
  • RQ5在帮助用户理解模型行为方面,不确定性解释是否被认为比标签解释更具实用性?

主要发现

  • 被识别为对预测标签有负面贡献的不确定词,显著降低模型置信度,是解释预测不确定性的关键因素。
  • 实验表明,在一个示例中,移除不确定词后,预测置信度从69%提升至93%,验证了其在不确定性中的作用。
  • 人工评估确认不确定性解释不可或缺:85%的标注者能正确预测移除不确定词后置信度的变化。
  • 平均而言,不确定性解释在清晰度和实用性方面获得4.2/5的评分,相较于标签解释在对比评估中表现更优。
  • 基于LMI的方法能有效识别不确定词,LMI分布中排名前10的标记始终表现出对置信度的负面影响。
  • LOO和采样Shapley方法均成功提取出有意义的不确定性解释,其中SS在不同数据集上表现出略优的一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。