Skip to main content
QUICK REVIEW

[论文解读] Can Explanations Be Useful for Calibrating Black Box Models?

Xi Ye, Greg Durrett|arXiv (Cornell University)|Oct 14, 2021
Topic Modeling被引用 5
一句话总结

本文提出一种校准方法,利用模型归因和人工设计的启发式规则,在不更新参数的情况下提升黑盒NLP模型在分布外数据上的性能。通过结合LIME或SHAP归因与任务特定特征,一个简单的分类器可预测模型预测的正确性,实现在选择性问答任务中的最先进性能,并在某些情况下优于微调方法,表明解释显著提升了模型校准能力。

ABSTRACT

NLP practitioners often want to take existing trained models and apply them to data from new domains. While fine-tuning or few-shot learning can be used to adapt a base model, there is no single recipe for making these techniques work; moreover, one may not have access to the original model weights if it is deployed as a black box. We study how to improve a black box model's performance on a new domain by leveraging explanations of the model's behavior. Our approach first extracts a set of features combining human intuition about the task with model attributions generated by black box interpretation techniques, then uses a simple calibrator, in the form of a classifier, to predict whether the base model was correct or not. We experiment with our method on two tasks, extractive question answering and natural language inference, covering adaptation from several pairs of domains with limited target-domain data. The experimental results across all the domain pairs show that explanations are useful for calibrating these models, boosting accuracy when predictions do not have to be returned on every example. We further show that the calibration model transfers to some extent between tasks.

研究动机与目标

  • 为解决在缺乏模型权重的情况下,难以对黑盒NLP模型进行微调而无法在新领域部署的问题。
  • 探究通过特征归因生成的模型解释是否能提升黑盒模型在分布外数据上的校准性能。
  • 开发一种校准器,结合人类直觉与模型级归因,无需访问模型参数即可预测模型预测的正确性。
  • 评估校准器在不同领域和任务中的泛化能力,特别是在选择性预测设置下的表现。

提出的方法

  • 该方法使用LIME或SHAP提取输入词元及其归因分数,量化每个词元对模型预测的重要性。
  • 构建一组特征,结合人工识别的启发式规则(如专有名词或动词的存在)与这些词元的归因分数。
  • 在目标领域的少量标注样本上训练一个二分类器(即校准器),以预测黑盒模型的预测是否正确。
  • 在校准器的标准和选择性问答设置中进行评估,仅当校准器判断预测可靠时才保留预测结果。
  • 该方法利用实例特定的解释构建元学习器,以估计模型的可靠性,避免依赖模型置信度分数。
  • 该方法在五个源-目标领域对组合上,针对两个任务(抽取式问答和自然语言蕴涵)进行了评估。

实验结果

研究问题

  • RQ1能否通过黑盒模型归因生成的解释来提升模型在分布外数据上的校准性能?
  • RQ2将人工识别的启发式规则与模型归因结合,是否能带来优于不使用解释的基线方法的校准器性能?
  • RQ3训练好的校准器是否能在不重新训练的情况下泛化到新领域或新任务?
  • RQ4在选择性预测设置中,基于解释的校准器是否能优于现有方法,更准确识别可靠预测?

主要发现

  • 基于解释的校准器LimeCal在所有五个领域对的抽取式问答和自然语言蕴涵任务中,均持续优于所有基线方法。
  • 在选择性问答设置中,LimeCal在所有方法中表现最佳,尤其在以Squad-Adv作为OOD分布时表现尤为突出。
  • 在某些设置中,基于解释的校准器甚至优于在目标领域数据上微调模型的性能,尽管后者可完全访问模型参数。
  • 校准器展现出良好的迁移能力:在某一领域上训练的模型可泛化到另一领域,表明所学习的启发式规则在跨领域间具有鲁棒性。
  • 该方法通过高精度识别正确预测,显著提升了模型的可靠性,即使在基础模型对分布外样本失效时亦能保持良好表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。