Skip to main content
QUICK REVIEW

[论文解读] Learning Variational Word Masks to Improve the Interpretability of Neural Text Classifiers

Hanjie Chen, Yangfeng Ji|arXiv (Cornell University)|Oct 1, 2020
Explainable Artificial Intelligence (XAI)参考文献 55被引用 5
一句话总结

本文提出变分词掩码(Vmask),一种通过变分推断学习任务特定、全局词重要性的方法,以抑制神经文本分类器中无关或噪声的词特征。通过将Vmask集成到CNN、LSTM和BERT等模型的输入层,该方法在无需人工标注或先验解释的情况下,同时提升了预测准确率与可解释性,在七个基准数据集上实现了更优的局部与全局解释质量。

ABSTRACT

To build an interpretable neural text classifier, most of the prior work has focused on designing inherently interpretable models or finding faithful explanations. A new line of work on improving model interpretability has just started, and many existing methods require either prior information or human annotations as additional inputs in training. To address this limitation, we propose the variational word mask (VMASK) method to automatically learn task-specific important words and reduce irrelevant information on classification, which ultimately improves the interpretability of model predictions. The proposed method is evaluated with three neural text classifiers (CNN, LSTM, and BERT) on seven benchmark text classification datasets. Experiments show the effectiveness of VMASK in improving both model prediction accuracy and interpretability.

研究动机与目标

  • 通过学习任务特定的全局词重要性,提升神经文本分类器的可解释性,且无需依赖人工标注的解释或先验知识。
  • 通过将可解释性直接嵌入模型训练过程,解决后处理解释方法无法提升模型可解释性的局限。
  • 开发一种模型无关的方法,通过可微、可训练的掩码机制,同时提升预测性能与解释保真度。
  • 证明具有相似架构的模型在可解释性上可能存在显著差异,且这种差异可通过Vmask系统性地改善。

提出的方法

  • Vmask插入在词嵌入层之后,通过变分推断学习词掩码的后验分布,以抑制无关或噪声的特征。
  • 该方法在信息瓶颈(IB)框架下进行形式化,使用变分近似最小化输入词与模型预测之间的互信息,同时保留预测信息。
  • 通过变分推断推导出IB目标的下界,实现模型与Vmask参数的端到端联合训练。
  • 每个词元的词掩码从由可微门控参数化的伯努利分布中采样,使反向传播可穿过掩码过程。
  • 该方法应用于三种架构——CNN、LSTM和BERT——且不修改其核心结构,因此具有模型无关性。
  • 通过LIME和SP-LIME分别生成后处理解释,以评估局部与全局可解释性。

实验结果

研究问题

  • RQ1可微、可训练的掩码机制是否能在无需人工标注解释的情况下,提升神经文本分类器的可解释性?
  • RQ2通过Vmask学习任务特定的词重要性,是否能产生比标准模型更忠实、更可靠的后处理解释?
  • RQ3Vmask在多大程度上提升了预测准确率,同时减少了对低重要性或高频词的依赖?
  • RQ4Vmask是否能有效应用于多样化的架构(CNN、LSTM、BERT)与文本分类任务?

主要发现

  • Vmask在所有七个基准数据集上均提升了预测准确率,尤其在IMDB、Subj和Yelp数据集上提升显著,表明其泛化能力与鲁棒性增强。
  • 基于Vmask模型的后处理LIME解释始终突出情感关键词(如'excellent'、'brilliant'、'thrilling'),而基线模型则选择无关词汇如'plot'或'to'。
  • SP-LIME全局重要性分析显示,Vmask模型仅选择与主题相关的词汇(如'favorite'、'powerful'),而基线模型则突出语义无关术语如'performances'或'butcher'。
  • 词频与Vmask重要性之间的皮尔逊相关性不显著,证实Vmask并非简单优先选择高频词。
  • 词云可视化显示,Vmask选择的词汇在语义上与任务一致(如情感任务中为'funnest',新闻任务中为'spaceport'),而IBA基线则选择无关词汇如'undress'或'slurred'。
  • 词掩码的期望值显示,情感词汇,即使为低频词如'craveable'或'funnest',也获得高掩码值(>0.8),而高频词的掩码值接近0.5,表明模型对有意义特征实现了选择性关注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。