Skip to main content
QUICK REVIEW

[论文解读] Improving the Explainability of Neural Sentiment Classifiers via Data Augmentation

Hanjie Chen, Yangfeng Ji|arXiv (Cornell University)|Sep 10, 2019
Explainable Artificial Intelligence (XAI)被引用 7
一句话总结

本文提出两种数据增强方法——使用预定义的情感词列表和对抗性样本——在不牺牲预测性能的前提下,提升神经网络情感分类器的可解释性。实验表明,这两种方法在基准数据集上的CNN和RNN模型中,显著增强了LIME生成解释的可解释性,且通过人工与自动评估均得到验证。

ABSTRACT

Sentiment analysis has been widely used by businesses for social media opinion mining, especially in the financial services industry, where customers' feedbacks are critical for companies. Recent progress of neural network models has achieved remarkable performance on sentiment classification, while the lack of classification interpretation may raise the trustworthy and many other issues in practice. In this work, we study the problem of improving the explainability of existing sentiment classifiers. We propose two data augmentation methods that create additional training examples to help improve model explainability: one method with a predefined sentiment word list as external knowledge and the other with adversarial examples. We test the proposed methods on both CNN and RNN classifiers with three benchmark sentiment datasets. The model explainability is assessed by both human evaluators and a simple automatic evaluation measurement. Experiments show the proposed data augmentation methods significantly improve the explainability of both neural classifiers.

研究动机与目标

  • 为解决神经网络情感分类器可解释性不足的问题,该问题阻碍其在金融等领域的信任与实际部署。
  • 提升LIME等模型生成的局部解释(如显著性关键词)的可解释性。
  • 探索是否可将数据增强不仅用于提升性能,还可用于增强模型可解释性。
  • 通过人工评估与自动一致性度量,验证可解释性改进的有效性。

提出的方法

  • 提出基于外部知识的数据增强(Da-Ek):对每个训练句,移除SentiWordNet情感词列表中的词汇,生成极性中立的增强样本。
  • 引入对抗性数据增强,通过生成保持情感极性但改变词显著性的扰动样本,提升模型鲁棒性与可解释性。
  • 在原始数据与增强数据的组合上训练情感分类器,使模型学会依赖更具可解释性的、与情感相关的关键特征。
  • 使用LIME生成局部解释,并基于余弦相似度计算一致性得分,自动评估解释质量。
  • 通过人工评估判断生成解释的可解释性,比较增强前后模型输出的差异。
  • 结合自动与人工评估,验证一致性得分的提升与人类感知可解释性之间存在正相关。

实验结果

研究问题

  • RQ1数据增强技术是否能在提升预测性能之外,进一步提升神经网络情感分类器的可解释性?
  • RQ2在数据增强过程中引入情感词列表作为外部知识,是否能生成更具可解释性的模型解释?
  • RQ3能否利用对抗性样本同时提升模型鲁棒性与解释可解释性?
  • RQ4自动一致性得分与人工评估的解释质量之间是否存在相关性?
  • RQ5所提方法是否在不降低分类准确率的前提下提升可解释性?

主要发现

  • 所提数据增强方法显著提升了CNN与RNN情感分类器的可解释性,经人工评估验证。
  • 使用Da-Ek与对抗性增强训练的模型,其生成的解释在可解释性评分上持续优于基线模型。
  • 自动一致性得分与人工评估得分呈正相关,验证了其作为可解释性代理指标的有效性。
  • 经增强数据训练的模型生成的解释能清晰指示情感极性,例如突出显示'brisk'、'treasure'和'familiar'等正向情感关键词。
  • 可解释性提升在多个数据集与模型架构上均保持一致,证明方法具备泛化能力。
  • 未观察到预测准确率显著下降,证实可解释性提升未以牺牲性能为代价。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。