[论文解读] Interpretable Text Classification Using CNN and Max-pooling
本文提出一种基于CNN的文本分类模型,通过卷积Attribution和n-gram特征分析实现可解释机制,以追踪输入标记对预测结果的贡献。该模型在实现SOTA性能的同时,通过可视化和与训练样本的模式匹配,提供详细且人类可读的模型决策解释。
Deep neural networks have been widely used in text classification. However, it is hard to interpret the neural models due to the complicate mechanisms. In this work, we study the interpretability of a variant of the typical text classification model which is based on convolutional operation and max-pooling layer. Two mechanisms: convolution attribution and n-gram feature analysis are proposed to analyse the process procedure for the CNN model. The interpretability of the model is reflected by providing posterior interpretation for neural network predictions. Besides, a multi-sentence strategy is proposed to enable the model to beused in multi-sentence situation without loss of performance and interpret ability. We evaluate the performance of the model on several classification tasks and justify the interpretable performance with some case studies.
研究动机与目标
- 为解决深度神经网络文本分类器,尤其是基于CNN的模型在可解释性方面的不足。
- 建立输入标记、学习到的n-gram特征与最终预测之间的逐点关联。
- 在多句文本上下文中保持可解释性,同时不损失性能或可解释性。
- 通过案例研究和预测贡献的可视化验证可解释性。
- 通过将判断依据追溯到训练样本,识别并分析误分类的原因。
提出的方法
- 卷积Attribution通过分解卷积操作,计算每个词向量值对n-gram特征的贡献。
- n-gram特征解析通过回溯最大池化操作,将特定n-gram特征与最终分类决策关联起来。
- 多句加权策略在保留可解释性的同时,聚合多个句子的表示。
- 模型使用具有多种卷积核大小的一维卷积,以检测词向量序列中的局部n-gram模式。
- 通过将词级别贡献映射到目标类别,实现可解释性可视化,从而支持人类可读的解释。
- 通过将预测模式与相似的训练样本匹配,执行错误分析,以识别误导性特征。
实验结果
研究问题
- RQ1如何解释基于CNN的文本分类器中单个输入标记对最终预测的贡献?
- RQ2我们能否在CNN模型中建立学习到的n-gram特征与输入词向量之间的可靠关联?
- RQ3在多句文本分类中,如何在不牺牲性能的前提下保持可解释性?
- RQ4在多大程度上可以通过特征级Attribution和模式匹配来解释模型的决策过程?
- RQ5我们能否通过将判断依据追溯到特定的训练样本,来识别并诊断误分类?
主要发现
- 该模型在TREC及其他基准测试的文本分类任务中,性能与SOTA分类器相当。
- 卷积Attribution成功识别出对预测贡献最大的特定词语,例如在'technology brand'类别中'intelligent'的贡献。
- n-gram特征分析表明,模型学习到了语义上有意义的模式,例如'how long'强烈指示'NUM'类别。
- 可视化显示,模型的关注度比注意力机制更精确地定位相关词语,其贡献更清晰、更集中。
- 与训练样本的模式匹配表明,低置信度预测通常源于不合理或误导性的特征组合。
- 多句策略在保持性能和可解释性的同时,实现了对长输入文本的有效分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。