[论文解读] EDUCE: Explaining model Decisions through Unsupervised Concepts Extraction
EDUCE 是一种自解释的深度学习模型,通过从输入文本中自动发现语义一致的无监督概念来解释文本预测。它将输入编码为二值向量,表示概念的有无——通过可微分的、语义受限的片段学习,实现高预测性能,同时通过概念级别的可解释性,在文本分类和多方面情感分析任务中实现人类可理解的解释。
Providing explanations along with predictions is crucial in some text processing tasks. Therefore, we propose a new self-interpretable model that performs output prediction and simultaneously provides an explanation in terms of the presence of particular concepts in the input. To do so, our model's prediction relies solely on a low-dimensional binary representation of the input, where each feature denotes the presence or absence of concepts. The presence of a concept is decided from an excerpt i.e. a small sequence of consecutive words in the text. Relevant concepts for the prediction task at hand are automatically defined by our model, avoiding the need for concept-level annotations. To ease interpretability, we enforce that for each concept, the corresponding excerpts share similar semantics and are differentiable from each others. We experimentally demonstrate the relevance of our approach on text classification and multi-sentiment analysis tasks.
研究动机与目标
- 开发一种自解释模型,通过自动发现的、人类可理解的文本概念来解释预测。
- 通过完全无监督的方式学习相关概念,消除对人工概念标注的需求。
- 通过强制每个概念的提取片段在语义上保持一致且可分离,确保可解释性。
- 在仅依赖所发现概念的有无的前提下,保持高预测准确性。
- 在包括文本分类和多方面情感分析在内的多样化 NLP 任务中,证明该方法的有效性。
提出的方法
- 该模型将输入文本编码为低维二值向量,其中每个维度对应一个已发现概念的有无。
- 通过在多个输入中识别语义一致且不重叠的片段(小段词语序列),无监督地学习概念。
- 应用可微分的概念一致性与可分性损失,确保同一概念的片段具有相似语义,而与其他概念的片段相异。
- 预测仅基于二值概念向量进行,从而能够清晰地解释输入中哪些概念存在。
- 模型通过标准预测损失(交叉熵或 MSE)和辅助概念一致性损失进行端到端训练。
- 使用基于梯度的注意力机制从输入中提取片段,突出每个概念的相关词语序列。
实验结果
研究问题
- RQ1深度学习模型能否在无需概念级别标注的情况下,自动发现语义上有意义且可解释的文本概念?
- RQ2此类无监督概念的有无能否作为可靠且可解释的依据,实现准确预测?
- RQ3每个概念所提取的片段在多样化的输入中,是否能反映一致且明确的语义含义?
- RQ4在保持高可解释性的同时,该模型的预测性能与最先进模型相比如何?
- RQ5该模型能否在多方面预测任务(如方面级情感分析)中实现泛化,并具备有意义的概念定位?
主要发现
- 在 BeerAdvocate 数据集上,EDUCE 在多方面回归任务中的测试 MSE 为 0.0119,优于全文本基线模型的 0.0089,概念准确率达到 92.8%。
- 在方面级情感预测中,概念 7 在 'Appearance' 方面的黄金理由标注上实现了 97.09% 的精确率,表明与人工标注理由高度一致。
- 为概念 7 提取的片段主要与啤酒外观相关(例如,'good head and lacing','beautiful golden-amber color'),证实了语义一致性。
- 该模型表现出高度可解释性:概念由语义一致的片段一致描述,例如概念 2(与口感相关)的片段为 'creamy and a/ chewy and rich'。
- 在 AGNews 文本分类数据集上,EDUCE 实现了具有竞争力的性能,同时基于概念有无提供了解释。
- 补充实验表明,该方法可泛化至图像输入,表明其在 NLP 之外具有更广泛的应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。