QUICK REVIEW
[论文解读] Neural Discourse Structure for Text Categorization
Yangfeng Ji, Noah A. Smith|arXiv (Cornell University)|Feb 7, 2017
Topic Modeling参考文献 28被引用 12
一句话总结
本文提出一种新型注意力机制的递归神经网络,利用自动生成的修辞结构理论(Rhetorical Structure Theory, RST)话语树来提升文本分类性能。通过将话语结构建模为依存树并关注关键话语单元,该方法在五项文本分类任务中的四项实现了最先进性能,表明当解析质量足够时,话语结构可增强表征学习。
ABSTRACT
We show that discourse structure, as defined by Rhetorical Structure Theory and provided by an existing discourse parser, benefits text categorization. Our approach uses a recursive neural network and a newly proposed attention mechanism to compute a representation of the text that focuses on salient content, from the perspective of both RST and the task. Experiments consider variants of the approach and illustrate its strengths and weaknesses.
研究动机与目标
- 探究由修辞结构理论(Rhetorical Structure Theory, RST)定义的话语结构是否能提升文本分类性能。
- 开发一种基于话语依存树的递归神经网络模型,以整合话语结构。
- 设计并评估一种新型非归一化注意力机制,以反映RST的核-卫星显著性层级。
- 评估话语解析器质量与领域差异对文本分类性能的影响。
- 证明话语结构可作为神经文本分类中有效的归纳偏置,即使解析器并非完美。
提出的方法
- 模型使用双向LSTM将每个基本话语单元(Elementary Discourse Unit, EDU)编码为分布式表征。
- 在源自RST解析的依存树上构建递归神经网络,其中每个内部节点表示其子节点表征的组合。
- 提出一种新型非归一化注意力机制,基于话语关系计算子节点的重要性得分,优先考虑核心(nucleus)而非卫星(satellite)节点。
- 注意力机制定义为 $\alpha_i = \mathbf{v}_j^\top \mathbf{W}_\alpha \mathbf{e}_i$,其中 $\mathbf{v}_j$ 为子节点的隐藏状态,$\mathbf{e}_i$ 为EDU嵌入向量。
- 最终文档表征由树的根节点生成,并通过Softmax层用于分类。
- 模型采用交叉熵损失进行端到端训练,并在五项文本分类任务上进行评估。
实验结果
研究问题
- RQ1在不同文本体裁中,结合RST解析的话语结构是否能提升文本分类性能?
- RQ2受RST核-卫星层级启发的新型非归一化注意力机制,与神经网络中的归一化注意力相比表现如何?
- RQ3话语解析质量在多大程度上影响话语增强型文本分类模型的性能?
- RQ4在哪些文本体裁中话语结构带来最大收益,而在哪些体裁中效果不佳?
- RQ5即使解析器不完美,话语结构能否作为神经文本分类的有用归纳偏置?
主要发现
- 所提模型在五项文本分类任务中的四项优于先前工作,在Yelp评论数据集上达到71.8%的准确率,实现最先进性能。
- 采用非归一化注意力的模型在Yelp数据集上取得71.8%的准确率,优于归一化注意力变体(70.3%准确率),支持了避免归一化的架构设计选择。
- 在美利坚合众国国会法案数据集上的表现较差,表明新闻领域解析器生成的话语结构难以泛化至具有不同修辞惯例的立法文本。
- 实验表明话语解析质量显著影响分类性能,表明话语解析的改进将直接提升下游文本分类效果。
- 注意力机制成功识别出显著话语单元,话语树的根节点(通常为核心)捕捉了对分类最相关的内容。
- 模型表明话语结构提供了有意义的归纳偏置,使网络能够聚焦于文档中核心且信息量大的部分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。