QUICK REVIEW
[论文解读] Addressing the Data Sparsity Issue in Neural AMR Parsing
Xiaochang Peng, Chuan Wang|arXiv (Cornell University)|Feb 16, 2017
Natural Language Processing Techniques参考文献 17被引用 9
一句话总结
本文提出了一种序列到序列的神经AMR解析器,通过一种新颖的线性化策略和概念分类,解决了数据稀疏性问题,将罕见概念和实体子图映射到可重用的类别中。该方法在AMR解析任务上取得了52%的F1分数,显著优于先前的神经序列到序列模型,并且在不使用外部语言资源的情况下,与最先进系统相当。
ABSTRACT
Neural attention models have achieved great success in different NLP tasks. How- ever, they have not fulfilled their promise on the AMR parsing task due to the data sparsity issue. In this paper, we de- scribe a sequence-to-sequence model for AMR parsing and present different ways to tackle the data sparsity problem. We show that our methods achieve significant improvement over a baseline neural atten- tion model and our results are also compet- itive against state-of-the-art systems that do not use extra linguistic resources.
研究动机与目标
- 为解决神经AMR解析中的数据稀疏性问题,即大规模目标词表和小规模训练集对模型性能的制约。
- 开发一种序列到序列模型,仅使用原始文本和最少的预处理,有效将自然语言解析为AMR图。
- 通过将罕见概念和关系分组到语义类别中,并使用启发式对齐进行解码,提升对罕见概念和关系的泛化能力。
- 证明神经序列到序列模型即使不依赖依存解析或外部语义资源,也能实现具有竞争力的性能。
- 提供一个在低资源条件下具有鲁棒性的端到端神经AMR解析基准。
提出的方法
- 模型使用双向LSTM编码器将输入句子编码为上下文感知的隐藏状态。
- 解码器配备注意力机制,在生成输出时关注相关输入位置,利用输入和输出标记之间的软对齐。
- 通过深度优先遍历对AMR图进行线性化,将概念和关系视为序列中的标记。
- 通过分类策略将低频概念和实体子图映射到一组减少的语义类型,以降低词表稀疏性。
- 启发式对齐将源端跨度与目标概念或子图关联,使模型能够从训练数据中学习映射。
- 在解码过程中,通过学习到的或基于规则的词典将类别类型映射到其对应的完整概念,作为后处理步骤。
实验结果
研究问题
- RQ1尽管存在数据稀疏性,序列到序列的神经模型是否能在AMR解析中实现具有竞争力的性能?
- RQ2概念分类在减小目标词表规模和提升泛化能力方面有多有效?
- RQ3源端跨度与目标概念之间的启发式对齐是否能提升解码准确性?
- RQ4所提出的方法是否在不使用外部语言资源的情况下,优于现有的神经序列到序列模型在AMR解析中的表现?
- RQ5与依赖于依存解析或语义词典的最先进系统相比,该模型表现如何?
主要发现
- 所提模型在AMR解析测试集上取得了0.52的F1分数,显著优于基线序列到序列模型(F1 0.37)和字符级模型(F1 0.43)。
- 尽管未依赖依存解析或语义角色标注等外部资源,该系统的性能与使用这些资源的最先进系统相当。
- 概念分类和启发式对齐的使用减轻了罕见概念和关系的影响,提升了模型在低资源样本上的鲁棒性。
- 结果表明,当结合针对性的稀疏性缓解技术时,序列到序列架构在AMR解析中依然有效。
- 结果表明,即使缺乏句法监督,通过结构化分类和对齐,也可以缓解语义解析中的数据稀疏性问题。
- 该方法为端到端神经AMR解析提供了一个强大基线,相较于基于流水线的系统更简单且更具可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。