[论文解读] Incremental Parsing with Minimal Features Using Bi-Directional LSTM
本文提出一种基于双向LSTM的最小特征解析框架,通过建模句子上下文实现增量依赖解析和成分解析。通过仅使用三个位置特征的双向LSTM表示,该模型在英语和中文数据集上均取得了当前最优的性能,优于以往工作在长距离依赖上的表现,并且无需依赖大量手工特征工程。
Recently, neural network approaches for parsing have largely automated the combination of individual features, but still rely on (often a larger number of) atomic features created from human linguistic intuition, and potentially omitting important global context. To further reduce feature engineering to the bare minimum, we use bi-directional LSTM sentence representations to model a parser state with only three sentence positions, which automatically identifies important aspects of the entire sentence. This model achieves state-of-the-art results among greedy dependency parsers for English. We also introduce a novel transition system for constituency parsing which does not require binarization, and together with the above architecture, achieves state-of-the-art results among greedy parsers for both English and Chinese.
研究动机与目标
- 通过用学习到的句子表示替代复杂的特征工程,将依赖解析和成分解析简化到人类设计特征的最低限度。
- 通过双向LSTM编码捕获全局句子上下文,提升解析准确率,特别是长距离依赖的解析性能。
- 为贪心成分解析开发一种新型转移系统,避免二叉化处理,同时支持高效的增量解析。
- 证明简单、端到端学习的表示可以达到或超越依赖于大量语言学特征的系统性能。
- 建立一个统一的、最小特征的架构,适用于多种语言和解析类型(依赖解析与成分解析)。
提出的方法
- 模型使用双向LSTM对句子中的每个词进行编码,输入向量结合了词嵌入和词性标注嵌入。
- 位置特征表示通过在每个词位置上拼接前向和后向LSTM隐藏状态获得。
- 采用两层双向LSTM架构,第一层的输出作为第二层的输入,以捕捉更高阶的句子交互关系。
- 对于依赖解析,使用贪心的移进-归约转移系统,解析决策基于栈和队列中最近的三个位置。
- 对于成分解析,引入一种新型的移进-提升-连接转移系统,可在不进行二叉化的情况下支持非二叉树结构。
- 模型仅使用三个位置特征(s1, s0, q0)和非终结符标签嵌入,所有上下文信息均由双向LSTM表示捕获。
实验结果
研究问题
- RQ1一个解析模型是否仅使用三个位置特征且不依赖手工设计的语言学特征,也能实现当前最优性能?
- RQ2与依赖于局部特征的模型相比,双向LSTM表示是否能在长距离依赖弧上表现更优?
- RQ3对于成分解析的新型转移系统是否能在贪心解析设置下避免二叉化处理,同时保持高准确率?
- RQ4通过双向LSTM表示引入全局句子上下文,对局部解析错误的鲁棒性有何影响?
- RQ5在结合深度上下文表示的前提下,最小特征集在多大程度上可以达到或超越依赖于大量特征工程的系统性能?
主要发现
- 在Penn Treebank开发集上,所提出的双向LSTM模型取得了93.67的UAS和91.48的LAS,优于所有先前的贪心依赖解析器。
- 在Penn Chinese Treebank上,模型取得了86.35的UAS和85.71的LAS,与中文领域最佳贪心解析器持平或超越。
- 在长依赖弧(长度 > 6)上,模型显著优于先前工作,且准确率下降极小,证实了全局上下文建模的优势。
- 消融实验表明,前向和后向上下文以及词性标注嵌入均对高性能至关重要,任一组件的移除都会导致准确率显著下降。
- 两层双向LSTM架构始终优于单层版本,表明更深的双向LSTM表示能捕捉到更有用的结构模式。
- 新型的移进-提升-连接转移系统实现了无需二叉化的高精度贪心成分解析,在英语上达到89.95的F1,在中文上达到80.13的F1,是对比中所有贪心解析器中的最高值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。