QUICK REVIEW
[论文解读] Unsupervised Dependency Parsing: Let's Use Supervised Parsers
Phong Ba Le, Willem Zuidema|arXiv (Cornell University)|Apr 18, 2015
Natural Language Processing Techniques参考文献 27被引用 10
一句话总结
本文提出迭代重排序(IR),一种自训练框架,通过重用有监督解析模型来提升无监督依存句法解析性能。该框架从无监督解析器生成的句法树出发,利用在当前预测结果上训练的高性能、高阶生成重排序器,迭代地优化这些句法树,从而在WSJ语料库上实现了比先前最先进方法高1.8%的DDA(依存解码准确率),同时通过词嵌入捕捉词汇语义。
ABSTRACT
We present a self-training approach to unsupervised dependency parsing that reuses existing supervised and unsupervised parsing algorithms. Our approach, called `iterated reranking' (IR), starts with dependency trees generated by an unsupervised parser, and iteratively improves these trees using the richer probability models used in supervised parsing that are in turn trained on these trees. Our system achieves 1.8% accuracy higher than the state-of-the-part parser of Spitkovsky et al. (2013) on the WSJ corpus.
研究动机与目标
- 通过在无监督设置中重用先进的有监督模型,弥合有监督与无监督依存句法解析之间的差距。
- 通过引入简单无监督模型无法捕捉的丰富语言规律和词汇语义,提升无监督解析性能。
- 开发一种实用的迭代框架,避免依赖人工标注数据,同时利用最先进有监督解析技术的表达能力。
- 评估在缺乏标准答案的情况下,具有大上下文条件的高阶生成模型是否能优于简单无监督模型。
提出的方法
- 该框架以无监督解析器生成的依存树作为初始值。
- 在每次迭代中,k-best解析器(如MSTParser)为每句话生成多个候选依存树。
- 一个高阶生成重排序器,具体为无限阶循环神经网络(IORNN),利用基于大段树结构的丰富上下文敏感概率模型,对k个最佳树进行重打分。
- 从每句话中选择得分最高的树,并用于在自训练循环中重新训练重排序器。
- 重排序器通过预训练的词嵌入初始化,以在无需人工标注的情况下引入词汇语义。
- 该过程通过使用日益精确的概率模型迭代优化预测,逐步提升解析准确率。
实验结果
研究问题
- RQ1能否有效将具有复杂高阶特征的有监督解析模型重新用于无监督依存句法解析?
- RQ2通过词嵌入引入词汇语义在多大程度上能提升无监督解析性能?
- RQ3在缺乏标准答案的情况下,使用具有大条件上下文(无限阶模型)的生成重排序器是否能优于简单模型?
- RQ4迭代重排序框架的性能对初始无监督解析器质量的敏感程度如何?
主要发现
- 所提出的迭代重排序系统在WSJ语料库上实现了比先前最先进无监督解析器高1.8%的DDA(依存解码准确率)。
- 由于使用了能捕捉远距离上下文模式的无限阶模型,系统在依存弧上的召回率和F1值显著提升,尤其在长距离依存(≥3个词)上表现突出。
- 性能提升在内容词(如名词NN、NNP、NNS,动词VBD、VBZ、VBN、VBG,形容词JJ、JJR)上最为明显,表明其对句法和语义规律的建模效果良好。
- 该框架对初始解析器有较强依赖性:当初始值质量较差时性能受限,但若以更优的无监督解析器作为起点,性能可进一步提升。
- 词嵌入的使用使系统能够隐式捕捉词汇语义,从而在无需人工语义标注的情况下,提升对罕见或未见词形的泛化能力。
- 实证表明,无限阶模型在建模长距离依存方面优于简单模型,尤其体现在对跨度≥3个词的依存弧上性能的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。