Skip to main content
QUICK REVIEW

[论文解读] All Roads Lead to UD: Converting Stanford and Penn Parses to English Universal Dependencies with Multilayer Annotations

Siyao Peng, Amir Zeldes|arXiv (Cornell University)|Sep 2, 2019
Natural Language Processing Techniques参考文献 12被引用 9
一句话总结

本文提出了一种高度准确的基于规则的方法,将标准斯坦福句法依存关系(SD)和宾州风格短语结构树转换为英语的通用依存关系(UD)2.2。通过引入多层标注——包括指代、命名实体和话语结构——SD到UD的转换错误率低于0.5%,显著优于基于短语结构树的转换方法,后者因短语功能描述不充分而产生约10%的错误。

ABSTRACT

We describe and evaluate different approaches to the conversion of gold standard corpus data from Stanford Typed Dependencies (SD) and Penn-style constituent trees to the latest English Universal Dependencies representation (UD 2.2). Our results indicate that pure SD to UD conversion is highly accurate across multiple genres, resulting in around 1.5% errors, but can be improved further to fewer than 0.5% errors given access to annotations beyond the pure syntax tree, such as entity types and coreference resolution, which are necessary for correct generation of several UD relations. We show that constituent-based conversion using CoreNLP (with automatic NER) performs substantially worse in all genres, including when using gold constituent trees, primarily due to underspecification of phrasal grammatical functions.

研究动机与目标

  • 评估将标准斯坦福句法依存关系(SD)转换为通用依存关系(UD)2.2的准确性。
  • 识别除句法树之外,哪些额外的标注层对于实现高精度的UD转换是必要的。
  • 从错误率和依存关系质量两个方面,比较基于SD的转换与基于短语结构树的转换(通过CoreNLP实现)的性能。
  • 发布一个包含超过8.5万个词元、涵盖八个语体的新型多层标注英语UD语料库。

提出的方法

  • 使用基于规则的转换系统DepEdit,通过基于词元属性和句法关系的可配置规则,将SD依存关系映射到UD 2.2关系。
  • 在预处理阶段整合补充标注层(如命名实体、指代、话语结构(RST)和信息状态),以解决模糊或罕见的UD关系。
  • 转换流程包括预处理(在句法树中整合外部标注)、基于规则的转换以及通过udapi API进行标点符号附加的后处理。
  • 评估每一层标注对转换准确率的影响,独立分析每一层对错误减少的贡献。
  • 对于基于短语结构树的转换,研究同时使用了标准短语结构树和通过CoreNLP自动生成的树,以评估解析质量对最终UD输出的影响。
  • 最终的UD输出与标准UD 2.2进行对比验证,错误率按词元和关系类型分别测量。

实验结果

研究问题

  • RQ1使用基于规则的方法从斯坦福句法依存关系(SD)到通用依存关系(UD)2.2的转换准确率如何?
  • RQ2除了句法解析之外,哪些额外的标注层是实现SD到UD转换近乎完美准确率所必需的?
  • RQ3基于短语结构树的转换(通过CoreNLP)与基于SD的转换相比,准确率如何,尤其是在使用标准短语结构树时?
  • RQ4SD-to-UD与基于短语结构树的转换在非投射依存关系方面有何差异?这些差异的成因是什么?
  • RQ5多层标注在检测和正确标注罕见UD关系(如呼语、修复性成分和离析成分)方面是否具有改善作用?

主要发现

  • 仅使用基于规则的方法进行SD到UD转换,在多个语体中错误率约为1.5%。
  • 整合额外的标注层(如指代、命名实体和话语结构)可将错误率降低至0.5%以下。
  • 即使使用标准短语结构树,通过CoreNLP进行的基于短语结构树的转换仍导致约10%的错误率,原因是短语句法功能描述不充分。
  • SD-to-UD转换引入的非投射依存关系(在GUM中占0.79%)多于原始SD(0.63%)或C2UD(0.29%),其中反向指向的并列连词(cc)是主要贡献因素。
  • 英语网页句法树库(EWT)V2.2的手动校对版UD版本的非投射性较低(0.46%),低于GUM的SD2UD版本(0.79%),表明语体差异或EWT中残留的描述不充分问题。
  • 本研究发现,UD关系'orphan'在SD中并非原生支持,其正确标注需要外部知识,凸显了当前依存关系体系中的一个缺口。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。