Skip to main content
QUICK REVIEW

[论文解读] Elimination of Spurious Ambiguity in Transition-Based Dependency Parsing

Shay B. Cohen, Carlos Gómez‐Rodríguez|arXiv (Cornell University)|Jun 28, 2012
Natural Language Processing Techniques参考文献 20被引用 8
一句话总结

本文提出一种系统化方法,通过为每个依存句法树定义规范的推导序列,消除自底向上转移式依存分析中的虚假歧义,确保每棵树通过确定性的、基于栈的转移策略拥有唯一推导路径。该方法保持与原始系统相同的渐近时间复杂度,同时实现无需对推导路径进行边缘化处理的高效概率分析。

ABSTRACT

We present a novel technique to remove spurious ambiguity from transition systems for dependency parsing. Our technique chooses a canonical sequence of transition operations (computation) for a given dependency tree. Our technique can be applied to a large class of bottom-up transition systems, including for instance Nivre (2004) and Attardi (2006).

研究动机与目标

  • 解决转移式依存分析中的虚假歧义问题,即多个推导序列产生相同句法结构的问题。
  • 在转移系统层面消除歧义,而非通过启发式方法或基于图表的方法在事后处理。
  • 提供一种系统化、确定性的方法,确保每棵依存树仅对应一个规范推导路径。
  • 在消除歧义的同时,保持与原始系统相同的渐近时间复杂度。
  • 通过避免对推导路径进行边缘化,实现在监督和无监督设置下的高效训练与解码。

提出的方法

  • 定义一类单调的自底向上移位-归约转移系统,包含弧标准型和非投射型解析器。
  • 引入规范推导策略:尽可能提前归约,并通过优先处理更接近当前栈顶的依存关系来解决冲突。
  • 使用确定性最优解,将每棵依存树映射到基于局部依存偏好唯一确定的推导序列。
  • 通过增加额外的状态信息来强制执行规范策略,同时不改变底层解析行为。
  • 确保增强后的系统保持完备性,并与原始系统具有相同的时间复杂度。
  • 通过为每条推导路径分配唯一概率,实现概率建模,避免对多条推导路径进行边缘化。

实验结果

研究问题

  • RQ1能否以系统化且高效的方式在系统层面消除转移式依存分析中的虚假歧义?
  • RQ2何种转移系统条件可保证每棵依存树存在唯一的规范推导路径?
  • RQ3所提方法是否保持与原始系统相同的渐近时间复杂度?
  • RQ4所提规范最优解的覆盖范围与现有系统中启发式最优解相比如何?
  • RQ5该方法能否扩展至无监督学习,使用EM算法时避免因歧义引入的复杂性?

主要发现

  • 所提规范最优解在原始Attardi解析器(使用度数为2的转移)可解析的所有树上实现了100%覆盖,而原始最优解在多种语言中遗漏了数百棵树。
  • 在CoNLL 2006语料库的树库中,所提方法实现了完全覆盖(0棵遗漏树),而Attardi的启发式最优解在72,703个捷克语句中遗漏了1,334棵。
  • 该方法在理论上正确且完备:若一棵树可被原始系统解析,则同样可被规范系统解析。
  • 增强系统所用动态规划算法的渐近时间复杂度与原始系统相同。
  • 该方法可实现高效的训练与解码,通过消除对推导路径的边缘化,在监督与无监督设置中均表现优异。
  • 该方法可扩展至概率模型,并可用于基于EM的无监督学习,实现依存语法归纳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。