Skip to main content
QUICK REVIEW

[论文解读] Can we Fix the Scope for Coreference? Problems and Solutions for Benchmarks beyond OntoNotes

Amir Zeldes|arXiv (Cornell University)|Dec 17, 2021
Natural Language Processing Techniques被引用 4
一句话总结

本文认为,像OntoNotes这样的共指基准存在语义和跨语言局限性,这是由于过度依赖形态句法线索,且排除了诸如类指、不定代词回指和命题等关键现象。文章主张转向以语义为导向、将作用域与共指分离的共指标注方式,倡导采用更广泛、更灵活的标注标准,以提升多语言和多领域NLP任务中可靠性和适用性。

ABSTRACT

Current work on automatic coreference resolution has focused on the OntoNotes benchmark dataset, due to both its size and consistency. However many aspects of the OntoNotes annotation scheme are not well understood by NLP practitioners, including the treatment of generic NPs, noun modifiers, indefinite anaphora, predication and more. These often lead to counterintuitive claims, results and system behaviors. This opinion piece aims to highlight some of the problems with the OntoNotes rendition of coreference, and to propose a way forward relying on three principles: 1. a focus on semantics, not morphosyntax; 2. cross-linguistic generalizability; and 3. a separation of identity and scope, which can resolve old problems involving temporal and modal domain consistency.

研究动机与目标

  • 识别并批判OntoNotes共指标注方案中的关键局限,特别是其对形态句法线索(如定指性与连系动词结构)的过度依赖。
  • 阐明排除类指、不定代词回指和命题等现象如何导致系统行为反直觉,降低实际可用性。
  • 倡导一种以语义而非句法为基础的新共指标注标准,以实现更好的跨语言泛化能力与多语言适用性。
  • 推动在共指识别中将身份与作用域分离,从而更细致地建模时间、模态和话语语义领域。
  • 鼓励采用更广泛、更具包容性的标注方案(如GUM和ARRAU中的方案)替代限制性较强的ON标准,尤其适用于高级NLP应用。

提出的方法

  • 提出从基于句法的标注转向以语义为导向的共指标注,优先关注指称意义而非形态句法形式(如定指性或连系动词结构)。
  • 引入将共指身份与作用域分离的原则,使时间、模态和话语语义领域可独立建模。
  • 倡导在共指标注中纳入此前被排除的现象(如类指、不定代词回指和命题),作为独立的子类型。
  • 以GUM和ARRAU等现有分层语料库为范例,展示更广泛、更灵活的标注方式的可行性,证明此类数据在需要时可被转换为ON风格格式。
  • 支持发展基于Universal Dependencies等倡议的通用共指标准,以实现在不同语言和话语类型间的一致性。
  • 将句法结构用作数据处理工具(如去除复合修饰语或重排同位语),以促进与不同标注方案的对齐。

实验结果

研究问题

  • RQ1为何在OntoNotes上训练的共指系统在处理类指、不定代词回指和连系动词命题时会产生反直觉结果?
  • RQ2如何改革共指标注以提升其在英语以外语言中的跨语言一致性与适用性?
  • RQ3在当前基准中,将指称识别与共指解析混为一谈会产生何种后果?
  • RQ4在共指标注中,作用域与身份在多大程度上可被有意义地分离,以提升模型可解释性与性能?
  • RQ5如何重构标注指南,以优先考虑语义指称而非形态句法形式,同时不牺牲可靠性?

主要发现

  • OntoNotes标注方案排除了类指、不定代词回指和命题等关键现象,导致系统行为不一致且反直觉,尽管其标注一致率较高。
  • 在OntoNotes上训练的系统常无法识别重复不定代词或类指名词短语中的指称连续性,即使这些指称在语义上是连贯的。
  • 对形态句法线索(如定指性与连系动词结构)的依赖,限制了共指系统在其他语言和非英语语料中的可迁移性。
  • 在共指解析中分离身份与作用域,可更准确地建模时间与模态领域的一致性,从而解决长期存在的接口问题。
  • GUM和ARRAU等语料库表明,更广泛、以语义为基础的标注方案是可行的,且比ON风格的限制更具信息量。
  • 将现有语料库(如GUM)转换为ON风格格式(如OntoGUM)是可能且有用的,但将缺失现象添加到ON中远比从一开始就采用包容性标注更困难。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。