[论文解读] ezCoref: Towards Unifying Annotation Guidelines for Coreference Resolution
ezCoref 提出了一种适合众包的共指标注框架,配备简化教程与工具,使非专家标注员在重新标注的七个英文数据集语料上,与专家标注的 B3 一致性超过 90%。该方法揭示了现有标注指南中的不一致之处——特别是针对泛指代词和同位语结构——凸显了未来标注标准中应统一的关键现象。
Large-scale, high-quality corpora are critical for advancing research in coreference resolution. However, existing datasets vary in their definition of coreferences and have been collected via complex and lengthy guidelines that are curated for linguistic experts. These concerns have sparked a growing interest among researchers to curate a unified set of guidelines suitable for annotators with various backgrounds. In this work, we develop a crowdsourcing-friendly coreference annotation methodology, ezCoref, consisting of an annotation tool and an interactive tutorial. We use ezCoref to re-annotate 240 passages from seven existing English coreference datasets (spanning fiction, news, and multiple other domains) while teaching annotators only cases that are treated similarly across these datasets. Surprisingly, we find that reasonable quality annotations were already achievable (>90% agreement between the crowd and expert annotations) even without extensive training. On carefully analyzing the remaining disagreements, we identify the presence of linguistic cases that our annotators unanimously agree upon but lack unified treatments (e.g., generic pronouns, appositives) in existing datasets. We propose the research community should revisit these phenomena when curating future unified annotation guidelines.
研究动机与目标
- 开发一种可扩展、适合众包的共指标注方法,减少对专家标注员的依赖。
- 评估非专家标注员是否仅通过极少的语言学训练即可与专家标注达成高度一致。
- 识别众包与专家标注在哪些语言现象上存在分歧,揭示当前标注指南中的空白。
- 通过暴露现有数据集间的一致性差异,推动制定统一、面向社区的标注指南。
提出的方法
- 设计一种交互式、基于教程的标注界面,仅教授现有数据集中统一处理的共指案例(如代词)。
- 使用 Amazon Mechanical Turk 对七个不同英文共指数据集(小说、新闻等)中的 240 个语段进行重新标注,仅提供极少的培训。
- 使用 B3 F1 分数定量比较众包标注与专家标注,从提及和聚类两个层面衡量一致性。
- 对众包与专家标注之间的分歧进行定性分析,识别出在现有标注中缺乏一致处理的语言现象。
- 分析不同文本类型间的标注者间一致性,评估在熟悉与复杂文本(如小说与依赖回指或世界知识的文本)中的表现差异。
- 将标注工具、教程及所有数据以开源许可证发布,以支持可复现性与未来研究。
实验结果
研究问题
- RQ1非专家众包标注员是否仅通过极少的统一指南,即可与专家共指标注达成高度一致?
- RQ2哪些语言现象在众包标注中表现出一致的共识,但在现有专家标注数据集中处理不一致?
- RQ3文本类型(如小说、新闻)如何影响众包标注员之间的标注一致性?
- RQ4众包与专家标注之间的关键差异是什么,这些差异揭示了当前标注指南中的哪些缺陷?
主要发现
- 非专家标注员在重新标注的语段上与专家标注的 B3 F1 一致性超过 90%,证明仅通过极少训练即可收集到高质量的共指数据。
- 众包标注员一致将泛指代词(如 'you' 和 'we')标记为共指,而现有数据集对这些代词的处理不一致——部分标注为非指代,部分未标记——暴露出缺乏标准化。
- 同位语结构和系动词结构在众包标注中也一致被标记为共指,但在专家数据集中处理不一致,表明亟需统一处理方式。
- 标注者间一致性在熟悉文本(如童年故事、小说)中较高,但在包含复杂回指或强依赖世界知识的文本中显著下降。
- 交互式教程获得高度正面反馈,有标注员称其为“我见过的最好的教程”——表明其具有出色的可用性与有效性。
- 本研究识别出特定语言现象——尤其是泛指代词和同位语——是未来统一标注指南开发中的关键修订对象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。