[论文解读] A Multi-Axis Annotation Scheme for Event Temporal Relations
本文提出一种用于事件时序关系的多轴注释方案,强调以起点锚定而非终点,并展示在评注者间一致性和 crowdsourced 数据集 MATRES 的提高,聚焦于起点。
Existing temporal relation (TempRel) annotation schemes often have low inter-annotator agreements (IAA) even between experts, suggesting that the current annotation task needs a better definition. This paper proposes a new multi-axis modeling to better capture the temporal structure of events. In addition, we identify that event end-points are a major source of confusion in annotation, so we also propose to annotate TempRels based on start-points only. A pilot expert annotation using the proposed scheme shows significant improvement in IAA from the conventional 60's to 80's (Cohen's Kappa). This better-defined annotation scheme further enables the use of crowdsourcing to alleviate the labor intensity for each annotator. We hope that this work can foster more interesting studies towards event understanding.
研究动机与目标
- 通过在多语义轴上重新定义任务来解决 TempRel 注释方案中较低的评注者间一致性。
- 通过聚焦起点而非终点来提高可靠性,因为终点存在歧义。
- 通过众包实现可扩展数据收集,配合鲁棒的质量控制。
- 提供支持基于起点的 TempRel 注释的新数据集 MATRES,并与 TB-Dense 进行比较。
- 提供一个基线系统,展示任务定义的改进以及对 TempRel 提取的潜在提升。
提出的方法
- 提出一种多轴建模,其中事件锚定在语义轴上(主轴和正交轴),仅对同轴对进行比较。
- 采用区间拆分,将时间区间关系分解为起点比较(起始-起始、起始-结束、结束-起始、结束-结束),以在保持表达能力的同时简化标注。
- 将标注聚焦于起点(t_start),将终点比较视为当前任务不必要,原因是存在更高的歧义性和较低的可靠性。
- 实现两步众包工作流:先做锚定性注释以确定在给定轴上事件是否可锚定,然后再对可锚定事件之间进行关系注释。
- 为众包引入质量控制(黄金问题、资格测试、多数票聚合)以及通过一个结构化的 Q1/Q2 歧义检查来处理起点顺序的模糊关系的程序。
实验结果
研究问题
- RQ1与传统的单轴方案相比,多轴注释方案能否提升 TempRel 注释的评注者间一致性?
- RQ2关注起点是否降低认知负荷和注释错误,从而实现可靠的众包 TempRel 数据集?
- RQ3在注释质量和跨数据集一致性方面,MATRES 数据集与 TB-Dense 相比如何?
- RQ4新注释方案对使用基线分类器的 TempRel 提取性能有何影响?
主要发现
- 初步专家注释在主轴上的评注者间一致性为 0.84(Cohen’s Kappa),显著高于此前约 0.60 的 IAA。
- 通过质量控制的众包产生了可靠的注释:锚定性和关系步骤在黄金数据上达到高准确性,工作者一致性强。
- MATRES 在 TempRel 注释的清晰度和注释可靠性方面显示出显著改进,支持基于起点的标注和正交轴。
- 与 TB-Dense 相比,MATRES 提供更好的起点对齐,并与金标准和众包共识显示出合理的一致性。
- 在 MATRES 上的基线平均感知器系统实现了具有竞争力的 F1 分数,表明该任务在新方案下定义良好且可学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。