Skip to main content
QUICK REVIEW

[论文解读] SciCo: Hierarchical Cross-Document Coreference for Scientific Concepts

Arie Cattan, Sophie Johnson|arXiv (Cornell University)|Apr 18, 2021
Topic Modeling参考文献 53被引用 11
一句话总结

本文提出了 SciCo,一个大规模、专家标注的科学文献层级跨文档共指消解(H-CDCR)数据集,其中对抽象技术概念的提及通过参照层级进行聚类和关联。联合建模方法能同时预测共指簇和层级关系,性能优于基线模型,但仍有显著的提升空间。

ABSTRACT

Determining coreference of concept mentions across multiple documents is a fundamental task in natural language understanding. Previous work on cross-document coreference resolution (CDCR) typically considers mentions of events in the news, which seldom involve abstract technical concepts that are prevalent in science and technology. These complex concepts take diverse or ambiguous forms and have many hierarchical levels of granularity (e.g., tasks and subtasks), posing challenges for CDCR. We present a new task of Hierarchical CDCR (H-CDCR) with the goal of jointly inferring coreference clusters and hierarchy between them. We create SciCo, an expert-annotated dataset for H-CDCR in scientific papers, 3X larger than the prominent ECB+ resource. We study strong baseline models that we customize for H-CDCR, and highlight challenges for future work.

研究动机与目标

  • 为解决科学文献中涉及抽象、层级化技术概念的跨文档共指消解(CDCR)缺乏数据集和模型的问题。
  • 提出并定义一项新任务:层级跨文档共指消解(H-CDCR),联合推断共指簇及其之间的参照层级关系。
  • 构建 SciCo,一个大规模、专家标注的数据集,其规模为 ECB+ 的三倍,涵盖计算机科学论文中具有层级粒度的概念提及。
  • 在 H-CDCR 上评估强基线模型,识别在科学文本中处理词汇多样性、歧义性和层级结构方面的挑战。
  • 支持下游应用,如分面式示例查询、概念导航以及科学文献集合中信息检索的改进。

提出的方法

  • 通过使用低覆盖率知识库、噪声超类提取器以及人工筛选的候选集,开发了一种新颖的候选生成管道,以构建 SciCo 数据集。
  • 由领域专家对科学论文中的共指簇和参照层级进行标注,确保 H-CDCR 任务的高质量监督。
  • 提出一种基于交叉编码器架构的联合建模方法,以同时预测簇之间的共指关系和层级关系。
  • 评估多种基线模型,包括基于 Levenshtein 距离的表面形式匹配方法以及独立的共指/层级模型,以建立性能基准。
  • 使用微平均 CoNLL F1 分数评估不同词汇多样性与歧义水平子集上的性能表现。
  • 应用皮尔逊与斯皮尔曼相关性分析,验证尽管词汇多样性存在差异,标注者间一致性仍为性能的可靠代理指标。

实验结果

研究问题

  • RQ1科学概念提及中的词汇多样性与歧义性如何影响共指消解的性能?
  • RQ2统一模型是否能比独立模型更有效地联合预测共指簇及其之间的层级关系?
  • RQ3共指模型在低词汇多样性或存在歧义的概念提及子集上的性能下降程度如何?
  • RQ4所提出的 H-CDCR 任务在多大程度上提升了对分面式示例查询和科学文献中概念导航的支持?
  • RQ5在多篇科学文献中建模层级化、抽象技术概念的关键挑战是什么?

主要发现

  • 所提出的联合交叉编码器模型在 H-CDCR 上优于多个基线模型,证明了共指与层级关系端到端联合学习的优势。
  • SciCo 数据集规模为知名数据集 ECB+ 的三倍,为训练和评估 H-CDCR 模型提供了重要资源。
  • 共指性能与词汇多样性密切相关,表现为在按编辑距离基线性能排序的底部 10% 和 20% 主题中 F1 分数显著降低。
  • 编辑距离基线与标注者间一致性无显著相关性(p 值分别为 0.10 和 0.21),验证了人类一致性在不同多样性水平下仍是可靠的性能度量。
  • 模型在处理语义相似但词汇表达不同的提及(如 'scientific paper analysis' 与 'scholarly document analysis')时表现不佳,表明需要更丰富的上下文表征。
  • 尽管基线性能强劲,仍存在巨大改进空间,尤其是在处理科学概念提及中的歧义性和词汇变体方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。