Skip to main content
QUICK REVIEW

[论文解读] Citation Classification for Behavioral Analysis of a Scientific Field

David Jurgens, Srijan Kumar|arXiv (Cornell University)|Sep 2, 2016
Topic Modeling被引用 10
一句话总结

本文提出了一套大规模、多维度的引用分类框架,通过功能(如背景、使用、扩展)和中心性(定位性 vs. 必要性)对引用进行标注,基于近2,000个标注引用的新型数据集,应用最先进的分类器对20,000篇NLP论文中的13.4万余条引用进行了标注,揭示了NLP领域正经历向共识的显著转变,表现为比较性和定位性引用减少,对共享基准和核心方法论文献的依赖性增强。

ABSTRACT

Citations are an important indicator of the state of a scientific field, reflecting how authors frame their work, and influencing uptake by future scholars. However, our understanding of citation behavior has been limited to small-scale manual citation analysis. We perform the largest behavioral study of citations to date, analyzing how citations are both framed and taken up by scholars in one entire field: natural language processing. We introduce a new dataset of nearly 2,000 citations annotated for function and centrality, and use it to develop a state-of-the-art classifier and label the entire ACL Reference Corpus. We then study how citations are framed by authors and use both papers and online traces to track how citations are followed by readers. We demonstrate that authors are sensitive to discourse structure and publication venue when citing, that online readers follow temporal links to previous and future work rather than methodological links, and that how a paper cites related work is predictive of its citation count. Finally, we use changes in citation roles to show that the field of NLP is undergoing a significant increase in consensus.

研究动机与目标

  • 为解决缺乏大规模、自动化引用功能标注的问题,创建统一且可操作的引用角色分类体系。
  • 开发高精度分类器,实现对整个科学领域中引用功能与中心性的自动标注。
  • 研究引用表述如何影响读者行为及未来引用次数,聚焦自然语言处理(NLP)领域。
  • 分析引用实践的时间趋势,以理解NLP领域的发展成熟与共识形成过程。
  • 公开发布数据集与代码,以支持未来对学术引用行为的研究。

提出的方法

  • 作者将先前的引用标注体系统一为二维分类:引用功能(如背景、使用、扩展、比较)与中心性(定位性 vs. 必要性)。
  • 通过人工标注ACL文集中的近2,000条引用,训练监督分类器,使用论点结构、主题建模与句法模式等特征。
  • 将分类器应用于完整的ACL参考文献语料库,对跨越近40年、20,000篇论文中的13.4万余条引用进行标注。
  • 研究使用自助法置信区间分析引用功能的时间趋势,并对相关性趋势进行显著性检验。
  • 通过ACL文集的在线引用网络轨迹追踪读者行为,记录其在引用网络中按顺序追踪的引用。
  • 将引用表述与未来引用次数进行比较,评估引用角色对学术影响力预测能力。

实验结果

研究问题

  • RQ1在NLP领域中,作者如何根据语篇结构与发表场所来组织引用?
  • RQ2在线读者在导航引用网络时更倾向于跟随哪些类型的引用?
  • RQ3引用表述在多大程度上能预测某论文的未来引用次数?
  • RQ4在NLP领域中,比较性与定位性引用的角色随时间如何演变?
  • RQ5基于引用行为,有哪些证据表明NLP领域正呈现日益增强的共识?

主要发现

  • NLP领域中定位性引用数量随时间显著下降,皮尔逊相关系数 r = -0.446(p ≤ 0.01),表明作者为自身工作辩护的需求减少。
  • 对比与比较性引用的使用下降更为急剧,r = -0.899(p ≤ 0.01),表明对核心方法与结果的共识正在增强。
  • 使用类引用显著增加,反映出先前工作在新贡献中的整合程度提高,尤其体现在共享基准(如Penn Treebank与BNC)周围。
  • 在线读者更倾向于追踪时间序列引用链(连接过去与未来工作),而非方法论传承路径,表明其更偏好叙事推进而非技术传承。
  • 对常用引用文献的引用次数在频率与集中度上均有所上升,与对照文献的相关系数 r = 0.734(p ≤ 0.01),与使用文献的相关系数 r = 0.889(p ≤ 0.01),表明对关键参考文献的共识正在增强。
  • 向共识的转变与共享评估机制及开源工具的兴起密切相关,这些因素推动了NLP领域快速发现科学的发展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。