Skip to main content
QUICK REVIEW

[论文解读] Will open science change authorship for good? Towards a quantitative analysis

Andrea Mannocci, Ornella Irrera|arXiv (Cornell University)|Jul 7, 2022
scientometrics and bibliometrics research被引用 4
一句话总结

本文通过使用开放科学图谱对学术出版物、研究数据和软件之间的作者归属差异进行定量分析,评估开放科学实践是否实现了信用归属的多样化。通过利用 OpenAIRE 研究图谱的元数据,并应用语义关系推理与作者去重技术,研究调查了非文献类研究成果的贡献者是否在作者列表中系统性地被低估,揭示了学术奖励体系中潜在的不平等现象。

ABSTRACT

Authorship of scientific articles has profoundly changed from early science until now. If once upon a time a paper was authored by a handful of authors, scientific collaborations are much more prominent on average nowadays. As authorship (and citation) is essentially the primary reward mechanism according to the traditional research evaluation frameworks, it turned to be a rather hot-button topic from which a significant portion of academic disputes stems. However, the novel Open Science practices could be an opportunity to disrupt such dynamics and diversify the credit of the different scientific contributors involved in the diverse phases of the lifecycle of the same research effort. In fact, a paper and research data (or software) contextually published could exhibit different authorship to give credit to the various contributors right where it feels most appropriate. We argue that this can be computationally analysed by taking advantage of the wealth of information in model Open Science Graphs. Such a study can pave the way to understand better the dynamics and patterns of authorship in linked literature, research data and software, and how they evolved over the years.

研究动机与目标

  • 调查开放科学实践是否导致了超越传统出版物作者署名的信用归属多样化。
  • 分析学术出版物与其关联的研究数据或软件之间在作者构成和顺序上的差异。
  • 评估数据和软件贡献者是否在出版物作者列表中系统性地被低估。
  • 识别出版物与关联研究成果之间作者列表变化的模式,特别是与资历和参与度的关系。
  • 评估当前的作者署名实践是否反映了过时的奖励机制,未能充分认可科学贡献的完整范围。

提出的方法

  • 以 OpenAIRE 研究图谱作为主要数据集,提取出版物、研究数据和软件的元数据,包括作者列表和语义关系。
  • 应用启发式方法,通过分析‘引用’和‘被引用’关系之间的出版日期、标题和作者重叠的相似性,回溯推断‘补充于’关系。
  • 采用基于 OpenAIRE 去重系统的定制化作者去重框架,整合不同研究产出类型中的作者姓名。
  • 从元数据(如标题、作者、出版年份)计算特征向量,量化关联文献与非文献记录之间的相似性。
  • 利用向量相似性的置信区间检测误分配的语义关系,并将其重新分类为‘补充于’或‘补充’关系。
  • 分析出版物与关联数据/软件之间作者列表的交集与排列,以检测贡献者的遗漏或排序变化。

实验结果

研究问题

  • RQ1在构成和顺序方面,关联研究数据或软件的作者列表与相应出版物的作者列表在多大程度上存在差异?
  • RQ2数据和软件的贡献者是否多于相应出版物中列出的作者,表明存在一个被掩盖的科研团队?
  • RQ3出版物与关联数据/软件之间作者列表的变化是否与作者资历相关,暗示对初级或非传统贡献者的战略性排除?
  • RQ4‘基础’关系(如‘Cites’、‘References’)是否经常被错误分配,导致有效补充关系的丢失,从而无法将数据和软件与出版物正确关联?
  • RQ5当前的作者署名实践在多大程度上未能反映科研生命周期中实际的贡献分布?

主要发现

  • 研究发现,出版物与数据/软件记录之间大量‘Cites’和‘References’关系可能被错误分配,表明许多有效的补充关系目前处于丢失或无结构状态。
  • 作者去重分析显示,姓名变体(如缩写或全名)常导致同一研究人员在出版物和关联数据中被计为不同个体,从而扭曲了作者列表的比较结果。
  • 分析表明,数据和软件的贡献通常涉及比关联出版物更多的贡献者,表明非传统贡献者可能在正式署名中被系统性地低估。
  • 出版物与关联产出之间作者列表构成的差异表明,署名可能被选择性地筛选,可能排除了数据和软件开发中的关键贡献者。
  • 基于特征向量相似性的启发式方法成功识别出一组极有可能代表真实补充关系的‘基础’关系,提高了关联检测的准确性。
  • 结果表明,当前的作者署名实践与开放科学中实际的贡献动态不一致,凸显了信用归属方面存在的系统性缺口。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。