[论文解读] Sneaked references: Cooked reference metadata inflate citation counts
本文揭示了一种此前未被记录的引用操纵方法——'隐匿引用'(sneaked references)——即出版商在注册DOI元数据时向其中注入虚假引用,从而在不修改已发表文章内容的情况下人为提高引用次数。本研究发现,三本期刊中至少9%(5,978/65,836)的引用为隐匿引用,主要使两名作者受益,且56%的引用在文献计量平台中'丢失',暴露了元数据完整性和引用指标体系中的系统性缺陷。
We report evidence of an undocumented method to manipulate citation counts involving 'sneaked' references. Sneaked references are registered as metadata for scientific articles in which they do not appear. This manipulation exploits trusted relationships between various actors: publishers, the Crossref metadata registration agency, digital libraries, and bibliometric platforms. By collecting metadata from various sources, we show that extra undue references are actually sneaked in at Digital Object Identifier (DOI) registration time, resulting in artificially inflated citation counts. As a case study, focusing on three journals from a given publisher, we identified at least 9% sneaked references (5,978/65,836) mainly benefiting two authors. Despite not existing in the articles, these sneaked references exist in metadata registries and inappropriately propagate to bibliometric dashboards. Furthermore, we discovered 'lost' references: the studied bibliometric platform failed to index at least 56% (36,939/65,836) of the references listed in the HTML version of the publications. The extent of the sneaked and lost references in the global literature remains unknown and requires further investigations. Bibliometric platforms producing citation counts should identify, quantify, and correct these flaws to provide accurate data to their patrons and prevent further citation gaming.
研究动机与目标
- 调查'隐匿引用'(即注入元数据但未出现在已发表文章中的引用)的存在及其影响。
- 评估在DOI注册过程中因元数据层面的操纵而导致引用次数被人为虚增的程度。
- 通过对比元数据、HTML版本和引用次数,检验文献计量平台在准确反映被引文献方面的可靠性。
- 揭示学术传播链条在元数据滥用背景下面临引用操纵的脆弱性。
- 倡导在出版商、Crossref和文献计量平台之间加强数据验证与问责机制。
提出的方法
- 从三个来源收集并对比参考文献列表:已发表文章的HTML版本、由Crossref注册的DOI元数据,以及文献计量平台(如Dimensions)的引用次数。
- 对三个来源的参考文献列表进行对比分析,以检测差异,识别出'隐匿引用'(存在于元数据中但未出现在文章中)和'丢失引用'(存在于文章中但缺失于元数据或引用平台中)。
- 使用统计估计方法计算所研究期刊中隐匿引用和丢失引用的下限数量。
- 利用Crossref和文献计量平台的公开API,大规模提取并交叉验证元数据和引用数据。
- 采用可复现的数据收集与分析代码,并在Zenodo上发布,以确保透明度并支持未来研究。
- 评估各平台间引用次数的一致性,以检测与元数据差异相关的异常现象。
实验结果
研究问题
- RQ1在不显示于已发表文章中的情况下,有多少引用被注入到元数据中(即'隐匿引用')?
- RQ2有多少引用在文献计量管道中'丢失',即存在于文章中但未被元数据或引用平台收录?
- RQ3隐匿引用和丢失引用对主要文献计量平台中引用次数的量化影响是什么?
- RQ4在学术传播生态系统中,哪些参与者最可能利用元数据层面的引用操纵?
- RQ5如何通过出版商、元数据注册机构和文献计量平台之间的交叉验证,提升引用指标的完整性?
主要发现
- 在三本期刊的参考文献中,至少9%(5,978/65,836)被识别为'隐匿引用',即这些引用被注册在元数据中,但未出现在已发布的HTML或PDF版本中。
- 研究发现,文献计量平台所使用的分析中,65,836篇出版物的HTML版本中列出的参考文献有56%(36,939/65,836)未被索引,表明存在大量'丢失引用'。
- 由于隐匿引用的存在,部分作者的引用次数被人为虚增,其中两名作者从该操纵中获得了不成比例的收益。
- Crossref的元数据注册流程易受操纵,因其未验证元数据中的引用是否与已发表文章的实际内容一致。
- 文献计量平台传播了这些错误,导致引用指标不准确,进而影响研究评估、资金分配和机构排名。
- 本研究证明,引用操纵可在不修改正式版本(version of record)的情况下发生,揭示了学术出版中一种此前未被记录的新攻击向量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。