Skip to main content
QUICK REVIEW

[论文解读] WithdrarXiv: A Large-Scale Dataset for Retraction Study

Delip Rao, Jonathan Young|arXiv (Cornell University)|Dec 4, 2024
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology被引用 3
一句话总结

本文介绍了 WithdrarXiv,这是首个大规模数据集,包含超过14,000篇被撤回的arXiv预印本及其相关的撤稿说明,并通过分析作者声明开发出10类撤稿原因分类体系。研究展示了无需微调的大型语言模型(LLM)分类方法,F1加权得分高达0.9594,并发布了 WithdrarXiv - SciFy,该版本通过解析PDF文件增强了数据集,以支持科学可行性与验证研究,同时实施了负责任的数据共享实践。

ABSTRACT

Retractions play a vital role in maintaining scientific integrity, yet systematic studies of retractions in computer science and other STEM fields remain scarce. We present WithdrarXiv, the first large-scale dataset of withdrawn papers from arXiv, containing over 14,000 papers and their associated retraction comments spanning the repository's entire history through September 2024. Through careful analysis of author comments, we develop a comprehensive taxonomy of retraction reasons, identifying 10 distinct categories ranging from critical errors to policy violations. We demonstrate a simple yet highly accurate zero-shot automatic categorization of retraction reasons, achieving a weighted average F1-score of 0.96. Additionally, we release WithdrarXiv-SciFy, an enriched version including scripts for parsed full-text PDFs, specifically designed to enable research in scientific feasibility studies, claim verification, and automated theorem proving. These findings provide valuable insights for improving scientific quality control and automated verification systems. Finally, and most importantly, we discuss ethical issues and take a number of steps to implement responsible data release while fostering open science in this area.

研究动机与目标

  • 为解决计算机科学与STEM领域中系统性撤稿研究的缺乏,特别是针对arXiv等预印本存储库的研究空白。
  • 通过分析arXiv存储库截至2024年9月的全部历史记录,创建一个全面且大规模的被撤回arXiv论文及其撤稿说明的数据库。
  • 基于作者提供的理由,开发一个稳健的、人工标注的10类撤稿原因分类体系。
  • 评估大型语言模型在零样本分类任务中对撤稿原因分类的有效性。
  • 发布 WithdrarXiv - SciFy,该数据集包含对1,000篇精选论文的全文PDF解析结果,以支持科学可行性、主张验证及自动化定理证明等研究。

提出的方法

  • 通过与arXiv.org的合作,抓取了所有被撤回的arXiv ID,共获得16,460个条目,经去重后得到14,000篇独立的被撤回论文。
  • 收集并分析作者提供的撤稿说明,以构建包含事实性错误、方法论缺陷及工作不完整等类别的10类撤稿原因分类体系。
  • 采用零样本提示工程,利用大型语言模型在不进行微调的情况下自动分类撤稿原因,借助模型的上下文学习能力。
  • 实施严格的元数据清洗流程,确保分类体系的一致性与准确性,通过迭代评审与优化进行验证。
  • 扩展数据集,推出 WithdrarXiv - SciFy,包含用于解析1,000篇精选论文全文PDF的脚本,以支持科学可行性与验证研究的下游应用。
  • 实施负责任的数据发布实践,包括数据匿名化、访问控制及作者隐私保护,其依据来自近期人工智能伦理研究及“被遗忘的权利”原则。

实验结果

研究问题

  • RQ1arXiv平台上预印本被撤回的最常见原因是什么?与传统期刊出版中的撤稿相比有何不同?
  • RQ2大型语言模型在无需微调的情况下,能够以多高准确度实现对撤稿原因的零样本分类?
  • RQ3如何利用被撤回预印本的全文PDF解析结果,来提升自动化科学可行性分析与主张验证系统的能力?
  • RQ4在发布被撤回科学作品的数据集时,会面临哪些伦理与隐私挑战?如何负责任地加以缓解?
  • RQ5arXiv上不同学科领域的撤稿模式有何差异?随时间推移,这些趋势如何演变?

主要发现

  • 该数据集包含arXiv自建立以来至2024年9月的14,000篇独立被撤回预印本及其对应的撤稿说明。
  • 开发出一个全面的10类撤稿原因分类体系,其中事实性或方法论错误是最常见的原因(占37%),工作不完整则占19%的撤稿。
  • 零样本LLM分类方法实现了0.9594的加权F1得分,表明在无需微调的情况下仍具有极高的分类准确性。
  • arXiv上最常见的撤稿原因与生物医学领域显著不同:在计算机科学中,错误和工作不完整占主导地位,而剽窃在生物医学领域更为常见。
  • WithdrarXiv - SciFy已发布,包含对部分论文的全文PDF解析结果,为未来自动化科学验证与可行性检查研究提供了支持。
  • 已成功实施负责任的数据发布实践,包括隐私保护措施与访问控制,有效平衡了数据实用性与伦理关切。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。