QUICK REVIEW
[论文解读] Decontamination of the scientific literature
Guillaume Cabanac|arXiv (Cornell University)|Oct 28, 2022
Artificial Intelligence in Healthcare and Education被引用 6
一句话总结
本文提出一种双重方法,通过检测和纠正虚假或错误的论文(治疗性)以及利用人工智能驱动的工具和社区参与预防未来不当行为(预防性),以净化科学文献。该研究引入了自动筛查工具(如Seek&Blastn)和众包平台(如Problematic Paper Screener),用于识别基因序列、图像篡改和人工智能生成文本中的错误,旨在恢复科学信任并提升研究诚信。
ABSTRACT
Research misconduct and frauds pollute the scientific literature. Honest errors and malevolent data fabrication, image manipulation, journal hijacking, and plagiarism passed peer review unnoticed. Problematic papers deceive readers, authors citing them, and AI-powered literature-based discovery. Flagship publishers accepted hundreds flawed papers despite claiming to enforce peer review. This application ambitions to decontaminate the scientific literature using curative and preventive actions.
研究动机与目标
- 应对研究不当行为、欺诈和错误出版物日益加剧的危机,这些行为正损害科学信任。
- 识别并纠正已发表的有缺陷的论文,特别是来自论文工厂、图像篡改和人工智能生成文本的论文。
- 通过开发针对新兴威胁(如大语言模型生成的科学内容)的检测工具,预防未来的污染。
- 通过使研究人员、审稿人和公众能够检测和报告错误,提升透明度和可重复性。
- 通过教学、媒体传播和公民科学计划,提升教育和公众对科学诚信的认识。
提出的方法
- 开发并部署自动化软件工具(如Seek&Blastn),利用基于BLAST的序列比对技术,检测肿瘤学文献中错误的DNA序列声明。
- 对来自开放(Crossref)和订阅型来源的9000多万篇文献记录进行文本和数据挖掘,以识别异常情况。
- 通过在线仪表板(如Problematic Paper Screener和COVID19 Preprint Monitor)可视化并众包错误检测。
- 应用自然语言处理和知识库验证(例如,使用BLAST验证基因声明)来标记科学文本中可疑或伪造的内容。
- 与物理学家和生物学家合作开展协作研究,复现纳米生物学中存疑的声明,以检验该领域中被夸大的期望。
- 将PubPeer和Retraction Watch的发现整合到教育课程中,训练研究人员批判性评估科学文献的能力。
实验结果
研究问题
- RQ1自动化工具如何在数千篇已发表的肿瘤学论文中检测并纠正基因序列数据中的错误声明?
- RQ2识别学术文献中人工智能生成的科学文本和伪造数据的最有效方法是什么?
- RQ3有缺陷的科学声明在研究社区中如何传播,哪些因素会影响其被纠正或持续存在?
- RQ4众包和公众参与在提升科学文献错误检测与净化方面能发挥多大作用?
- RQ5教育计划和媒体传播在提升公众和研究人员对研究诚信及错误检测的认识方面有何作用?
主要发现
- Seek&Blastn工具成功识别出数百起涉及错误DNA序列靶向的肿瘤学论文中的错误声明,使有缺陷的研究得以系统性纠正。
- 已有超过180篇与COVID-19相关的研究被撤回,凸显了改进错误检测和加快纠正机制的紧迫需求。
- 尽管当前人工智能生成的科学文本因修辞缺陷仍可被检测,但随着模型性能的提升,其威胁正在加剧,亟需主动开发检测工具。
- 众包平台(如Problematic Paper Screener)已使公众能够参与识别问题论文,显著提升了透明度。
- 通过Le Monde和FranceInfo等媒体渠道开展的传播活动,显著提高了公众对研究诚信和错误检测的认知。
- 教育举措(包括使用“Calling Bullshit”课程大纲并融入博士生培训)在教授批判性评估科学声明方面被证明是有效的。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。