Skip to main content
QUICK REVIEW

[论文解读] Identifying the Development and Application of Artificial Intelligence in Scientific Text

James Dunham, Jennifer Melot|arXiv (Cornell University)|Feb 17, 2020
Biomedical Text Mining and Ontologies参考文献 16被引用 22
一句话总结

本文提出一种利用SciBERT的迁移学习方法,通过利用arXiv的专家标注主题标签作为AI相关性的代理指标,识别与人工智能相关的科学出版物。该模型在arXiv元数据上进行训练,在特定主题任务上F1分数介于0.75至0.86之间,并能有效泛化至外部语料库(如Web of Science、Dimensions和Microsoft Academic Graph),在无需人工标注的情况下展现出稳健的域外性能。

ABSTRACT

We describe a strategy for identifying the universe of research publications relevant to the application and development of artificial intelligence. The approach leverages the arXiv corpus of scientific preprints, in which authors choose subject tags for their papers from a set defined by editors. We compose a functional definition of AI relevance by learning these subjects from paper metadata, and then inferring the arXiv-subject labels of papers in larger corpora: Clarivate Web of Science, Digital Science Dimensions, and Microsoft Academic Graph. This yields predictive classification $F_1$ scores between .75 and .86 for Natural Language Processing (cs.CL), Computer Vision (cs.CV), and Robotics (cs.RO). For a single model that learns these and four other AI-relevant subjects (cs.AI, cs.LG, stat.ML, and cs.MA), we see precision of .83 and recall of .85. We evaluate the out-of-domain performance of our classifiers against other sources of topic information and predictions from alternative methods. We find that a supervised solution can generalize to identify publications that belong to the high-level fields of study represented on arXiv. This offers a method for identifying AI-relevant publications that updates at the pace of research output, without reliance on subject-matter experts for query development or labeling.

研究动机与目标

  • 为解决由于该领域不断发展且边界不一致,导致难以准确定义AI相关研究的挑战。
  • 开发一种可扩展的自动化方法,用于检测AI相关出版物,而无需依赖人工整理或静态关键词查询。
  • 评估在arXiv的动态、社区标注的主题标签上训练的模型向外部科学数据库泛化的能力。
  • 提供一种可复现、实时更新的分类框架,随研究成果动态更新,避免专家标注查询的局限性。
  • 通过使用一致、数据驱动的AI相关性定义,实现对跨多样化科学领域的AI发展与应用的文献计量分析。

提出的方法

  • 该方法使用在arXiv元数据和主题标签上微调的SciBERT模型,从社区标注标签中学习AI相关性的功能定义。
  • 模型在六个与AI相关的arXiv主题类别上进行训练:cs.CL、cs.CV、cs.RO、cs.AI、cs.LG和stat.ML。
  • 推理过程应用于外部语料库——Clarivate Web of Science、Digital Science Dimensions和Microsoft Academic Graph,使用相同的模型而无需重新训练。
  • 性能通过在保留的arXiv测试集上的F1分数进行评估,并通过与MAG的学科分类对齐来评估域外性能。
  • 与基于关键词的方法进行比较,包括先前文献计量研究中提出的混合关键词-学习者方法,以进行性能基准测试。
  • 该方法依赖于SciBERT在科学文本上预训练的迁移学习,即使存在领域偏移,也能增强向新领域的泛化能力。

实验结果

研究问题

  • RQ1在arXiv的社区标注主题标签上训练的监督NLP模型,能否泛化至外部科学语料库,以识别AI相关出版物?
  • RQ2微调后的SciBERT模型在识别AI相关出版物方面,与基于关键词或混合关键词-学习者方法相比,性能如何?
  • RQ3arXiv的隐式、实时的主题定义在多大程度上可被用于在更广泛的科学文献中定义和检测AI相关研究?
  • RQ4该模型在分类不同科学领域出版物方面表现如何,特别是在arXiv未覆盖的领域?
  • RQ5类别不平衡对模型性能有何影响,以及在下游应用中应如何应对?

主要发现

  • 该模型在arXiv上的主题特定分类任务中,F1分数介于0.75至0.86之间,六大学科核心AI领域多分类AI相关性标签的F1分数为0.84。
  • 基于关键词的方法在与arXiv标签对比评估时,F1分数分别仅为0.55和0.59,表明监督学习方法具有显著更优的性能。
  • 该模型在外部语料库中表现出有效的泛化能力,预测的AI相关性比例与MAG的学科分类对齐合理,表明其具备强大的域外泛化能力。
  • 该方法实现了可扩展的、实时更新的AI相关出版物识别,无需人工标注或专家整理的查询。
  • 尽管存在类别不平衡(arXiv数据中正负样本比例为9:1),该方法仍表现稳健,并在多样化科学领域中表现良好。
  • 本研究证明,从arXiv的动态、社区驱动主题分类体系进行迁移学习,可作为静态关键词或专家定义查询在AI文献识别中的可行、可扩展的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。