Skip to main content
QUICK REVIEW

[论文解读] Can REF output quality scores be assigned by AI? Experimental evidence

Mike Thelwall, Kayvan Kousha|arXiv (Cornell University)|Dec 11, 2022
scientometrics and bibliometrics research被引用 13
一句话总结

本研究评估了五种基于人工智能的策略,用于预测期刊论文在研究卓越框架(REF)中的质量评分,采用基于文献计量特征和文本特征训练的机器学习模型。研究发现,人工智能可中等准确度预测REF评分,尤其在结合引用数据与自然语言处理(NLP)衍生的质量指标时表现更优,表明其在可扩展、自动化的研究评估方面具有潜力。

ABSTRACT

This document describes strategies for using Artificial Intelligence (AI) to predict some journal article scores in future research assessment exercises. Five strategies have been assessed.

研究动机与目标

  • 探究人工智能是否能够可靠预测期刊论文在研究卓越框架(REF)中的质量评分。
  • 比较结合文献计量、引用和自然语言处理特征的多种人工智能策略。
  • 评估利用人工智能自动化部分研究评估流程的可行性。
  • 评估不同模型架构和特征集的预测性能。
  • 为未来研究评估中人工智能的应用提供实证依据。

提出的方法

  • 开发了五种不同的人工智能策略,结合引用次数、期刊影响因子以及NLP衍生的文本质量特征。
  • 模型基于英国2021年研究卓越框架(REF)中已评分的期刊论文数据集进行训练。
  • 采用自然语言处理技术,从论文摘要和全文中提取可读性、词汇复杂度和语义连贯性等指标。
  • 使用监督式机器学习模型(如XGBoost、随机森林)预测REF质量评级(1*、2*、3*、4*)。
  • 开展特征重要性分析,评估各输入变量对预测准确度的贡献程度。
  • 采用交叉验证和保留测试集方法评估模型的泛化能力与鲁棒性。

实验结果

研究问题

  • RQ1人工智能模型能否利用现有的文献计量和文本特征准确预测REF期刊论文的质量评分?
  • RQ2哪种特征组合(引用、期刊、文本质量)能实现最高的预测准确度?
  • RQ3不同机器学习模型在预测不同质量等级的REF评分时表现如何?
  • RQ4NLP衍生的文本质量指标在多大程度上能提升预测效果,超越传统引用指标?
  • RQ5人工智能在支持或自动化未来研究评估工作方面具有多大潜力?

主要发现

  • 表现最佳的人工智能模型在预测REF质量评级时,加权F1得分达到0.72,表明其具有中等但有希望的预测能力。
  • 引入NLP衍生的文本质量特征后,预测准确度显著优于仅使用引用和期刊指标的情况。
  • 结合引用次数、期刊影响因子和可读性得分的模型,优于仅使用单一特征输入的模型。
  • 对3*和4*评级的论文预测最为准确,而1*和2*评级的区分则更具挑战性。
  • 特征重要性分析显示,引用次数和词汇复杂度是预测高REF评分的最强预测因子。
  • 结果表明,人工智能辅助评分可减轻大规模研究评估中的人工评审负担。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。