[论文解读] Assessing the societal influence of academic research with ChatGPT: Impact case study evaluations
本研究评估了ChatGPT是否能有效评估学术研究的社会影响,通过使用GPT-4o-mini分析英国REF2021的6,220份影响案例研究(ICS)。研究发现,仅输入标题和摘要并修改评估指南时,与专家评分的相关性较高(r = 0.56),尤其在心理学与运动科学领域表现突出,表明ChatGPT作为影响评估的支持工具具有可行性。
Academics and departments are sometimes judged by how their research has benefitted society. For example, the UK Research Excellence Framework (REF) assesses Impact Case Studies (ICS), which are five-page evidence-based claims of societal impacts. This study investigates whether ChatGPT can evaluate societal impact claims and therefore potentially support expert human assessors. For this, various parts of 6,220 public ICS from REF2021 were fed to ChatGPT 4o-mini along with the REF2021 evaluation guidelines, comparing the results with published departmental average ICS scores. The results suggest that the optimal strategy for high correlations with expert scores is to input the title and summary of an ICS but not the remaining text, and to modify the original REF guidelines to encourage a stricter evaluation. The scores generated by this approach correlated positively with departmental average scores in all 34 Units of Assessment (UoAs), with values between 0.18 (Economics and Econometrics) and 0.56 (Psychology, Psychiatry and Neuroscience). At the departmental level, the corresponding correlations were higher, reaching 0.71 for Sport and Exercise Sciences, Leisure and Tourism. Thus, ChatGPT-based ICS evaluations are simple and viable to support or cross-check expert judgments, although their value varies substantially between fields.
研究动机与目标
- 探究类似ChatGPT的大语言模型能否作为专家评估者的辅助工具,评估学术研究的社会影响。
- 确定最优输入配置(如标题、摘要、全文等),以最大化与专家评分的影响得分的一致性。
- 评估修改评估指南对模型表现及与官方院系评分相关性的影响。
- 考察英国研究卓越框架(REF)34个评估单元(UoAs)中,不同学科领域内模型表现的差异。
提出的方法
- 从英国REF2021数据库中获取了6,220份公开的影响案例研究(ICS)。
- 仅将每份ICS的标题和摘要输入GPT-4o-mini,同时配合修改后的官方REF2021评估指南。
- 对REF2021指南进行修改,以促使模型执行更严格、更一致的评估。
- 将模型生成的评分与所有34个评估单元(UoAs)中公布的院系平均ICS评分进行对比。
- 在评估单元和院系两个层级上,计算模型评分与专家评分之间的皮尔逊积矩相关系数。
- 分析各学科领域的表现差异,以识别高绩效与低绩效学科。
实验结果
研究问题
- RQ1当仅提供影响案例研究的标题和摘要时,ChatGPT能否准确评估其学术研究的社会影响?
- RQ2修改REF2021评估指南对ChatGPT生成评分与专家评分之间相关性有何影响?
- RQ3ChatGPT生成的影响评分与官方院系平均评分在不同学术学科中的一致性如何?
- RQ4模型在英国研究卓越框架(REF)的34个评估单元(UoAs)中的表现如何变化?
- RQ5ChatGPT在多大程度上可作为专家影响评估的可靠辅助工具应用于科研评估?
主要发现
- 当仅输入每份影响案例研究的标题和摘要时,ChatGPT生成评分与专家评分之间的相关性最高,心理学、精神病学与神经科学领域的相关系数达到0.56。
- 相关系数范围从经济学与计量经济学的0.18到心理学、精神病学与神经科学的0.56不等,表明模型表现存在显著的学科依赖性。
- 在院系层级,运动与体育科学、休闲与旅游学科的最高相关系数达到0.71,表明在特定学科中模型评分与专家评分高度一致。
- 通过修改REF2021指南以鼓励更严格的评估,提升了模型的一致性及其与专家判断的一致性。
- 模型在全部34个评估单元中均表现出稳定性能,所有学科均呈现正相关,表明其具有广泛的适用性。
- 结果表明,ChatGPT可作为可行且可扩展的工具,用于支持或交叉验证科研评估中的专家影响评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。