Skip to main content
QUICK REVIEW

[論文レビュー] Assessing the societal influence of academic research with ChatGPT: Impact case study evaluations

Kayvan Kousha, Mike Thelwall|arXiv (Cornell University)|Oct 25, 2024
Artificial Intelligence in Healthcare and EducationMedicine被引用数 3
ひとこと要約

本研究では、GPT-4o-miniを用いて英国のREF2021から抽出した6,220件のインパクト・ケーススタディ(ICS)を分析することで、ChatGPTが学術研究の社会的インパクトを効果的に評価できるかどうかを評価している。評価ガイドラインを変更した上で、タイトルと要約のみを入力した場合、専門家スコアと高い相関(r = 0.56)を示し、特に心理学およびスポーツ科学分野で顕著であった。これにより、ChatGPTがインパクト評価の支援ツールとしての有効性を示している。

ABSTRACT

Academics and departments are sometimes judged by how their research has benefitted society. For example, the UK Research Excellence Framework (REF) assesses Impact Case Studies (ICS), which are five-page evidence-based claims of societal impacts. This study investigates whether ChatGPT can evaluate societal impact claims and therefore potentially support expert human assessors. For this, various parts of 6,220 public ICS from REF2021 were fed to ChatGPT 4o-mini along with the REF2021 evaluation guidelines, comparing the results with published departmental average ICS scores. The results suggest that the optimal strategy for high correlations with expert scores is to input the title and summary of an ICS but not the remaining text, and to modify the original REF guidelines to encourage a stricter evaluation. The scores generated by this approach correlated positively with departmental average scores in all 34 Units of Assessment (UoAs), with values between 0.18 (Economics and Econometrics) and 0.56 (Psychology, Psychiatry and Neuroscience). At the departmental level, the corresponding correlations were higher, reaching 0.71 for Sport and Exercise Sciences, Leisure and Tourism. Thus, ChatGPT-based ICS evaluations are simple and viable to support or cross-check expert judgments, although their value varies substantially between fields.

研究の動機と目的

  • 大規模言語モデル(例:ChatGPT)が、専門家評価者を支援するツールとして、学術的インパクトの社会的影響を評価できるかどうかを調査すること。
  • 専門家が与えたインパクトスコアと最も一致するよう最適化された入力構成(例:タイトル、要約、本文全体)を特定すること。
  • 評価ガイドラインの変更がモデルのパフォーマンスおよび公式の部門別スコアとの相関に与える影響を評価すること。
  • 英国の研究の質評価(REF)における34の評価単位(UoAs)における分野別パフォーマンスの差異を検討すること。

提案手法

  • 英国のREF2021データベースから6,220件の公開インパクト・ケーススタディ(ICS)を収集した。
  • 各ICSのタイトルと要約のみをGPT-4o-miniに供給し、公式のREF2021評価ガイドラインの改変版を併記した。
  • モデルによる評価をより厳密かつ一貫性を持たせるために、REF2021のガイドラインを改変した。
  • 全34の評価単位(UoAs)において、モデルが生成したスコアと公表済みの部門平均ICSスコアを比較した。
  • UoAレベルおよび部門レベルにおけるモデルスコアと専門家スコアのピアソン積率相関係数を算出した。
  • 分野別パフォーマンスの差異を分析し、優れた成績を示す分野と低い成績を示す分野を特定した。

実験結果

リサーチクエスチョン

  • RQ1インパクト・ケーススタディのタイトルと要約のみが提供された場合、ChatGPTは学術的インパクトの社会的影響を正確に評価できるか?
  • RQ2REF2021の評価ガイドラインを変更することで、ChatGPTが生成したスコアと専門家が与えたスコアとの相関にどのような影響が生じるか?
  • RQ3さまざまな学術分野において、ChatGPTが生成したインパクトスコアと公式の部門平均スコアとの一致度はどの程度か?
  • RQ4英国の研究の質評価(REF)における34の評価単位(UoAs)において、モデルのパフォーマンスはどのように変動するか?
  • RQ5ChatGPTは、研究評価における専門家によるインパクト評価の支援ツールとして、どの程度信頼できるか?

主な発見

  • インパクト・ケーススタディのタイトルと要約のみを入力した場合、心理学・精神医学・神経科学分野で、ChatGPTのスコアと専門家スコアとの相関が最大の0.56を示した。
  • 相関係数は経済学・計量経済学分野で0.18から心理学・精神医学・神経科学分野で0.56まで変動し、分野による顕著なパフォーマンスの差が示された。
  • 部門レベルでは、スポーツ・エクササイズ・サイエンス、レジャー・観光分野で最高の相関係数0.71を記録し、特定の分野で強い整合性を示した。
  • REF2021のガイドラインを厳格化する形で改変することで、モデルの一貫性と専門家判断との整合性が向上した。
  • 34のすべての評価単位(UoAs)において、モデルは一貫したパフォーマンスを示し、全分野で正の相関が確認されたことから、広範な適用可能性が示された。
  • 結果から、ChatGPTは研究評価におけるインパクト評価の支援または検証ツールとして、実用的かつスケーラブルな選択肢である可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。