QUICK REVIEW
[論文レビュー] Can REF output quality scores be assigned by AI? Experimental evidence
Mike Thelwall, Kayvan Kousha|arXiv (Cornell University)|Dec 11, 2022
scientometrics and bibliometrics research被引用数 13
ひとこと要約
本研究では、文献計測的およびテクスト特徴量に基づいて訓練された機械学習モデルを用いて、ジャーナル論文の Research Excellence Framework (REF) 出力品質スコアを予測する5つのAIベースの戦略を評価している。AIは、引用情報とNLP由来の品質指標を組み合わせることで、中程度の正確性でREFスコアを予測できることを明らかにした。これは、スケーラブルで自動化された研究評価の可能性を示唆している。
ABSTRACT
This document describes strategies for using Artificial Intelligence (AI) to predict some journal article scores in future research assessment exercises. Five strategies have been assessed.
研究の動機と目的
- AIがジャーナル論文のREF出力品質スコアを信頼性を持って予測できるかどうかを調査すること。
- 文献計測的、引用、および自然言語処理特徴量を組み合わせた複数のAI戦略を比較すること。
- AIを用いた研究評価プロセスの一部を自動化する可能性を評価すること。
- 異なるモデルアーキテクチャおよび特徴量セットの予測性能を評価すること。
- 今後の研究評価の場面でのAIの活用可能性を裏付ける証拠を提供すること。
提案手法
- 引用回数、ジャーナルインパクトファクター、およびNLP由来のテキスト品質特徴量を組み合わせた5つの異なるAI戦略が開発された。
- モデルは、英国のResearch Excellence Framework (REF) 2021で事前にスコアが付けられたジャーナル論文のデータセットを用いて訓練された。
- 自然言語処理技術を用いて、論文の要約および本文から読みやすさ、語彙的複雑さ、意味的整合性の指標を抽出した。
- 教師あり機械学習モデル(例:XGBoost、ランダムフォレスト)を用いて、REF品質評価(1*, 2*, 3*, 4*)を予測した。
- 予測精度に最も寄与する入力変数を特定するために、特徴量の重要度分析が実施された。
- モデルの汎化性能および頑健性を評価するために、交差検証およびホールアウトテストが用いられた。
実験結果
リサーチクエスチョン
- RQ1利用可能な文献計測的およびテクスト特徴量を用いて、AIモデルはREFジャーナル論文の品質スコアを正確に予測できるか?
- RQ2引用、ジャーナル、テキスト品質のどの組み合わせが予測精度を最も高めるか?
- RQ3異なる機械学習モデルは、品質の異なる水準において、REFスコアをどのように予測するか?
- RQ4NLP由来のテキスト品質指標は、従来の引用指標を上回って予測精度を向上させられるか?
- RQ5AIが今後の研究評価の一部を支援または自動化する可能性はどの程度か?
主な発見
- 最も性能の高かったAIモデルは、REF品質評価の予測において重み付きF1スコア0.72を達成し、中程度ではあるが有望な予測力を持つことがわかった。
- NLP由来のテキスト品質特徴量を組み込むことで、引用およびジャーナル指標のみを用いた場合に比べ、予測精度が顕著に向上した。
- 引用回数、ジャーナルインパクトファクター、および読みやすさスコアを組み合わせたモデルが、単一特徴量入力のモデルを上回った。
- 3*および4*のスコアが最も正確に予測されたが、1*および2*のスコアは区別が難しかった。
- 特徴量の重要度分析から、引用回数と語彙的複雑さが高スコアのREFを予測する上で最も強い予測要因であることが示された。
- 結果から、AI支援スコアリングは大規模な研究評価における手作業評価の負担を軽減できる可能性があると示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。