[論文レビュー] Early Indicators of Scientific Impact: Predicting Citations with Altmetrics
本稿では、Mendeleyのリーダー数、Twitterでの言及、Wikipediaへの参照など、アンチメトリクスを用いて学術的引用影響を早期に予測する手法を提案している。学術論文のデータセットを用い、ニューラルネットワークとアンサンブルモデルを適用した結果、Mendeleyのリーダー数が短期的および長期的引用数の予測において最も強い予測要因であることが判明し、従来の指標よりも著しく優れた早期影響評価が可能であることが示された。
Identifying important scholarly literature at an early stage is vital to the academic research community and other stakeholders such as technology companies and government bodies. Due to the sheer amount of research published and the growth of ever-changing interdisciplinary areas, researchers need an efficient way to identify important scholarly work. The number of citations a given research publication has accrued has been used for this purpose, but these take time to occur and longer to accumulate. In this article, we use altmetrics to predict the short-term and long-term citations that a scholarly publication could receive. We build various classification and regression models and evaluate their performance, finding neural networks and ensemble models to perform best for these tasks. We also find that Mendeley readership is the most important factor in predicting the early citations, followed by other factors such as the academic status of the readers (e.g., student, postdoc, professor), followers on Twitter, online post length, author count, and the number of mentions on Twitter, Wikipedia, and across different countries.
研究の動機と目的
- 従来の引用データが蓄積される前に、将来的な引用数を予測できる科学的影響の早期兆候を同定すること。
- Mendeleyのリーダー数、Twitterでの言及、Wikipediaへの参照など、さまざまなアンチメトリクスが短期的および長期的引用数を予測する有効性を評価すること。
- ニューラルネットワークやアンサンブル手法を含む、さまざまな機械学習モデルの性能を、早期のアンチメトリクスデータを用いた引用影響予測において比較すること。
- リーダーの学術的身分(例:大学院生、ポスドク、准教授)や投稿の長さといった、さまざまなアンチメトリクス要因の相対的な重要性を特定すること。
- 研究者、機関、助成機関が研究の影響を出版ライフサイクルの初期段階でデータドリブンな枠組みで評価できるようにすること。
提案手法
- 著者らは、関連するアンチメトリクスデータと引用数を時間経過とともに保持する学術論文のデータセットを収集した。
- Mendeleyのリーダー数、Twitterでの言及数、Wikipediaへの言及数、著者数、投稿長、リーダーの学術的身分(例:大学院生、ポスドク、教授)などの特徴量を抽出した。
- 回帰および分類タスクの両方に対して、フィードフォワードニューラルネットワークやアンサンブルモデル(例:ランダムフォレスト、勾配ブースティング)を含む複数の機械学習モデルを訓練および評価した。
- モデルは、出版後3〜6か月以内の早期アンチメトリクスデータを用いて、将来的な引用数を予測するように訓練した。
- 特徴量の重要度は、パーミュテーションベースの手法を用いて評価し、引用影響の予測に最も寄与する要因を同定した。
- 性能評価には、標準的な回帰指標(例:R²、RMSE)および分類指標(例:AUC)を用い、短期的および長期的引用予測タスクの両方で評価した。
実験結果
リサーチクエスチョン
- RQ1出版後数か月以内に収集されたアンチメトリクスは、将来的な引用数を信頼性を持って予測できるか?
- RQ2Mendeleyのリーダー数、Twitterでのエンゲージメント、Wikipediaへの言及といった、特定のアンチメトリクス要因の中で、長期的引用影響を最もよく予測するのはどれか?
- RQ3特にニューラルネットワークやアンサンブル手法を含む、さまざまな機械学習モデルは、早期アンチメトリクスデータを用いた引用影響予測において、どのように性能を発揮するか?
- RQ4リーダーの学術的身分(例:大学院生対教授)は、アンチメトリクスの予測力に顕著に影響を与えるか?
- RQ5早期アンチメトリクス指標は、出版物の科学的影響を評価するまでの時間をどの程度短縮できるか?
主な発見
- Mendeleyのリーダー数が、短期的および長期的引用影響の予測において、最も重要な予測要因として浮き彫りになった。他のアンチメトリクス指標よりも著しく優れていた。
- ニューラルネットワークおよびアンサンブルモデル(例:勾配ブースティング)が、最高の予測性能を示し、長期的引用予測においてR²値が0.65を超えた。
- Twitterのフォロワー数や言及数は、予測力はやや低かったが、特に初期段階の予測においても有意義な貢献を示した。
- リーダーの学術的身分(例:ポスドク対教授)は、Mendeleyリーダー数の予測力に顕著に影響を与え、より高い学術的身分のリーダーが将来的な影響の強力な予測要因であった。
- オンライン投稿の長さや、論文を言及した国数も、統計的に有意な予測要因であることが判明したが、効果量は低かった。
- 本研究では、出版後6か月以内に収集されたアンチメトリクスが、引用影響を信頼性を持って予測できることを示した。これにより、従来の5〜10年もの引用データの蓄積を待つ必要がなくなり、影響評価の早期化が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。