Skip to main content
QUICK REVIEW

[論文レビュー] Using Machine Learning to Predict the Evolution of Physics Research

Wenyuan Liu|arXiv (Cornell University)|Oct 29, 2018
scientometrics and bibliometrics research参考文献 41被引用数 5
ひとこと要約

本稿では、APSの出版物(1981–2010年)の文献結合および共著者引用ネットワークを用いて、物理学研究コミュニティの進化を予測する機械学習フレームワークを提案する。タイムリーに変化するトピック的クラスタをLouvain法で追跡し、親密度指標を用いたグループ進化発見(GED)手法を適用することで、特に次数、媒介性、およびジャーナル別論文数といった重要な予測特徴量を同定し、統合、分裂、継続、消滅といったクラスタイベントを高精度に予測する。

ABSTRACT

The advancement of science as outlined by Popper and Kuhn is largely qualitative, but with bibliometric data it is possible and desirable to develop a quantitative picture of scientific progress. Furthermore it is also important to allocate finite resources to research topics that have growth potential, to accelerate the process from scientific breakthroughs to technological innovations. In this paper, we address this problem of quantitative knowledge evolution by analysing the APS publication data set from 1981 to 2010. We build the bibliographic coupling and co-citation networks, use the Louvain method to detect topical clusters (TCs) in each year, measure the similarity of TCs in consecutive years, and visualize the results as alluvial diagrams. Having the predictive features describing a given TC and its known evolution in the next year, we can train a machine learning model to predict future changes of TCs, i.e., their continuing, dissolving, merging and splitting. We found the number of papers from certain journals, the degree, closeness, and betweenness to be the most predictive features. Additionally, betweenness increases significantly for merging events, and decreases significantly for splitting events. Our results represent a first step from a descriptive understanding of the Science of Science (SciSci), towards one that is ultimately prescriptive.

研究の動機と目的

  • 物理学分野における科学的研究コミュニティの進化を定量的かつ予測可能なモデルとして開発すること。
  • 機械学習を用いて、統合、分裂、継続、消滅といったトピック的クラスタ(TC)進化の最も予測可能な特徴量(例:次数、媒介性、ジャーナル別論文数)を同定すること。
  • 科学的知識の進化に関する記述的分析を越えて、研究のリソース配分に向けた規範的フレームワークを構築すること。
  • 歴史的APS出版データ(1981–2010年)を用いてモデルを検証し、繰り返し特徴量選択を用いて特徴量の重要度を評価すること。

提案手法

  • APS出版データ(1981–2010年)から文献結合ネットワークおよび共著者引用ネットワークを構築した。
  • 各年についてLouvain法を適用し、研究コミュニティを表すトピック的クラスタ(TC)を検出した。
  • 包含測度および親密度指標を用いたグループ進化発見(GED)手法を適用し、連続する年間のTCをマッチングし、進化イベントをラベル付けした。
  • 隣接年間のTC間の参照に基づく類似性を測るための前方および後方親密度指標を定義し、社会的役割(SP)を介して加重された引用の重要性を統合した。
  • 次数、近接性、媒介性などの構造的特徴量、動的特徴量、文脈的特徴量(例:ジャーナル別論文数)を含む100以上の特徴量を各TCから抽出した。
  • 繰り返し進化的アルゴリズムに基づく特徴量選択を用いて機械学習分類器を訓練し、イベント予測に最も適した特徴量をランク付け・選択した。

実験結果

リサーチクエスチョン

  • RQ1物理学研究におけるトピック的クラスタ進化の予測に最も寄与するネットワーク的および文脈的特徴量は何か?
  • RQ2次数や媒介性といった構造的特性は、統合や分裂といった特定の進化イベントとどのように相関するか?
  • RQ3共有参照に基づく親密度指標は、時間的経過に伴うクラスタ進化イベントのマッチングおよびラベル付け精度を向上させることができるか?
  • RQ4新規の動的および文脈的特徴量は、従来の構造的指標に比べて、将来のクラスタ行動予測においてどれほど優れているか?
  • RQ5歴史的データで学習した機械学習モデルは、将来的な研究コミュニティの変化(例:統合、消滅)を高精度に予測できるか?

主な発見

  • 特定ジャーナルからの論文数、次数、近接性、および媒介性が、TC進化イベント分類において最も予測可能な特徴量であった。
  • 統合イベントの前には媒介性が顕著に上昇し、分裂イベントの前には顕著に低下する傾向が認められ、その分類能が強く示された。
  • 動的および文脈的特徴量(例:ジャーナル別論文数)を組み込むことで、従来の構造的特徴量のみに依存するモデルに比べて予測性能が向上した。
  • 進化的アルゴリズムによる特徴量選択により、上位10個の特徴量が安定したセットとして特定され、100個以上の全特徴量を用いたモデルを上回る性能を示した。
  • 本モデルは、継続、消滅、統合、分裂の4つの主要な進化タイプを、従来の相関ベース手法に比べて測定可能な改善を伴って正確に予測できた。
  • 本研究の結果は、科学の科学(SciSci)分野において記述的モデルから規範的モデルへのシフトを示しており、成長が著しいまたは影響力のある研究分野を事前に特定可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。