[論文レビュー] Hierarchical Classification of Research Fields in the "Web of Science" Using Deep Learning
本論文は、マイクロソフトアカデミックグラフの学術論文を、要約に基づいて分野・分野・分野下位分野の三段階階層的分類に自動的に割り当てる深層学習ベースの階層的分類システムを提案する。このシステムは、1億6000万件の要約を対象に、微調整されたニューラルネットワーク(CNN、RNN、Transformer)を用い、77.13%(単一ラベル)および78.19%(複数ラベル)の分類で90%を超える正確性を達成した。これにより、スケーラブルで複数ラベル対応かつ多分野にまたがる研究分類が可能になった。
This paper presents a hierarchical classification system that automatically categorizes a scholarly publication using its abstract into a three-tier hierarchical label set (discipline, field, subfield) in a multi-class setting. This system enables a holistic categorization of research activities in the mentioned hierarchy in terms of knowledge production through articles and impact through citations, permitting those activities to fall into multiple categories. The classification system distinguishes 44 disciplines, 718 fields and 1,485 subfields among 160 million abstract snippets in Microsoft Academic Graph (version 2018-05-17). We used batch training in a modularized and distributed fashion to address and allow for interdisciplinary and interfield classifications in single-label and multi-label settings. In total, we have conducted 3,140 experiments in all considered models (Convolutional Neural Networks, Recurrent Neural Networks, Transformers). The classification accuracy is > 90% in 77.13% and 78.19% of the single-label and multi-label classifications, respectively. We examine the advantages of our classification by its ability to better align research texts and output with disciplines, to adequately classify them in an automated way, and to capture the degree of interdisciplinarity. The proposed system (a set of pre-trained models) can serve as a backbone to an interactive system for indexing scientific publications in the future.
研究の動機と目的
- すべての学術分野にわたる学術出版物の統合的でスケーラブルかつ自動化された階層的分類システムの開発。
- 多分野にまたがる研究活動を捉えることのできる複数ラベル分類の実現。
- 一貫した粒度で、分野・分野・分野下位分野という細分化された標準化された研究分野の分類体系の構築。
- 分野や分野下位分野を越えた標準化されたインパクトとパフォーマンス比較を可能にする、メタ科学的分析の支援。
- 将来的な科学的出版物のインタラクティブインデクシングシステムのための事前学習済みモデルバックボーンの提供。
提案手法
- システムは、分野 → 分野 → 分野下位分野という三段階の階層的構造を採用し、Wikipedia、JEL、ACM、PACSなどの多分野的ソースから得た44の分野、718の分野、1,485の分野下位分野を定義した。
- テキストベクトル化には、トークン化、小文字化、標点記号の除去、および200トークンまでに切り詰める処理を実施し、入力表現を生成した。
- モジュラーで分散型かつバッチ学習方式を採用し、CNN、RNN、Transformerアーキテクチャの全3,140件の実験を実施した。
- モデルは、階層的レベル間の周辺確率(P(p ∈ D))と条件付き確率(P(p ∈ Fi | p ∈ D))を推定するためにソフトマックス出力層を採用した。
- ハイパーパrameterは、修士論文のアブレーションスタディに基づき選定され、標準モデルにはRMSProp(学習率0.001)を、BERTベースのモデルにはAdam(2e-5)を用いた。
- 1件の出版物に複数の分野下位分野ラベルを割り当てることで、複数ラベル分類をサポートし、多分野研究の正確な同定を可能にした。
実験結果
リサーチクエスチョン
- RQ1深層学習モデルは、すべての学術分野にわたる学術的要約の高精度で複数ラベル対応の階層的分類を達成できるか?
- RQ2モデルの階層的構造は、フラットな多クラスアプローチと比較して、分類性能をどのように向上させるか?
- RQ31件の出版物に複数の分野下位分野ラベルを割り当てることで、このシステムは多分野研究をどの程度正確に捉えることができるか?
- RQ4CNN、RNN、Transformerといった異なるニューラルネットワークアーキテクチャは、細分化された多段階分類体系への要約分類において、それぞれどの程度のパフォーマンスを示すか?
- RQ5一貫性がありスケーラブルな分類を提供することにより、このシステムは分野を越えた標準化されたインパクトとパフォーマンス分析を可能にするか?
主な発見
- 全テストモデル全体で、単一ラベル分類の正確性は77.13%、複数ラベル分類の正確性は78.19%を達成した。
- 最も優れた性能を示したモデル(主にTransformerおよび微調整済みBERT)は、大多数の分類タスクで90%を超える正確性を達成した。
- 階層的設計により、複数ラベル予測が効果的に可能となり、出版物が複数の分野下位分野および分野に分類可能となり、多分野研究の捉えが可能になった。
- モジュラーで分散型のトレーニングパイプラインは、1億6000万件の要約にわたりスケーリングに成功し、効率的で強固なモデルトレーニングを可能にした。
- トランスファーラーニングと共有埋め込み空間の活用により、ラベルデータが限られる分野に対しても、強力な一般化性能を示した。
- 718の分野ラベルとマッピングテーブルを含む、公開可能なリポジトリを提供しており、再現性および将来的なシステム統合を支援している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。