Skip to main content
QUICK REVIEW

[論文レビュー] Improving Active Learning in Systematic Reviews

Gaurav Singh, James Thomas|arXiv (Cornell University)|Jan 29, 2018
Machine Learning and Algorithms参考文献 12被引用数 6
ひとこと要約

本稿では、LDAに基づくトピックモデリングと分類器を用いて関連性スコアと新規性スコアを統合する、システマティックレビューのための新規なアクティブラーニングフレームワークを提案する。関連性(訓練済み分類器からのスコア)と新規性(トピック分散の乖離度)のスコアを乗算することで、高い再現率を維持しながら手作業のラベリング作業を顕著に削減し、実験では25%の文書ラベリングで95%の再現率を達成した。

ABSTRACT

Systematic reviews are essential to summarizing the results of different clinical and social science studies. The first step in a systematic review task is to identify all the studies relevant to the review. The task of identifying relevant studies for a given systematic review is usually performed manually, and as a result, involves substantial amounts of expensive human resource. Lately, there have been some attempts to reduce this manual effort using active learning. In this work, we build upon some such existing techniques, and validate by experimenting on a larger and comprehensive dataset than has been attempted until now. Our experiments provide insights on the use of different feature extraction models for different disciplines. More importantly, we identify that a naive active learning based screening process is biased in favour of selecting similar documents. We aimed to improve the performance of the screening process using a novel active learning algorithm with success. Additionally, we propose a mechanism to choose the best feature extraction method for a given review.

研究の動機と目的

  • 手作業によるラベリング負荷を軽減し、人間のレビューに適した情報量の多い文書の自動選択を実現すること。
  • 標準的な不確実性サンプリングを超えて、システマティックレビューにおけるラベル不足の課題に応えるため、アクティブラーニング戦略を改善すること。
  • トピックモデリング(LDA)と分類を統合し、文書選択における関連性と多様性のバランスを取ること。
  • 関連性スコアと新規性スコアを統合することで、システマティックレビューのアクティブラーニングにおける再現率と効率性が向上するかどうかを評価すること。
  • 大規模な文献スクリーニングにおけるエビデンス統合に適用可能な実用的でスケーラブルな手法を提供すること。

提案手法

  • 本手法は、初期の手作業ラベル付き文書集合($\mathcal{H}$)とラベルなし文書のプール($\mathcal{G} = \mathcal{D} - \mathcal{H}$)から開始する。
  • 全文書コレクション($\mathcal{D}$)に対してLDAを適用し、コロナの300トピック表現($V$)を学習する。
  • 文書$d \in \mathcal{G}$の関連性スコア$R(d)$($p(r|d)$を表す)を、$\mathcal{H}$を用いて訓練した分類器で予測する。
  • 新規性スコア$N(d)$は、$\mathcal{H}$と$\mathcal{G}$間のトピック分散の乖離度を用いて計算され、$p(n|d)$を表す。時間に基づく減衰要因$t=3$を適用する。
  • 文書は$\text{scores}(d) = R(d) \times N(d)$としてスコア付けされ、関連性と新規性を統合して、情報量が多く多様な文書を優先する。
  • 各イテレーションで、組み合わせスコアが上位$s=25$件の文書が選択され、ラベリング対象となる。このプロセスは、最大150のトピックが探索されるまで繰り返される。

実験結果

リサーチクエスチョン

  • RQ1標準的な不確実性サンプリングと比較して、関連性と新規性スコアを統合することで、システマティックレビューにおけるアクティブラーニングのパフォーマンスが向上するか?
  • RQ2LDAに基づくトピックモデリングの統合が、アクティブラーニング中の情報量の多い文書の選択にどのように寄与するか?
  • RQ3トピック分散に基づいて算出される新規性スコアが、重複ラベリングの削減とカバレッジの向上に与える影響は何か?
  • RQ4提案手法は、高い再現率を維持しながら、手作業によるラベリングが必要な文書数をどの程度削減できるか?
  • RQ5時間に基づく減衰要因$t$は、文書選択における関連性と新規性のバランスにどのように影響するか?

主な発見

  • 本手法は、文書の25%しかラベリングしなくても、システマティックレビューのスクリーニングで95%の再現率を達成した。これは、手作業の負荷を顕著に削減したことを示している。
  • 関連性と新規性スコアの統合により、情報量が多く多様な文書を優先することができ、ベースライン手法を上回る性能を発揮した。
  • LDAに基づくトピックモデリングにより、ラベル付き集合とラベルなし集合間のトピック分布のズレを測定することで、新規性の効果的推定が可能になった。
  • 乗算スコア関数($R(d) \times N(d)$)を用いることで、関連性と多様性のバランスが効果的に取られ、選択の効率性が向上した。
  • 本手法は、最小限のチューニングで実用的かつスケーラブルであることが、実世界のシステマティックレビューのワークフローで確認された。
  • 時間に基づく減衰要因$t=3$は、古い・関連性の低い文書の影響を低下させることで、時間経過に伴う関連性の維持に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。