Skip to main content
QUICK REVIEW

[論文レビュー] Information Extraction from Scientific Literature for Method Recommendation

Yi Luan|arXiv (Cornell University)|Dec 13, 2018
Topic Modeling被引用数 4
ひとこと要約

本稿では、未注釈付きの文献から科学用語を抽出し、共起性、依存解析、Wikipedia由来の関係を用いて知識グラフを構築することで、半教師あり枠組みを提案する。用語抽出で最先端の性能を達成し、最小限の人的注釈で方法-タスク推薦のリンク予測を可能にし、MRRと人的評価により検証された。

ABSTRACT

As a research community grows, more and more papers are published each year. As a result there is increasing demand for improved methods for finding relevant papers, automatically understanding the key ideas and recommending potential methods for a target problem. Despite advances in search engines, it is still hard to identify new technologies according to a researcher's need. Due to the large variety of domains and extremely limited annotated resources, there has been relatively little work on leveraging natural language processing in scientific recommendation. In this proposal, we aim at making scientific recommendations by extracting scientific terms from a large collection of scientific papers and organizing the terms into a knowledge graph. In preliminary work, we trained a scientific term extractor using a small amount of annotated data and obtained state-of-the-art performance by leveraging large amount of unannotated papers through applying multiple semi-supervised approaches. We propose to construct a knowledge graph in a way that can make minimal use of hand annotated data, using only the extracted terms, unsupervised relational signals such as co-occurrence, and structural external resources such as Wikipedia. Latent relations between scientific terms can be learned from the graph. Recommendations will be made through graph inference for both observed and unobserved relational pairs.

研究の動機と目的

  • 膨大な科学文献から関連するキーワードと関係を抽出することで、研究者に適切な科学的メソッドを推薦する課題に対処すること。
  • 半教師あり学習と非教師的関係信号を活用することで、高コストな人的注釈データへの依存を最小限に抑えること。
  • 共起性、依存解析、Wikipediaを用いて、メソッドとタスクの間の潜在的関係をモデル化する科学的知識グラフを構築すること。
  • グラフベースのリンク予測とマルチパス関係モデリングを用いて、まだ文献に登場していないメソッド-タスクペアの推薦を可能にすること。
  • 自動指標(MRR、Hits@k)と人的評価の両方を用いて、実用的関連性を保証するためのシステムの評価を行うこと。

提案手法

  • 少量の注釈付きデータで訓練された半教師ありニューラルモデルを、大規模な未注釈付き科学論文を用いて拡張することで、科学的用語抽出の性能を向上させる。
  • 共起パターンと依存関係を非教師的関係信号として用い、科学用語間の接続を推論する。
  • Wikipediaからの外部知識を補助リソースとして統合し、関係信号を豊かにし、グラフ表現を向上させる。
  • マルチパスグラフ推論モデルは、複数のソース(例:依存パス、Wikipedia)からの証拠を重み付きパス表現とランダムウォーク確率を用いて統合する。
  • リンク予測のスコア関数は、パス表現を組み合わせ、異なるリソースタイプごとにパス長ごとに共有重みを学習する。
  • オープンエンドド関係は、潜在的関係表現のクラスタリングにより探索され、明示的な注釈なしに細分化されたメソッド-タスク関係の発見が可能になる。

実験結果

リサーチクエスチョン

  • RQ1半教師あり学習は、最小限の注釈付きデータで科学的用語抽出において最先端の性能を達成できるか?
  • RQ2共起性とWikipediaなどの外部知識ソースは、人的注釈を最小限に抑えつつ、科学的知識グラフを効果的に構築できるか?
  • RQ3グラフベースのリンク予測は、文献にまだ登場していない新しいメソッド-タスク関係をどの程度正確に推定できるか?
  • RQ4多様なソースからのマルチパス関係信号は、単一ソースアプローチと比較して、推薦性能をどの程度向上させるか?
  • RQ5潜在的関係表現のクラスタリングは、意味的で細分化されたメソッドとタスクの関係を明らかにできるか?

主な発見

  • 提案された半教師あり用語抽出モデルは、大規模な未注釈付き論文を活用することで、科学的用語抽出で最先端の性能を達成した。
  • 知識グラフ構築法は、共起性、依存関係、Wikipediaを効果的に統合し、人的注釈データを最小限に抑えつつ科学的関係をモデル化した。
  • 構築された知識グラフを用いたリンク予測は、GANがNLPで使用されることの予測など、妥当なメソッド-タスク応用を高い正確性で特定した。
  • 自動評価では強力な性能を示し、MRRおよびHits@kスコアが関連するメソッド-タスクペアの適切なランク付けを示した。
  • 人的評価により、上位30件の推薦が高精度かつ高再現率で関連性があることが確認され、本手法の実用的有用性が裏付けられた。
  • 潜在的関係表現のクラスタリングにより、HMM + Viterbiのようなメソッドの組み合わせや、POSタギングとNERのようなタスクの類似性といった意味的で細分化された関係が明らかになった。これは、オープン関係学習の可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。