Skip to main content
QUICK REVIEW

[論文レビュー] Higher order features and recurrent neural networks based on Long-Short Term Memory nodes in supervised biomedical word sense disambiguation.

Antonio Jimeno Yepes|arXiv (Cornell University)|Apr 9, 2016
Natural Language Processing Techniques参考文献 43被引用数 4
ひとこと要約

本稿では、高次特徴量と長短期記憶(LSTM)再帰ニューラルネットワークを用いた教師ありバイオメディカル語の意味あいまい性解消手法を提案する。単語の特徴量とワード埋め込みを組み合わせることで、MSH WSDデータセットにおいて95.97の新たな最良精度を達成し、ワード埋め込みが従来の特徴量を強化し、LSTMによる有効な系列モデリングを可能にすることを示している。

ABSTRACT

Word sense disambiguation helps identifying the proper sense of ambiguous words in text. With large terminologies such as the UMLS Metathesaurus ambiguities appear and highly effective disambiguation methods are required. Supervised learning algorithm methods are used as one of the approaches to perform disambiguation. Features extracted from the context of an ambiguous word are used to identify the proper sense of such a word. The type of features have an impact on machine learning methods, thus affect disambiguation performance. In this work, we have evaluated several types of features derived from the context of the ambiguous word and we have explored as well more global features derived from MEDLINE using word embeddings. Results show that word embeddings improve the performance of more traditional features and allow as well using recurrent neural networks based on Long-Short Term Memory (LSTM) nodes, which further improve the disambiguation performance. The combination of unigrams and word embeddings set a new state of the art performance with an accuracy of 95.97 in the MSH WSD data set.

研究の動機と目的

  • 高度な特徴工学を用いて、バイオメディカルテキストにおける教師あり語の意味あいまい性解消を改善すること。
  • 高次文脈特徴量が意味あいまい性解消性能に与える影響を評価すること。
  • MEDLINEから得たワード埋め込みが特徴表現をどのように向上させるかを調査すること。
  • 長短期記憶(LSTM)ネットワークを用いて、語の意味あいまい性解消における系列的文脈をモデリングすること。
  • MSH WSDベンチマークデータセットにおいて、新たな最良性能を確立すること。

提案手法

  • バイオメディカルテキストにおける意味あいまい語の文脈から単語特徴量を抽出した。
  • 大規模なMEDLINEコーパスを用いてグローバルなワード埋め込みを生成し、意味的文脈を表現した。
  • 単語特徴量と事前学習済みのワード埋め込みを組み合わせ、特徴表現を豊かにした。
  • 系列的依存関係を文脈でモデリングするために、長短期記憶(LSTM)ネットワークを採用した。
  • 組み合わせた特徴セットを用いて教師あり学習モデルを訓練し、語の意味を分類した。
  • MSH WSDデータセットでモデルを最適化し、意味あいまい性解消の精度を最大化した。

実験結果

リサーチクエスチョン

  • RQ1高次文脈特徴量は、従来の単語特徴量と比較して、バイオメディカル語の意味あいまい性解消においてどのように異なるか?
  • RQ2MEDLINEから得たワード埋め込みは、意味あいまい性解消性能をどの程度向上させるか?
  • RQ3LSTMノードに基づく再帰的ニューラルネットワークは、ワード埋め込みと組み合わせることで性能向上を達成できるか?
  • RQ4単語特徴量とワード埋め込みの組み合わせが、全体の意味あいまい性解消精度に与える影響は何か?
  • RQ5提案手法は、MSH WSDベンチマークで最良の性能を達成するか?

主な発見

  • ワード埋め込みと単語特徴量の統合は、従来の特徴量のみを用いた場合と比較して、意味あいまい性解消性能を顕著に向上させた。
  • LSTMベースのモデルは、静的特徴量のみを用いたモデルを上回り、文脈における系列モデリングの価値を示した。
  • 単語特徴量とワード埋め込みの組み合わせにより、MSH WSDデータセットで95.97%の新たな最良精度を達成した。
  • ワード埋め込みのおかげで、もともとスパースな特徴表現で困難だった再帰的ニューラルネットワークの有効な利用が可能になった。
  • 提案手法は、多様性の高いバイオメディカル用語を扱う上で、頑健性とスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。