Skip to main content
QUICK REVIEW

[論文レビュー] MedMentions: A Large Biomedical Corpus Annotated with UMLS Concepts

Sunil Mohan, Donghui Li|arXiv (Cornell University)|Feb 25, 2019
Biomedical Text Mining and Ontologies参考文献 14被引用数 47
ひとこと要約

MedMentionsは大規模な手動注釈付きの生物医学コーパスを提供し、UMS conceptsへ言及を結びつける。ST21pvサブコーパスと基礎的なエンドツーエンドのエンティティ認識/リンクモデルを含む。

ABSTRACT

This paper presents the formal release of MedMentions, a new manually annotated resource for the recognition of biomedical concepts. What distinguishes MedMentions from other annotated biomedical corpora is its size (over 4,000 abstracts and over 350,000 linked mentions), as well as the size of the concept ontology (over 3 million concepts from UMLS 2017) and its broad coverage of biomedical disciplines. In addition to the full corpus, a sub-corpus of MedMentions is also presented, comprising annotations for a subset of UMLS 2017 targeted towards document retrieval. To encourage research in Biomedical Named Entity Recognition and Linking, data splits for training and testing are included in the release, and a baseline model and its metrics for entity linking are also described.

研究の動機と目的

  • UMLSを対象オントロジーとして用い、広範なカバーを持つ大規模で豊富に注釈された生物医学コーパスを提供する。
  • 巨大なオントロジーサイズゆえのゼロショットシナリオを含む、エンドツーエンドの生物医学概念認識とリンクの開発を可能にする。
  • 文書検索とインデックス作成タスクに合わせたST21pvサブコーパスを提供する。
  • 将来の概念認識モデルを評価するための訓練/検証/テスト分割と基準メトリクスを提示する。

提案手法

  • 2016–2017年のPubMed要約をランダムに抽出し、アノテーションのために4,392件の英語の生物医学要約を確定する。
  • すべての生物医学的言及を、2017 AAリリースとGATEツールを用いて最も具体的なUMLS概念で注釈し、重複しない言及を保証する。
  • ST21pvを、ターゲットとする文書検索のためのUMLSのフィルタ済み21の意味タイプサブセットとして導入する。
  • コーパス統計を計算し、概念重複分析を含む60/20/20の訓練/開発/テスト分割を提供する。
  • ST21pvデータ上でベースラインのエンドツーエンドの概念認識とリンクモデル(TaggerOne)を訓練し、言及レベルおよび文書レベルの指標を報告する。

実験結果

リサーチクエスチョン

  • RQ1MedMentionsとそのST21pvサブセットがUMLS概念にマッピングされたときの規模とカバレッジはどの程度か?
  • RQ2言及レベルと文書レベルの両方で、MedMentionsに対するベースラインのエンドツーエンド概念認識とリンクモデルの性能はどうか?
  • RQ3訓練・開発・テスト分割間の概念の重複はどの程度か、テストに現れる未知ラベルはいくつか?
  • RQ4規模・オントロジーカバレッジ・注釈の粒度という点で、MedMentionsは他の大規模生物医学コーパスとどのように比較されるか?

主な発見

  • MedMentionsは4,392件の要約を含み、総計352,496の言及が34,724のユニークな概念にリンクされている。
  • ST21pvサブコーパスは、フィルタリング後に2,327,250の概念と203,282の言及をカバーする。
  • ST21pvのテストセットは60%–20%–20%の分割を含み、テストの概念の42%が訓練で見られず、38%が訓練と開発のどちらでも見られない。
  • ベースラインのTaggerOneモデルは、MM-ST21pvテストデータで言及レベル0.471の精度、0.436の再現率、0.453のF1、文書レベルで0.536の精度、0.561の再現率、0.548のF1を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。