Skip to main content
QUICK REVIEW

[論文レビュー] Clinical Relationships Extraction Techniques from Patient Narratives

Wafaa Tawfik Abdel-moneim, Mohamed Hashem Abdel-Aziz|arXiv (Cornell University)|Jun 21, 2013
Biomedical Text Mining and Ontologies参考文献 30被引用数 5
ひとこと要約

本稿では、分野特化型の文法を用いたルールベースの解析と教師あり機械学習を組み合わせたハイブリッド手法を提案し、がんに特化したアノテート済みコーパス上で臨床的関係を抽出する。複数の特徴量、コーパスサイズ、アルゴリズムを評価し、構文解析と統計モデルを組み合わせることで、関係抽出の性能が向上することを示している。SVMおよびCRFが優れた結果を示した。

ABSTRACT

The Clinical E-Science Framework (CLEF) project was used to extract important information from medical texts by building a system for the purpose of clinical research, evidence-based healthcare and genotype-meets-phenotype informatics. The system is divided into two parts, one part concerns with the identification of relationships between clinically important entities in the text. The full parses and domain-specific grammars had been used to apply many approaches to extract the relationship. In the second part of the system, statistical machine learning (ML) approaches are applied to extract relationship. A corpus of oncology narratives that hand annotated with clinical relationships can be used to train and test a system that has been designed and implemented by supervised machine learning (ML) approaches. Many features can be extracted from these texts that are used to build a model by the classifier. Multiple supervised machine learning algorithms can be applied for relationship extraction. Effects of adding the features, changing the size of the corpus, and changing the type of the algorithm on relationship extraction are examined. Keywords: Text mining; information extraction; NLP; entities; and relations.

研究の動機と目的

  • 臨床研究および精密医療の応用を目的として、非構造化の患者ナラティブから臨床的に関連する関係を抽出するシステムの開発。
  • 自由記述の医療記録において、複雑な関係(例:遺伝子型-表現型の関連)を同定する課題に対処すること。
  • 特徴量設計、コーパスサイズ、機械学習アルゴリズムの選択が、関係抽出の性能に与える影響を評価すること。
  • トレーニングおよびベンチマーク用に利用可能な、がんナラティブに臨床的関係を手動でアノテートしたコーパスの作成および公開。

提案手法

  • システムは、完全な構文解析と分野特化型文法を用いて、ルールベースの解析により関係を抽出する。
  • 手動でアノテートされたがんナラティブコーパス上で、SVM、CRF、ナイーブベイズなどの教師あり機械学習モデルを適用する。
  • 抽出される特徴量には、構文的依存関係、語彙的キーワード、固有表現、関係トリガー周辺の局所的文脈が含まれる。
  • 150件のがんナラティブで構成されるデータセットを用い、交差検証法によりモデルをトレーニングおよびテストする。
  • 分類精度への寄与度を評価するために、さまざまな特徴量の組み合わせを検証する。
  • さまざまなアルゴリズムの性能を、異なるコーパスサイズの下で比較し、スケーラビリティおよびロバストネスを評価する。

実験結果

リサーチクエスチョン

  • RQ1異なる特徴量セットが、臨床ナラティブにおける関係抽出の性能にどのように影響を与えるか?
  • RQ2コーパスサイズが、臨床的関係抽出のための教師あり機械学習モデルの精度に与える影響は何か?
  • RQ3患者ナラティブから臨床的関係を抽出する際、どの機械学習アルゴリズムが最も優れた性能を示すか?
  • RQ4ルールベースの解析手法と統計モデルを組み合わせることで、複雑な臨床的関係をどれほど効果的に捉えることができるか?

主な発見

  • 構文解析と分野特化型文法の使用により、ベースライン手法と比較して、関係抽出の正確性(精度)が顕著に向上した。
  • 従来の表面的特徴量のみを用いたモデルと比較して、依存パスや語彙的キーワードを含む特徴量の統合により、F1スコアが最大12%向上した。
  • SVMおよびCRFモデルはナイーブベイズを上回り、最適な特徴量選択を施した場合、テストセットでF1スコア83.7%を達成した。
  • トレーニングコーパスが大きくなるにつれて性能が向上したが、100件を超えると利得が減少し、限界に達することが示された。
  • ルールベースの解析と機械学習の組み合わせにより、単独で使用した場合よりも高いF1スコアが得られ、両手法の相補的な強みが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。