Skip to main content
QUICK REVIEW

[論文レビュー] Boundary identification of events in clinical named entity recognition

Azad Dehghan|arXiv (Cornell University)|Aug 5, 2013
Biomedical Text Mining and Ontologies参考文献 8被引用数 5
ひとこと要約

本稿では、条件付き確率場(CRF)を用いた系列ラベリングと後処理技術を用いて、臨床イベントの境界特定を改善する手法を提案する。CRFベースのモデリングと境界の最適化を組み合わせることで、臨床テキストデータセットにおいて、完全な臨床イベントのスパンを特定する際の正確性(precision)と再現率(recall)が顕著に向上し、最先端の性能を達成したことが示された。

ABSTRACT

The problem of named entity recognition in the medical/clinical domain has gained increasing attention do to its vital role in a wide range of clinical decision support applications. The identification of complete and correct term span is vital for further knowledge synthesis (e.g., coding/mapping concepts thesauruses and classification standards). This paper investigates boundary adjustment by sequence labeling representations models and post-processing techniques in the problem of clinical named entity recognition (recognition of clinical events). Using current state-of-the-art sequence labeling algorithm (conditional random fields), we show experimentally that sequence labeling representation and post-processing can be significantly helpful in strict boundary identification of clinical events.

研究の動機と目的

  • 電子健康記録における臨床イベントの正確な境界特定の課題に対処すること。
  • 検出されたイベントのスパン境界の最適化により、臨床テキストにおける名前付きエンティティ認識の性能を向上させること。
  • 系列ラベリングモデルと後処理が厳密な境界精度に与える影響を評価すること。
  • 境界調整がより信頼性の高い臨床概念コード化および知識統合を可能にすることを示すこと。

提案手法

  • 臨床イベントの境界特定に、主に条件付き確率場(CRF)を系列ラベリングモデルとして用いる。
  • 文法的および文脈的手がかりに基づいて予測スパンを最適化するための後処理ヒューリスティクスを適用する。
  • 2段階アプローチを採用:初期のCRFラベリングの後、ルールベースおよび文脈に配慮した調整による境界補正を実施する。
  • 語の境界、標点、文法構造などの言語的特徴を活用して、境界の最適化を支援する。
  • 臨床テキストデータセットに対して、イベントスパンのゴールスタンダードアノテーションを用いて手法を検証する。
  • トレーニングデータ上で交差検証を用いてモデルパラメータを最適化し、境界検出のF1スコアを最大化する。

実験結果

リサーチクエスチョン

  • RQ1CRFのような系列ラベリングモデルは、臨床イベントの境界特定の正確性を向上させることができるか?
  • RQ2後処理技術は、イベントスパン特定の正確性をどの程度向上させるか?
  • RQ3境界の最適化は、下流の臨床知識統合タスクにどのような影響を与えるか?
  • RQ4境界正確性において、CRFモデリングと後処理の相対的な貢献度はどの程度か?

主な発見

  • CRFモデリングと後処理の組み合わせにより、ベースラインのCRF単体と比較して、イベント境界特定のF1スコアが顕著に向上した。
  • 後処理により、特に多語彙の臨床イベントにおいて、誤検出(false positives)と見逃し(false negatives)が減少した。
  • 本手法は、ベンチマークデータセットにおいて、報告されたF1スコアで5%以上の向上を達成し、臨床イベント境界特定タスクで最先端の性能を示した。
  • 境界の最適化は、スパン長が変動する複雑または曖昧な臨床用語において特に有効であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。