Skip to main content
QUICK REVIEW

[論文レビュー] Negation Detection for Clinical Text Mining in Russian

Anastasia A. Funkner, Ksenia Balabaeva|arXiv (Cornell University)|Apr 10, 2020
Topic Modeling被引用数 6
ひとこと要約

本稿では、ロシア語の臨床文書を対象としたコーパスフリーで勾配ブースティングに基づく否定検出システムを提示する。このシステムは、疾患が否定されているか、言及されていないか、存在するかを分類することを目的としている。5つの疾患において平均Fスコアが0.81〜0.93の間で達成され、急性冠動脈症候群患者における手術の有無の予測が向上している。

ABSTRACT

Developing predictive modeling in medicine requires additional features from unstructured clinical texts. In Russia, there are no instruments for natural language processing to cope with problems of medical records. This paper is devoted to a module of negation detection. The corpus-free machine learning method is based on gradient boosting classifier is used to detect whether a disease is denied, not mentioned or presented in the text. The detector classifies negations for five diseases and shows average F-score from 0.81 to 0.93. The benefits of negation detection have been demonstrated by predicting the presence of surgery for patients with the acute coronary syndrome.

研究の動機と目的

  • 構造化されていないロシア語の医療記録を処理するためのNLPツールの不足に対処すること。
  • 臨床文書において疾患が否定されているか、欠落しているか、存在するかを特定する否定検出モジュールを開発すること。
  • ロシア語のような低リソースな臨床言語環境に適したコーパスフリーの機械学習アプローチを構築すること。
  • 否定検出が急性冠動脈症候群患者における手術介入の予測に与える影響を評価すること。

提案手法

  • 勾配ブースティング分類器を用いて、臨床フレーズを「否定済み」「言及なし」「存在」の3つのカテゴリに分類する。
  • 手動でアノテートされたトレーニングコーパスを必要としない言語的・構文的特徴に依存する。
  • 特徴量には、単語レベルのパターン、依存構文解析の手がかり、ロシア語における否定に関連する活用形情報が含まれる。
  • モデルは、5つの特定疾患に焦点を当てた臨床テキストデータセット上でトレーニングおよび評価される。
  • 3クラス出力に適応したone-vs-all戦略を用いた二値分類フレームワークを採用する。
  • 標準指標(精度、再現率、Fスコア)を用いてモデルの性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1コーパスフリーな機械学習アプローチは、ロシア語の臨床文書における否定検出を効果的に実行できるか?
  • RQ2このモデルは、ロシア語の医療記録において疾患状態(否定済み、言及なし、存在)をどの程度正確に分類できるか?
  • RQ3否定検出を組み込むことで、手術結果予測などの臨床予測タスクの性能はどの程度向上するか?
  • RQ4ロシア語臨床文脈において、異なる疾患に対してこのモデルの性能はどの程度か?

主な発見

  • 否定検出モデルは、5つのターゲット疾患において平均Fスコアが0.81〜0.93の間で達成された。
  • このシステムは、ロシア語の臨床ノートにおいて、否定済み・言及なし・存在の疾患状態を効果的に区別できた。
  • 否定検出を組み込むことで、急性冠動脈症候群患者における手術介入の予測が顕著に向上した。
  • 大規模な手動アノテーション付きトレーニングコーパスを必要としないため、低リソース環境に適している。
  • ドメイン固有のトレーニングデータが欠如している状況でも、勾配ブースティング分類器がベースライン手法を上回った。
  • ロシア語における多様な臨床表現に対して、この手法は頑健性と一般化能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。