Skip to main content
QUICK REVIEW

[論文レビュー] Pathology Extraction from Chest X-Ray Radiology Reports: A Performance Study

Tahsin Mostafiz, Khalid Ashraf|arXiv (Cornell University)|Dec 6, 2018
Topic Modeling参考文献 11被引用数 4
ひとこと要約

本研究では、胸部X線レントゲン画像報告書からの病理学的用語抽出を評価し、医療特化型API(MTI、MOD)と汎用NLU API(IBM NLU)の性能が低いことが判明した。本研究では、タスク固有のレントゲン画像レポートコーパスで微調整されたカスタムDNNベースの名前付きエンティティ認識(NER)モデルを提案し、一般の病理学的用語抽出では49.91%、透明度(opacity)では82.53%というF1スコアを達成した。これは、他のすべてのツールを上回り、オフザシェルソリューションよりもドメイン特化型のモデル学習が優れていることを示している。

ABSTRACT

Extraction of relevant pathological terms from radiology reports is important for correct image label generation and disease population studies. In this letter, we compare the performance of some known application program interface (APIs) for the task of thoracic abnormality extraction from radiology reports. We explored several medical domain specific annotation tools like Medical Text Indexer(MTI) with Non-MEDLINE and Mesh On Demand(MOD) options and generic Natural Language Understanding (NLU) API provided by the IBM cloud. Our results show that although MTI and MOD are intended for extracting medical terms, their performance is worst compared to generic extraction API like IBM NLU. Finally, we trained a DNN-based Named Entity Recognition (NER) model to extract the key concept words from radiology reports. Our model outperforms the medical specific and generic API performance by a large margin. Our results demonstrate the inadequacy of generic APIs for pathology extraction task and establish the importance of domain specific model training for improved results. We hope that these results motivate the research community to release larger de-identified radiology reports corpus for building high accuracy machine learning models for the important task of pathology extraction.

研究の動機と目的

  • 胸部X線レントゲン画像報告書から病理学的用語を抽出するための、既存の公開API(医療特化型:MTI、MOD、および汎用型:IBM NLU)の性能を評価すること。
  • 特に誤検出や用語の誤分類が頻発する現行の医療アノテーションツールの限界を特定すること。
  • 胸部X線レポートデータに特化して訓練されたディープニューラルネットワークベースの名前付きエンティティ認識(NER)モデルを構築・検証し、病理学的用語抽出の精度を向上させること。
  • タスク固有のモデル学習が、たとえ医療テキスト専用に設計されたAPIであっても、オフザシェルソリューションよりも顕著に優れた結果をもたらすことを示すこと。
  • 高精度な機械学習モデルの開発を可能にするために、より大規模で脱識別化されたレントゲン画像レポートコーパスの公開を提言すること。

提案手法

  • 本研究では、公に利用可能なインディアナ州の胸部X線レポートレポートデータセットをベンチマークコーパスとして使用した。
  • MTI(Non-MEDLINEおよびMesh On Demand(MOD)オプション)とIBMの汎用NLU APIの3つの既存APIを評価した。
  • 同じデータセット上で、単語埋め込みとシーケンスラベル付け技術を用いて、エンドツーエンドで訓練されたカスタムDNNベースのNERモデルを構築した。
  • モデルは、レントゲン画像レポートにおける主な所見(例:「no opacity」のような否定の処理、類似した医学用語の区別)を最適化するために設計された。
  • 評価指標には、手動でアノテートされた正解データを用いて、各病理学的用語クラス(例:透明度、心臓肥大)ごとに計算された精度、再現率、F1スコアを用いた。
  • 定量的分析では、否定の検出や曖昧または希少な用語の処理といったモデルの挙動を検証した。

実験結果

リサーチクエスチョン

  • RQ1医療特化型のアノテーションツール(MTI、MOD)と汎用NLU API(IBM NLU)は、胸部X線レポートから病理学的用語を抽出する際に、どの程度の性能を示すか?
  • RQ2既存の医療APIがレポートに適用された際の失敗モードは何か。特に誤検出や誤った用語マッピングの観点から。
  • RQ3タスク固有のレポートコーパスで微調整されたDNNベースのNERモデルは、医療特化型および汎用APIを上回る病理学的用語抽出性能を達成できるか?
  • RQ4このタスクにおいて、ドメイン特化型のモデル学習はオフザシェルソリューションに比べて、どの程度F1スコアを向上させるか?
  • RQ5カスタムNERモデルが、否定や意味的類似性といった臨床的文脈を理解する上で、どのような主な定性的優位性を示すか?

主な発見

  • DNNベースのNERモデルは、一般の病理学的用語抽出において49.91%のF1スコアを達成し、IBM NLU(26.47%)およびMTI with MOD(15.42%)を顕著に上回った。
  • 「透明度(opacity)」抽出に関しては、NERモデルが82.53%のF1スコアを達成したが、IBM NLUは12.61%、MTIの両設定は0.00%にとどまった。
  • 「心臓肥大(cardiomegaly)」に関しては、NERモデルが90.90%の精度と28.57%の再現率を達成し、IBM NLU(4.54% F1)とMTI with Non-MEDLINE(10.30% F1)を上回ったが、MTI with MODは高い再現率(62.85%)を示した。
  • MTIツールの両設定(Non-MEDLINEおよびMOD)は「透明度」の抽出に完全に失敗し、精度と再現率が0.00%にとどまり、特定の放射線学的用語の処理に深刻な限界があることが示された。
  • NERモデルは否定語(例:「no opacity」)を正しく検出でき、意味的に類似する用語を区別する能力を習得していたが、汎用および医療特化型APIは一貫してその能力に欠けていた。
  • 本研究では、MTI や MOD といった既存の医療APIが、元のレポートに存在しない用語を誤って追加することが判明した(例:「CABG」が「nitro compounds hydrogen-ion」と誤分類)。これは、信頼性を損なう要因である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。