Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Classification of Pathology Reports using TF-IDF Features

Shivam Kalra, Larry Li|arXiv (Cornell University)|Mar 5, 2019
Biomedical Text Mining and Ontologies参考文献 14被引用数 14
ひとこと要約

本研究では、SVM、XGBoost、ロジスティック回帰を用いて、TF-IDFに基づく機械学習的手法を提案し、腫瘍病理報告書をICD-O診断カテゴリに自動分類する。XGBoostを用いた場合、92%の正確性を達成し、TF-IDFが計算病理学およびがん監視において、重要な診断用語を効果的に強調できることを示している。

ABSTRACT

A Pathology report is arguably one of the most important documents in medicine containing interpretive information about the visual findings from the patient's biopsy sample. Each pathology report has a retention period of up to 20 years after the treatment of a patient. Cancer registries process and encode high volumes of free-text pathology reports for surveillance of cancer and tumor diseases all across the world. In spite of their extremely valuable information they hold, pathology reports are not used in any systematic way to facilitate computational pathology. Therefore, in this study, we investigate automated machine-learning techniques to identify/predict the primary diagnosis (based on ICD-O code) from pathology reports. We performed experiments by extracting the TF-IDF features from the reports and classifying them using three different methods---SVM, XGBoost, and Logistic Regression. We constructed a new dataset with 1,949 pathology reports arranged into 37 ICD-O categories, collected from four different primary sites, namely lung, kidney, thymus, and testis. The reports were manually transcribed into text format after collecting them as PDF files from NCI Genomic Data Commons public dataset. We subsequently pre-processed the reports by removing irrelevant textual artifacts produced by OCR software. The highest classification accuracy we achieved was 92\% using XGBoost classifier on TF-IDF feature vectors, the linear SVM scored 87\% accuracy. Furthermore, the study shows that TF-IDF vectors are suitable for highlighting the important keywords within a report which can be helpful for the cancer research and diagnostic workflow. The results are encouraging in demonstrating the potential of machine learning methods for classification and encoding of pathology reports.

研究の動機と目的

  • がん登録機関における非構造化病理報告書の手作業による分類の課題を解決すること。
  • 自由記述の病理報告書から主要診断(ICD-Oコード)を自動的かつスケーラブルに抽出すること。
  • 機械学習モデルと組み合わせたTF-IDF特徴量の診断分類における有効性を評価すること。
  • 4つの主要ながん巣の部位にまたがる1,949件の手動転写病理報告書からなる、新規の公開可能なデータセットの構築。
  • TF-IDFが診断および研究用途における臨床的関連性のあるキーワードを強調できることを実証すること。

提案手法

  • NCIゲノムデータコモンズから収集した1,949件の手動転写病理報告書からTF-IDF特徴量を抽出した。
  • 光学文字認識(OCR)由来のアーティファクトを除去し、テキストを標準化することで、特徴量の品質を向上させた。
  • TF-IDF特徴量ベクトル上で、SVM(線形およびRBF)、ロジスティック回帰、XGBoostの3つの分類器を訓練・比較した。
  • 解釈可能性および臨床的関連性を高めるために、上位50個のTF-IDF重み付きキーワードにLDAを用いて潜在的トピックを抽出し、色分けした。
  • 微分平均Fスコアとマクロ平均Fスコアの指標を用い、モデルの性能を評価した。交差検証を用いた訓練・テスト分割により、妥当性を確保した。
  • キーワードとトピックの一致を定性的に検証し、抽出された用語の臨床的解釈可能性を検証した。

実験結果

リサーチクエスチョン

  • RQ1TF-IDF特徴量は、機械学習分類のための非構造化病理報告書の診断的コンテンツを効果的に表現できるか?
  • RQ2SVM、ロジスティック回帰、XGBoostの中では、どの機械学習分類器が病理報告書からICD-O診断コードを予測する際に最も高い正確性を達成するか?
  • RQ3TF-IDFとLDAを併用することで、病理報告書に含まれる臨床的関連性のあるキーワードやバイオマーカーをどの程度効果的に強調できるか?
  • RQ4この分類タスクにおいて、SVMの線形カーネルと非線形カーネルの性能にどのような差が生じるか?
  • RQ5提案手法は、がん登録報告における手作業の負担を軽減しつつ、高い診断正確性を維持できるか?

主な発見

  • XGBoost分類器が、最高のマイクロFスコア0.92およびマクロFスコア0.31を達成し、他のすべてのモデルを上回った。
  • 線形カーネルを用いたSVMは87%のテスト正確性を達成し、RBFカーネル(75%)を顕著に上回った。
  • ロジスティック回帰は78%のテスト正確性を示し、線形SVMは87%の正確性を示した。これは、線形モデルが優れた性能を発揮していることを示している。
  • TF-IDF特徴量は、「epithelial(上皮)」、「presence(存在)」、「necrosis(壊死)」、「tumor(腫瘍)」といった重要な診断用語を高い重みで効果的に強調した。
  • LDAを用いたキーワードの色分けにより、「tumor necrosis(腫瘍壊死)」や「lymph node involvement(リンパ節侵襲)」といった臨床的意味のあるトピックが明らかになり、解釈可能性が向上した。
  • 本研究では、37のICD-Oカテゴリにまたがる1,949件の病理報告書からなる、新規の公開可能なデータセットを構築した。今後の自動病理報告書分析研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。